Платформа для управляемой аугментации CV-датасетов: она объединяет загрузку и версионирование датасетов, генерацию и модификацию изображений в одном пайплайне.
0
stars
200
commits
Jupyter Notebook
primary language
Mar 30, 2026
updated

Платформа для управляемой аугментации, review и доработки CV-датасетов с единым workflow: от загрузки архива и генерации новых изображений до отбора результатов и обучения классификатора.
Базовый локальный сценарий рассчитан на запуск через Docker Compose.
Клонирование репозитория:
git clone https://github.com/dolganin/tiny_augment_anything.git
cd tiny_augment_anything
Подготовка локального конфига и runtime-директорий:
cp config/app.yaml.example config/app.yaml
cp .env.example .env
mkdir -p storage/tiny-augment
Запуск сервисов:
docker compose up --build
После старта:
http://localhost:5444;http://localhost:8000;http://localhost:8000/api/health.Для полноценной работы ml-worker нужен CUDA/NVIDIA runtime. Если GPU worker должен реально выполнять генерацию и обучение, Docker host должен поддерживать nvidia-container-runtime, а окружение должно уметь поднимать CUDA-compatible контейнеры.
Работа в приложении устроена как последовательный workflow по стадиям:
/modify.В интерфейсе workflow проходит через страницы /datasets → /dataset/stats → /modify → /review → /classifier/train → /metrics.

Минимальная practical-конфигурация для локального запуска:
ml-worker.Без GPU проект бессмысленен.
Пользователь проходит pipeline через страницы /datasets → /dataset/stats → /modify → /review → /classifier/train → /metrics, а под капотом это поддерживается несколькими сервисами: frontend отвечает за интерфейс, backend за API и orchestration, worker за фоновые CPU-задачи, ml-worker за GPU-генерацию и обучение, postgres хранит состояние проекта, redis держит очереди и события, а storage содержит runtime-артефакты. Диаграмма ниже показывает, как эти части связаны между собой.

Каталог scripts_for_gen/ содержит утилиты для ручной подготовки данных и экспериментов, бэкенд их просто вызывает по имени с помощью subprocess.
Примеры:
python scripts_for_gen/segment_evf_sam2_json.py --input-json data/input.json --output-json data/output.json
python scripts_for_gen/segment_sam2_json.py --input-json data/input.json --output-json data/output.json
python scripts_for_gen/train.py --config scripts_for_gen/train.yaml

Jupyter Notebook
69.3%
Python
15.6%
TypeScript
12.4%
CSS
2.5%
Платформа для управляемой аугментации CV-датасетов: она объединяет загрузку и версионирование датасетов, генерацию и модификацию изображений в одном пайплайне.
0
stars
200
commits
Jupyter Notebook
primary language
Mar 30, 2026
updated

Платформа для управляемой аугментации, review и доработки CV-датасетов с единым workflow: от загрузки архива и генерации новых изображений до отбора результатов и обучения классификатора.
Базовый локальный сценарий рассчитан на запуск через Docker Compose.
Клонирование репозитория:
git clone https://github.com/dolganin/tiny_augment_anything.git
cd tiny_augment_anything
Подготовка локального конфига и runtime-директорий:
cp config/app.yaml.example config/app.yaml
cp .env.example .env
mkdir -p storage/tiny-augment
Запуск сервисов:
docker compose up --build
После старта:
http://localhost:5444;http://localhost:8000;http://localhost:8000/api/health.Для полноценной работы ml-worker нужен CUDA/NVIDIA runtime. Если GPU worker должен реально выполнять генерацию и обучение, Docker host должен поддерживать nvidia-container-runtime, а окружение должно уметь поднимать CUDA-compatible контейнеры.
Работа в приложении устроена как последовательный workflow по стадиям:
/modify.В интерфейсе workflow проходит через страницы /datasets → /dataset/stats → /modify → /review → /classifier/train → /metrics.

Минимальная practical-конфигурация для локального запуска:
ml-worker.Без GPU проект бессмысленен.
Пользователь проходит pipeline через страницы /datasets → /dataset/stats → /modify → /review → /classifier/train → /metrics, а под капотом это поддерживается несколькими сервисами: frontend отвечает за интерфейс, backend за API и orchestration, worker за фоновые CPU-задачи, ml-worker за GPU-генерацию и обучение, postgres хранит состояние проекта, redis держит очереди и события, а storage содержит runtime-артефакты. Диаграмма ниже показывает, как эти части связаны между собой.

Каталог scripts_for_gen/ содержит утилиты для ручной подготовки данных и экспериментов, бэкенд их просто вызывает по имени с помощью subprocess.
Примеры:
python scripts_for_gen/segment_evf_sam2_json.py --input-json data/input.json --output-json data/output.json
python scripts_for_gen/segment_sam2_json.py --input-json data/input.json --output-json data/output.json
python scripts_for_gen/train.py --config scripts_for_gen/train.yaml

Jupyter Notebook
69.3%
Python
15.6%
TypeScript
12.4%
CSS
2.5%