Hệ thống Trích xuất & Benchmark Multimodal SOTA: Video OCR, Vietnamese ASR, và Open-Vocabulary Object Detection dành cho RunPod Server sử dụng trình quản lý gói siêu tốc
uv.
Hệ thống được tổ chức thành 3 pipeline độc lập, chuyên sâu với tài liệu hướng dẫn và mã nguồn hoàn chỉnh:
| Nhánh Multimodal | Công nghệ SOTA Nòng cốt | File Hướng dẫn Chi tiết & RunPod Blueprint |
|---|---|---|
| 🔤 Video OCR | TransNetV2 + PP-OCRv5 + ByteTrack + RapidFuzz LCS | 📄 OCR_PIPELINE_RUNPOD_GUIDE.md |
| 🎙️ Vietnamese ASR | Silero VAD + PhoWhisper-large (VinAI) + WhisperX + ITN | 📄 ASR_PIPELINE_RUNPOD_GUIDE.md |
| 🎯 Object Detection | Spatial UI Masking + YOLO-World v2 + RAM++ + Florence-2 | 📄 OBJECT_DETECTION_PIPELINE_RUNPOD_GUIDE.md |
d:\AI-HCMC\
├── pyproject.toml # File cấu hình dependencies cho `uv`
├── download_data.py # Tải bộ dữ liệu & queries từ HuggingFace
├── extract_data.py # Giải nén các tập dữ liệu zip (.mp4 / metadata)
│
├── pipelines/ # BỘ EXECUTION SCRIPTS 3 PIPELINES
│ ├── run_ocr_pipeline.py # Script chạy 5-Stage SOTA Video OCR
│ ├── run_asr_pipeline.py # Script chạy 5-Stage SOTA Vietnamese ASR
│ ├── run_obj_detection_pipeline.py # Script chạy 5-Stage SOTA Object Detection
│ └── run_all_pipelines.py # Master runner chạy cả 3 pipelines nối tiếp
│
├── eval/ # BỘ BENCHMARK & GROUND TRUTH EVALUATION SUITE
│ ├── benchmarks/
│ │ ├── recall_at_k.py # Script tính Recall@1, Recall@5, Recall@10
│ │ └── mrr_calculator.py # Script tính MRR (Mean Reciprocal Rank) chuẩn BTC
│ └── evaluate_benchmark.py # Master runner đánh giá Ground Truth & A/B Testing
│
├── OCR_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho OCR
├── ASR_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho ASR
└── OBJECT_DETECTION_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho Obj Det
uv (QUICKSTART)uv & Đồng bộ Môi trường (Environment Sync)# 1. Cài đặt uv (nếu server chưa có)
pip install uv
# 2. Tạo virtualenv và cài tự động 100% dependencies (bao gồm GPU PyTorch, PaddlePaddle-GPU, Whisper, YOLO)
uv sync
# 3. Tự động tải trước (preload) toàn bộ trọng số mô hình SOTA (PaddleOCR, PhoWhisper, YOLO-World, CLIP)
uv run python preload_models.py
uv run# Tải gói dữ liệu Benchmark
uv run python download_data.py --phase benchmark
# Giải nén dữ liệu video
uv run python extract_data.py --raw-dir ./data/raw --extract-dir ./data/extracted
uv run# Chạy cả 3 pipeline OCR, ASR, Object Detection trên 500 video benchmark
uv run python pipelines/run_all_pipelines.py --video-dir ./data/extracted --output-base-dir ./data/processed --limit 500
uv run# Đánh giá hiệu quả tìm kiếm Recall@K & MRR dựa trên bộ câu hỏi đề thi
uv run python eval/evaluate_benchmark.py --processed-dir ./data/processed --query-dir ./data/raw/query
Để khẳng định tính hiệu quả của các pipeline trên bài toán thi đấu, dự án áp dụng kịch bản A/B Testing đối soát với Ground Truth:
[start_frame, end_frame] trong Top-K kết quả.75 commits
Python
100.0%
Hệ thống Trích xuất & Benchmark Multimodal SOTA: Video OCR, Vietnamese ASR, và Open-Vocabulary Object Detection dành cho RunPod Server sử dụng trình quản lý gói siêu tốc
uv.
Hệ thống được tổ chức thành 3 pipeline độc lập, chuyên sâu với tài liệu hướng dẫn và mã nguồn hoàn chỉnh:
| Nhánh Multimodal | Công nghệ SOTA Nòng cốt | File Hướng dẫn Chi tiết & RunPod Blueprint |
|---|---|---|
| 🔤 Video OCR | TransNetV2 + PP-OCRv5 + ByteTrack + RapidFuzz LCS | 📄 OCR_PIPELINE_RUNPOD_GUIDE.md |
| 🎙️ Vietnamese ASR | Silero VAD + PhoWhisper-large (VinAI) + WhisperX + ITN | 📄 ASR_PIPELINE_RUNPOD_GUIDE.md |
| 🎯 Object Detection | Spatial UI Masking + YOLO-World v2 + RAM++ + Florence-2 | 📄 OBJECT_DETECTION_PIPELINE_RUNPOD_GUIDE.md |
d:\AI-HCMC\
├── pyproject.toml # File cấu hình dependencies cho `uv`
├── download_data.py # Tải bộ dữ liệu & queries từ HuggingFace
├── extract_data.py # Giải nén các tập dữ liệu zip (.mp4 / metadata)
│
├── pipelines/ # BỘ EXECUTION SCRIPTS 3 PIPELINES
│ ├── run_ocr_pipeline.py # Script chạy 5-Stage SOTA Video OCR
│ ├── run_asr_pipeline.py # Script chạy 5-Stage SOTA Vietnamese ASR
│ ├── run_obj_detection_pipeline.py # Script chạy 5-Stage SOTA Object Detection
│ └── run_all_pipelines.py # Master runner chạy cả 3 pipelines nối tiếp
│
├── eval/ # BỘ BENCHMARK & GROUND TRUTH EVALUATION SUITE
│ ├── benchmarks/
│ │ ├── recall_at_k.py # Script tính Recall@1, Recall@5, Recall@10
│ │ └── mrr_calculator.py # Script tính MRR (Mean Reciprocal Rank) chuẩn BTC
│ └── evaluate_benchmark.py # Master runner đánh giá Ground Truth & A/B Testing
│
├── OCR_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho OCR
├── ASR_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho ASR
└── OBJECT_DETECTION_PIPELINE_RUNPOD_GUIDE.md # Hướng dẫn chi tiết & RunPod Blueprint cho Obj Det
uv (QUICKSTART)uv & Đồng bộ Môi trường (Environment Sync)# 1. Cài đặt uv (nếu server chưa có)
pip install uv
# 2. Tạo virtualenv và cài tự động 100% dependencies (bao gồm GPU PyTorch, PaddlePaddle-GPU, Whisper, YOLO)
uv sync
# 3. Tự động tải trước (preload) toàn bộ trọng số mô hình SOTA (PaddleOCR, PhoWhisper, YOLO-World, CLIP)
uv run python preload_models.py
uv run# Tải gói dữ liệu Benchmark
uv run python download_data.py --phase benchmark
# Giải nén dữ liệu video
uv run python extract_data.py --raw-dir ./data/raw --extract-dir ./data/extracted
uv run# Chạy cả 3 pipeline OCR, ASR, Object Detection trên 500 video benchmark
uv run python pipelines/run_all_pipelines.py --video-dir ./data/extracted --output-base-dir ./data/processed --limit 500
uv run# Đánh giá hiệu quả tìm kiếm Recall@K & MRR dựa trên bộ câu hỏi đề thi
uv run python eval/evaluate_benchmark.py --processed-dir ./data/processed --query-dir ./data/raw/query
Để khẳng định tính hiệu quả của các pipeline trên bài toán thi đấu, dự án áp dụng kịch bản A/B Testing đối soát với Ground Truth:
[start_frame, end_frame] trong Top-K kết quả.75 commits
Python
100.0%