This Space lets you drag-and-drop a video and ask questions about it using Efficient-Large-Model/qwen2_5vl-7b-wolfv2-tuned (a fine-tuned Qwen2.5-VL-7B-Instruct).
app.py, requirements.txt, README.md.MODEL_ID=Efficient-Large-Model/qwen2_5vl-7b-wolfv2-tuned (default already).USE_INT4=1 to enable 4-bit weight-only quantization.GPU recommended. A10/A100 or ZeroGPU works for short videos; longer/high-res videos may OOM on CPU.
processor.apply_chat_template(..., fps=1) and model.generate(...).fps for more temporal detail. Higher fps → more tokens/VRAM.min_pixels/max_pixels on AutoProcessor.KeyError: 'qwen2_5_vl', your Transformers is too old — upgrade to >=4.50.0..mp4 (H.264 + AAC).This Space lets you drag-and-drop a video and ask questions about it using Efficient-Large-Model/qwen2_5vl-7b-wolfv2-tuned (a fine-tuned Qwen2.5-VL-7B-Instruct).
app.py, requirements.txt, README.md.MODEL_ID=Efficient-Large-Model/qwen2_5vl-7b-wolfv2-tuned (default already).USE_INT4=1 to enable 4-bit weight-only quantization.GPU recommended. A10/A100 or ZeroGPU works for short videos; longer/high-res videos may OOM on CPU.
processor.apply_chat_template(..., fps=1) and model.generate(...).fps for more temporal detail. Higher fps → more tokens/VRAM.min_pixels/max_pixels on AutoProcessor.KeyError: 'qwen2_5_vl', your Transformers is too old — upgrade to >=4.50.0..mp4 (H.264 + AAC).