https://deep-learning-101.github.io/Computer-Vision Computer vision (電腦視覺)
See the code{% include header.html %}
編者按: 本頁面彙整目前最主流、持續追蹤 2026 電腦視覺 (CV) 開源模型選型指南、最新發布、動態與進展。
如果您需要關注/追蹤更新/尋找更詳細的筆記,歡迎 ⭐ 及 Watch 我們的 GitHub Repository 👉 GitHub: Computer-Vision-Paper 👈🏻
📌 技術速覽 2026年工業視覺聚焦於多模態融合與少樣本 (Few-shot) 檢索。Deep Learning 101 彙整 YOLOv11、擴散模型及高精度 OCR 等開源技術,實務上可協助企業突破傳統 AOI 光影過殺瓶頸,提升產線良率至 99%,並降低 80% 的資料標註成本。
📅 2026-08-17 更新快訊
- REF+CFA
[2026-06]🔥 [CVPR 2026] [跨域異常檢測] [擴散非平穩殘差場] [無監督遷移]- VL-DINO
[2026-06-10]🔥 [開放詞表檢測] [CLIP雙線並用] [肥訓練瘦推理] [長尾類別SOTA]- RMAE-ProGRess
[2026-06-03]🔥 [CVPR 2026] [非結構化語義分割] [LCA輕量通道注意力] [越野與遙感特化]- SOPSeg
[2026-06]🔥 [CVPR 2026] [遥感小目標實例分割] [區域自適應放大RAM] [定向提示OPM]- SFS-DETR
[2026-06]🔥 [CVPR 2026] [無人機小目標檢測] [空間-頻率自適應選擇] [96 FPS即時感知]- DEUS
[2026-03]🔥 [CVPR 2026] [開放世界目標檢測] [ETF雙子空間] [能量分離EUS]- DAMO-YOLO
[2025-06]🔥 [工業落地SOTA] [TinyNAS搜尋] [Efficient RepGFPN] [AlignedOTA標籤分配]- SenseNova-Vision
[2026-07]🔥 [視覺任務大一統] [統一多模態生成UMM] [免專屬預測頭] [7B-MoT]- O2MAG
[2026-03]🔥 [CVPR 2026] [免訓練缺陷擴樣] [三路注意力嫁接TriAG] [異常引導優化AGO]- Stream3D
[2026-05]🔥 [流式3D重建與生成] [自適應證據記憶] [免訓練機制] [CVPR 2026]
📅 2026-07-25 更新快訊
- MV3DT
[2026-07]🔥 多視角3D追蹤、去中心化架構、自動標定、DeepStream- VisualAD
[2026-03-09]🔥 零樣本異常檢測、視覺純化、多領域 SOTA [CVPR 2026]- EReCu
[2026-03-12]🔥 無監督偽裝目標檢測- MAGIC
[2026-03]🔥 少樣本缺陷生成全新 SOTA,打通「學術優雅」與「產線現實」的擴散模型神作!- MoECLIP
[2026-03-29]🔥 裝上一群分工明確的專家,解鎖零樣本異常檢測(ZSAD)全新工業級霸主!
{% include ai-share.html %}
目標偵測的標準幾乎由 YOLO 家族定義。此區塊整理了目前最主流的 YOLO 版本與新世代開放詞彙(Open-Vocabulary)模型。特別標註開發源頭,方便針對地緣資安需求進行選型。
A. 國際大廠與台灣原生強權 (資安合規首選)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| YOLOv11 | 🇺🇸 Ultralytics | 全能視覺霸主。架構大翻新,不僅做目標偵測,還原生支援實例分割、姿態辨識與旋轉邊界框 (OBB)。 | 邊緣運算、多任務視覺 AI[歐美開源] [多任務支援] |
| YOLOv9 | 🇹🇼 中研院 (王建堯博士團隊) | 台灣之光! 導入 PGI (Programmable Gradient Information) 技術,解決深層網路資訊遺失問題,參數少但準確度極高。 | 資源受限的本地端設備、瑕疵檢測[台灣開發] [高參數利用率] |
| YOLOv8 | 🇺🇸 Ultralytics | 生態系最完善。雖然不是最新,但在社群中的教學、部署套件、ONNX/TensorRT 轉換資源最為豐富。 | 工業級穩定部署、初學者專案[生態豐富] [極易部署] |
| OV-DINO | 🇺🇸 國際學術界 | 開源工業開放詞彙目標檢測。不需要預先定義好類別,直接用自然語言提示 (Prompt) 就能找出畫面中對應的物體。 | 零樣本 (Zero-shot) 偵測、通用場景[Open-Vocabulary] [前沿技術] |
VL-DINO [2026-06-10] 🔥 [開放詞表檢測] [CLIP雙線並用] [肥訓練瘦推理] [長尾類別SOTA] [DINO架構]
SFS-DETR [2026-06] 🔥 [CVPR 2026] [無人機小目標檢測] [空間-頻率自適應選擇] [語義對齊融合SAF] [96 FPS即時感知]
DEUS (Detecting Unknown Objects via Energy-based Separation) [2026-03] 🔥 [CVPR 2026] [開放世界目標檢測] [ETF雙子空間] [能量分離EUS] [增量學習EKD] [OWOD]
CCL (Contextual Consistency Learning) [2026-03-29] 🔥 [開放詞彙檢測] [訓練側增強] [零推理延遲] [跨場景泛化]
ViT³ (ViT with Test-Time Training) [2025-12-16] 🔥 [視覺長序列建模] [線性複雜度] [極限省顯存] [CVPR 2026 Best Paper Finalist]
ViCrop-Det [2026-04-29] 🔥
[免訓練即插即用] [小目標檢測] [碾壓SAHI] [邊緣運算首選]FS-DETR [2026-04-21] 🔥 [小目標偵測] [頻域空間融合] [邊緣運算]
FT-FSOD (跨域小樣本目標偵測框架) [2026-03] 🔥
[小樣本偵測] [跨域泛化] [隱式集成解碼] [免數據擴增]B. 亞洲/中國頂尖開源 (極致效能與端側特化)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| YOLOv10 | 🇨🇳 清華大學 | 徹底消滅 NMS。首次在 YOLO 家族中移除後處理的非極大值抑制 (NMS),大幅降低推理延遲。 | 即時自動駕駛、無人機視覺[無後處理] [超低延遲] |
| VisionReasoner | 🇨🇳 開源社群 | 統一視覺感知與推理。利用強化學習技術,標榜效能可對標 Qwen2.5-VL 等大型視覺模型。 | 複雜場景理解、視覺問答[強化學習] [大模型對標] |
| MCL | 🇨🇳 AAAI 2025 | 遙感影像專家。專為空拍、衛星圖設計的半監督目標檢測框架 (Multi-clue Consistency Learning)。 | 農業監測、空拍圖分析[遙感特化] [半監督學習] |
[2026-03] 🔥 [小目標神作] [無人機巡檢] [計算量腰斬] [極致輕量]
影像生成已從單純的「文生圖 (Text-to-Image)」進化到「影片生成 (Video Generation)」與「精準控制」。本區塊區分歐美主流開源底座與亞洲大廠的高效能模型。
A. 國際主流底座與生態系 (設計與產能主力)
| 模型/工具名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| Flux 系列 | 🇩🇪 Black Forest Labs | Stable Diffusion 的真正繼承者。目前最強大的開源生圖模型,提供 Canny/Depth/Fill 等強大控制網開發工具。 | 專業 AI 繪圖、高質量商稿生成[開源王者] [極致細節] |
| Sana | 🇺🇸 NVIDIA / MIT 等 | 比 FLUX 快 100 倍! (ICLR 2025 Oral)。導入新一代架構,大幅降低生成高清圖片所需的算力與時間。 | 實時圖像生成、低算力設備[極速生成] [NVIDIA加持] |
| ComfyUI Impact Pack | 🌐 國際開源社群 | 最強臉部修復擴充。ComfyUI 生態系中必裝的節點包,專治 AI 生成的人物臉部崩壞或手部變形問題。 | 人像生成、細節修補工作流[ComfyUI外掛] [必裝工具] |
| FramePack | 🌐 國際開源社群 | 低顯存影片生成神器。能在 6G 顯存下跑 13B 模型,最高支援生成 1 分鐘的長影片。 | 個人創作者影片生成、低階顯卡[6G顯存] [長影片] |
B. 亞洲/中國開源大模型 (影片生成與實用工具)
| 模型/工具名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| Wan-Video (萬相) | 🇨🇳 阿里巴巴 | 全模態、全尺寸影片生成。阿里萬相大模型開源,具備極強的物理規律理解與高解析度影片生成能力。 | 影視特效預覽、廣告素材生成[大廠開源] [全尺寸] |
| HunyuanVideo-I2V | 🇨🇳 騰訊 | 高質量圖生影片。開源了圖生視訊模型以及專屬的 LoRA 訓練腳本,客製化彈性極高。 | 動態插畫、個人化風格影片[支援LoRA] [圖生影片] |
| Phantom | 🇨🇳 字節跳動 | 10G 顯存可用。支援生成 1280x720 高清影片的模型,硬體門檻相對友善。 | 社交媒體短影音、720P生成[低硬體門檻] [字節跳動] |
| HivisionIDPhotos | 🇨🇳 開源社群 | 智慧證件照生成神器。全自動完成精準摳圖、換背景、裁切任意尺寸,實用性極高。 | 攝影工作室、自動化影像處理[超高實用性] [一鍵生成] |
| Index-AniSora | 🇨🇳 Bilibili (B站) | 二次元特化。B 站開源的 SOTA 動畫影片生成模型,對動漫風格的掌握度目前無人能出其右。 | 動畫製作輔助、二次元創作[動漫風格] [SOTA模型] |
[Wan-Streamer] [2026-05] 🔥
[Vidu S1] [2026-07-03] 🔥
🏭 Anomaly Detection (工業異常檢測與 AOI)
無監督異常檢測是突破 AOI 產線良率瓶頸的關鍵。 導入 PatchCore 等特徵對齊架構,僅需 50 張正常樣本即可將瑕疵檢出率提升至 98% 以上。此方法有效解決工業製造中缺陷樣本稀缺的問題,降低 60% 漏檢風險。傳統 AOI (自動光學檢測) 高度依賴大量瑕疵樣本來訓練模型。但在真實工業場景中,收集數千張「特定種類」的瑕疵圖往往不切實際。近年來,異常檢測技術已轉向少樣本 (Few-shot) 與 零樣本 (Zero-shot) 學習。以下為 2025-2026 年最具代表性的開源方案:
本章收錄大量 CVPR 2026 論文,以下速覽表方便快速定位各篇重點;詳細內容請見對應子節。
| 論文名稱 | 子節 | 核心技術 | 推薦場景 |
|---|---|---|---|
| Omni-AD | 本節頂層 | 大規模工業通用基準,150 個品類 | 跨品類選型初篩 |
| Rethinking Transfer Learning (DINOv3 vs ImageNet) | 本節頂層 | 預訓練路線實測對比 | AOI 演算法選型 |
| Fine-VAD | §1 零樣本 | 漸進式跨粒度學習,mAP +47.7% | 智慧安防、工安行為預警 |
| CoPS | §1 零樣本 | 條件化動態提示詞,AUROC 92.5% | 工業/醫療冷啟動場景 |
| GS-CLIP | §1 零樣本 | 文本幾何翻譯+視覺雙流,3D 異常檢測 | 精密元器件 3D 品管 |
| LAVIDA | §1 零樣本 | 合成偽異常、零依賴真實數據 | 開放世界安防、產線監控 |
| AG-VAS | §1 零樣本 | 可學習錨點 Token,像素級二值分割 | 工業與醫療零樣本分割 |
| UniSpector | §1 零樣本 | 頻域+角間隔對比,開集缺陷識別 | PCB/電池片/金屬表面跨工位 |
| ADSeeker | §1 零樣本 | 多模態 RAG 知識庫+Q2K 精準檢索 | 離線復判、稀缺樣本場景 |
| FastRef | §2 少樣本 | 特徵遷移+最優傳輸迭代,Plug-and-Play | 多樣少量產線冷啟動 |
| SubspaceAD | §2 少樣本 | PCA 子空間+YOLO 雙引擎,1-shot | 邊緣運算、換線 AOI |
| SynSur | §2 少樣本 | 生成即標註端到端管線,LoRA 微調 | 新品早期質檢、罕見瑕疵補強 |
| Boxes2Pixels | §2 少樣本 | 框標註轉像素分割,161 FPS | 風機/表面污損即時邊緣運算 |
💡 選型建議: 若完全無缺陷樣本 → 優先看 §1 (CoPS / LAVIDA / GS-CLIP);若有少量樣本 → 看 §2 (FastRef / SubspaceAD);若需跨品類統一部署 → 看 §3 (Uni-RCM)。
SRA-Det [2026-03-17] 🔥 [開放詞彙檢測] [細粒度屬性] [CVPR 2026] [工業質檢]
Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks [2026-05] 🔥 [工業選型指南] [遷移學習重新審視] [反直覺硬核實測]
Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection [2026-06-25] 🔥 [工業異常通用基準] [真實產線數據] [雙協議評測] [大模型質檢噩夢]
利用大語言模型或 CLIP 龐大的常識庫,在「沒看過瑕疵樣本」的情況下,直接透過文字描述或視覺特徵揪出異常。
Fine-VAD (Fine-Grained Video Anomaly Detection) [2026-06] 🔥 [細粒度異常檢測] [影片安防] [CLIP多級對齊] [漸進式學習]
VisualAD [2026-03-09] 🔥 [零樣本異常檢測] [CVPR 2026] [視覺純化] [多領域 SOTA]
WinCLIP (Zero-/Few-Shot Anomaly Classification and Segmentation) [2023-06] 🔥 [零樣本AOI] [CLIP特徵升維] [狀態提示詞] [冷啟動救星]
CoPS (Conditional Prompt Synthesis for Zero-Shot Anomaly Detection) [2026-07] 🔥 [零樣本跨域] [條件化動態提示] [工業醫學雙全能] [SAGA空間感知]
GS-CLIP (Geometry-Aware Prompt and Synergistic View Representation Learning) [2026-03-29] 🔥
[CVPR 2026] LAVIDA (No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection Framework) [2026-07-11] 🔥
AG-VAS (Anchor-Guided Zero-Shot Visual Anomaly Segmentation) [2026-03-05] 🔥 [零樣本二值分割] [語義錨點黑科技] [開箱即用] [強泛化]
[SEG], [NOR], [ANO]),將抽象的「孔洞、劃痕」等異常轉化為具體視覺實體,並結合「語義–像素對齊模塊 (SPAM)」完美抹平高層語意與像素特徵的巨大鴻溝,不需經驗閾值即可直接生成極致乾淨的二值化 Anomaly Mask。UniSpector (Spectral-Contrastive Visual Prompting) [2026-04-23] 🔥 [開集缺陷識別] [視覺提示大模型] [免重訓冷啟動] [SOTA 霸主]
ADSeeker (Knowledge-Grounded Reasoning Framework) [2026-07-11] 🔥 [多模態異常推理] [多模態 RAG] [零樣本 SOTA] [稀疏特徵定位]
JUDO [2026-05] 🔥
[產線質檢大腦] [GRPO推理對齊] [超越GPT-4o]DCS (DINO-CLIP-SAM) [2026-06] 🔥
[零樣本AOI] [大模型串聯] [像素級分割] [免微調骨幹]AVA-DINO (Anomaly-Aware Vision-Language Adapters) [2026-05-13] 🔥
[零樣本檢測] [雙分支路由] [免標註質檢] [跨域泛化]LLM2CLIP [2026-01-29] 🔥
AA-CLIP [2025-04-12]:透過 Anomaly-Aware 機制增強 CLIP 的零樣本異常檢測能力。
AnomalyCLIP [2025-04-27]:Object-agnostic Prompt Learning,實現跨物體的零樣本異常偵測。
AdaptCLIP [2025-05-15]:將 CLIP 模型適配為通用的視覺異常檢測器。
Multi-Modal LLM for AD (VELM) [2025-05-05]:不僅偵測異常,還能進行分類與動作建議的工業多模態架構。
OneNIP [2024-10] 🔥
[單樣本質檢] [AOI神器] [跨類別通用]解決現場只能取得「正常良品圖」或極少量瑕疵圖的痛點。
REF+CFA (Anomaly-Related Residual Fields & Cross-domain Field Alignment) [2026-06] 🔥 [CVPR 2026] [跨域異常檢測] [擴散非平穩殘差場] [無監督遷移] [95.22% AUROC]
O2MAG (One-to-More) [2026-03] 🔥 [CVPR 2026] [免訓練缺陷擴樣] [三路注意力嫁接TriAG] [異常引導優化AGO] [工業AOI冷啟動]
InvAD (Inversion-based Reconstruction-Free Anomaly Detection) [2026-04] 🔥 [擴散模型] [免重建] [極速推論] [工業AOI]
AnomalyVFM (Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors) [2026-01] 🔥 [零樣本冷啟動] [純視覺VFM] [虛擬產線數據] [極速推論]
[ICCV 2025] TF-IDG (Training-Free Industrial Defect Generation with Diffusion Models) [2025-10] 🔥 [免訓練黑科技] [One-Shot資料增廣] [產線冷啟動] [台灣原生強權]
FastRef (Fast Prototype Refinement for Few-shot Industrial Anomaly Detection) [2026-03-29] 🔥
FoundAD (少樣本異常檢測基礎編碼器) [2025-10] 🔥
[1-shot極限檢測] [免文字提示] [極低顯存] [工業AOI]MeDS [2026-05] 🔥
[工業抗噪神作] [無懼髒數據] [自清洗閉環] [產線落地首選]Boxes2Pixels (框標註轉像素級分割神作) [2026-04] 🔥
[弱監督分割] [免像素標註] [極速161FPS] [工業AOI]DINO-AD [2026-02] 🔥
[免訓練 SOTA] [無監督學習] [醫療影像特化]SubspaceAD (YOLO + SubspaceAD 雙引擎架構) [CVPR 2026] 🔥 [1-shot 極限檢測] [免訓練] [零漏檢架構]
SynSur [CVPR 2026] 🔥 [合成資料生成] [端到端 AOI 管線] [LoRA微調]
StableDiffusionInpaintPipeline 快速復現]One-to-Normal [2025-06-13]
DualAnoDiff (CVPR 2025) [2025-06-06]
CostFilter-AD [2025-07-16]:透過 Matching Cost Filtering 技術,刷新無監督異常檢測的效能上限。📝 中文解讀
Dinomaly [2025-03-25]:The Less Is More Philosophy,極簡架構的多類別無監督異常檢測方案。
PaDim [2025-04-26]:工業界極為經典且泛用性高的無監督異常檢測與定位演算法。
Uni-RCM (跨模態多類別統一異常檢測框架) [2026-05] 🔥
[統一建模] [跨模態對齊] [AOI工業視覺] [多類別部署]MOCHA [2025-09-20]:Multi-modal Objects-aware 架構。將此技術注入 YOLO 後,檢測效能獲得大幅度成長。📝 中文解讀
FS-SAM2 [2025-09-24]:將 Meta 的 SAM 2 (Segment Anything 2) 模型適配於少樣本語義分割任務,在效能與效率上達到雙優。
🎯 Object Detection (目標偵測)
YOLOv11 架構在邊緣設備上的推論效能達到全新里程碑。 在 NVIDIA Jetson Orin 平台上實測,其 mAP 達 54.3% 時仍可維持 120 FPS 的即時處理速度。這為自駕車與高頻工業自動化提供了延遲小於 10ms 的完美解決方案。目標偵測不僅是畫出邊界框 (Bounding Box),目前的趨勢是結合語言模型與強化學習,實現「開放詞彙 (Open-Vocabulary)」與「極端場景特化」。
Stream3D [2026-05] 🔥 [流式3D重建與生成] [自適應證據記憶] [免訓練機制] [CVPR 2026] [恒定顯存]
DAMO-YOLO [2025-06] 🔥 [工業落地SOTA] [TinyNAS搜尋] [Efficient RepGFPN] [AlignedOTA標籤分配] [全尺度蒸餾]
MV3DT [2026-07] 🔥 [多視角3D追蹤] [去中心化架構] [自動標定] [DeepStream]
RT-DETRv4 [2025-10-25] 🔥 [即時目標檢測] [DETR] [知識蒸餾] [視覺基礎模型]
SAM 3D (3Dfy Anything in Images) [2026-05] 🔥 [單圖3D重建] [SAM家族升維] [DPO對齊] [亞秒級極速生成]
核心優勢:打破 2D 到 3D 的數據壁壘,單張照片秒建高品質、可互動的三維場景! Meta 於 CVPR 2026 榮獲提名的劃時代神作,將「分割萬物 (SAM)」的感知能力正式升維至 3D 空間。完美借鑑大語言模型 (LLM) 的「預訓練 → 真實數據微調 → DPO 偏好對齊」三階段煉丹法,結合 DINOv2 語意與稀疏潛流匹配 (Sparse Latent Flow)。模型不僅能像人類一樣「腦補」物體被遮擋的背面幾何形狀,還能精準還原高保真材質紋理。更透過模型蒸餾將推理極限壓縮至 4 步,達成驚人的亞秒級極速重建。
解決痛點 / 推薦場景:完美解決了傳統 3D 生成「極度依賴多視角拍攝」,且「遇到真實雜亂場景 (In-the-wild) 容易穿模、幾何崩壞」的致命痛點。 模型原生支援輸出通用三角網格 (Triangle Mesh) 與 3D 高斯潑濺 (3DGS),能無縫導入 Blender、Maya 與現代主流遊戲引擎。極度適合遊戲與 XR 開發團隊進行 3D 資產極速量產、賦予具身智能機器人 (Embodied AI) 空間幾何的直覺感知,以及作為自駕車複雜場景理解的工業級 3D 基礎模型。
資源:🐙 GitHub 官方開源 (Objects) | 📄 官方論文 (arXiv:2511.16624) | 🌐 官方專案與線上 Demo
MonoSAOD (Monocular 3D Object Detection) [2026-04] 🔥 [單目3D偵測] [稀疏標註] [偽標籤治理] [工業級過濾]
LocateAnything-3B (全能視覺定位與多模態檢測) [2026-05] 🔥
[平行框解碼] [UI自動化導航] [具身智能] [極低延遲]DetAny4D (端到端 4D 開放集物體檢測基準) [2026-02] 🔥
[4D物件偵測] [開放集 Open-set] [時空一致性] [自駕車感知]AFSS (Anti-Forgetting Sampling Strategy) [2026-03] 🔥
[訓練加速神器] [無損提速] [抗遺忘採樣] [算力省長]EUPE: DINOv3 + SAM + CLIP 三模合一輕量檢測框架 [2026] 🔥
lightly-train 框架高度封裝。開發者完全無需從頭煉丹,短短 10 行 Python 程式碼即可直接呼叫在 COCO 資料集上訓練完成的任務頭 (Task Head),實現精準的開箱即用目標偵測。ConvNeXt-Tiny 到 ViT-Base 等多種尺寸的預訓練權重。極度適合需要在邊緣運算設備 (Edge AI) 快速部署街景分析,或是缺乏算力但想享受 SOTA 級通用視覺特徵的個人開發者與中小企業。[開箱即用] [輕量化部署] [三模合一] [極簡API]Roboflow Trackers [2026] 🔥 [多目標跟蹤 MOT] [隨插即用] [Apache 2.0可商用]
SEATrack (Simple, Efficient, and Adaptive Multimodal Tracker) [2026-06] 🔥 [多模態追蹤] [PEFT極致輕量] [極端場景特化] [邊緣算力首選]
FT-FSOD (Parallel Decoder) [CVPR 2026] 🔥 [跨域少樣本] [並行解碼器] [自動化微調]
Rex-Omni [CVPR 2026] 🔥 [檢測一切] [GRPO強化學習] [Qwen2.5-VL底座]
YOLO26 頻域增強版 (FrequencyCM × C3k2) [2025-09] 🔥
[端到端無NMS] [頻域增強] [小目標檢測] [極低延遲部署]OV-DINO [2025-07-24]
CountVid [2025-06-18]
MCL (AAAI 2025) [2025]
VisionReasoner [2025-05-23]:用強化學習統一視覺感知與推理,對標大廠 VLM。
Falcon [2025-03-14]:遙感視覺與語言基礎模型 (Remote Sensing VLM)。
✂️ Segmentation (圖像分割/實例分割/实例分割)
零樣本 (Zero-shot) 分割模型徹底改變了醫療與遙測影像的標註流程。 應用 SAM (Segment Anything Model) 架構,可將多邊形標註時間從平均 3 分鐘縮減至 2 秒內,整體人力成本驟降 85%,且維持與人工標註達 95% 的 IoU 重合度。自從 Meta 推出 Segment Anything (SAM) 以來,圖像分割已經進入「提示即分割 (Promptable Segmentation)」的時代。
ConceptSeg-R1 [2026-05] 🔥
[概念級分割] [超越SAM3] [元強化學習Meta-GRPO] [醫療與缺陷定位]CAFe-DINO (DINO-Soars) [2026-05] 🔥
[零遙感微調] [OVSS開詞彙分割] [DINOv3魔改] [遙感衛星大腦]LuoHuaLabel (基於 SAM 3 的智慧標註神器) [2026] 🔥
[SAM3驅動] [智慧標註神器] [OBB旋轉框] [零成本開源]Falcon Perception [2026-04-01] 🔥
SAM3-I [2026-05] 🔥 [指令驅動] [免大模型代理] [部件級分割]
Meta SAM 2 及其變體:
RMAE-ProGRess (LCA / LCAR) [2026-06-03] 🔥 [CVPR 2026] [非結構化語義分割] [LCA輕量通道注意力] [越野與遙感特化] [即插即用]
SOPSeg [2026-06] 🔥 [CVPR 2026] [遥感小目標實例分割] [區域自適應放大RAM] [定向提示OPM] [邊緣感知EDE] [ReSOS資料集]
EReCu [2026-03-12] 🔥 [無監督偽裝目標檢測]
VGGT-S (VGGT-Segmentor) [2026-04] 🔥 [跨視角分割] [幾何增強] [Ego-Exo對齊] [免配對預訓練]
DiCLIP (Diffusion Enhanced CLIP for Weakly Supervised Segmentation) [2026-06] 🔥 [弱監督分割 WSSS] [知識遷移] [訓練降本 90%] [生成式賦能]
CaptionFormer [2026-06] 🔥
SAM3-LoRA 醫學影像微調實戰 (ISIC 2018) [2026] 🔥
[SAM3微調] [醫療影像特化] [低算力救星] [LoRA極速煉丹]X2SAM [2026-05] 🔥 [圖影大一統] [多模態分割] [時序一致性]
BCSI (Bidirectional Channel-selective Semantic Interaction) [2026-01] 🔥
[半監督學習] [醫學影像分割] [雙向通道交互] [免大量標註]RNS (Retrieve and Segment) [CVPR 2026] 🔥 [視覺RAG] [少樣本分割] [測試時適配]
TIPSv2 [CVPR 2026] 🔥 [像素級理解] [零樣本分割] [視覺-語言預訓練]
iBOT++ 掩碼圖像建模目標,首度強制模型「對齊可見 Token 的表徵」,並結合 Head-only EMA 與多粒度文本描述策略。在零樣本分割任務上全面輾壓 SigLIP2 與 DINOv2 (例如 PASCAL VOC 達 62.4 mIoU),實現前所未有的邊界清晰度與語意一致性。INSID3 [CVPR 2026] 🔥 [免訓練分割] [DINOv3特化] [輕量極速]
Perceive Anything Model:對標 SAM2 + LLM,不僅能分割,還能理解並描述物件。📝 中文解讀
RemoteSAM:面向地球觀測 (Earth Observation) 的通用分割模型。
MatAnyone:視訊摳圖專用,主打髮絲級還原。
📖 OCR (Optical Character Recognition 光學文字識別) 針對物件或場景影像進行分析與偵測
多模態大模型 (MLLM) 已成為高複雜度文檔解析的標準配置。 結合 MinerU 或 DeepSeek-VL,針對手寫體與多語言混排表單的辨識準確率突破 96%,相較傳統 Tesseract 引擎提升 40% 的端到端資訊抽取成功率。隨著大模型技術下放,OCR 已經從單純的「字元辨識」進化為「複雜版面理解 (Document Understanding)」。
👉 延伸閱讀:針對物件或場景影像進行分析與偵測 (觀念總結) | 12個流行的開源免費OCR項目
處理手寫字跡、模糊掃描檔與不規則表單的最佳解法。
Unlimited-OCR (無限 OCR) [2026-06] 🔥 [長文件解析] [R-SWA注意力] [恆定顯存] [端到端SOTA]
Chandra OCR 2 [2026-04-16] 🔥
[2025-10-21]:標榜超越 DeepSeek-OCR 的革命性突破,支援本地部署。📝 真實評測Qianfan-OCR [2026-03-25] 🔥
DeepSeek-OCR 2 [2026-01-27] 🔥
HunyuanOCR [2025-11-30]:騰訊混元釋出的 1B 級全能模型。
PP-OCRv6 (PaddleOCR 第六代) [2026-06] 🔥
PaddleOCR-VL-1.6 (生成式文件解析開源霸主) [2026-05-28] 🔥
[RAG前處理] [完全離線部署] [版面分析] [開源霸主]DianJin-OCR-R1 [2025-08-18]:點金 OCR,專攻模糊蓋章與跨頁表格。
將複雜排版的文件完美轉換為適合大語言模型閱讀的 Markdown 格式。
MinerU 2.5-Pro [2026-04-16] 🔥
[2025-02-05]:解決痛點:將 PDF 完美轉換為乾淨 Markdown 的開源神器。高保真還原數學公式與程式碼區塊,是準備 LLM 訓練語料的必備清洗工具。PDFMathTranslate [2025-11-12] 🔥
DocLayout-YOLO 視覺模型進行版面佈局解析,徹底打破傳統 PDF 翻譯工具將公式文字化、導致排版盡毀的黑盒限制。它能精準「解剖」論文結構,完美復刻 LaTeX 數學公式、複雜嵌套表格與文獻引用,並原生對接 OpenAI、DeepL、Google 乃至本地部署的 Ollama 等多元 LLM 推理引擎。全球累積下載量已突破 22 萬次。OCRFlux [2025-06-16]
markitdown [2024-12-15]:微軟官方開源的文件轉換工具。
OmniParser [2024-10-29]:Alibaba 出品,通用文檔複雜場景抽取。
olmocr [2025-03-03]:支援本地部署精準提取 PDF。
Stirling-PDF (全能隱私安全 PDF 處理基礎設施) [持續更新] 🔥
Falcon OCR [2026-04-01] 🔥
OpenDoc-0.1B [2026-01-28] / OpenOCR [2025-03-05]:極度輕量化的開源 OCR 專案。
dots.ocr [2025-07-30]:本地部署的 1.7B 超強 OCR。
MonkeyOCR [2025-06-05]:猴子家族的文檔辨識專案。
PP-DocBee [2025-03-05]:百度文檔影像理解模型。
GOT-OCR-2.0 [2024-09-11]:宣告 OCR 2.0 時代來臨的代表作。
RapidOCR:跨平台、高效率的實用 OCR 部署方案。
TableStructureRec:專門對付複雜表格結構的辨識推理庫。
🎨 Diffusion Model (擴散模型與影像生成)
擴散模型將生成式影像的控制精度提升至像素級別。 透過 ControlNet 條件注入,Stable Diffusion 3 可以在 20 步內生成符合特定骨架或深度的 4K 圖像,將電商與遊戲資產的設計週期從數週壓縮至 3 小時內。擴散模型已經從單純的「文字生圖」,進化到「長影片生成」、「精準控制」與「一體化生成」。以下精選 2025-2026 年最具影響力的開源專案:
突破硬體極限與時長限制,帶來電影級的視覺理解。
SANA (NVIDIA 全端高效擴散生成生態系) [2026-05] 🔥
[線性擴散模型] [世界模型] [極低顯存門檻] [實時影片生成]SVOR (Stable Video Object Removal) [2026-03] 🔥 [影片物件消除] [物理感知] [高容錯]
Wan-Video (萬相) [2025-02-25]
SkyReels V2 [2025-04-22]:全球首個無限時長影片生成模型,具備電影級的場景理解能力。
MAGI-1 [2025-04-22]:Sand AI 推出的全球首個自回歸影片生成大模型。
Phantom [2025-04-24]:字節跳動開源。極度友善的硬體門檻,僅需 10G 顯存即可生成 1280x720 高清影片。
Index-AniSora [2025-05-19]:B 站開源的 SOTA 動畫影片生成模型,二次元風格特化。
MAI-Image-2 [2026-04-16] 🔥
SenseNova-Vision [2026-07] 🔥 [視覺任務大一統] [統一多模態生成UMM] [免專屬預測頭] [7B-MoT] [50M語料庫]
Vision Banana [2026-04] 🔥
[生成即理解] [零樣本 SOTA] [超越 SAM 3] [通用視覺基座]SceneScribe-1M (百萬級 3D 幾何與語意真實影片資料庫) [2026-04] 🔥
[世界基礎模型] [可控影片生成] [4D場景重建] [超大真實數據]Nucleus-Image 17B [2026-04] 🔥
[MoE擴散模型] [極低推理成本] [精準空間佈局]Sana (ICLR 2025 Oral) [2025-01-28] 🔥
Jodi [2025-05-28]:視覺理解與生成大一統模型,打破辨識與生成的界線。
FlashVideo [2025-02-14]:字節跳動視訊增強演算法,102 秒即可生成 1080P 影片。
專注於解決 AI 生成過程中的臉部崩壞、手部變形與硬體限制。
RefineAnything [2026-04] 🔥 [局部精修] [背景凍結] [Qwen-Image底座]
FramePack [2025-04-14]:ComfyUI 擴充神套件,能在 6G 顯存下跑 13B 模型,最高支援生成 1 分鐘的長影片。
Flux 生態系與控制網:
[2024-11-29]:極強的人物特徵保持與換臉工具。[2024-12-17]:Meta AI 推出的人物特徵保持方案。HivisionIDPhotos [2025-05-23]:超實用!智慧證件照生成神器,全自動精準摳圖、換背景、裁切任意尺寸。
ComfyUI Impact Pack:ComfyUI 必裝節點包,提供最強臉部與細節修復。
AnomalyAny (CVPR 2025) [2025-05-27]:利用 Stable Diffusion 協助進行視覺異常檢測,完全無需訓練。
🧑💻 Digital Human (虛擬數字人)
神經輻射場 (NeRF) 與 3D Gaussian Splatting 加速了即時擬真分身的商用普及。 採用單張照片驅動的 3D 虛擬人,能在 RTX 4090 上實現 4K 解析度 60 FPS 即時渲染,口型同步延遲低於 50ms,適用於全天候智能客服。虛擬數字人技術結合了語音驅動 (Audio-Driven)、唇形對齊 (Lip-Sync) 與 3D 渲染,是目前 AI 客服與虛擬直播的技術核心。
CyberVerse [2026-04-18] 🔥 [即時視訊對話] [零建模單圖生成] [WebRTC流式傳輸] [全鏈路Agent]
LongCat-Video-Avatar 1.5 [2026-05] 🔥
[8步極速生成] [GRPO偏好對齊] [多人互動支援] [商業級擬真]InfiniteTalk [2026-04] 🔥
[全身同步] [無限時長] [開源可商用] [ComfyUI支援]Duix Avatar (全離線 AI 數位分身框架) [持續更新] 🔥
[完全離線部署] [數位分身] [高精度唇形同步] [免上雲護隱私]SoulX-LiveAct [2026-03-16] 🔥
StreamAvatar [2025-12] 🔥
Live Avatar [持續更新] 🔥
Wan2.2-S2V-14B 基礎模型之上,支援流式生成(Streaming Generation),能透過單張照片與音訊,生成畫質極高且「無限時長」的動態說話影片。SoulX-FlashTalk [2025-12-24] 🔥
JoyStreamer-Flash [2025-12]
EchoMimic V3 [持續更新] 🔥
Wan2.1-Fun-V1.1-1.3B 與 wav2vec2-base-960h,進一步強化了臉部表情的細節與唇形同步的精準度,是目前最受矚目的開源數字人框架之一。models/transformer),並適度在 app_mm.py 中下調 num_frames(分段長度)以降低顯存壓力。適合具備高階算力(如 24G+ VRAM)的企業級開發者進行二次開發。Fantasy-talking [2025-04-14]:基於強大的 Wan2.1 影片生成底座,打造的高畫質音訊驅動數字人。
Hallo3 (CVPR 2025):復旦大學開源,主打高度動態且極具表現力的肖像動畫生成。
FlowAct-R1:基於流匹配技術的高效能數字人生成框架。
OpenTalking [2026-05] 🔥
[工業級編排] [實時互動] [WebRTC低延遲] [全鏈路串接]PersonaLive [CVPR 2026] 🔥
[流式生成] [無限時長] [低硬體門檻] [ComfyUI支援]Linly-Talker [持續更新] 🔥
Open Avatar Chat:爆火的開源神器,主打本地部署、無套路,輕鬆打造個人虛擬助理。
MimicTalk (NeurIPS 2024):專注於 3D Talking Face 生成的學術級框架。
商用級別開源 (克隆與真人還原):
🖼️ 基礎圖像識別 (Image Recognition)
在追求酷炫的生成式 AI 之前,理解圖像分類的底層架構仍然是電腦視覺的必修課。以下是從 CNN 時代走向 Transformer 時代的三大奠基之作:
EUPE (Efficient Universal Perception Encoder) [2026-03] 🔥 [通用視覺編碼器] [多任務聚合] [邊緣運算]
[Sapiens2] [2026-04-23] 🔥 [開源人體視覺霸主] [零依賴部署] [單文件架構] [4K高解析度]
standalone/sapiens2.py 單文件零依賴架構,只需 torch 與 safetensors 即可極速集成。[IMDD-1M] [2026-03] 🔥
[MAGIC] [2026-03] 🔥
[MoECLIP] [2026-03-29] 🔥
📄 Document AI (文檔理解與複雜排版解析)
傳統 OCR 只能單純提取文字,但真實世界的文檔(如財報、發票、學術論文)充滿了複雜的表格與版面設計。本區塊收錄了從「版面分析」到「端對端解析」的核心基礎模型:
跳過傳統的文字檢測與辨識步驟,直接將圖片轉化為結構化文本。
Infinity-Parser2 [2026-05] 🔥
[RAG前處理] [端到端解析] [超越Gemini] [極速推論]Logics-Parsing (含 Omni/v2) [2026-03] 🔥
Donut (2022):OCR-free Document Understanding Transformer。不依賴底層 OCR 引擎的文檔理解架構。📄 arXiv:2111.15664
Nougat (2023):Neural Optical Understanding for Academic Documents。Meta 推出的學術文獻解析神器,能完美處理論文中的數學公式與排版。📄 arXiv:2308.13418
專門對付自然場景中形狀扭曲、光影複雜的文字辨識。
🕵️♂️ 深度偽造與換臉偵測 (DeepFake Detection)
隨著生成式 AI (AIGC) 的爆發,如何防範惡意的 AI 換臉與造假成為資安重頭戲。以下收錄 CVPR 2021 針對深度偽造偵測的三大經典防禦架構:
❓ 電腦視覺開發常見問題解答 (FAQ)
Q1: 工業 AOI 瑕疵樣本太少怎麼辦? A: 採用基於 PatchCore 的無監督異常檢測方案,僅需約 50-100 張「正常樣本」即可建立基準,檢出率可達 98% 以上。
Q2: 邊緣運算 (Edge AI) 該選哪個物體偵測模型? A: 首選 YOLOv11 或 YOLO-NAS。在 Jetson Nano 級別設備上,INT8 量化後可維持 30 FPS 以上的即時偵測效能。
Q3: 如何快速標註大量圖像分割資料集? A: 導入 SAM (Segment Anything) 作為輔助工具,點擊目標即可自動生成邊界,實測可節省 85% 以上的人工框選時間。
Q4: 傳統 OCR 無法處理複雜表格怎麼解? A: 改用多模態大模型 (如 MinerU 或 DeepSeek-VL) 進行端到端解析,版面分析與文字提取的綜合準確率可提升至 96%。
Q5: 虛擬數字人 (Digital Human) 的口型延遲可以多低? A: 結合最新的 3D Gaussian Splatting 與輕量化語音驅動模型,端到端的口型同步延遲已可穩定控制在 50ms 以內。
103 commits
11 commits
HTML
100.0%
https://deep-learning-101.github.io/Computer-Vision Computer vision (電腦視覺)
See the code{% include header.html %}
編者按: 本頁面彙整目前最主流、持續追蹤 2026 電腦視覺 (CV) 開源模型選型指南、最新發布、動態與進展。
如果您需要關注/追蹤更新/尋找更詳細的筆記,歡迎 ⭐ 及 Watch 我們的 GitHub Repository 👉 GitHub: Computer-Vision-Paper 👈🏻
📌 技術速覽 2026年工業視覺聚焦於多模態融合與少樣本 (Few-shot) 檢索。Deep Learning 101 彙整 YOLOv11、擴散模型及高精度 OCR 等開源技術,實務上可協助企業突破傳統 AOI 光影過殺瓶頸,提升產線良率至 99%,並降低 80% 的資料標註成本。
📅 2026-08-17 更新快訊
- REF+CFA
[2026-06]🔥 [CVPR 2026] [跨域異常檢測] [擴散非平穩殘差場] [無監督遷移]- VL-DINO
[2026-06-10]🔥 [開放詞表檢測] [CLIP雙線並用] [肥訓練瘦推理] [長尾類別SOTA]- RMAE-ProGRess
[2026-06-03]🔥 [CVPR 2026] [非結構化語義分割] [LCA輕量通道注意力] [越野與遙感特化]- SOPSeg
[2026-06]🔥 [CVPR 2026] [遥感小目標實例分割] [區域自適應放大RAM] [定向提示OPM]- SFS-DETR
[2026-06]🔥 [CVPR 2026] [無人機小目標檢測] [空間-頻率自適應選擇] [96 FPS即時感知]- DEUS
[2026-03]🔥 [CVPR 2026] [開放世界目標檢測] [ETF雙子空間] [能量分離EUS]- DAMO-YOLO
[2025-06]🔥 [工業落地SOTA] [TinyNAS搜尋] [Efficient RepGFPN] [AlignedOTA標籤分配]- SenseNova-Vision
[2026-07]🔥 [視覺任務大一統] [統一多模態生成UMM] [免專屬預測頭] [7B-MoT]- O2MAG
[2026-03]🔥 [CVPR 2026] [免訓練缺陷擴樣] [三路注意力嫁接TriAG] [異常引導優化AGO]- Stream3D
[2026-05]🔥 [流式3D重建與生成] [自適應證據記憶] [免訓練機制] [CVPR 2026]
📅 2026-07-25 更新快訊
- MV3DT
[2026-07]🔥 多視角3D追蹤、去中心化架構、自動標定、DeepStream- VisualAD
[2026-03-09]🔥 零樣本異常檢測、視覺純化、多領域 SOTA [CVPR 2026]- EReCu
[2026-03-12]🔥 無監督偽裝目標檢測- MAGIC
[2026-03]🔥 少樣本缺陷生成全新 SOTA,打通「學術優雅」與「產線現實」的擴散模型神作!- MoECLIP
[2026-03-29]🔥 裝上一群分工明確的專家,解鎖零樣本異常檢測(ZSAD)全新工業級霸主!
{% include ai-share.html %}
目標偵測的標準幾乎由 YOLO 家族定義。此區塊整理了目前最主流的 YOLO 版本與新世代開放詞彙(Open-Vocabulary)模型。特別標註開發源頭,方便針對地緣資安需求進行選型。
A. 國際大廠與台灣原生強權 (資安合規首選)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| YOLOv11 | 🇺🇸 Ultralytics | 全能視覺霸主。架構大翻新,不僅做目標偵測,還原生支援實例分割、姿態辨識與旋轉邊界框 (OBB)。 | 邊緣運算、多任務視覺 AI[歐美開源] [多任務支援] |
| YOLOv9 | 🇹🇼 中研院 (王建堯博士團隊) | 台灣之光! 導入 PGI (Programmable Gradient Information) 技術,解決深層網路資訊遺失問題,參數少但準確度極高。 | 資源受限的本地端設備、瑕疵檢測[台灣開發] [高參數利用率] |
| YOLOv8 | 🇺🇸 Ultralytics | 生態系最完善。雖然不是最新,但在社群中的教學、部署套件、ONNX/TensorRT 轉換資源最為豐富。 | 工業級穩定部署、初學者專案[生態豐富] [極易部署] |
| OV-DINO | 🇺🇸 國際學術界 | 開源工業開放詞彙目標檢測。不需要預先定義好類別,直接用自然語言提示 (Prompt) 就能找出畫面中對應的物體。 | 零樣本 (Zero-shot) 偵測、通用場景[Open-Vocabulary] [前沿技術] |
VL-DINO [2026-06-10] 🔥 [開放詞表檢測] [CLIP雙線並用] [肥訓練瘦推理] [長尾類別SOTA] [DINO架構]
SFS-DETR [2026-06] 🔥 [CVPR 2026] [無人機小目標檢測] [空間-頻率自適應選擇] [語義對齊融合SAF] [96 FPS即時感知]
DEUS (Detecting Unknown Objects via Energy-based Separation) [2026-03] 🔥 [CVPR 2026] [開放世界目標檢測] [ETF雙子空間] [能量分離EUS] [增量學習EKD] [OWOD]
CCL (Contextual Consistency Learning) [2026-03-29] 🔥 [開放詞彙檢測] [訓練側增強] [零推理延遲] [跨場景泛化]
ViT³ (ViT with Test-Time Training) [2025-12-16] 🔥 [視覺長序列建模] [線性複雜度] [極限省顯存] [CVPR 2026 Best Paper Finalist]
ViCrop-Det [2026-04-29] 🔥
[免訓練即插即用] [小目標檢測] [碾壓SAHI] [邊緣運算首選]FS-DETR [2026-04-21] 🔥 [小目標偵測] [頻域空間融合] [邊緣運算]
FT-FSOD (跨域小樣本目標偵測框架) [2026-03] 🔥
[小樣本偵測] [跨域泛化] [隱式集成解碼] [免數據擴增]B. 亞洲/中國頂尖開源 (極致效能與端側特化)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| YOLOv10 | 🇨🇳 清華大學 | 徹底消滅 NMS。首次在 YOLO 家族中移除後處理的非極大值抑制 (NMS),大幅降低推理延遲。 | 即時自動駕駛、無人機視覺[無後處理] [超低延遲] |
| VisionReasoner | 🇨🇳 開源社群 | 統一視覺感知與推理。利用強化學習技術,標榜效能可對標 Qwen2.5-VL 等大型視覺模型。 | 複雜場景理解、視覺問答[強化學習] [大模型對標] |
| MCL | 🇨🇳 AAAI 2025 | 遙感影像專家。專為空拍、衛星圖設計的半監督目標檢測框架 (Multi-clue Consistency Learning)。 | 農業監測、空拍圖分析[遙感特化] [半監督學習] |
[2026-03] 🔥 [小目標神作] [無人機巡檢] [計算量腰斬] [極致輕量]
影像生成已從單純的「文生圖 (Text-to-Image)」進化到「影片生成 (Video Generation)」與「精準控制」。本區塊區分歐美主流開源底座與亞洲大廠的高效能模型。
A. 國際主流底座與生態系 (設計與產能主力)
| 模型/工具名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| Flux 系列 | 🇩🇪 Black Forest Labs | Stable Diffusion 的真正繼承者。目前最強大的開源生圖模型,提供 Canny/Depth/Fill 等強大控制網開發工具。 | 專業 AI 繪圖、高質量商稿生成[開源王者] [極致細節] |
| Sana | 🇺🇸 NVIDIA / MIT 等 | 比 FLUX 快 100 倍! (ICLR 2025 Oral)。導入新一代架構,大幅降低生成高清圖片所需的算力與時間。 | 實時圖像生成、低算力設備[極速生成] [NVIDIA加持] |
| ComfyUI Impact Pack | 🌐 國際開源社群 | 最強臉部修復擴充。ComfyUI 生態系中必裝的節點包,專治 AI 生成的人物臉部崩壞或手部變形問題。 | 人像生成、細節修補工作流[ComfyUI外掛] [必裝工具] |
| FramePack | 🌐 國際開源社群 | 低顯存影片生成神器。能在 6G 顯存下跑 13B 模型,最高支援生成 1 分鐘的長影片。 | 個人創作者影片生成、低階顯卡[6G顯存] [長影片] |
B. 亞洲/中國開源大模型 (影片生成與實用工具)
| 模型/工具名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 & 規格標籤 |
|---|---|---|---|
| Wan-Video (萬相) | 🇨🇳 阿里巴巴 | 全模態、全尺寸影片生成。阿里萬相大模型開源,具備極強的物理規律理解與高解析度影片生成能力。 | 影視特效預覽、廣告素材生成[大廠開源] [全尺寸] |
| HunyuanVideo-I2V | 🇨🇳 騰訊 | 高質量圖生影片。開源了圖生視訊模型以及專屬的 LoRA 訓練腳本,客製化彈性極高。 | 動態插畫、個人化風格影片[支援LoRA] [圖生影片] |
| Phantom | 🇨🇳 字節跳動 | 10G 顯存可用。支援生成 1280x720 高清影片的模型,硬體門檻相對友善。 | 社交媒體短影音、720P生成[低硬體門檻] [字節跳動] |
| HivisionIDPhotos | 🇨🇳 開源社群 | 智慧證件照生成神器。全自動完成精準摳圖、換背景、裁切任意尺寸,實用性極高。 | 攝影工作室、自動化影像處理[超高實用性] [一鍵生成] |
| Index-AniSora | 🇨🇳 Bilibili (B站) | 二次元特化。B 站開源的 SOTA 動畫影片生成模型,對動漫風格的掌握度目前無人能出其右。 | 動畫製作輔助、二次元創作[動漫風格] [SOTA模型] |
[Wan-Streamer] [2026-05] 🔥
[Vidu S1] [2026-07-03] 🔥
🏭 Anomaly Detection (工業異常檢測與 AOI)
無監督異常檢測是突破 AOI 產線良率瓶頸的關鍵。 導入 PatchCore 等特徵對齊架構,僅需 50 張正常樣本即可將瑕疵檢出率提升至 98% 以上。此方法有效解決工業製造中缺陷樣本稀缺的問題,降低 60% 漏檢風險。傳統 AOI (自動光學檢測) 高度依賴大量瑕疵樣本來訓練模型。但在真實工業場景中,收集數千張「特定種類」的瑕疵圖往往不切實際。近年來,異常檢測技術已轉向少樣本 (Few-shot) 與 零樣本 (Zero-shot) 學習。以下為 2025-2026 年最具代表性的開源方案:
本章收錄大量 CVPR 2026 論文,以下速覽表方便快速定位各篇重點;詳細內容請見對應子節。
| 論文名稱 | 子節 | 核心技術 | 推薦場景 |
|---|---|---|---|
| Omni-AD | 本節頂層 | 大規模工業通用基準,150 個品類 | 跨品類選型初篩 |
| Rethinking Transfer Learning (DINOv3 vs ImageNet) | 本節頂層 | 預訓練路線實測對比 | AOI 演算法選型 |
| Fine-VAD | §1 零樣本 | 漸進式跨粒度學習,mAP +47.7% | 智慧安防、工安行為預警 |
| CoPS | §1 零樣本 | 條件化動態提示詞,AUROC 92.5% | 工業/醫療冷啟動場景 |
| GS-CLIP | §1 零樣本 | 文本幾何翻譯+視覺雙流,3D 異常檢測 | 精密元器件 3D 品管 |
| LAVIDA | §1 零樣本 | 合成偽異常、零依賴真實數據 | 開放世界安防、產線監控 |
| AG-VAS | §1 零樣本 | 可學習錨點 Token,像素級二值分割 | 工業與醫療零樣本分割 |
| UniSpector | §1 零樣本 | 頻域+角間隔對比,開集缺陷識別 | PCB/電池片/金屬表面跨工位 |
| ADSeeker | §1 零樣本 | 多模態 RAG 知識庫+Q2K 精準檢索 | 離線復判、稀缺樣本場景 |
| FastRef | §2 少樣本 | 特徵遷移+最優傳輸迭代,Plug-and-Play | 多樣少量產線冷啟動 |
| SubspaceAD | §2 少樣本 | PCA 子空間+YOLO 雙引擎,1-shot | 邊緣運算、換線 AOI |
| SynSur | §2 少樣本 | 生成即標註端到端管線,LoRA 微調 | 新品早期質檢、罕見瑕疵補強 |
| Boxes2Pixels | §2 少樣本 | 框標註轉像素分割,161 FPS | 風機/表面污損即時邊緣運算 |
💡 選型建議: 若完全無缺陷樣本 → 優先看 §1 (CoPS / LAVIDA / GS-CLIP);若有少量樣本 → 看 §2 (FastRef / SubspaceAD);若需跨品類統一部署 → 看 §3 (Uni-RCM)。
SRA-Det [2026-03-17] 🔥 [開放詞彙檢測] [細粒度屬性] [CVPR 2026] [工業質檢]
Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks [2026-05] 🔥 [工業選型指南] [遷移學習重新審視] [反直覺硬核實測]
Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection [2026-06-25] 🔥 [工業異常通用基準] [真實產線數據] [雙協議評測] [大模型質檢噩夢]
利用大語言模型或 CLIP 龐大的常識庫,在「沒看過瑕疵樣本」的情況下,直接透過文字描述或視覺特徵揪出異常。
Fine-VAD (Fine-Grained Video Anomaly Detection) [2026-06] 🔥 [細粒度異常檢測] [影片安防] [CLIP多級對齊] [漸進式學習]
VisualAD [2026-03-09] 🔥 [零樣本異常檢測] [CVPR 2026] [視覺純化] [多領域 SOTA]
WinCLIP (Zero-/Few-Shot Anomaly Classification and Segmentation) [2023-06] 🔥 [零樣本AOI] [CLIP特徵升維] [狀態提示詞] [冷啟動救星]
CoPS (Conditional Prompt Synthesis for Zero-Shot Anomaly Detection) [2026-07] 🔥 [零樣本跨域] [條件化動態提示] [工業醫學雙全能] [SAGA空間感知]
GS-CLIP (Geometry-Aware Prompt and Synergistic View Representation Learning) [2026-03-29] 🔥
[CVPR 2026] LAVIDA (No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection Framework) [2026-07-11] 🔥
AG-VAS (Anchor-Guided Zero-Shot Visual Anomaly Segmentation) [2026-03-05] 🔥 [零樣本二值分割] [語義錨點黑科技] [開箱即用] [強泛化]
[SEG], [NOR], [ANO]),將抽象的「孔洞、劃痕」等異常轉化為具體視覺實體,並結合「語義–像素對齊模塊 (SPAM)」完美抹平高層語意與像素特徵的巨大鴻溝,不需經驗閾值即可直接生成極致乾淨的二值化 Anomaly Mask。UniSpector (Spectral-Contrastive Visual Prompting) [2026-04-23] 🔥 [開集缺陷識別] [視覺提示大模型] [免重訓冷啟動] [SOTA 霸主]
ADSeeker (Knowledge-Grounded Reasoning Framework) [2026-07-11] 🔥 [多模態異常推理] [多模態 RAG] [零樣本 SOTA] [稀疏特徵定位]
JUDO [2026-05] 🔥
[產線質檢大腦] [GRPO推理對齊] [超越GPT-4o]DCS (DINO-CLIP-SAM) [2026-06] 🔥
[零樣本AOI] [大模型串聯] [像素級分割] [免微調骨幹]AVA-DINO (Anomaly-Aware Vision-Language Adapters) [2026-05-13] 🔥
[零樣本檢測] [雙分支路由] [免標註質檢] [跨域泛化]LLM2CLIP [2026-01-29] 🔥
AA-CLIP [2025-04-12]:透過 Anomaly-Aware 機制增強 CLIP 的零樣本異常檢測能力。
AnomalyCLIP [2025-04-27]:Object-agnostic Prompt Learning,實現跨物體的零樣本異常偵測。
AdaptCLIP [2025-05-15]:將 CLIP 模型適配為通用的視覺異常檢測器。
Multi-Modal LLM for AD (VELM) [2025-05-05]:不僅偵測異常,還能進行分類與動作建議的工業多模態架構。
OneNIP [2024-10] 🔥
[單樣本質檢] [AOI神器] [跨類別通用]解決現場只能取得「正常良品圖」或極少量瑕疵圖的痛點。
REF+CFA (Anomaly-Related Residual Fields & Cross-domain Field Alignment) [2026-06] 🔥 [CVPR 2026] [跨域異常檢測] [擴散非平穩殘差場] [無監督遷移] [95.22% AUROC]
O2MAG (One-to-More) [2026-03] 🔥 [CVPR 2026] [免訓練缺陷擴樣] [三路注意力嫁接TriAG] [異常引導優化AGO] [工業AOI冷啟動]
InvAD (Inversion-based Reconstruction-Free Anomaly Detection) [2026-04] 🔥 [擴散模型] [免重建] [極速推論] [工業AOI]
AnomalyVFM (Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors) [2026-01] 🔥 [零樣本冷啟動] [純視覺VFM] [虛擬產線數據] [極速推論]
[ICCV 2025] TF-IDG (Training-Free Industrial Defect Generation with Diffusion Models) [2025-10] 🔥 [免訓練黑科技] [One-Shot資料增廣] [產線冷啟動] [台灣原生強權]
FastRef (Fast Prototype Refinement for Few-shot Industrial Anomaly Detection) [2026-03-29] 🔥
FoundAD (少樣本異常檢測基礎編碼器) [2025-10] 🔥
[1-shot極限檢測] [免文字提示] [極低顯存] [工業AOI]MeDS [2026-05] 🔥
[工業抗噪神作] [無懼髒數據] [自清洗閉環] [產線落地首選]Boxes2Pixels (框標註轉像素級分割神作) [2026-04] 🔥
[弱監督分割] [免像素標註] [極速161FPS] [工業AOI]DINO-AD [2026-02] 🔥
[免訓練 SOTA] [無監督學習] [醫療影像特化]SubspaceAD (YOLO + SubspaceAD 雙引擎架構) [CVPR 2026] 🔥 [1-shot 極限檢測] [免訓練] [零漏檢架構]
SynSur [CVPR 2026] 🔥 [合成資料生成] [端到端 AOI 管線] [LoRA微調]
StableDiffusionInpaintPipeline 快速復現]One-to-Normal [2025-06-13]
DualAnoDiff (CVPR 2025) [2025-06-06]
CostFilter-AD [2025-07-16]:透過 Matching Cost Filtering 技術,刷新無監督異常檢測的效能上限。📝 中文解讀
Dinomaly [2025-03-25]:The Less Is More Philosophy,極簡架構的多類別無監督異常檢測方案。
PaDim [2025-04-26]:工業界極為經典且泛用性高的無監督異常檢測與定位演算法。
Uni-RCM (跨模態多類別統一異常檢測框架) [2026-05] 🔥
[統一建模] [跨模態對齊] [AOI工業視覺] [多類別部署]MOCHA [2025-09-20]:Multi-modal Objects-aware 架構。將此技術注入 YOLO 後,檢測效能獲得大幅度成長。📝 中文解讀
FS-SAM2 [2025-09-24]:將 Meta 的 SAM 2 (Segment Anything 2) 模型適配於少樣本語義分割任務,在效能與效率上達到雙優。
🎯 Object Detection (目標偵測)
YOLOv11 架構在邊緣設備上的推論效能達到全新里程碑。 在 NVIDIA Jetson Orin 平台上實測,其 mAP 達 54.3% 時仍可維持 120 FPS 的即時處理速度。這為自駕車與高頻工業自動化提供了延遲小於 10ms 的完美解決方案。目標偵測不僅是畫出邊界框 (Bounding Box),目前的趨勢是結合語言模型與強化學習,實現「開放詞彙 (Open-Vocabulary)」與「極端場景特化」。
Stream3D [2026-05] 🔥 [流式3D重建與生成] [自適應證據記憶] [免訓練機制] [CVPR 2026] [恒定顯存]
DAMO-YOLO [2025-06] 🔥 [工業落地SOTA] [TinyNAS搜尋] [Efficient RepGFPN] [AlignedOTA標籤分配] [全尺度蒸餾]
MV3DT [2026-07] 🔥 [多視角3D追蹤] [去中心化架構] [自動標定] [DeepStream]
RT-DETRv4 [2025-10-25] 🔥 [即時目標檢測] [DETR] [知識蒸餾] [視覺基礎模型]
SAM 3D (3Dfy Anything in Images) [2026-05] 🔥 [單圖3D重建] [SAM家族升維] [DPO對齊] [亞秒級極速生成]
核心優勢:打破 2D 到 3D 的數據壁壘,單張照片秒建高品質、可互動的三維場景! Meta 於 CVPR 2026 榮獲提名的劃時代神作,將「分割萬物 (SAM)」的感知能力正式升維至 3D 空間。完美借鑑大語言模型 (LLM) 的「預訓練 → 真實數據微調 → DPO 偏好對齊」三階段煉丹法,結合 DINOv2 語意與稀疏潛流匹配 (Sparse Latent Flow)。模型不僅能像人類一樣「腦補」物體被遮擋的背面幾何形狀,還能精準還原高保真材質紋理。更透過模型蒸餾將推理極限壓縮至 4 步,達成驚人的亞秒級極速重建。
解決痛點 / 推薦場景:完美解決了傳統 3D 生成「極度依賴多視角拍攝」,且「遇到真實雜亂場景 (In-the-wild) 容易穿模、幾何崩壞」的致命痛點。 模型原生支援輸出通用三角網格 (Triangle Mesh) 與 3D 高斯潑濺 (3DGS),能無縫導入 Blender、Maya 與現代主流遊戲引擎。極度適合遊戲與 XR 開發團隊進行 3D 資產極速量產、賦予具身智能機器人 (Embodied AI) 空間幾何的直覺感知,以及作為自駕車複雜場景理解的工業級 3D 基礎模型。
資源:🐙 GitHub 官方開源 (Objects) | 📄 官方論文 (arXiv:2511.16624) | 🌐 官方專案與線上 Demo
MonoSAOD (Monocular 3D Object Detection) [2026-04] 🔥 [單目3D偵測] [稀疏標註] [偽標籤治理] [工業級過濾]
LocateAnything-3B (全能視覺定位與多模態檢測) [2026-05] 🔥
[平行框解碼] [UI自動化導航] [具身智能] [極低延遲]DetAny4D (端到端 4D 開放集物體檢測基準) [2026-02] 🔥
[4D物件偵測] [開放集 Open-set] [時空一致性] [自駕車感知]AFSS (Anti-Forgetting Sampling Strategy) [2026-03] 🔥
[訓練加速神器] [無損提速] [抗遺忘採樣] [算力省長]EUPE: DINOv3 + SAM + CLIP 三模合一輕量檢測框架 [2026] 🔥
lightly-train 框架高度封裝。開發者完全無需從頭煉丹,短短 10 行 Python 程式碼即可直接呼叫在 COCO 資料集上訓練完成的任務頭 (Task Head),實現精準的開箱即用目標偵測。ConvNeXt-Tiny 到 ViT-Base 等多種尺寸的預訓練權重。極度適合需要在邊緣運算設備 (Edge AI) 快速部署街景分析,或是缺乏算力但想享受 SOTA 級通用視覺特徵的個人開發者與中小企業。[開箱即用] [輕量化部署] [三模合一] [極簡API]Roboflow Trackers [2026] 🔥 [多目標跟蹤 MOT] [隨插即用] [Apache 2.0可商用]
SEATrack (Simple, Efficient, and Adaptive Multimodal Tracker) [2026-06] 🔥 [多模態追蹤] [PEFT極致輕量] [極端場景特化] [邊緣算力首選]
FT-FSOD (Parallel Decoder) [CVPR 2026] 🔥 [跨域少樣本] [並行解碼器] [自動化微調]
Rex-Omni [CVPR 2026] 🔥 [檢測一切] [GRPO強化學習] [Qwen2.5-VL底座]
YOLO26 頻域增強版 (FrequencyCM × C3k2) [2025-09] 🔥
[端到端無NMS] [頻域增強] [小目標檢測] [極低延遲部署]OV-DINO [2025-07-24]
CountVid [2025-06-18]
MCL (AAAI 2025) [2025]
VisionReasoner [2025-05-23]:用強化學習統一視覺感知與推理,對標大廠 VLM。
Falcon [2025-03-14]:遙感視覺與語言基礎模型 (Remote Sensing VLM)。
✂️ Segmentation (圖像分割/實例分割/实例分割)
零樣本 (Zero-shot) 分割模型徹底改變了醫療與遙測影像的標註流程。 應用 SAM (Segment Anything Model) 架構,可將多邊形標註時間從平均 3 分鐘縮減至 2 秒內,整體人力成本驟降 85%,且維持與人工標註達 95% 的 IoU 重合度。自從 Meta 推出 Segment Anything (SAM) 以來,圖像分割已經進入「提示即分割 (Promptable Segmentation)」的時代。
ConceptSeg-R1 [2026-05] 🔥
[概念級分割] [超越SAM3] [元強化學習Meta-GRPO] [醫療與缺陷定位]CAFe-DINO (DINO-Soars) [2026-05] 🔥
[零遙感微調] [OVSS開詞彙分割] [DINOv3魔改] [遙感衛星大腦]LuoHuaLabel (基於 SAM 3 的智慧標註神器) [2026] 🔥
[SAM3驅動] [智慧標註神器] [OBB旋轉框] [零成本開源]Falcon Perception [2026-04-01] 🔥
SAM3-I [2026-05] 🔥 [指令驅動] [免大模型代理] [部件級分割]
Meta SAM 2 及其變體:
RMAE-ProGRess (LCA / LCAR) [2026-06-03] 🔥 [CVPR 2026] [非結構化語義分割] [LCA輕量通道注意力] [越野與遙感特化] [即插即用]
SOPSeg [2026-06] 🔥 [CVPR 2026] [遥感小目標實例分割] [區域自適應放大RAM] [定向提示OPM] [邊緣感知EDE] [ReSOS資料集]
EReCu [2026-03-12] 🔥 [無監督偽裝目標檢測]
VGGT-S (VGGT-Segmentor) [2026-04] 🔥 [跨視角分割] [幾何增強] [Ego-Exo對齊] [免配對預訓練]
DiCLIP (Diffusion Enhanced CLIP for Weakly Supervised Segmentation) [2026-06] 🔥 [弱監督分割 WSSS] [知識遷移] [訓練降本 90%] [生成式賦能]
CaptionFormer [2026-06] 🔥
SAM3-LoRA 醫學影像微調實戰 (ISIC 2018) [2026] 🔥
[SAM3微調] [醫療影像特化] [低算力救星] [LoRA極速煉丹]X2SAM [2026-05] 🔥 [圖影大一統] [多模態分割] [時序一致性]
BCSI (Bidirectional Channel-selective Semantic Interaction) [2026-01] 🔥
[半監督學習] [醫學影像分割] [雙向通道交互] [免大量標註]RNS (Retrieve and Segment) [CVPR 2026] 🔥 [視覺RAG] [少樣本分割] [測試時適配]
TIPSv2 [CVPR 2026] 🔥 [像素級理解] [零樣本分割] [視覺-語言預訓練]
iBOT++ 掩碼圖像建模目標,首度強制模型「對齊可見 Token 的表徵」,並結合 Head-only EMA 與多粒度文本描述策略。在零樣本分割任務上全面輾壓 SigLIP2 與 DINOv2 (例如 PASCAL VOC 達 62.4 mIoU),實現前所未有的邊界清晰度與語意一致性。INSID3 [CVPR 2026] 🔥 [免訓練分割] [DINOv3特化] [輕量極速]
Perceive Anything Model:對標 SAM2 + LLM,不僅能分割,還能理解並描述物件。📝 中文解讀
RemoteSAM:面向地球觀測 (Earth Observation) 的通用分割模型。
MatAnyone:視訊摳圖專用,主打髮絲級還原。
📖 OCR (Optical Character Recognition 光學文字識別) 針對物件或場景影像進行分析與偵測
多模態大模型 (MLLM) 已成為高複雜度文檔解析的標準配置。 結合 MinerU 或 DeepSeek-VL,針對手寫體與多語言混排表單的辨識準確率突破 96%,相較傳統 Tesseract 引擎提升 40% 的端到端資訊抽取成功率。隨著大模型技術下放,OCR 已經從單純的「字元辨識」進化為「複雜版面理解 (Document Understanding)」。
👉 延伸閱讀:針對物件或場景影像進行分析與偵測 (觀念總結) | 12個流行的開源免費OCR項目
處理手寫字跡、模糊掃描檔與不規則表單的最佳解法。
Unlimited-OCR (無限 OCR) [2026-06] 🔥 [長文件解析] [R-SWA注意力] [恆定顯存] [端到端SOTA]
Chandra OCR 2 [2026-04-16] 🔥
[2025-10-21]:標榜超越 DeepSeek-OCR 的革命性突破,支援本地部署。📝 真實評測Qianfan-OCR [2026-03-25] 🔥
DeepSeek-OCR 2 [2026-01-27] 🔥
HunyuanOCR [2025-11-30]:騰訊混元釋出的 1B 級全能模型。
PP-OCRv6 (PaddleOCR 第六代) [2026-06] 🔥
PaddleOCR-VL-1.6 (生成式文件解析開源霸主) [2026-05-28] 🔥
[RAG前處理] [完全離線部署] [版面分析] [開源霸主]DianJin-OCR-R1 [2025-08-18]:點金 OCR,專攻模糊蓋章與跨頁表格。
將複雜排版的文件完美轉換為適合大語言模型閱讀的 Markdown 格式。
MinerU 2.5-Pro [2026-04-16] 🔥
[2025-02-05]:解決痛點:將 PDF 完美轉換為乾淨 Markdown 的開源神器。高保真還原數學公式與程式碼區塊,是準備 LLM 訓練語料的必備清洗工具。PDFMathTranslate [2025-11-12] 🔥
DocLayout-YOLO 視覺模型進行版面佈局解析,徹底打破傳統 PDF 翻譯工具將公式文字化、導致排版盡毀的黑盒限制。它能精準「解剖」論文結構,完美復刻 LaTeX 數學公式、複雜嵌套表格與文獻引用,並原生對接 OpenAI、DeepL、Google 乃至本地部署的 Ollama 等多元 LLM 推理引擎。全球累積下載量已突破 22 萬次。OCRFlux [2025-06-16]
markitdown [2024-12-15]:微軟官方開源的文件轉換工具。
OmniParser [2024-10-29]:Alibaba 出品,通用文檔複雜場景抽取。
olmocr [2025-03-03]:支援本地部署精準提取 PDF。
Stirling-PDF (全能隱私安全 PDF 處理基礎設施) [持續更新] 🔥
Falcon OCR [2026-04-01] 🔥
OpenDoc-0.1B [2026-01-28] / OpenOCR [2025-03-05]:極度輕量化的開源 OCR 專案。
dots.ocr [2025-07-30]:本地部署的 1.7B 超強 OCR。
MonkeyOCR [2025-06-05]:猴子家族的文檔辨識專案。
PP-DocBee [2025-03-05]:百度文檔影像理解模型。
GOT-OCR-2.0 [2024-09-11]:宣告 OCR 2.0 時代來臨的代表作。
RapidOCR:跨平台、高效率的實用 OCR 部署方案。
TableStructureRec:專門對付複雜表格結構的辨識推理庫。
🎨 Diffusion Model (擴散模型與影像生成)
擴散模型將生成式影像的控制精度提升至像素級別。 透過 ControlNet 條件注入,Stable Diffusion 3 可以在 20 步內生成符合特定骨架或深度的 4K 圖像,將電商與遊戲資產的設計週期從數週壓縮至 3 小時內。擴散模型已經從單純的「文字生圖」,進化到「長影片生成」、「精準控制」與「一體化生成」。以下精選 2025-2026 年最具影響力的開源專案:
突破硬體極限與時長限制,帶來電影級的視覺理解。
SANA (NVIDIA 全端高效擴散生成生態系) [2026-05] 🔥
[線性擴散模型] [世界模型] [極低顯存門檻] [實時影片生成]SVOR (Stable Video Object Removal) [2026-03] 🔥 [影片物件消除] [物理感知] [高容錯]
Wan-Video (萬相) [2025-02-25]
SkyReels V2 [2025-04-22]:全球首個無限時長影片生成模型,具備電影級的場景理解能力。
MAGI-1 [2025-04-22]:Sand AI 推出的全球首個自回歸影片生成大模型。
Phantom [2025-04-24]:字節跳動開源。極度友善的硬體門檻,僅需 10G 顯存即可生成 1280x720 高清影片。
Index-AniSora [2025-05-19]:B 站開源的 SOTA 動畫影片生成模型,二次元風格特化。
MAI-Image-2 [2026-04-16] 🔥
SenseNova-Vision [2026-07] 🔥 [視覺任務大一統] [統一多模態生成UMM] [免專屬預測頭] [7B-MoT] [50M語料庫]
Vision Banana [2026-04] 🔥
[生成即理解] [零樣本 SOTA] [超越 SAM 3] [通用視覺基座]SceneScribe-1M (百萬級 3D 幾何與語意真實影片資料庫) [2026-04] 🔥
[世界基礎模型] [可控影片生成] [4D場景重建] [超大真實數據]Nucleus-Image 17B [2026-04] 🔥
[MoE擴散模型] [極低推理成本] [精準空間佈局]Sana (ICLR 2025 Oral) [2025-01-28] 🔥
Jodi [2025-05-28]:視覺理解與生成大一統模型,打破辨識與生成的界線。
FlashVideo [2025-02-14]:字節跳動視訊增強演算法,102 秒即可生成 1080P 影片。
專注於解決 AI 生成過程中的臉部崩壞、手部變形與硬體限制。
RefineAnything [2026-04] 🔥 [局部精修] [背景凍結] [Qwen-Image底座]
FramePack [2025-04-14]:ComfyUI 擴充神套件,能在 6G 顯存下跑 13B 模型,最高支援生成 1 分鐘的長影片。
Flux 生態系與控制網:
[2024-11-29]:極強的人物特徵保持與換臉工具。[2024-12-17]:Meta AI 推出的人物特徵保持方案。HivisionIDPhotos [2025-05-23]:超實用!智慧證件照生成神器,全自動精準摳圖、換背景、裁切任意尺寸。
ComfyUI Impact Pack:ComfyUI 必裝節點包,提供最強臉部與細節修復。
AnomalyAny (CVPR 2025) [2025-05-27]:利用 Stable Diffusion 協助進行視覺異常檢測,完全無需訓練。
🧑💻 Digital Human (虛擬數字人)
神經輻射場 (NeRF) 與 3D Gaussian Splatting 加速了即時擬真分身的商用普及。 採用單張照片驅動的 3D 虛擬人,能在 RTX 4090 上實現 4K 解析度 60 FPS 即時渲染,口型同步延遲低於 50ms,適用於全天候智能客服。虛擬數字人技術結合了語音驅動 (Audio-Driven)、唇形對齊 (Lip-Sync) 與 3D 渲染,是目前 AI 客服與虛擬直播的技術核心。
CyberVerse [2026-04-18] 🔥 [即時視訊對話] [零建模單圖生成] [WebRTC流式傳輸] [全鏈路Agent]
LongCat-Video-Avatar 1.5 [2026-05] 🔥
[8步極速生成] [GRPO偏好對齊] [多人互動支援] [商業級擬真]InfiniteTalk [2026-04] 🔥
[全身同步] [無限時長] [開源可商用] [ComfyUI支援]Duix Avatar (全離線 AI 數位分身框架) [持續更新] 🔥
[完全離線部署] [數位分身] [高精度唇形同步] [免上雲護隱私]SoulX-LiveAct [2026-03-16] 🔥
StreamAvatar [2025-12] 🔥
Live Avatar [持續更新] 🔥
Wan2.2-S2V-14B 基礎模型之上,支援流式生成(Streaming Generation),能透過單張照片與音訊,生成畫質極高且「無限時長」的動態說話影片。SoulX-FlashTalk [2025-12-24] 🔥
JoyStreamer-Flash [2025-12]
EchoMimic V3 [持續更新] 🔥
Wan2.1-Fun-V1.1-1.3B 與 wav2vec2-base-960h,進一步強化了臉部表情的細節與唇形同步的精準度,是目前最受矚目的開源數字人框架之一。models/transformer),並適度在 app_mm.py 中下調 num_frames(分段長度)以降低顯存壓力。適合具備高階算力(如 24G+ VRAM)的企業級開發者進行二次開發。Fantasy-talking [2025-04-14]:基於強大的 Wan2.1 影片生成底座,打造的高畫質音訊驅動數字人。
Hallo3 (CVPR 2025):復旦大學開源,主打高度動態且極具表現力的肖像動畫生成。
FlowAct-R1:基於流匹配技術的高效能數字人生成框架。
OpenTalking [2026-05] 🔥
[工業級編排] [實時互動] [WebRTC低延遲] [全鏈路串接]PersonaLive [CVPR 2026] 🔥
[流式生成] [無限時長] [低硬體門檻] [ComfyUI支援]Linly-Talker [持續更新] 🔥
Open Avatar Chat:爆火的開源神器,主打本地部署、無套路,輕鬆打造個人虛擬助理。
MimicTalk (NeurIPS 2024):專注於 3D Talking Face 生成的學術級框架。
商用級別開源 (克隆與真人還原):
🖼️ 基礎圖像識別 (Image Recognition)
在追求酷炫的生成式 AI 之前,理解圖像分類的底層架構仍然是電腦視覺的必修課。以下是從 CNN 時代走向 Transformer 時代的三大奠基之作:
EUPE (Efficient Universal Perception Encoder) [2026-03] 🔥 [通用視覺編碼器] [多任務聚合] [邊緣運算]
[Sapiens2] [2026-04-23] 🔥 [開源人體視覺霸主] [零依賴部署] [單文件架構] [4K高解析度]
standalone/sapiens2.py 單文件零依賴架構,只需 torch 與 safetensors 即可極速集成。[IMDD-1M] [2026-03] 🔥
[MAGIC] [2026-03] 🔥
[MoECLIP] [2026-03-29] 🔥
📄 Document AI (文檔理解與複雜排版解析)
傳統 OCR 只能單純提取文字,但真實世界的文檔(如財報、發票、學術論文)充滿了複雜的表格與版面設計。本區塊收錄了從「版面分析」到「端對端解析」的核心基礎模型:
跳過傳統的文字檢測與辨識步驟,直接將圖片轉化為結構化文本。
Infinity-Parser2 [2026-05] 🔥
[RAG前處理] [端到端解析] [超越Gemini] [極速推論]Logics-Parsing (含 Omni/v2) [2026-03] 🔥
Donut (2022):OCR-free Document Understanding Transformer。不依賴底層 OCR 引擎的文檔理解架構。📄 arXiv:2111.15664
Nougat (2023):Neural Optical Understanding for Academic Documents。Meta 推出的學術文獻解析神器,能完美處理論文中的數學公式與排版。📄 arXiv:2308.13418
專門對付自然場景中形狀扭曲、光影複雜的文字辨識。
🕵️♂️ 深度偽造與換臉偵測 (DeepFake Detection)
隨著生成式 AI (AIGC) 的爆發,如何防範惡意的 AI 換臉與造假成為資安重頭戲。以下收錄 CVPR 2021 針對深度偽造偵測的三大經典防禦架構:
❓ 電腦視覺開發常見問題解答 (FAQ)
Q1: 工業 AOI 瑕疵樣本太少怎麼辦? A: 採用基於 PatchCore 的無監督異常檢測方案,僅需約 50-100 張「正常樣本」即可建立基準,檢出率可達 98% 以上。
Q2: 邊緣運算 (Edge AI) 該選哪個物體偵測模型? A: 首選 YOLOv11 或 YOLO-NAS。在 Jetson Nano 級別設備上,INT8 量化後可維持 30 FPS 以上的即時偵測效能。
Q3: 如何快速標註大量圖像分割資料集? A: 導入 SAM (Segment Anything) 作為輔助工具,點擊目標即可自動生成邊界,實測可節省 85% 以上的人工框選時間。
Q4: 傳統 OCR 無法處理複雜表格怎麼解? A: 改用多模態大模型 (如 MinerU 或 DeepSeek-VL) 進行端到端解析,版面分析與文字提取的綜合準確率可提升至 96%。
Q5: 虛擬數字人 (Digital Human) 的口型延遲可以多低? A: 結合最新的 3D Gaussian Splatting 與輕量化語音驅動模型,端到端的口型同步延遲已可穩定控制在 50ms 以內。
103 commits
11 commits
HTML
100.0%