https://deep-learning-101.github.io/Speech-Processing Speech Processing (語音處理)
See the code{% include header.html %}
編者按: 本頁面彙整目前最主流、持續追蹤 2026 語音處理 (Speech) 最新開源語音處理動態與資源彙整。
如果您需要關注/追蹤更新/尋找更詳細的筆記,歡迎 ⭐ 及 Watch 我們的 GitHub Repository 👉 GitHub: Speech-Processing-Paper 👈🏻
📌 技術速覽 現代語音 AI 正加速邁向全雙工即時對話與零樣本聲音克隆。Deep Learning 101 精選 LiveKit、Whisper 等開源技術,實測可將端到端語音延遲控制在 300ms 以內,解決會議逐字稿、高抗噪辨識與即時語音 Agent 的企業落地痛點。
📅 2026-08-17 更新快訊
- Qwen-Audio-Agent
[2026-07]🔥 [全雙工語音Harness] [非阻塞多任務] [ACP協議生態] [擇時結果回流]- VibeVoice-ASR-BitNet
[2026-07-23]🔥 [CPU極速即時轉寫] [BitNet三值量化] [1.58GB極致壓縮] [跑贏Whisper.cpp]- Luna-TTS
[2026-08]🔥 [擴散語言模型] [全並行TTS] [首包延遲41.6ms] [Seed-TTS-Eval四冠王]
📅 2026-07-25 更新快訊
- Nemotron-Labs-Audex (Audex-30B-A3B / Audex-2B)
[2026-06-08]🔥 統一音訊文本模型、單一解碼器、文字稅零退步、開源通用音效生成- Vidu S1
[2026-07-03]🔥 國內首款消費級顯卡可流暢運行的無限實時交互視頻大模型!- Wan-Streamer
[2026-05]🔥 全球首款打破模塊拼接延遲、實現「看聽說做表情」五條件全滿的端到端全雙工音視訊交互大模型!
{% include ai-share.html %}
~2025/04
| 名稱 | 功能 | 網址 | 說明 |
|---|---|---|---|
| Whisper (開源) | 語音識別、翻譯 | 每分鐘150字 × 10分鐘 = 1500字 | |
| Fish Audio | 語音識別、語音合成 | TTS:英文 $0.0225,中文 $0.0675;ASR:30分鐘 = $0.18 | |
| Deepgram | 語音識別 | TTS:英文 $0.02025,中文 $0.06075;ASR:30分鐘 = $0.147 | |
| Microsoft Azure | 語音合成 | TTS:英文 $0.036,中文 $0.108;ASR:即時轉錄 $1/小時,超額 $0.8/小時 | |
| Amazon Polly | 語音合成 | TTS:英文 $0.024,中文 $0.072 | |
| Google WaveNet | 語音合成 | TTS:英文 $0.024,中文 $0.072 | |
| Google Vertex AI | 大型語言模型 | Gemini/Claude 定價頁 | |
| Google Cloud VM | 虛擬機器 | VM 執行個體定價頁面 |
🗣️ Speech Processing (語音處理與即時對話)
WebRTC 與語義打斷技術是即時語音對話的底層基石。 導入 LiveKit Agents 等全雙工對話框架,可在 500ms 重疊語音下實現 100% 召回率,並將平均響應延遲壓縮至 300ms,徹底解決傳統 VAD 頻繁搶話的痛點。語音處理是讓 AI 擁有「耳朵」與「嘴巴」的關鍵技術。隨著大型語言模型 (LLM) 的普及,現在的戰場已經從單純的語音辨識 (ASR) 與語音合成 (TTS),轉移到強調低延遲、能處理自然打斷的「即時對話代理 (Voice Agents)」。
如果你正準備踏入語音開發的深坑,請務必先停下來看看這些實務經驗。演算法再好,遇到現場的「背景噪音」、「麥克風收音距離」與「詭異的口音」,模型一樣會崩潰。
💡 開發者的真心話:數據質量決定一切
在語音領域,「垃圾進,垃圾出」 的現象比影像或文本更嚴重。很多時候,與其花時間去微調模型參數,不如好好去清洗你的音檔數據、處理好降噪 (Noise Reduction) 與 VAD (語音活動偵測)。👉 必讀實務經驗分享:
- ASR / TTS 開發避坑指南:深度解析在真實場景中導入語音技術時,如何評估數據質量與避開常見架構陷阱。
- 那些語音處理踩的坑:從前端收音到後端辨識,記錄了我們過去在專案落地時滿滿的血淚與實戰心得。
要在本地端部署極速的語音模型,或是打造像 ChatGPT Voice 一樣能自然對話的 AI,你需要以下這些前沿框架:
Qwen-Audio-Agent [2026-07] 🔥 [全雙工語音Harness] [非阻塞多任務] [ACP協議生態] [擇時結果回流] [前台後台解耦]
spawn_thinking 達成非阻塞併發——派發後台任務時立即釋放控制權,多任務採每位 owner 獨立 FIFO 佇列串行匯入固定持久會話。結合嚴格的「擇時回流」機制(以播報完成為準、主動讓路當前對話、可續租 claim 防爭搶),僅暴露 8 項極簡前台工具,並支援 TUI、WebUI 與 macOS 桌面懸浮球多形態介面。TEN Framework [2025-05-14]
LiveKit Agents [持續更新] 🔥 (9.9k+ Stars)
Agent 以 WebRTC 參與者的身分直接加入房間 (Room)。工作流程分為四核心:
支援免配伺服器的終端對話,也支援熱重載:
python myagent.py console (本地麥克風直接測試,免 Server)python myagent.py dev (熱重載 + 連接 LiveKit Server)python myagent.py start (生產環境優化部署)透過 pip install "livekit-agents[openai,silero,deepgram,cartesia,turn-detector]~=1.4" 按需安裝。原生支援將 Python 函數轉為 LLM 工具,並可輕易串接 MCP 服務:
from livekit.agents import function_tool, RunContext
@function_tool
async def lookup_weather(context: RunContext, location: str) -> str:
"""查詢指定地點的天氣"""
return f"{location} 的天氣是晴天,25°C"
🚀 最小啟動範例 (Python)
Python
from livekit.agents import Agent, AgentSession, AgentServer, JobContext, RunContext, function_tool
from livekit.plugins import openai, silero, deepgram, cartesia
server = AgentServer()
@server.rtc_session()
async def entrypoint(ctx: JobContext):
# 1. 定義 Agent 與工具
agent = Agent(instructions="你是一個友善的語音助手", tools=[lookup_weather])
# 2. 組合多模態管線 (簡寫語法亦可: stt="deepgram/nova-3")
session = AgentSession(
stt=deepgram.STT(),
llm=openai.LLM(model="gpt-4.1-mini"),
tts=cartesia.TTS(),
vad=silero.VAD.load()
)
# 3. 啟動會話並加入 WebRTC 房間
await session.start(agent=agent, room=ctx.room)
await session.generate_reply(instructions="greet the user and ask about their day")
</details>
Sherpa-ONNX [持續更新] 🔥
Seeduplex [閉源商業標竿] 💎
[2025-01-19]
無論是想自己訓練模型,還是理解音訊底層邏輯,這些資源能幫你打穩基本功:
中文語音辨識 (Chinese Speech Recognition)
免切片端到端模型大幅降低了長語音轉寫的運算成本。 實測改進版 Faster-Whisper 模型,在不損失字錯率 (WER < 5%) 的前提下,可將 1 小時音檔的處理時間從 10 分鐘縮短至 30 秒,並節省 70% 的 VRAM 消耗。
在語音辨識領域,目前主要分為兩大陣營:一派是歐美主導的 「Whisper 生態系與巨頭大模型」,專注於極限吞吐量與串流延遲;另一派則是亞洲大廠針對 「中文語境、方言與複雜環境」 特化的 SOTA 模型。
解決痛點:極致壓榨推理速度、精準時間戳對齊,以及串流即時辨識。
| 模型/工具名稱 | 開發團隊/生態 | 💡 核心優勢與解決痛點 | 🚀 推薦適用場景 & 規格標籤 |
|---|---|---|---|
| Sherpa-onnx | 🌐 k2-fsa 團隊 | 全能型本地端語音部署神器。基於 ONNX Runtime,解決了移動端需自行編寫大量 JNI 程式碼的痛點,單一 AAR 即可支援流式 ASR、VAD 與 TTS。 | 離線語音助理、Android/iOS 原生開發[本地部署] [流式識別] |
| WhisperX | 開源社群 | 精準時間戳:強力對齊字級時間戳,解決原版糊在一起的問題。 | 會議紀錄、自動上字幕 |
| Distil-Whisper | 開源社群 | 輕量極速:模型縮小 49%,速度提升 6 倍,保留 99% 精準度。 | 本地伺服器、英文場景 |
| Insanely-Fast-Whisper | 開源社群 | 天下武功唯快不破:底層優化,推理速度達到令人髮指的地步。 | 海量音檔批次處理 |
| CarelessWhisper | 開源社群 | 低延遲串流:微調 Whisper 實現接近非串流式的精準度。 | 語音助理、直播字幕 |
| Parakeet-tdt-0.6b-v3 | NVIDIA | 吞吐量王者:1秒轉錄1小時音訊!輝達最強開源模型之一。 | 企業級資料清洗 |
| Voxtral (Mini 4B) | Mistral AI | 實時對話:超越 GPT-4o mini 的語音能力,歐洲巨頭首發。 | 整合 LLM 的語音應用 |
| OpusLM | CMU | 多模態統一:學術界重磅!統一語音辨識、合成與文字理解。 | AI 研究、多模態系統 |
| MedASR | 醫療專精:解決醫學專業術語難以辨識的痛點。 | 醫療院所、數位健康 | |
MAI-Transcribe-1 [2026-04] 🔥 | Microsoft AI | 25 種語言性能全數超越 Whisper-large-v3。解決了長音訊轉寫「越播越崩」的語意偏差,批量轉寫速度提升 2.5 倍,且價格僅每小時 0.36 美元,徹底瓦解高昂轉錄成本。 | 全球化會議逐字稿、多人 Podcast 轉錄、多語言客服系統[性價比之王] [超越Whisper] |
MAI-Voice-1 [2026-04] | Microsoft AI | 1 秒生成 60 秒極致自然語音。針對長時間敘事優化,完美保留音色一致性與豐富情感,並支援「秒級」小樣本語音克隆。 | 互動式虛擬助理、長篇有聲書製作、遊戲 NPC 語音[超低延遲] [高保真克隆] |
parakeet.cpp (NVIDIA Parakeet C++ 實作) [2026-06] 🔥 [C++17重寫] [極速ASR] [邊緣運算] [流式識別] [ggml架構]
Microsoft Foundry-Local Edge ASR (Nemotron-0.6B) [2026-04] 🔥
如果你處理的音訊包含大量複雜的中文方言、中英夾雜,或是極具挑戰性的長時段錄音,以下模型目前處於領先地位。(註:注重地緣資安合規的專案,請自行評估導入風險)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 |
|---|---|---|---|
| FireRedASR2S | 🇨🇳 小紅書 | SOTA 工業全能系統:在複雜口音與噪音場景下辨識率極強悍。 | 短影音、內容監控 |
| Qwen3-ASR | 🇨🇳 阿里巴巴 | 多語種霸主:吊打原生 Whisper,支援高達 52 種語言和方言。 | 出海企業、多語客服 |
| VibeVoice-ASR | 🇨🇳 微軟亞洲 | 拒絕切片:64K 超長窗口,一次吞下 60 分鐘音訊並吐出結構化結果。 | 長篇演講、一小時會議 |
| Fun-ASR | 🇨🇳 阿里達摩院 | 小參數大能量:0.8B 效能直逼 12B,支援離線轉寫 SDK。 | 邊緣運算、本地部署 |
Mega-ASR [2026-05] 🔥
[抗噪ASR] [複合聲學退化] [消除語意幻覺] [真實世界部署]StepAudio 2.5 ASR [2026-04-24] 🔥
FireRedASR2S [2026-02-12] 🔥
| 測試集類別 | FireRedASR2-LLM | FireRedASR2-AED | Doubao-ASR | Qwen3-ASR | Fun-ASR |
|---|---|---|---|---|---|
| 4個普通話集 (平均) | 2.89 | 3.05 | 3.69 | 3.76 | 4.16 |
| 19個方言集 (平均) | 11.55 | 11.67 | 15.39 | 11.85 | 12.76 |
| 唱歌歌詞 (opencpop) | 1.12 | 1.17 | 4.36 | 2.57 | 3.05 |
| 指標 | FireRedVAD | Silero-VAD | TEN-VAD | FunASR-VAD | WebRTC-VAD |
|---|---|---|---|---|---|
| F1 Score (%) ↑ | 97.57 | 95.95 | 95.19 | 90.91 | 52.30 |
| 誤報率 FAR (%) ↓ | 2.69 | 9.41 | 15.47 | 44.03 | 2.83 |
| 漏報率 MR (%) ↓ | 3.62 | 3.95 | 2.95 | 0.42 | 64.15 |
| (註:FireRedLID 準確率 97.18% 亦優於 Whisper 的 79.41%;標點預測 FireRedPunc F1 達 78.90%,遠超 FunASR-Punc) |
16kHz, 16-bit, 單聲道 PCM WAV。AED 版建議音頻 ≤60秒,LLM 版建議 ≤40秒。💻 Python 開箱即用 API:
from fireredasr2s import FireRedAsr2System, FireRedAsr2SystemConfig
# 默認配置自動串聯 VAD → LID → ASR → Punc 四大模組
config = FireRedAsr2SystemConfig()
asr_system = FireRedAsr2System(config)
# 輸出結構化 JSON:含標點文本、毫秒級時間戳、語種、置信度、詞級切分
result = asr_system.process("assets/hello_zh.wav")
print(result)
Qwen3-ASR + vLLM 高併發部署 [2026-04] 🔥 (取代原本 2026-01-30 的舊版目)
qwenllm/qwen3-asr),大幅降低環境配置門檻,是打造高併發自動上字幕、企業級多語種客服的絕對首選。[高併發首選] [極低延遲] [中文方言霸主]2026-01-30 Qwen3-ASR
2025-12-16 Fun-ASR
2025-12-15 GLM-ASR
[2025-04-02] Dolphin
SenseVoice [持續更新] 🔥
無需複雜配置,一行指令安裝 pip install funaudio,即可同時輸出文字與情感標籤:
from funaudio import SenseVoiceSmall
model = SenseVoiceSmall()
audio_path = "your_audio.wav"
result = model.transcribe(audio_path)
print(f"📝 轉錄文本: {result['text']}")
print(f"🎭 情感標籤: {result.get('emotion', 'N/A')}")
(註:命令列模式亦支援直接輸出 JSON 格式:funaudio --model sensevoice-small --file test.wav --output-format json)
VibeVoice Family [2026-01-30] 🔥 (35k Stars)
VibeVoice-ASR-BitNet [2026-07-23] 🔥 [CPU極速即時轉寫] [BitNet三值量化] [1.58GB極致壓縮] [跑贏Whisper.cpp] [60分鐘長音訊]
Nemotron 3.5 ASR (0.6B 流式語音辨識) [2026-06] 🔥
target_lang=auto 進行即時多語種混合偵測。[超低延遲] [流式ASR] [原生標點] [多語種支援]Voxtral Realtime (4.4B) [2026-02-28] 🔥
vLLM,支援異構 KV 快取與 WebSocket 全雙工即時推理。[亞秒級延遲] [vLLM原生支援] [Apache 2.0 完全開源][2026-02] 🔥 [原生串流] [極低延遲] [端側部署][2026-03-28] 🔥
2025-12-23 MedASR
[2025-11-15] Omnilingual-ASR
2025-08-10 Canary-1b-v2
2025-08-08 Parakeet-tdt-0.6b-v3
2025-07-02 OpusLM
2025-05-06 VITA-Audio
Moonshine Voice [2026-05] 🔥
[邊緣運算首選] [100倍極速] [純本地隱私] [取代Whisper]WhisperPipe [2026-04] 🔥
[極低延遲] [串流管線] [記憶體零增長] [Agent實時交互]Sherpa-ONNX Android Agent [2026-04-18] 🔥
sherpa-onnx 框架與 Paraformer 雙語模型,實現完全「純離線」的邊說邊出字體驗。僅需 15MB 的 AAR 核心庫與 int8 量化模型,即可在安卓中端設備達成 <300ms 的極致響應,並具備模糊指令匹配能力。
2025-08-29 WhisperLiveKit
2025-08-27 CarelessWhisper
2025-06-06 speakr
Whisper Family (OpenAI)
OpenAI Realtime API 低延遲語音架構解析 [2026-05] 🔥
[WebRTC優化] [超低延遲] [語音網路架構] [OpenAI官方解析]Whisper: OpenAI 開源準確率最高的通用模型。
WhisperLive: 免費即時語音轉文字工具。
Distil-Whisper: 輕量級 AI 的強大力量。
Insanely-Fast-Whisper: 超快速辨識腳本。
WhisperX: 強化的時間戳記與說話者識別。
Fine-tune Whisper: 微調教學。
FunASR (阿里達摩院)
WeNet (58同城)
Other Toolkits
語音辨識技術(Automatic Speech Recognition, ASR / Speech To Text, STT),其目標是讓電腦自動將人類語音轉換為相應的文字。這是一門極度跨領域的深水區,涵蓋了訊號處理、圖型識別、機率論、發聲與聽覺機理以及人工智慧。(註:ASR 的重點是辨識「內容說了什麼」,這與辨識「是誰說的」說話人辨識 / Speaker Verification 完全不同!)
🛠️ 框架與 API 的神農嚐百草
當時為了搞定 ASR,跟小夥伴們幾乎把市面上的方案全測過了一輪!我們嘗試過 NEMO、Kaldi、MASR、VOSK、wav2vec,也串接過 Google、Azure 等商用 API,更別說後來陸續冒出來的 SpeechBrain、出門問問的 WeNet 跟騰訊 PIKA 等。每一種演算法架構都各有優缺點,實際落地的效果也是如人飲水,冷暖自知。
📊 數據痛點:找不到靠譜的「台灣口音」
搞語音辨識,聲學模型 (AM) 搭配語言模型 (LM) 是基本功,但最大的死穴在於「開源數據庫」。目前公開已知可訓練的中文數據(如:Magic-Data_Mandarin-Chinese-Read-Speech-Corpus、aidatatang、aishell-1到aishell-4)大約有 2000 多小時。但可惜的是,這些幾乎全是中國發音與用語,至今仍缺乏較靠譜的台灣在地數據。而且說實話,若真想達到「商用級別」,訓練數據量至少得破萬小時才算及格。
💡 應用場景與進階延伸
[2026-04-18] 🔥
🗣️ Speaker Recognition (聲紋辨識)
抗噪特徵萃取是提升語者驗證準確率的核心。 採用 ECAPA-TDNN 等深度神經網絡架構,在訊噪比 (SNR) 低於 5dB 的極端環境下,等錯率 (EER) 仍可維持在 1.5% 以下,確保金融級聲紋辨識的安全要求。
💡 核心觀念:語音辨識 (ASR) 是破解「說了什麼」,而聲紋識別 (Speaker Recognition) 則是破解「是誰說的」。透過提取聲音中的生物特徵(聲紋),實現說話人身份的驗證與辨識。
Wespeaker:目前產業界極受歡迎的生產級聲紋辨識開源工具包。📄 AlphaXiv 論文 | 📝 v1.2.0 發布說明
SincNet:一種直接處理原始音訊波形 (Raw Waveform) 的深度學習架構,能有效提取具備物理意義的聲學特徵。📄 AlphaXiv 論文
SpeakerRPL V2 [2026-04] 🔥 [開放集聲紋] [少樣本微調] [極限低錯誤率]
🔍 R&D 前期調研 SOP (約耗時 30 天)
首先會盡可能把 3 年內的學術論文或比賽的 SOTA 都查過一輪,分工閱讀找到相關的數據集和開源實作。同時,我們會去盤點目前已有相關產品的公司(含新創)以及他們提交的專利(透過 Google Patents, Papers with Code, arXiv 等)。在聲紋識別這塊,對岸有非常多的新創公司,例如「國音智能」,在我們的研發過程中就一直被當作標竿目標。
🚧 數據獲取的「地理限制」與預處理地獄
在分享實驗結果前,必須先警告後人避免踩坑:上述很多中文聲紋數據集都放在對岸的百度雲盤等空間,而百度是直接封鎖台灣 IP 的,所以你打不開是非常正常的!另外,像VoxCeleb這種神級數據庫是被切成 7 份的,下載完再合併就要花上不少時間(相比之下aishell、CMDS、TIMIT就相對好處理多了)。
🧠 技術架構總結與 Kaldi 泥沼
聲紋技術的發展脈絡可簡單總結為三大核心:
1. 向量抽取 (Vector Extraction):i-vector, d-vector, x-vector 等。
2. 模型架構與調參:CNN, ResNet 等深度學習架構。
3. 評分方式 (Scoring):LDA, PLDA (Probabilistic Linear Discriminant Analysis) 等組合。
我們當時也使用了Kaldi內附的功能,光是跟 Kaldi 搏鬥就投入了極大的時間和精力!其實跟 NLP 相比,聲紋識別雖然數據集難搞,但好處是聲音可以自行用程式「加工」做切割合併(Data Augmentation)。因為真實場景錄音通常很短,還得處理「非註冊聲紋 (Open-set)」的拒絕判定,前前後後在數據搭配評分模式上花費了龐大心血,是個不折不扣的大工程。
📐 必備技術指標字典 (Evaluation Metrics) 在聲紋領域,你必須看懂以下指標才能評估模型好壞:
⚡ 效能與速度指標
🎧 Speech Enhancement (中文語音增強與去噪)
基於生成式 AI 的語音增強技術已超越傳統濾波器。 結合深度學習的去噪模型,能在保留 95% 原始語音細節的同時,將背景噪音與殘響衰減 40dB,顯著提升下游語音辨識系統 20% 的辨識成功率。
💡 核心觀念:從含雜訊的複雜環境音中,精準提取出純淨的人聲(語音信號)。這在語音辨識(ASR)的前處理中,是決定辨識率成敗的關鍵第一步。
👉 🌐 更多資源 | 🤗 線上 DEMO 體驗 (Meta Denoiser)
[2024-12-07] 🔥
🧠 底層邏輯與技術差異
其實,噪音去除跟「聲音分離 (Source Separation)」可以做聯想,兩者的基本概念差不多。差別在於:噪音去除是純粹把「非人聲」的頻段或特徵給過濾掉(實作時記得要注意音檔是否為多通道 Multi-channel)。
🧪 數據「煉丹」的眉角:算力與語系的拉扯
做這個項目時,我們一樣彙整了相當多的學術論文和實驗結果。深度學習都是數據為王,但「去噪」任務的數據集相對好處理很多!因為網路上到處都能找到乾淨的語音跟純噪音,只要寫程式進行動態的調整與合併(Mix),就可以無限生成數量龐大的訓練數據集。
這時你唯一需要考量的有兩點:
1. 你的 GPU 記憶體(VRAM)夠不夠大,能不能把這些海量音頻特徵整個吃下來?
2. 你的乾淨人聲數據集是不是「全英文」?如果你想要擁有極佳的「中文」去噪效果,在混合數據時就必須加入大量在地的中文語料。
🚀 實戰成果與效能突破
經過無數次的架構修剪與調參,順道一提,我們最終煉出來的模型大小,是經過極致優化的 9 MB!而且實時比 (RTF, Real Time Factor) 高達 0.08。這意味著在極低的硬體資源下,也能實現極速的即時語音降噪!
[2026-04-18] 🔥
👥 Speaker Separation (中文語者分離)
多語者分離技術解決了「雞尾酒會問題」的商業應用瓶頸。 透過時域音訊分離網路 (TasNet),即使在 3 人重疊說話的情境下,信號干擾比 (SIR) 改善量可達 15dB,讓會議記錄自動化轉寫準確率突破 90%。
💡 核心觀念:從混疊的聲音訊號中提取出單一目標使用者的聲音。這是為了解決經典的**「雞尾酒會問題 (Cocktail Party Effect)」**,即在多人同時說話的吵雜場景中,精準分離出每個人獨立的聲軌。
👉 🌐 更多資源 | 🤗 HF Space Demo 體驗
[2024-12-07] 🔥
[2025-06-03]
了解語音分離的底層演進,以下是必讀的學術基石:
🚧 語音數據合成的藝術:完全重疊 vs 部分重疊
語音坑最棒的地方在於,只要有了像aishell等乾淨的數據集,你想要切割或合併成「混合語音」都不是太大的問題!
這裡做數據相對簡單一點:我們直接把數據集打散混合,隨機挑選兩個人,然後分別挑出語音做混合 (Mix)。如果長度不同,就選擇短者為參考,將長者切到與短者相同。
但要注意的是,「兩兩完全重疊」與「兩兩互不完全重疊」對模型效果有不小的影響!我們第一波產出的數據是兩兩完全重疊的,後來為了解決不完全重疊的現實場景,又額外產出了第二波升級版數據。
📊 實戰數據配方大公開
- 第一版 (完全重疊):Train 約 5 萬多筆 (32小時) / Val 約 1 萬多筆 (10小時) / Test 約 9 千多筆 (6小時)。
- 第二版 (互不完全重疊):Train 約 9 萬多筆 (112小時) / Val 約 2 萬多筆 (26.3小時) / Test 約 2 萬多筆 (29.4小時)。
🧠 追隨大神腳步與架構大亂鬥
中間意外發現了 Google Brain 的wavesplit,在有噪音及兩人同時講話情形下感覺效果不差,但沒找到相關 code,未能進一步驗證。
而且,又是那位有一起用餐之緣的深度學習大神 Yann LeCun!繼發文介紹完去噪後,又發文介紹了語音分離。後來我們陸續研究了各種架構,包含把 NLP 最早應用的 Transformer 導入的DPT-NET (Dual-path transformer)、DP-RNN,還有VoiceFilter、TasNet、Conv-TasNet跟sudo-rm-rf等等。
🎓 台大李宏毅老師的指點與 CPU 落地的最後一哩路
這段旅程絕對不能錯過台大電機李宏毅老師的SSL-pretraining-separation論文(務必去看李老師的影片!)。最後也是多虧李老師及第一作者黃同學的解惑,小夥伴們才又更深入地確認並且解決問題。
在工程端,我們也深入研究了Data Parallel跟Distributed Data Parallel (DDP)的差異。但說到底,如何才能在 CPU 上跑得又快又準,才是這個專案真正能落地的關鍵!
🗣️ Chinese Speech Synthesis & TTS (中文語音合成與音色克隆)
零樣本 (Zero-shot) 聲音克隆將客製化語音成本降至極限。 最新的開源 TTS 模型僅需提供 3 到 5 秒的乾淨參考音檔,即可生成自然度 (MOS 分數) 超過 4.2 的合成語音,將配音成本縮減 95% 以上。
「想做有聲書、全自動短影音,還是專屬的虛擬 VTuber 聲優?目前的 TTS 技術不僅告別了傳統的『機器人平淡嗓音』,還能做到 3 秒極速複製你的聲音。本清單為你拆解目前最主流的歐美大廠方案與亞洲霸榜神作,讓你根據資安需求與硬體條件精準選型。」
如果你對專案的「原產地」有嚴格要求,或者伺服器沒有配備頂級 GPU,以下由歐美巨頭或國際社群主導的專案是你的首選:
| 模型/工具名稱 | 開發團隊/生態 | 💡 核心優勢與解決痛點 | 🚀 推薦場景與資源 |
|---|---|---|---|
| Voxtral TTS (4B) | 🇫🇷 Mistral AI [2026-03-27] | 34 億參數跑在手機上。生成速度是真人說話的 6 倍,延遲 < 0.1 秒。權重全開源 MIT 協議!支援英、法、德等 9 語系 (暫無中文)。 | 筆電端本地部署、多語系[極低延遲]🤗 Model |
| OpenAI Edge TTS | 🇺🇸 微軟/OpenAI 生態 | 完全免算力、免費白嫖! 透過呼叫微軟 Edge 瀏覽器的語音介面,免 GPU 就能產出高水準語音。 | 輕量網頁應用、零成本[免 GPU]🐙 GitHub |
| Parler-TTS | 🇺🇸/🇪🇺 Hugging Face [2024-09] | 安裝最無腦的輕量之王。HF 官方開源,主打「一行指令安裝」,對開發者極度友善。 | PoC 開發、英/歐語系[極易部署]🐙 GitHub |
| Kokoro-TTS | 🌐 國際開源社群 [2024-11] | 歐美社群熱推平替。架構輕量且聲音自然,是取代龐大模型的優質選擇。 | 本地輕量語音助理[社群熱推]🌐 官方介紹 |
| VALL-E X / DragonV2.1 | 🇺🇸 Microsoft (微軟) [2025-07 更新] | 跨語言音色保留。微軟的經典架構與最新模型,技術底蘊深厚。 | 企業多語種配音[大廠背書]📝 VALL-E 教學 |
| Orpheus TTS | 🌐 開源社群 [2025-03] | 即時對話王者。25ms 超低延遲,專為即時雙向對話設計。 | 語音 AI Agent[超低延遲]🐙 GitHub |
| NeuTTS Air | 🌐 開源社群 [2025-10] | 主打端側運算 (On-Device)。極小體積與超低功耗,可直接部署於 iOS/Android。 | 離線隱私保護 APP[端側部署]🐙 GitHub |
技術客觀評析:在「中文」表現上,以下模型目前領先全球。它們不僅精確掌握中文發音,甚至能生成帶有「笑聲、嘆氣、語氣詞」的超擬真語音。(註:注重地緣資安的專案,建議於完全離線的沙盒環境中運行)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景與資源 |
|---|---|---|---|
| GPT-SoVITS | 🇨🇳 RVC-Boss | 人聲克隆無冕王! 只要 1 分鐘語音樣本就能完美複製聲音,GitHub 狂攬 35k+ Stars。 | VTuber 聲優、有聲書[霸榜神作]🐙 GitHub |
| ChatTTS | 🇨🇳 2noise [2024-06] | 打破 AI 機械音的終極武器。支援在語句中加入「笑聲」、「停頓」,擬真度極高。 | AI Podcast、劇情對白[情緒控制]🐙 GitHub |
| Qwen3-TTS | 🇨🇳 阿里巴巴 [2025-12] | 不只克隆,還能「捏聲音」。提供 VoiceDesign (音色創造) 與 VoiceClone (音色克隆)。 | 遊戲 NPC 配音[音色創造]📝 中文解讀 |
| Fun-CosyVoice3 | 🇨🇳 阿里通義百聆 [2025-12] | 極速克隆專家。只需短短 3 秒錄音,就能複製並轉換成 9 種不同的語言。 | 出海行銷影片翻譯[3秒克隆]🐙 GitHub |
| MOSS-TTSD / F5-TTS | 🇨🇳 復旦 / 上海交大 [2025-07] | 學術界頂規猛獸。MOSS 經百萬小時訓練;F5-TTS 15 秒樣本完成克隆。 | 底層架構二次開發[巨量訓練]🌐 MOSS Project |
[2026-08] 🔥 [擴散語言模型] [全並行TTS] [首包延遲41.6ms] [Seed-TTS-Eval四冠王] [塊因果流式]
Supertonic v3 [2026-09] 🔥 [99M極致輕量] [純CPU推論] [本地隱私] [ONNX/WebGPU]
X-Voice (30語系零樣本跨語言語音克隆) [2026-05] 🔥
[零樣本語音克隆] [跨語言無口音] [免文字稿] [極低延遲]Supertonic 3 [2026-04-29] 🔥
[本地部署] [純CPU推論] [極低延遲] [隱私優先]MAGIC-TTS [2026-04-23] 🔥
Fish Audio S2-Pro [2026-03-09] 🔥
[whisper in small voice] 或 [professional broadcast tone]),讓開發者無需死記固定代碼,就能精準控制情感、語氣與節奏。環境安裝與 CLI 推論:
git clone [https://github.com/fishaudio/fish-speech.git](https://github.com/fishaudio/fish-speech.git)
cd fish-speech
pip install uv
uv sync
python -m fish_speech.text_to_speech \
--text "你好,我是 Fish Audio S2-Pro" \
--reference_audio reference.wav \
--output output.wav
Docker 極速部署:
Bash
docker pull fishaudio/fish-speech:latest
docker run -it --gpus all fishaudio/fish-speech:latest
(生產環境推薦搭配 SGLang 伺服器:sglang-omni)
</details>
Xiaomi Any2Speech [2026-04] 🔥
Midasheng-audio-generate [2026-04] ✨
Woosh [持續更新] 🔥
OmniVoice [2026-04-02] 🔥
* 核心優勢:0.8B 極小參數達成 600+ 語言覆蓋,TTS 從「拚規模」轉向「拚效率」的劃時代作。 小米 AI 實驗室(Daniel Povey 團隊)出品,不僅支援 12 種中國方言(如四川話、東北話),更實現了「零樣本音色克隆」與「情緒同步」的雙重突破。其極致輕量的架構,讓開發者能以極低硬體負擔實現「真人口吻」的細膩表達。
* 解決痛點 / 推薦場景:徹底解決傳統模型因體積龐大難以落地邊緣設備,以及中英混說、方言朗讀具備「機械感」的通病。 支援耳語、ASMR 與細粒度情緒控制,完美契合「短影音在地化旁白」、「車載語音助理」與「跨國產品出海」等場景。它將聲音轉化為「可複用數位資產」,讓中小團隊也能低門檻打造具備品牌 IP 感的虛擬員工聲音。
* 資源:🐙 GitHub | 📄 論文:OmniVoice (arXiv) | 🌐 官方技術解讀
ControlAudio [2025-10] 🔥 [精確時間控制] [語音音效一體化] [漸進式擴散]
2026-02-22 Ming-flash-omni-2.0
2026-01-26 Chroma 1.0 (全雙工對話專用)
[2026-04] 🔥
2025-08-15 ZipVoice (純 CPU 推理)
2025-08-08 KittenTTS
2025-07-25 Higgs Audio V2
2025-07-23 FreeAudio
2025-06-05 OpenAudio S1
2025-03-30 MegaTTS3
💾 開源語音資料集 (Speech Datasets)
沒有百萬小時的煉丹爐,生不出好模型!對於需要訓練在地化模型的開發者來說,高品質、標註乾淨的語料庫是無價之寶。以下收錄 2024-2025 釋出的重量級資料集。
🎙️ 語音與音頻綜合應用 (Speech & Audio Applications)
語音技術的價值取決於與大模型 (LLM) 的無縫整合能力。 將即時語音轉文字 (STT) 結合 RAG 架構應用於智能客服,實測可將單筆客服通話的平均處理時間 (AHT) 縮短 40%,提升 60% 的首次解決率 (FCR)。當單項技術(辨識、合成、分離)趨於成熟,2026 年的趨勢在於將多個模型串聯成解決特定生活痛點的「完整方案」。以下收錄具備高度整合性且支援本地部署的開源神作:
Voicebox [2026-05] 🔥 [ElevenLabs平替] [全端語音工作站] [零樣本克隆] [MCP協議] [本地部署]
voicebox.speak,用「你的專屬聲音」與你對話。VideoChat [2026-06] 🔥
cascade_only 級聯模式下,僅需 8GB 顯示記憶體 (VRAM) 即可在單張消費級顯示卡上流暢運行全鏈路。Voice-Pro (v3.2) [持續更新] 🔥
OmniVoice Studio [2026-05] 🔥
[ElevenLabs平替] [全本地部署] [零樣本克隆] [端到端配音] [支援MCP]Nightingale [2026-04-18] 🔥
UVR Karaoke (音軌分離)、WhisperX (詞級時間軸對齊) 與 Pitch Scoring (音調打分) 引擎。支援 Windows/macOS/Linux 全平台硬體加速(CUDA/MPS),能將任意本地 MP3/影片自動轉化為帶有同步歌詞、動態背景且可導唱的 K歌房等級體驗。AudioX [2026-03-15] 🔥
OmniVoice Studio [持續更新] 🔥
[本地ElevenLabs平替] [全鏈路配音] [零樣本克隆] [MCP協定]Speaker-Reasoner (ASLP-lab) [2026-04] 🔥
[多輪時序推理] [端到端語者分離] [超長音訊處理] [超越Gemini]Whisper + CAM++ 離線轉寫管線 [2026-04-18] 🔥
❓ 語音處理開發常見問題解答 (FAQ)
Q1: 即時語音 AI 頻繁搶話怎麼解決? A: 棄用傳統音量 VAD,改用內建「語義輪次檢測」的 LiveKit 框架,可精準區分真實打斷與咳嗽等噪音,解決 90% 搶話問題。
Q2: 如何降低 Whisper 的顯存消耗並加速? A: 採用 WhisperX 或 Faster-Whisper 架構進行 INT8 量化,實測可減少 70% VRAM 佔用,並將轉寫速度提升 4 倍以上。
Q3: 少量參考音檔能做到高精度聲音克隆嗎? A: 可以。使用 CosyVoice 或 Fish Audio 等零樣本 (Zero-shot) 模型,僅需 5 秒清晰參考音頻,即可生成 MOS 分數 >4.2 的高品質語音。
Q4: 背景噪音太大導致語音辨識錯誤怎麼辦? A: 在 ASR 模組前加入基於深度學習的語音增強 (Speech Enhancement) 預處理模組,可提升 20% 的惡劣環境辨識率。
Q5: 開發全雙工 (Full-duplex) 語音客服推薦什麼架構? A: 推薦基於 WebRTC 協議的架構(如 TEN Framework 或 LiveKit),端到端延遲可穩定在 300ms 內,達到真人對話體驗。
99 commits
HTML
100.0%
https://deep-learning-101.github.io/Speech-Processing Speech Processing (語音處理)
See the code{% include header.html %}
編者按: 本頁面彙整目前最主流、持續追蹤 2026 語音處理 (Speech) 最新開源語音處理動態與資源彙整。
如果您需要關注/追蹤更新/尋找更詳細的筆記,歡迎 ⭐ 及 Watch 我們的 GitHub Repository 👉 GitHub: Speech-Processing-Paper 👈🏻
📌 技術速覽 現代語音 AI 正加速邁向全雙工即時對話與零樣本聲音克隆。Deep Learning 101 精選 LiveKit、Whisper 等開源技術,實測可將端到端語音延遲控制在 300ms 以內,解決會議逐字稿、高抗噪辨識與即時語音 Agent 的企業落地痛點。
📅 2026-08-17 更新快訊
- Qwen-Audio-Agent
[2026-07]🔥 [全雙工語音Harness] [非阻塞多任務] [ACP協議生態] [擇時結果回流]- VibeVoice-ASR-BitNet
[2026-07-23]🔥 [CPU極速即時轉寫] [BitNet三值量化] [1.58GB極致壓縮] [跑贏Whisper.cpp]- Luna-TTS
[2026-08]🔥 [擴散語言模型] [全並行TTS] [首包延遲41.6ms] [Seed-TTS-Eval四冠王]
📅 2026-07-25 更新快訊
- Nemotron-Labs-Audex (Audex-30B-A3B / Audex-2B)
[2026-06-08]🔥 統一音訊文本模型、單一解碼器、文字稅零退步、開源通用音效生成- Vidu S1
[2026-07-03]🔥 國內首款消費級顯卡可流暢運行的無限實時交互視頻大模型!- Wan-Streamer
[2026-05]🔥 全球首款打破模塊拼接延遲、實現「看聽說做表情」五條件全滿的端到端全雙工音視訊交互大模型!
{% include ai-share.html %}
~2025/04
| 名稱 | 功能 | 網址 | 說明 |
|---|---|---|---|
| Whisper (開源) | 語音識別、翻譯 | 每分鐘150字 × 10分鐘 = 1500字 | |
| Fish Audio | 語音識別、語音合成 | TTS:英文 $0.0225,中文 $0.0675;ASR:30分鐘 = $0.18 | |
| Deepgram | 語音識別 | TTS:英文 $0.02025,中文 $0.06075;ASR:30分鐘 = $0.147 | |
| Microsoft Azure | 語音合成 | TTS:英文 $0.036,中文 $0.108;ASR:即時轉錄 $1/小時,超額 $0.8/小時 | |
| Amazon Polly | 語音合成 | TTS:英文 $0.024,中文 $0.072 | |
| Google WaveNet | 語音合成 | TTS:英文 $0.024,中文 $0.072 | |
| Google Vertex AI | 大型語言模型 | Gemini/Claude 定價頁 | |
| Google Cloud VM | 虛擬機器 | VM 執行個體定價頁面 |
🗣️ Speech Processing (語音處理與即時對話)
WebRTC 與語義打斷技術是即時語音對話的底層基石。 導入 LiveKit Agents 等全雙工對話框架,可在 500ms 重疊語音下實現 100% 召回率,並將平均響應延遲壓縮至 300ms,徹底解決傳統 VAD 頻繁搶話的痛點。語音處理是讓 AI 擁有「耳朵」與「嘴巴」的關鍵技術。隨著大型語言模型 (LLM) 的普及,現在的戰場已經從單純的語音辨識 (ASR) 與語音合成 (TTS),轉移到強調低延遲、能處理自然打斷的「即時對話代理 (Voice Agents)」。
如果你正準備踏入語音開發的深坑,請務必先停下來看看這些實務經驗。演算法再好,遇到現場的「背景噪音」、「麥克風收音距離」與「詭異的口音」,模型一樣會崩潰。
💡 開發者的真心話:數據質量決定一切
在語音領域,「垃圾進,垃圾出」 的現象比影像或文本更嚴重。很多時候,與其花時間去微調模型參數,不如好好去清洗你的音檔數據、處理好降噪 (Noise Reduction) 與 VAD (語音活動偵測)。👉 必讀實務經驗分享:
- ASR / TTS 開發避坑指南:深度解析在真實場景中導入語音技術時,如何評估數據質量與避開常見架構陷阱。
- 那些語音處理踩的坑:從前端收音到後端辨識,記錄了我們過去在專案落地時滿滿的血淚與實戰心得。
要在本地端部署極速的語音模型,或是打造像 ChatGPT Voice 一樣能自然對話的 AI,你需要以下這些前沿框架:
Qwen-Audio-Agent [2026-07] 🔥 [全雙工語音Harness] [非阻塞多任務] [ACP協議生態] [擇時結果回流] [前台後台解耦]
spawn_thinking 達成非阻塞併發——派發後台任務時立即釋放控制權,多任務採每位 owner 獨立 FIFO 佇列串行匯入固定持久會話。結合嚴格的「擇時回流」機制(以播報完成為準、主動讓路當前對話、可續租 claim 防爭搶),僅暴露 8 項極簡前台工具,並支援 TUI、WebUI 與 macOS 桌面懸浮球多形態介面。TEN Framework [2025-05-14]
LiveKit Agents [持續更新] 🔥 (9.9k+ Stars)
Agent 以 WebRTC 參與者的身分直接加入房間 (Room)。工作流程分為四核心:
支援免配伺服器的終端對話,也支援熱重載:
python myagent.py console (本地麥克風直接測試,免 Server)python myagent.py dev (熱重載 + 連接 LiveKit Server)python myagent.py start (生產環境優化部署)透過 pip install "livekit-agents[openai,silero,deepgram,cartesia,turn-detector]~=1.4" 按需安裝。原生支援將 Python 函數轉為 LLM 工具,並可輕易串接 MCP 服務:
from livekit.agents import function_tool, RunContext
@function_tool
async def lookup_weather(context: RunContext, location: str) -> str:
"""查詢指定地點的天氣"""
return f"{location} 的天氣是晴天,25°C"
🚀 最小啟動範例 (Python)
Python
from livekit.agents import Agent, AgentSession, AgentServer, JobContext, RunContext, function_tool
from livekit.plugins import openai, silero, deepgram, cartesia
server = AgentServer()
@server.rtc_session()
async def entrypoint(ctx: JobContext):
# 1. 定義 Agent 與工具
agent = Agent(instructions="你是一個友善的語音助手", tools=[lookup_weather])
# 2. 組合多模態管線 (簡寫語法亦可: stt="deepgram/nova-3")
session = AgentSession(
stt=deepgram.STT(),
llm=openai.LLM(model="gpt-4.1-mini"),
tts=cartesia.TTS(),
vad=silero.VAD.load()
)
# 3. 啟動會話並加入 WebRTC 房間
await session.start(agent=agent, room=ctx.room)
await session.generate_reply(instructions="greet the user and ask about their day")
</details>
Sherpa-ONNX [持續更新] 🔥
Seeduplex [閉源商業標竿] 💎
[2025-01-19]
無論是想自己訓練模型,還是理解音訊底層邏輯,這些資源能幫你打穩基本功:
中文語音辨識 (Chinese Speech Recognition)
免切片端到端模型大幅降低了長語音轉寫的運算成本。 實測改進版 Faster-Whisper 模型,在不損失字錯率 (WER < 5%) 的前提下,可將 1 小時音檔的處理時間從 10 分鐘縮短至 30 秒,並節省 70% 的 VRAM 消耗。
在語音辨識領域,目前主要分為兩大陣營:一派是歐美主導的 「Whisper 生態系與巨頭大模型」,專注於極限吞吐量與串流延遲;另一派則是亞洲大廠針對 「中文語境、方言與複雜環境」 特化的 SOTA 模型。
解決痛點:極致壓榨推理速度、精準時間戳對齊,以及串流即時辨識。
| 模型/工具名稱 | 開發團隊/生態 | 💡 核心優勢與解決痛點 | 🚀 推薦適用場景 & 規格標籤 |
|---|---|---|---|
| Sherpa-onnx | 🌐 k2-fsa 團隊 | 全能型本地端語音部署神器。基於 ONNX Runtime,解決了移動端需自行編寫大量 JNI 程式碼的痛點,單一 AAR 即可支援流式 ASR、VAD 與 TTS。 | 離線語音助理、Android/iOS 原生開發[本地部署] [流式識別] |
| WhisperX | 開源社群 | 精準時間戳:強力對齊字級時間戳,解決原版糊在一起的問題。 | 會議紀錄、自動上字幕 |
| Distil-Whisper | 開源社群 | 輕量極速:模型縮小 49%,速度提升 6 倍,保留 99% 精準度。 | 本地伺服器、英文場景 |
| Insanely-Fast-Whisper | 開源社群 | 天下武功唯快不破:底層優化,推理速度達到令人髮指的地步。 | 海量音檔批次處理 |
| CarelessWhisper | 開源社群 | 低延遲串流:微調 Whisper 實現接近非串流式的精準度。 | 語音助理、直播字幕 |
| Parakeet-tdt-0.6b-v3 | NVIDIA | 吞吐量王者:1秒轉錄1小時音訊!輝達最強開源模型之一。 | 企業級資料清洗 |
| Voxtral (Mini 4B) | Mistral AI | 實時對話:超越 GPT-4o mini 的語音能力,歐洲巨頭首發。 | 整合 LLM 的語音應用 |
| OpusLM | CMU | 多模態統一:學術界重磅!統一語音辨識、合成與文字理解。 | AI 研究、多模態系統 |
| MedASR | 醫療專精:解決醫學專業術語難以辨識的痛點。 | 醫療院所、數位健康 | |
MAI-Transcribe-1 [2026-04] 🔥 | Microsoft AI | 25 種語言性能全數超越 Whisper-large-v3。解決了長音訊轉寫「越播越崩」的語意偏差,批量轉寫速度提升 2.5 倍,且價格僅每小時 0.36 美元,徹底瓦解高昂轉錄成本。 | 全球化會議逐字稿、多人 Podcast 轉錄、多語言客服系統[性價比之王] [超越Whisper] |
MAI-Voice-1 [2026-04] | Microsoft AI | 1 秒生成 60 秒極致自然語音。針對長時間敘事優化,完美保留音色一致性與豐富情感,並支援「秒級」小樣本語音克隆。 | 互動式虛擬助理、長篇有聲書製作、遊戲 NPC 語音[超低延遲] [高保真克隆] |
parakeet.cpp (NVIDIA Parakeet C++ 實作) [2026-06] 🔥 [C++17重寫] [極速ASR] [邊緣運算] [流式識別] [ggml架構]
Microsoft Foundry-Local Edge ASR (Nemotron-0.6B) [2026-04] 🔥
如果你處理的音訊包含大量複雜的中文方言、中英夾雜,或是極具挑戰性的長時段錄音,以下模型目前處於領先地位。(註:注重地緣資安合規的專案,請自行評估導入風險)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景 |
|---|---|---|---|
| FireRedASR2S | 🇨🇳 小紅書 | SOTA 工業全能系統:在複雜口音與噪音場景下辨識率極強悍。 | 短影音、內容監控 |
| Qwen3-ASR | 🇨🇳 阿里巴巴 | 多語種霸主:吊打原生 Whisper,支援高達 52 種語言和方言。 | 出海企業、多語客服 |
| VibeVoice-ASR | 🇨🇳 微軟亞洲 | 拒絕切片:64K 超長窗口,一次吞下 60 分鐘音訊並吐出結構化結果。 | 長篇演講、一小時會議 |
| Fun-ASR | 🇨🇳 阿里達摩院 | 小參數大能量:0.8B 效能直逼 12B,支援離線轉寫 SDK。 | 邊緣運算、本地部署 |
Mega-ASR [2026-05] 🔥
[抗噪ASR] [複合聲學退化] [消除語意幻覺] [真實世界部署]StepAudio 2.5 ASR [2026-04-24] 🔥
FireRedASR2S [2026-02-12] 🔥
| 測試集類別 | FireRedASR2-LLM | FireRedASR2-AED | Doubao-ASR | Qwen3-ASR | Fun-ASR |
|---|---|---|---|---|---|
| 4個普通話集 (平均) | 2.89 | 3.05 | 3.69 | 3.76 | 4.16 |
| 19個方言集 (平均) | 11.55 | 11.67 | 15.39 | 11.85 | 12.76 |
| 唱歌歌詞 (opencpop) | 1.12 | 1.17 | 4.36 | 2.57 | 3.05 |
| 指標 | FireRedVAD | Silero-VAD | TEN-VAD | FunASR-VAD | WebRTC-VAD |
|---|---|---|---|---|---|
| F1 Score (%) ↑ | 97.57 | 95.95 | 95.19 | 90.91 | 52.30 |
| 誤報率 FAR (%) ↓ | 2.69 | 9.41 | 15.47 | 44.03 | 2.83 |
| 漏報率 MR (%) ↓ | 3.62 | 3.95 | 2.95 | 0.42 | 64.15 |
| (註:FireRedLID 準確率 97.18% 亦優於 Whisper 的 79.41%;標點預測 FireRedPunc F1 達 78.90%,遠超 FunASR-Punc) |
16kHz, 16-bit, 單聲道 PCM WAV。AED 版建議音頻 ≤60秒,LLM 版建議 ≤40秒。💻 Python 開箱即用 API:
from fireredasr2s import FireRedAsr2System, FireRedAsr2SystemConfig
# 默認配置自動串聯 VAD → LID → ASR → Punc 四大模組
config = FireRedAsr2SystemConfig()
asr_system = FireRedAsr2System(config)
# 輸出結構化 JSON:含標點文本、毫秒級時間戳、語種、置信度、詞級切分
result = asr_system.process("assets/hello_zh.wav")
print(result)
Qwen3-ASR + vLLM 高併發部署 [2026-04] 🔥 (取代原本 2026-01-30 的舊版目)
qwenllm/qwen3-asr),大幅降低環境配置門檻,是打造高併發自動上字幕、企業級多語種客服的絕對首選。[高併發首選] [極低延遲] [中文方言霸主]2026-01-30 Qwen3-ASR
2025-12-16 Fun-ASR
2025-12-15 GLM-ASR
[2025-04-02] Dolphin
SenseVoice [持續更新] 🔥
無需複雜配置,一行指令安裝 pip install funaudio,即可同時輸出文字與情感標籤:
from funaudio import SenseVoiceSmall
model = SenseVoiceSmall()
audio_path = "your_audio.wav"
result = model.transcribe(audio_path)
print(f"📝 轉錄文本: {result['text']}")
print(f"🎭 情感標籤: {result.get('emotion', 'N/A')}")
(註:命令列模式亦支援直接輸出 JSON 格式:funaudio --model sensevoice-small --file test.wav --output-format json)
VibeVoice Family [2026-01-30] 🔥 (35k Stars)
VibeVoice-ASR-BitNet [2026-07-23] 🔥 [CPU極速即時轉寫] [BitNet三值量化] [1.58GB極致壓縮] [跑贏Whisper.cpp] [60分鐘長音訊]
Nemotron 3.5 ASR (0.6B 流式語音辨識) [2026-06] 🔥
target_lang=auto 進行即時多語種混合偵測。[超低延遲] [流式ASR] [原生標點] [多語種支援]Voxtral Realtime (4.4B) [2026-02-28] 🔥
vLLM,支援異構 KV 快取與 WebSocket 全雙工即時推理。[亞秒級延遲] [vLLM原生支援] [Apache 2.0 完全開源][2026-02] 🔥 [原生串流] [極低延遲] [端側部署][2026-03-28] 🔥
2025-12-23 MedASR
[2025-11-15] Omnilingual-ASR
2025-08-10 Canary-1b-v2
2025-08-08 Parakeet-tdt-0.6b-v3
2025-07-02 OpusLM
2025-05-06 VITA-Audio
Moonshine Voice [2026-05] 🔥
[邊緣運算首選] [100倍極速] [純本地隱私] [取代Whisper]WhisperPipe [2026-04] 🔥
[極低延遲] [串流管線] [記憶體零增長] [Agent實時交互]Sherpa-ONNX Android Agent [2026-04-18] 🔥
sherpa-onnx 框架與 Paraformer 雙語模型,實現完全「純離線」的邊說邊出字體驗。僅需 15MB 的 AAR 核心庫與 int8 量化模型,即可在安卓中端設備達成 <300ms 的極致響應,並具備模糊指令匹配能力。
2025-08-29 WhisperLiveKit
2025-08-27 CarelessWhisper
2025-06-06 speakr
Whisper Family (OpenAI)
OpenAI Realtime API 低延遲語音架構解析 [2026-05] 🔥
[WebRTC優化] [超低延遲] [語音網路架構] [OpenAI官方解析]Whisper: OpenAI 開源準確率最高的通用模型。
WhisperLive: 免費即時語音轉文字工具。
Distil-Whisper: 輕量級 AI 的強大力量。
Insanely-Fast-Whisper: 超快速辨識腳本。
WhisperX: 強化的時間戳記與說話者識別。
Fine-tune Whisper: 微調教學。
FunASR (阿里達摩院)
WeNet (58同城)
Other Toolkits
語音辨識技術(Automatic Speech Recognition, ASR / Speech To Text, STT),其目標是讓電腦自動將人類語音轉換為相應的文字。這是一門極度跨領域的深水區,涵蓋了訊號處理、圖型識別、機率論、發聲與聽覺機理以及人工智慧。(註:ASR 的重點是辨識「內容說了什麼」,這與辨識「是誰說的」說話人辨識 / Speaker Verification 完全不同!)
🛠️ 框架與 API 的神農嚐百草
當時為了搞定 ASR,跟小夥伴們幾乎把市面上的方案全測過了一輪!我們嘗試過 NEMO、Kaldi、MASR、VOSK、wav2vec,也串接過 Google、Azure 等商用 API,更別說後來陸續冒出來的 SpeechBrain、出門問問的 WeNet 跟騰訊 PIKA 等。每一種演算法架構都各有優缺點,實際落地的效果也是如人飲水,冷暖自知。
📊 數據痛點:找不到靠譜的「台灣口音」
搞語音辨識,聲學模型 (AM) 搭配語言模型 (LM) 是基本功,但最大的死穴在於「開源數據庫」。目前公開已知可訓練的中文數據(如:Magic-Data_Mandarin-Chinese-Read-Speech-Corpus、aidatatang、aishell-1到aishell-4)大約有 2000 多小時。但可惜的是,這些幾乎全是中國發音與用語,至今仍缺乏較靠譜的台灣在地數據。而且說實話,若真想達到「商用級別」,訓練數據量至少得破萬小時才算及格。
💡 應用場景與進階延伸
[2026-04-18] 🔥
🗣️ Speaker Recognition (聲紋辨識)
抗噪特徵萃取是提升語者驗證準確率的核心。 採用 ECAPA-TDNN 等深度神經網絡架構,在訊噪比 (SNR) 低於 5dB 的極端環境下,等錯率 (EER) 仍可維持在 1.5% 以下,確保金融級聲紋辨識的安全要求。
💡 核心觀念:語音辨識 (ASR) 是破解「說了什麼」,而聲紋識別 (Speaker Recognition) 則是破解「是誰說的」。透過提取聲音中的生物特徵(聲紋),實現說話人身份的驗證與辨識。
Wespeaker:目前產業界極受歡迎的生產級聲紋辨識開源工具包。📄 AlphaXiv 論文 | 📝 v1.2.0 發布說明
SincNet:一種直接處理原始音訊波形 (Raw Waveform) 的深度學習架構,能有效提取具備物理意義的聲學特徵。📄 AlphaXiv 論文
SpeakerRPL V2 [2026-04] 🔥 [開放集聲紋] [少樣本微調] [極限低錯誤率]
🔍 R&D 前期調研 SOP (約耗時 30 天)
首先會盡可能把 3 年內的學術論文或比賽的 SOTA 都查過一輪,分工閱讀找到相關的數據集和開源實作。同時,我們會去盤點目前已有相關產品的公司(含新創)以及他們提交的專利(透過 Google Patents, Papers with Code, arXiv 等)。在聲紋識別這塊,對岸有非常多的新創公司,例如「國音智能」,在我們的研發過程中就一直被當作標竿目標。
🚧 數據獲取的「地理限制」與預處理地獄
在分享實驗結果前,必須先警告後人避免踩坑:上述很多中文聲紋數據集都放在對岸的百度雲盤等空間,而百度是直接封鎖台灣 IP 的,所以你打不開是非常正常的!另外,像VoxCeleb這種神級數據庫是被切成 7 份的,下載完再合併就要花上不少時間(相比之下aishell、CMDS、TIMIT就相對好處理多了)。
🧠 技術架構總結與 Kaldi 泥沼
聲紋技術的發展脈絡可簡單總結為三大核心:
1. 向量抽取 (Vector Extraction):i-vector, d-vector, x-vector 等。
2. 模型架構與調參:CNN, ResNet 等深度學習架構。
3. 評分方式 (Scoring):LDA, PLDA (Probabilistic Linear Discriminant Analysis) 等組合。
我們當時也使用了Kaldi內附的功能,光是跟 Kaldi 搏鬥就投入了極大的時間和精力!其實跟 NLP 相比,聲紋識別雖然數據集難搞,但好處是聲音可以自行用程式「加工」做切割合併(Data Augmentation)。因為真實場景錄音通常很短,還得處理「非註冊聲紋 (Open-set)」的拒絕判定,前前後後在數據搭配評分模式上花費了龐大心血,是個不折不扣的大工程。
📐 必備技術指標字典 (Evaluation Metrics) 在聲紋領域,你必須看懂以下指標才能評估模型好壞:
⚡ 效能與速度指標
🎧 Speech Enhancement (中文語音增強與去噪)
基於生成式 AI 的語音增強技術已超越傳統濾波器。 結合深度學習的去噪模型,能在保留 95% 原始語音細節的同時,將背景噪音與殘響衰減 40dB,顯著提升下游語音辨識系統 20% 的辨識成功率。
💡 核心觀念:從含雜訊的複雜環境音中,精準提取出純淨的人聲(語音信號)。這在語音辨識(ASR)的前處理中,是決定辨識率成敗的關鍵第一步。
👉 🌐 更多資源 | 🤗 線上 DEMO 體驗 (Meta Denoiser)
[2024-12-07] 🔥
🧠 底層邏輯與技術差異
其實,噪音去除跟「聲音分離 (Source Separation)」可以做聯想,兩者的基本概念差不多。差別在於:噪音去除是純粹把「非人聲」的頻段或特徵給過濾掉(實作時記得要注意音檔是否為多通道 Multi-channel)。
🧪 數據「煉丹」的眉角:算力與語系的拉扯
做這個項目時,我們一樣彙整了相當多的學術論文和實驗結果。深度學習都是數據為王,但「去噪」任務的數據集相對好處理很多!因為網路上到處都能找到乾淨的語音跟純噪音,只要寫程式進行動態的調整與合併(Mix),就可以無限生成數量龐大的訓練數據集。
這時你唯一需要考量的有兩點:
1. 你的 GPU 記憶體(VRAM)夠不夠大,能不能把這些海量音頻特徵整個吃下來?
2. 你的乾淨人聲數據集是不是「全英文」?如果你想要擁有極佳的「中文」去噪效果,在混合數據時就必須加入大量在地的中文語料。
🚀 實戰成果與效能突破
經過無數次的架構修剪與調參,順道一提,我們最終煉出來的模型大小,是經過極致優化的 9 MB!而且實時比 (RTF, Real Time Factor) 高達 0.08。這意味著在極低的硬體資源下,也能實現極速的即時語音降噪!
[2026-04-18] 🔥
👥 Speaker Separation (中文語者分離)
多語者分離技術解決了「雞尾酒會問題」的商業應用瓶頸。 透過時域音訊分離網路 (TasNet),即使在 3 人重疊說話的情境下,信號干擾比 (SIR) 改善量可達 15dB,讓會議記錄自動化轉寫準確率突破 90%。
💡 核心觀念:從混疊的聲音訊號中提取出單一目標使用者的聲音。這是為了解決經典的**「雞尾酒會問題 (Cocktail Party Effect)」**,即在多人同時說話的吵雜場景中,精準分離出每個人獨立的聲軌。
👉 🌐 更多資源 | 🤗 HF Space Demo 體驗
[2024-12-07] 🔥
[2025-06-03]
了解語音分離的底層演進,以下是必讀的學術基石:
🚧 語音數據合成的藝術:完全重疊 vs 部分重疊
語音坑最棒的地方在於,只要有了像aishell等乾淨的數據集,你想要切割或合併成「混合語音」都不是太大的問題!
這裡做數據相對簡單一點:我們直接把數據集打散混合,隨機挑選兩個人,然後分別挑出語音做混合 (Mix)。如果長度不同,就選擇短者為參考,將長者切到與短者相同。
但要注意的是,「兩兩完全重疊」與「兩兩互不完全重疊」對模型效果有不小的影響!我們第一波產出的數據是兩兩完全重疊的,後來為了解決不完全重疊的現實場景,又額外產出了第二波升級版數據。
📊 實戰數據配方大公開
- 第一版 (完全重疊):Train 約 5 萬多筆 (32小時) / Val 約 1 萬多筆 (10小時) / Test 約 9 千多筆 (6小時)。
- 第二版 (互不完全重疊):Train 約 9 萬多筆 (112小時) / Val 約 2 萬多筆 (26.3小時) / Test 約 2 萬多筆 (29.4小時)。
🧠 追隨大神腳步與架構大亂鬥
中間意外發現了 Google Brain 的wavesplit,在有噪音及兩人同時講話情形下感覺效果不差,但沒找到相關 code,未能進一步驗證。
而且,又是那位有一起用餐之緣的深度學習大神 Yann LeCun!繼發文介紹完去噪後,又發文介紹了語音分離。後來我們陸續研究了各種架構,包含把 NLP 最早應用的 Transformer 導入的DPT-NET (Dual-path transformer)、DP-RNN,還有VoiceFilter、TasNet、Conv-TasNet跟sudo-rm-rf等等。
🎓 台大李宏毅老師的指點與 CPU 落地的最後一哩路
這段旅程絕對不能錯過台大電機李宏毅老師的SSL-pretraining-separation論文(務必去看李老師的影片!)。最後也是多虧李老師及第一作者黃同學的解惑,小夥伴們才又更深入地確認並且解決問題。
在工程端,我們也深入研究了Data Parallel跟Distributed Data Parallel (DDP)的差異。但說到底,如何才能在 CPU 上跑得又快又準,才是這個專案真正能落地的關鍵!
🗣️ Chinese Speech Synthesis & TTS (中文語音合成與音色克隆)
零樣本 (Zero-shot) 聲音克隆將客製化語音成本降至極限。 最新的開源 TTS 模型僅需提供 3 到 5 秒的乾淨參考音檔,即可生成自然度 (MOS 分數) 超過 4.2 的合成語音,將配音成本縮減 95% 以上。
「想做有聲書、全自動短影音,還是專屬的虛擬 VTuber 聲優?目前的 TTS 技術不僅告別了傳統的『機器人平淡嗓音』,還能做到 3 秒極速複製你的聲音。本清單為你拆解目前最主流的歐美大廠方案與亞洲霸榜神作,讓你根據資安需求與硬體條件精準選型。」
如果你對專案的「原產地」有嚴格要求,或者伺服器沒有配備頂級 GPU,以下由歐美巨頭或國際社群主導的專案是你的首選:
| 模型/工具名稱 | 開發團隊/生態 | 💡 核心優勢與解決痛點 | 🚀 推薦場景與資源 |
|---|---|---|---|
| Voxtral TTS (4B) | 🇫🇷 Mistral AI [2026-03-27] | 34 億參數跑在手機上。生成速度是真人說話的 6 倍,延遲 < 0.1 秒。權重全開源 MIT 協議!支援英、法、德等 9 語系 (暫無中文)。 | 筆電端本地部署、多語系[極低延遲]🤗 Model |
| OpenAI Edge TTS | 🇺🇸 微軟/OpenAI 生態 | 完全免算力、免費白嫖! 透過呼叫微軟 Edge 瀏覽器的語音介面,免 GPU 就能產出高水準語音。 | 輕量網頁應用、零成本[免 GPU]🐙 GitHub |
| Parler-TTS | 🇺🇸/🇪🇺 Hugging Face [2024-09] | 安裝最無腦的輕量之王。HF 官方開源,主打「一行指令安裝」,對開發者極度友善。 | PoC 開發、英/歐語系[極易部署]🐙 GitHub |
| Kokoro-TTS | 🌐 國際開源社群 [2024-11] | 歐美社群熱推平替。架構輕量且聲音自然,是取代龐大模型的優質選擇。 | 本地輕量語音助理[社群熱推]🌐 官方介紹 |
| VALL-E X / DragonV2.1 | 🇺🇸 Microsoft (微軟) [2025-07 更新] | 跨語言音色保留。微軟的經典架構與最新模型,技術底蘊深厚。 | 企業多語種配音[大廠背書]📝 VALL-E 教學 |
| Orpheus TTS | 🌐 開源社群 [2025-03] | 即時對話王者。25ms 超低延遲,專為即時雙向對話設計。 | 語音 AI Agent[超低延遲]🐙 GitHub |
| NeuTTS Air | 🌐 開源社群 [2025-10] | 主打端側運算 (On-Device)。極小體積與超低功耗,可直接部署於 iOS/Android。 | 離線隱私保護 APP[端側部署]🐙 GitHub |
技術客觀評析:在「中文」表現上,以下模型目前領先全球。它們不僅精確掌握中文發音,甚至能生成帶有「笑聲、嘆氣、語氣詞」的超擬真語音。(註:注重地緣資安的專案,建議於完全離線的沙盒環境中運行)
| 模型名稱 | 開發團隊 | 💡 核心優勢與突破點 | 🚀 推薦場景與資源 |
|---|---|---|---|
| GPT-SoVITS | 🇨🇳 RVC-Boss | 人聲克隆無冕王! 只要 1 分鐘語音樣本就能完美複製聲音,GitHub 狂攬 35k+ Stars。 | VTuber 聲優、有聲書[霸榜神作]🐙 GitHub |
| ChatTTS | 🇨🇳 2noise [2024-06] | 打破 AI 機械音的終極武器。支援在語句中加入「笑聲」、「停頓」,擬真度極高。 | AI Podcast、劇情對白[情緒控制]🐙 GitHub |
| Qwen3-TTS | 🇨🇳 阿里巴巴 [2025-12] | 不只克隆,還能「捏聲音」。提供 VoiceDesign (音色創造) 與 VoiceClone (音色克隆)。 | 遊戲 NPC 配音[音色創造]📝 中文解讀 |
| Fun-CosyVoice3 | 🇨🇳 阿里通義百聆 [2025-12] | 極速克隆專家。只需短短 3 秒錄音,就能複製並轉換成 9 種不同的語言。 | 出海行銷影片翻譯[3秒克隆]🐙 GitHub |
| MOSS-TTSD / F5-TTS | 🇨🇳 復旦 / 上海交大 [2025-07] | 學術界頂規猛獸。MOSS 經百萬小時訓練;F5-TTS 15 秒樣本完成克隆。 | 底層架構二次開發[巨量訓練]🌐 MOSS Project |
[2026-08] 🔥 [擴散語言模型] [全並行TTS] [首包延遲41.6ms] [Seed-TTS-Eval四冠王] [塊因果流式]
Supertonic v3 [2026-09] 🔥 [99M極致輕量] [純CPU推論] [本地隱私] [ONNX/WebGPU]
X-Voice (30語系零樣本跨語言語音克隆) [2026-05] 🔥
[零樣本語音克隆] [跨語言無口音] [免文字稿] [極低延遲]Supertonic 3 [2026-04-29] 🔥
[本地部署] [純CPU推論] [極低延遲] [隱私優先]MAGIC-TTS [2026-04-23] 🔥
Fish Audio S2-Pro [2026-03-09] 🔥
[whisper in small voice] 或 [professional broadcast tone]),讓開發者無需死記固定代碼,就能精準控制情感、語氣與節奏。環境安裝與 CLI 推論:
git clone [https://github.com/fishaudio/fish-speech.git](https://github.com/fishaudio/fish-speech.git)
cd fish-speech
pip install uv
uv sync
python -m fish_speech.text_to_speech \
--text "你好,我是 Fish Audio S2-Pro" \
--reference_audio reference.wav \
--output output.wav
Docker 極速部署:
Bash
docker pull fishaudio/fish-speech:latest
docker run -it --gpus all fishaudio/fish-speech:latest
(生產環境推薦搭配 SGLang 伺服器:sglang-omni)
</details>
Xiaomi Any2Speech [2026-04] 🔥
Midasheng-audio-generate [2026-04] ✨
Woosh [持續更新] 🔥
OmniVoice [2026-04-02] 🔥
* 核心優勢:0.8B 極小參數達成 600+ 語言覆蓋,TTS 從「拚規模」轉向「拚效率」的劃時代作。 小米 AI 實驗室(Daniel Povey 團隊)出品,不僅支援 12 種中國方言(如四川話、東北話),更實現了「零樣本音色克隆」與「情緒同步」的雙重突破。其極致輕量的架構,讓開發者能以極低硬體負擔實現「真人口吻」的細膩表達。
* 解決痛點 / 推薦場景:徹底解決傳統模型因體積龐大難以落地邊緣設備,以及中英混說、方言朗讀具備「機械感」的通病。 支援耳語、ASMR 與細粒度情緒控制,完美契合「短影音在地化旁白」、「車載語音助理」與「跨國產品出海」等場景。它將聲音轉化為「可複用數位資產」,讓中小團隊也能低門檻打造具備品牌 IP 感的虛擬員工聲音。
* 資源:🐙 GitHub | 📄 論文:OmniVoice (arXiv) | 🌐 官方技術解讀
ControlAudio [2025-10] 🔥 [精確時間控制] [語音音效一體化] [漸進式擴散]
2026-02-22 Ming-flash-omni-2.0
2026-01-26 Chroma 1.0 (全雙工對話專用)
[2026-04] 🔥
2025-08-15 ZipVoice (純 CPU 推理)
2025-08-08 KittenTTS
2025-07-25 Higgs Audio V2
2025-07-23 FreeAudio
2025-06-05 OpenAudio S1
2025-03-30 MegaTTS3
💾 開源語音資料集 (Speech Datasets)
沒有百萬小時的煉丹爐,生不出好模型!對於需要訓練在地化模型的開發者來說,高品質、標註乾淨的語料庫是無價之寶。以下收錄 2024-2025 釋出的重量級資料集。
🎙️ 語音與音頻綜合應用 (Speech & Audio Applications)
語音技術的價值取決於與大模型 (LLM) 的無縫整合能力。 將即時語音轉文字 (STT) 結合 RAG 架構應用於智能客服,實測可將單筆客服通話的平均處理時間 (AHT) 縮短 40%,提升 60% 的首次解決率 (FCR)。當單項技術(辨識、合成、分離)趨於成熟,2026 年的趨勢在於將多個模型串聯成解決特定生活痛點的「完整方案」。以下收錄具備高度整合性且支援本地部署的開源神作:
Voicebox [2026-05] 🔥 [ElevenLabs平替] [全端語音工作站] [零樣本克隆] [MCP協議] [本地部署]
voicebox.speak,用「你的專屬聲音」與你對話。VideoChat [2026-06] 🔥
cascade_only 級聯模式下,僅需 8GB 顯示記憶體 (VRAM) 即可在單張消費級顯示卡上流暢運行全鏈路。Voice-Pro (v3.2) [持續更新] 🔥
OmniVoice Studio [2026-05] 🔥
[ElevenLabs平替] [全本地部署] [零樣本克隆] [端到端配音] [支援MCP]Nightingale [2026-04-18] 🔥
UVR Karaoke (音軌分離)、WhisperX (詞級時間軸對齊) 與 Pitch Scoring (音調打分) 引擎。支援 Windows/macOS/Linux 全平台硬體加速(CUDA/MPS),能將任意本地 MP3/影片自動轉化為帶有同步歌詞、動態背景且可導唱的 K歌房等級體驗。AudioX [2026-03-15] 🔥
OmniVoice Studio [持續更新] 🔥
[本地ElevenLabs平替] [全鏈路配音] [零樣本克隆] [MCP協定]Speaker-Reasoner (ASLP-lab) [2026-04] 🔥
[多輪時序推理] [端到端語者分離] [超長音訊處理] [超越Gemini]Whisper + CAM++ 離線轉寫管線 [2026-04-18] 🔥
❓ 語音處理開發常見問題解答 (FAQ)
Q1: 即時語音 AI 頻繁搶話怎麼解決? A: 棄用傳統音量 VAD,改用內建「語義輪次檢測」的 LiveKit 框架,可精準區分真實打斷與咳嗽等噪音,解決 90% 搶話問題。
Q2: 如何降低 Whisper 的顯存消耗並加速? A: 採用 WhisperX 或 Faster-Whisper 架構進行 INT8 量化,實測可減少 70% VRAM 佔用,並將轉寫速度提升 4 倍以上。
Q3: 少量參考音檔能做到高精度聲音克隆嗎? A: 可以。使用 CosyVoice 或 Fish Audio 等零樣本 (Zero-shot) 模型,僅需 5 秒清晰參考音頻,即可生成 MOS 分數 >4.2 的高品質語音。
Q4: 背景噪音太大導致語音辨識錯誤怎麼辦? A: 在 ASR 模組前加入基於深度學習的語音增強 (Speech Enhancement) 預處理模組,可提升 20% 的惡劣環境辨識率。
Q5: 開發全雙工 (Full-duplex) 語音客服推薦什麼架構? A: 推薦基於 WebRTC 協議的架構(如 TEN Framework 或 LiveKit),端到端延遲可穩定在 300ms 內,達到真人對話體驗。
99 commits
HTML
100.0%