一句話結論
會議語音轉寫最強、速度快 4 倍;單句朗讀的文字準度略遜家族中的 large-v3 版本。
實測數字(三份測試集,同硬體同腳本連續量測)
① 真實會議語音(121 句 held-out,16.4 分鐘)
真實台灣商務會議錄音,自發口語、含填充詞與中英夾雜。此測試集未參與訓練,也未用於選擇檢查點。
在最貼近實務的會議場景,本模型準度最佳,且比 large-v3 版本快 4 倍。
② 朗讀語料(962 句 Common Voice zh-TW 測試集)
Table with columns: 模型, 內容 CER, 實際 CER※, 耗時| 模型 | 內容 CER | 實際 CER※ | 耗時 |
|---|
whisper-large-v3-turbo(底模) | 7.13% | 35.04% | 198s |
| 本模型 | 5.94% | 5.85% | 195s |
whisper-large-v3(底模) | 5.94% | 33.26% | 923s |
| Whisper-Large-v3-xVITA-zhTW | 5.58% |
※ 實際 CER=模型原始輸出直接對繁體標註比對。底模因輸出簡體而大幅扣分,這欄反映「能不能直接用、不必後處理」。
朗讀語料上本模型與 whisper-large-v3 底模同分,略遜 large-v3 微調版 0.36 個百分點。
③ 長音檔(64 秒連續語音)
Table with columns: 模型, 轉出字數| 模型 | 轉出字數 |
|---|
| 本模型 | 248 字 |
| Whisper-Large-v3-xVITA-zhTW | 247 字 |
長音檔內容涵蓋量與 large-v3 版本相當,無截斷。
繁體輸出
底模在 64 秒測試音檔上出現 37 種簡體字;本模型降至 0–1 種。
generation_config.json 另封禁 110 個純簡體 token,解碼空間出不了簡體,可直接使用不需 OpenCC 後處理。
已知弱點(請一併衡量)
- 同音字判斷:「通風」可能誤為「東風」、「關瓦斯」可能誤為「觀瓦斯」。此類錯誤在 large-v3 版本上不會發生,
是蒸餾版解碼器層數較少(4 層 vs 32 層)的語言模型能力差距,增加訓練資料並未改善。
對文字準度要求極高的批次轉檔,建議使用 large-v3 版本。
- 標點風格:本模型以逗號分隔句子,較少產生句號。
訓練方式
- 底模:
openai/whisper-large-v3-turbo(MIT)
- 方法:LoRA(r=32、α=64)微調解碼器,凍結編碼器
- 超參數:learning rate 2e-5、有效批次 16、以字錯誤率提前停止
- 語料:102,618 段台灣華語語音 —— 公開語料(Common Voice zh-TW,已濾除混入的 zh-CN)
90,800 段 + 云碩自有真實會議錄音 11,818 段(約 26 小時)
資料工程:對齊驗證是關鍵
會議語料的音檔與逐字稿以自建管線重新切段,並逐段以 ASR 交叉核對音文是否對得上,
僅保留通過者(通過率 62.9%)。
這一步不是可選的:我們曾有一個內部版本使用未經對齊驗證的同批會議語料,
結果在會議測試集上 CER 30.69% —— 比未微調的底模(19.40%)還差 11 個百分點。
錯位的訓練資料不是「沒有幫助」,而是主動傷害模型。此處據實記載,供同類工作參考。
語料另經去識別化處理;訓練於云碩自有 AI 算力資源池完成,資料未離開自有場域。
使用方式
from transformers import pipeline
asr = pipeline("automatic-speech-recognition",
model="xCloudinfo/Whisper-Large-v3-Turbo-xVITA-zhTW",
device=0, chunk_length_s=30)
print(asr("meeting.wav", generate_kwargs={"language": "zh", "task": "transcribe"})["text"])
倉庫同時提供 CTranslate2 格式(ct2/),可直接餵給 faster-whisper:
from faster_whisper import WhisperModel
model = WhisperModel("ct2", device="cuda", compute_type="float16")
segments, _ = model.transcribe("meeting.wav", language="zh", without_timestamps=True)
家族其他模型
授權
MIT,與底模 openai/whisper-large-v3-turbo 一致。
本模型與 TAIDE 專案無關,未使用 TAIDE 作為教師模型、未包含 TAIDE 授權語料。
引用
@misc{xvita-whisper-turbo-zhtw-2026,
title = {Whisper-Large-v3-Turbo-xVITA-zhTW},
author = {xCloudinfo},
year = {2026},
url = {https://huggingface.co/xCloudinfo/Whisper-Large-v3-Turbo-xVITA-zhTW}
}