
Microsoft Research聯同中國科學院大學及上海交通大學研究人員,開發VibeVoice-ASR-Streaming。
模型以 Large Language Model(LLM)為核心的端到端串流Speaker-Attributed Automatic Speech Recognition(ASR)系統,連續處理到達中的語音,同時輸出文字及講者身份。傳統流程通常把ASR與speaker diarization分開處理;此模型將兩項工作放進單一模型,針對即時語音助手及語音代理需要低延遲回應的場景,減少等待完整錄音後才分析的限制。
VibeVoice-ASR-Streaming 會交錯處理固定大小的audio chunks,並加入少量lookahead,讓模型在保留未來聲音片段作判斷的同時,逐步產生轉錄結果。固定分塊有助控制處理延遲,但lookahead 與分塊大小之間仍要取捨:前者越多,講者切換及語句判斷可能更穩定,回應時間亦可能增加。
- 以單一LLM-based端到端模型同步處理ASR與speaker attribution
- 使用固定大小audio chunks及少量lookahead支援串流輸出
- 針對即時語音助手及agents的低延遲需求設計
- 量化檔案、推論框架、硬體需求及效能指標尚未在提供內容中交代