原文標題:Introducing Eleven v4, our most emotive model
ElevenLabs 9 月 28 日發布 Eleven v4 與 Eleven v4 Turbo,兩款文字轉語音模型都採用新的架構,重點不只在發音正確,而是理解語氣、節奏、情緒、角色與前後文,讓同一句話能依不同情境產生更接近表演的聲音。
Eleven v4 Turbo 則針對即時代理與對話工作負載最佳化。ElevenLabs 公布的測試顯示,其推論延遲中位數約 100ms,並與 ElevenAgents 一起做系統級最佳化,希望讓語音代理能更快回應,同時保留 v4 的情緒與多語能力。
兩款模型也改善多說話者互動,讓不同角色的回應可以根據對話上下文調整,而不是像把獨立台詞拼接在一起。官方把應用範圍指向有聲書、角色演出、旁白、配音、本地化,以及需要自然聲音的 conversational agent。
Eleven v4 與 Turbo 已可在 ElevenAgents、ElevenCreative 與 ElevenAPI 使用。官方也引用 Artificial Analysis 排名與盲測偏好數據,但這些評測有特定樣本、競品與條件,實際語言、聲線與延遲仍應以個別應用測試為準。
發生了什麼事
ElevenLabs 推出 Eleven v4 與 Eleven v4 Turbo,強化情緒化、多語與多說話者語音,並把 Turbo 延遲壓到約 100ms 級。
為什麼重要
語音 agent 的體驗很大程度受延遲與語氣自然度影響;若模型能同時降低首段語音等待並維持情緒表現,客服、遊戲角色與即時互動應用會更容易落地。
影響哪些人
語音代理開發者、遊戲與影音創作者、配音與在地化團隊,以及需要即時 TTS 的客服與產品團隊最直接受影響。
已確認與未確認
模型已正式提供,官方也公布延遲與盲測結果;這些效能數據依 ElevenLabs 測試條件而定,實際網路、語言與聲音設定可能有差異。