Gate News 訊息,4 月 17 日——Google 於 4 月 15 日揭曉 Gemini 3.1 Flash TTS,這是一款先進的文字轉語音模型,強化了情感表達與控制功能。新模型將透過開發者 API、企業 Vertex AI,以及協作工具逐步推出。
模型的核心能力包括基於自然語言的音訊標籤,以便針對速度、語調與情感進行微調,並提供「Director Mode」用於指定場景與角色定位,以生成更細緻的語音輸出。多說話人功能可讓對話同時生成,使對話流程更自然,適用於播客、音訊內容與 AI 助理。模型支援超過 70 種語言與方言,反映不同地區的口音與表達方式,以在全球範圍提供在地化的語音體驗。
Google 強調效能與成本效率,透過 Flash 架構在盲測的人類評估基準上取得高分,同時降低運算成本——該架構旨在支援大規模的企業採用。生成的音訊包含 SynthID 水印,用於辨識由 AI 生成的內容並打擊錯誤資訊。
此舉反映語音介面競爭的加劇。OpenAI 正將即時語音功能與對話式 AI 結合,以實現類人互動;而 Meta 則擴大投資 AI 角色,並以語音為基礎的社交體驗來推動。產業觀察人士指出,儘管高水準的表演與創意工作或許仍將以人類主導為主,但重複性且規模化的製作市場,可能會在配音、廣告與有聲讀物等領域逐步導入 AI。