Google 推出 Gemini 3.1 Flash TTS,強化情感表達並支援多說話人能力

Gate News 訊息,4 月 17 日——Google 於 4 月 15 日揭曉 Gemini 3.1 Flash TTS,這是一款先進的文字轉語音模型,強化了情感表達與控制功能。新模型將透過開發者 API、企業 Vertex AI,以及協作工具逐步推出。

模型的核心能力包括基於自然語言的音訊標籤,以便針對速度、語調與情感進行微調,並提供「Director Mode」用於指定場景與角色定位,以生成更細緻的語音輸出。多說話人功能可讓對話同時生成,使對話流程更自然,適用於播客、音訊內容與 AI 助理。模型支援超過 70 種語言與方言,反映不同地區的口音與表達方式,以在全球範圍提供在地化的語音體驗。

Google 強調效能與成本效率,透過 Flash 架構在盲測的人類評估基準上取得高分,同時降低運算成本——該架構旨在支援大規模的企業採用。生成的音訊包含 SynthID 水印,用於辨識由 AI 生成的內容並打擊錯誤資訊。

此舉反映語音介面競爭的加劇。OpenAI 正將即時語音功能與對話式 AI 結合,以實現類人互動;而 Meta 則擴大投資 AI 角色,並以語音為基礎的社交體驗來推動。產業觀察人士指出,儘管高水準的表演與創意工作或許仍將以人類主導為主,但重複性且規模化的製作市場,可能會在配音、廣告與有聲讀物等領域逐步導入 AI。

免責聲明:本頁面資訊可能來自第三方,不代表 Gate 的觀點或意見。頁面顯示的內容僅供參考,不構成任何財務、投資或法律建議。Gate 對資訊的準確性、完整性不作保證,對因使用本資訊而產生的任何損失不承擔責任。虛擬資產投資屬高風險行為,價格波動劇烈,您可能損失全部投資本金。請充分了解相關風險,並根據自身財務狀況和風險承受能力謹慎決策。具體內容詳見聲明

相關文章

Google 將 AI 搜尋整合進 Chrome,讓使用者進行對話式網頁瀏覽

Google 正在用 AI 驅動的搜尋功能強化 Chrome,讓使用者能以對話方式瀏覽並獲得具情境感知的回應。這項新功能也包含多分頁整合,透過整併已開啟分頁並提供量身打造的資訊,改善使用者在各種任務中的體驗。

GateNews23分鐘前

新世界集團終止與 OpenAI 的合作,改與 Reflection AI 建立夥伴關係,調整零售策略

新世界集團已停止與 OpenAI 的合作,轉而選擇與 Reflection AI 進行更大規模的合作,以強化零售營運中的 AI。此一決策旨在簡化工作流程,並針對對 AI 商務成效的疑慮作出回應。

GateNews1小時前

OpenAI 與 Google 為 HWP 格式新增支援,Hancom 盼估值回升

OpenAI 的 ChatGPT 現在支援 HWP 和 HWPX 檔案格式,讓韓國用戶可以直接上傳文件以進行分析,且無需轉換。這提升了本地企業的使用便利性,也可能在近期下跌之後促進 Hancom 股價的反彈。

GateNews1小時前

Google 在南韓使用 AI 執法移除 1.755 億(175.5M)個廣告,暫停 32.6 萬(326K)名廣告主帳戶

在 2025 年,Google 使用 AI 在南韓移除了 1.755 億(175.5 million)個違規廣告,暫停了 326,000 個帳戶,並因隱私違規面臨 $50 百萬(million)罰款,凸顯出執法趨嚴以及 AI 在打擊詐騙性廣告中的作用日益增強的趨勢。

GateNews1小時前

Naver 和 Kakao 預計在 AI 投資持續下公布亮眼的 2026 年第一季業績

Naver 和 Kakao 預計將在 2026 年第一季公布亮眼的財報表現,主要受益於商務與廣告成長,儘管早期階段的 AI 產品影響有限。兩家公司都在顯著增加 AI 基礎設施投資,並調整策略,將 AI 整合到既有服務中。

GateNews1小時前

Anthropic 發布 Claude Opus 4.7,削弱資安攻防能力

Anthropic 於 4 月 16 日 (當地時間) 發布其旗艦模型升級版 Claude Opus 4.7。與先前的 Opus 4.6 模型相比,Opus 4.7 在進階軟體工程能力上展現出「顯著提升」,特別是在困難任務上,並透過更高的嚴謹性與一致性,強化複雜且長時間運作的流程,同時提升了視覺能力;然而,Anthropic 在訓練期間刻意削弱模型的資安攻防能力,並引入安全機制以自動偵測並封鎖被禁止或高風險的請求。

Crypto Frontier2小時前
留言
0/400
暫無留言