來源較早收集於 50m

Google 正在測試 Gemini 的語音自訂功能

閱讀原文: Digital Trends
#voice-ai#ux-design#tts

Google 為 Gemini 加入細緻的語音控制功能,以提升使用者體驗。

30 秒速覽

有什麼變化

使用者可以調整語音的能量與溫暖度。

為什麼重要

強化語音控制使 AI 助理在特定應用場景(如客戶服務或個人生產力)中更具通用性。這為人機互動的個人化設定樹立了新標準。

下一步行動

若您正在開發語音 AI 應用,請實作類似的 TTS 參數控制,以提升使用者留存率與滿意度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用者可以調整語音的能量與溫暖度。
  • 正式程度設定允許控制語氣的專業或休閒感。
  • 語速自訂功能可提升無障礙體驗與個人偏好設定。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • 此功能預計將整合至 Gemini Live 互動模式中,旨在降低 AI 語音的機械感,使其更符合人類對話的語調起伏。
  • Google 正在利用其最新的語音合成技術(TTS)模型,透過神經網絡參數即時調整音頻特徵,而非僅是簡單的播放速度變更。
  • 該功能開發過程中,Google 特別強調了對不同語言與口音的適應性,以確保語氣調整在非英語系環境下仍能保持自然。
  • 此項更新與 Google 提升 Gemini 在 Android 系統層級整合的策略一致,目標是讓 AI 助理成為更具備個人化特質的數位伴侶。
  • 測試數據顯示,透過調整語氣參數,使用者在與 Gemini 進行長對話時的參與度與滿意度有顯著提升。

競品分析

語氣調整
Google Gemini (語音自訂)
支援能量、溫暖度、正式度
OpenAI ChatGPT (Advanced Voice)
支援多種預設音色,語氣調整較有限
Anthropic Claude
目前主要為文字與視覺,語音功能較弱
語速控制
Google Gemini (語音自訂)
支援
OpenAI ChatGPT (Advanced Voice)
支援
Anthropic Claude
不適用
核心技術
Google Gemini (語音自訂)
Gemini 多模態模型
OpenAI ChatGPT (Advanced Voice)
GPT-4o 語音引擎
Anthropic Claude
N/A

技術深入

  • 採用端對端(End-to-End)神經語音合成架構,直接從文字生成波形,減少中間處理延遲。
  • 引入了風格遷移(Style Transfer)模組,透過潛在空間(Latent Space)中的向量偏移來控制語氣參數。
  • 支援即時串流(Streaming)處理,確保在調整語速或語氣時,音頻輸出不會產生斷層或雜訊。
  • 整合了自適應語音編碼器,以在低頻寬環境下維持語音品質與情感表達的準確度。

前景展望基於引用來源的 AI 分析

語音個人化將成為 AI 助理市場的標準配置。
隨著使用者對 AI 互動自然度要求提高,語氣自訂功能將迫使競爭對手跟進以維持產品競爭力。
此技術將顯著降低 AI 語音在情感陪伴領域的門檻。
更具備溫暖度與個人化語氣的 AI 能有效提升使用者在心理諮詢或語言學習場景中的沉浸感。

時間線

2023-12
Google 發布 Gemini 1.0 模型,奠定多模態互動基礎。
2024-05
Google I/O 大會展示 Project Astra,預告更自然的即時語音互動能力。
2024-08
Gemini Live 正式推出,提供更流暢的對話體驗。
2026-07
Google 開始測試 Gemini 語音自訂功能,進一步細化語音控制選項。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Digital Trends

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。