💰較早收集於 27h

Google 將 Gemini 驅動的語音輸入整合至 Gboard

Google 將 Gemini 驅動的語音輸入整合至 Gboard
PostLinkedIn
💰閱讀原文: TechCrunch AI

💡Google 原生 AI 功能整合對語音轉錄市場的潛在衝擊分析。

⚡ 30-Second TL;DR

有什麼變化

Gboard 整合 Gemini 以提升語音轉錄準確度

為什麼重要

此舉將 AI 轉錄功能普及化,可能導致依賴基礎語音輸入功能的第三方應用程式失去市場份額。

下一步行動

若你的產品涉及語音轉錄功能,請審視其差異化價值,避免與 OS 層級的原生 AI 功能直接競爭。

誰應關注:Founders & Product Leaders

關鍵要點

  • Gboard 整合 Gemini 以提升語音轉錄準確度
  • 初期僅限 Samsung Galaxy 與 Google Pixel 裝置使用
  • 對專注於語音轉錄的第三方新創構成市場威脅

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • 此功能被稱為「Rambler」,旨在將口語化、雜亂的語音輸入(包含贅字、停頓、重複和自我修正)轉化為清晰、精煉的文字,超越了傳統的逐字轉錄。
  • Gemini 驅動的語音輸入支援多語言混合輸入(code-switching),允許用戶在同一句話中無縫切換不同語言,這對許多獨立的語音聽寫應用來說是一項挑戰。
  • Google 強調隱私保護,語音輸入的音訊僅用於即時轉錄,不會被儲存,且 Gboard 會明確指示「Rambler」功能何時啟用。
  • 這項整合是 Google 更廣泛的「Gemini Intelligence」推動的一部分,旨在將 Gemini 的先進 AI 功能引入 Android 系統,包括自動填表、網頁摘要和生成式使用者介面等。
  • Gemini 驅動的 Gboard 語音輸入在 Pixel 6 及更高版本裝置上支援進階語音輸入功能,例如自動標點、語音插入表情符號和語音編輯指令,且大部分處理在裝置端完成,以保護隱私。
📊 競品分析▸ Show
功能/產品Google Gboard (Gemini 驅動)Apple DictationMicrosoft SwiftKeyCleverType AI KeyboardFUTO Keyboard
主要功能清理贅字、自我修正、多語言混合、即時潤飾、自動標點、語音編輯指令內建於 iOS/iPadOS、離線處理 (新 iPhone)、多語言、免手動標點AI 預測、滑動輸入、700+ 語言、剪貼簿、翻譯內建 AI 助理、即時語法修正 (40+ 語言)、語氣調整、AI 回覆、文字翻譯、高度客製化完全離線、離線語音輸入、多語言、高度可配置
定價免費 (內建於 Android Gboard)免費 (內建於 iOS/iPadOS)免費付費訂閱未明確說明 (通常開源或一次性購買)
準確度傳統約 95%,Gemini 提升後應更高快速但對專業內容可能過於基礎預測準確度高,語音聽寫較弱 (專有名詞易錯)99.2%+離線語音輸入可能較慢
離線模式傳統需網路,Gemini 部分裝置端處理,整體離線能力未明確說明為完全離線支援離線處理 (新 iPhone)語音資料傳送至雲端,需網路支援完全離線處理 (裝置端)完全離線

🛠️ 技術深入

  • Gemini 驅動的 Gboard 語音輸入功能被稱為「Rambler」,它利用 Gemini 模型來理解自然語音模式,而不僅僅是逐字轉錄。
  • 該系統能夠移除贅字(如「嗯」、「啊」)、理解句子中間的自我修正、解釋語句中的變更,並支援多語言混合輸入。
  • Gemini 模型在處理音訊時,每秒音訊會被表示為 32 個 token,單一提示中支援的最長音訊資料為 9.5 小時。
  • 音訊檔案會被降採樣至 16 Kbps 的資料解析度,若音訊來源包含多個聲道,Gemini 會將其合併為單一聲道。
  • 雖然 Gemini API 目前不直接支援即時轉錄,但 Gboard 的整合顯示 Google 正在將這些能力應用於即時語音輸入場景。
  • 在 Pixel 6 及更高版本裝置上,Gboard 的進階語音輸入功能(可能包含部分 Gemini 能力)大部分處理在裝置端進行,音訊不會傳送至 Google 伺服器,除非使用「修正」或詳細編輯功能。
  • Gemini 2.0 的多模態能力被用於更好地理解語音模式,這在 2025 年的 Google AI 回顧中有所提及。

🔮 前景展望AI analysis grounded in cited sources

語音輸入將成為行動裝置上的主要文字輸入方式。
透過消除口語表達中的「雜訊」並提供更自然的聽寫體驗,Google 顯著提高了語音輸入的可用性和效率,可能改變用戶行為。
專注於語音轉錄的第三方新創公司將面臨巨大的市場壓力。
當 Gboard 將先進的 AI 編輯功能直接整合到 Android 鍵盤中時,它將過去的付費或高級功能變成了內建的基準功能。
裝置端 AI 處理將成為行動 AI 功能的關鍵差異化因素。
Google 強調音訊僅用於即時轉錄且不儲存,並在裝置端處理大部分功能,這將提升用戶對隱私的信任並推動更多裝置端 AI 發展。

時間線

2016-05
Google Assistant 首次亮相,作為 Google Nest 智慧音箱和 Allo 訊息應用的一部分。
2017-02
Google Assistant 開始部署到運行 Android 6.0.1 或 7.0 的其他 Android 智慧型手機。
2023-02
Google 推出 Bard 聊天機器人,作為其消費者端大型語言模型部署的開端。
2023-12
Google 推出 Gemini 模型家族,標誌著向統一、多模態 AI 基礎的戰略轉變。
2024-02
Bard 和 Duet AI 統一品牌為 Gemini,並推出 Android 行動應用程式。
2026-05
Google 在 Android Show I/O Edition 2026 上宣布 Gboard 整合 Gemini 驅動的「Rambler」語音輸入功能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI