📋近期收集於 26h

Google 測試網頁版 Gemini Live 與技能功能

Google 測試網頁版 Gemini Live 與技能功能
PostLinkedIn
📋閱讀原文: TestingCatalog

💡Google 將代理程式能力引入網頁端:在桌面版測試 Gemini Live 與可重複使用的任務自動化。

⚡ 30-Second TL;DR

有什麼變化

Gemini Live 從行動裝置擴展至桌面與網頁環境

為什麼重要

將 Live 與可重複使用技能引入網頁端,顯著降低了進階使用者直接在瀏覽器內自動化複雜任務的門檻。

下一步行動

一旦開放,請嘗試使用全新的聊天層級技能,為您的日常研究任務建立自定義自動化工作流程。

誰應關注:Developers & AI Engineers

關鍵要點

  • Gemini Live 從行動裝置擴展至桌面與網頁環境
  • 全新的聊天層級技能功能實現可重複使用的任務自動化
  • 加強 Gemini 介面內使用者自定義工作流程的支援

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Gemini Live 的網頁版整合了即時語音處理技術,利用 WebRTC 協議降低延遲,以實現與行動端一致的流暢對話體驗。
  • 「技能」(Skills)功能採用了模組化代理(Modular Agent)架構,允許使用者透過自然語言定義觸發條件與執行步驟,並儲存於 Google Workspace 帳戶中。
  • 此項更新旨在強化 Gemini 作為生產力工具的地位,透過與 Google Drive、Gmail 及 Calendar 的深度 API 整合,實現跨應用程式的自動化任務執行。
  • Google 正在測試一套權限管理系統,讓使用者能將自定義的「技能」分享給特定群組或組織成員,進一步推動協作自動化。
  • 該功能目前優先向 Gemini Advanced 訂閱用戶開放測試,顯示 Google 策略性地將高階自動化功能作為付費服務的核心價值。
📊 競品分析▸ Show
功能/特性Gemini Live (Google)ChatGPT Advanced Voice (OpenAI)Claude Projects (Anthropic)
語音互動即時雙向語音即時雙向語音僅文字/檔案分析
自動化技能支援自定義任務腳本透過 GPTs 執行自動化透過 Project 知識庫整合
跨平台整合Google Workspace 深度整合透過 Actions 連結外部 API專注於文件與程式碼庫
定價模式訂閱制 (Advanced)訂閱制 (Plus/Team)訂閱制 (Pro/Team)

🛠️ 技術深入

  • 採用多模態模型架構,支援即時音訊串流處理與文字轉語音(TTS)的低延遲合成。
  • 技能功能基於 Google 的 Agentic Workflow 框架,利用結構化提示詞(Structured Prompting)將使用者指令轉化為可執行的 API 呼叫序列。
  • 網頁端實作依賴於 Chromium 的 Web Speech API 增強版,並結合後端伺服器端的推理加速以維持對話連貫性。
  • 整合了 OAuth 2.0 授權機制,確保自動化任務在執行時能安全存取使用者的個人雲端資料。

🔮 前景展望AI analysis grounded in cited sources

Gemini 將轉型為具備主動執行能力的代理人系統
透過技能功能的普及,Gemini 將從單純的問答機器人演變為能自動處理複雜工作流程的數位助理。
企業級自動化市場競爭將加劇
隨著 Google 允許技能分享與協作,企業將更依賴 Gemini 構建內部自動化工作流,直接挑戰現有的 RPA 軟體市場。

時間線

2023-12
Google 發布 Gemini 1.0 模型,標誌著多模態 AI 發展的新階段。
2024-02
Google 將 Bard 正式更名為 Gemini,並推出 Gemini Advanced 訂閱服務。
2024-08
Google 在 Pixel 9 系列發表會上正式推出 Gemini Live 行動版語音互動功能。
2025-05
Google I/O 大會宣布擴大 Gemini 的代理人(Agent)能力,強化跨應用程式整合。
2026-07
Google 開始測試 Gemini Live 網頁版及聊天層級的「技能」自動化功能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog