📋TestingCatalog•近期收集於 26h
Google 測試網頁版 Gemini Live 與技能功能

💡Google 將代理程式能力引入網頁端:在桌面版測試 Gemini Live 與可重複使用的任務自動化。
⚡ 30-Second TL;DR
有什麼變化
Gemini Live 從行動裝置擴展至桌面與網頁環境
為什麼重要
將 Live 與可重複使用技能引入網頁端,顯著降低了進階使用者直接在瀏覽器內自動化複雜任務的門檻。
下一步行動
一旦開放,請嘗試使用全新的聊天層級技能,為您的日常研究任務建立自定義自動化工作流程。
誰應關注:Developers & AI Engineers
關鍵要點
- •Gemini Live 從行動裝置擴展至桌面與網頁環境
- •全新的聊天層級技能功能實現可重複使用的任務自動化
- •加強 Gemini 介面內使用者自定義工作流程的支援
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Gemini Live 的網頁版整合了即時語音處理技術,利用 WebRTC 協議降低延遲,以實現與行動端一致的流暢對話體驗。
- •「技能」(Skills)功能採用了模組化代理(Modular Agent)架構,允許使用者透過自然語言定義觸發條件與執行步驟,並儲存於 Google Workspace 帳戶中。
- •此項更新旨在強化 Gemini 作為生產力工具的地位,透過與 Google Drive、Gmail 及 Calendar 的深度 API 整合,實現跨應用程式的自動化任務執行。
- •Google 正在測試一套權限管理系統,讓使用者能將自定義的「技能」分享給特定群組或組織成員,進一步推動協作自動化。
- •該功能目前優先向 Gemini Advanced 訂閱用戶開放測試,顯示 Google 策略性地將高階自動化功能作為付費服務的核心價值。
📊 競品分析▸ Show
| 功能/特性 | Gemini Live (Google) | ChatGPT Advanced Voice (OpenAI) | Claude Projects (Anthropic) |
|---|---|---|---|
| 語音互動 | 即時雙向語音 | 即時雙向語音 | 僅文字/檔案分析 |
| 自動化技能 | 支援自定義任務腳本 | 透過 GPTs 執行自動化 | 透過 Project 知識庫整合 |
| 跨平台整合 | Google Workspace 深度整合 | 透過 Actions 連結外部 API | 專注於文件與程式碼庫 |
| 定價模式 | 訂閱制 (Advanced) | 訂閱制 (Plus/Team) | 訂閱制 (Pro/Team) |
🛠️ 技術深入
- 採用多模態模型架構,支援即時音訊串流處理與文字轉語音(TTS)的低延遲合成。
- 技能功能基於 Google 的 Agentic Workflow 框架,利用結構化提示詞(Structured Prompting)將使用者指令轉化為可執行的 API 呼叫序列。
- 網頁端實作依賴於 Chromium 的 Web Speech API 增強版,並結合後端伺服器端的推理加速以維持對話連貫性。
- 整合了 OAuth 2.0 授權機制,確保自動化任務在執行時能安全存取使用者的個人雲端資料。
🔮 前景展望AI analysis grounded in cited sources
Gemini 將轉型為具備主動執行能力的代理人系統
透過技能功能的普及,Gemini 將從單純的問答機器人演變為能自動處理複雜工作流程的數位助理。
企業級自動化市場競爭將加劇
隨著 Google 允許技能分享與協作,企業將更依賴 Gemini 構建內部自動化工作流,直接挑戰現有的 RPA 軟體市場。
⏳ 時間線
2023-12
Google 發布 Gemini 1.0 模型,標誌著多模態 AI 發展的新階段。
2024-02
Google 將 Bard 正式更名為 Gemini,並推出 Gemini Advanced 訂閱服務。
2024-08
Google 在 Pixel 9 系列發表會上正式推出 Gemini Live 行動版語音互動功能。
2025-05
Google I/O 大會宣布擴大 Gemini 的代理人(Agent)能力,強化跨應用程式整合。
2026-07
Google 開始測試 Gemini Live 網頁版及聊天層級的「技能」自動化功能。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog ↗
