📲最新收集於 12h

Gemini Live 新增語音驅動的 Deep Research

Gemini Live 新增語音驅動的 Deep Research
PostLinkedIn
📲閱讀原文: Digital Trends

💡可用語音啟動的背景研究,可能讓 Gemini 更適合處理長時間的 AI 調查。

⚡ 30-Second TL;DR

有什麼變化

使用者可透過 Gemini Live 的語音互動啟動 Deep Research 報告。

為什麼重要

這項更新讓長時間研究流程更具對話性,也減少使用者持續盯著螢幕的需求。對 AI 從業者而言,它可能改善資訊蒐集流程,但報告品質與來源驗證仍然重要。

下一步行動

請在 Gemini Live 中執行一項具代表性的研究任務,接著檢查引用來源,並與現有研究流程的結果進行比較。

誰應關注:Researchers & Academics

關鍵要點

  • 使用者可透過 Gemini Live 的語音互動啟動 Deep Research 報告。
  • 研究報告可在背景持續處理。
  • 報告完成後,使用者能以對話方式討論研究結果。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 22 個來源。

🔑 增強重點摘要

  • Gemini Deep Research由Google DeepMind開發,能夠自主瀏覽網路約5-10分鐘,生成帶有引用的綜合研究報告。
  • 此功能於2024年12月作為Gemini Advanced的一部分推出,被視為首批廣泛成功的消費者導向AI代理產品之一。
  • Deep Research利用Gemini極長的上下文視窗(1-2百萬個tokens),在多輪對話中保持所有瀏覽內容的上下文,允許用戶提出後續問題而無需重新進行網路搜尋。
  • 該系統能夠整合來自網路頁面、文件及其他媒體等多種來源的資訊,並利用Gemini的多模態能力將其綜合呈現。
  • 用戶可以對Gemini Deep Research所制定的研究計畫進行調整,從而控制研究的重點領域。
  • Deep Research還能自主搜尋並瀏覽用戶的Gmail、雲端硬碟和聊天記錄(若用戶選擇啟用),並且用戶可以上傳自己的文件進行分析。
  • Gemini Live與Deep Research的整合,允許用戶透過語音啟動研究任務,並讓其在背景非同步執行,即使切換應用程式或鎖定手機也能繼續進行。
📊 競品分析▸ Show

競爭者分析

功能/產品Google Gemini Deep ResearchOpenAI Deep Research / ChatGPT VoicePerplexity AI Deep ResearchClaude Advanced ResearchMicrosoft Copilot Voice
核心能力語音啟動、背景執行、對話式討論、自主網路瀏覽、生成帶引用報告、整合Google Workspace、多模態對話式AI、腦力激盪、研究、快速問答、多模態、自然語音對話每次回答均提供引用來源、搜尋即時網路、多源資訊整合、內聯引用多模態、良好視覺理解、良好跨模態推理、代理系統整合Office應用、自由流暢語音對話
發布時間2024年12月 (Deep Research) / 2024年8月 (Gemini Live)2025年2月 (Deep Research Agent)2024年後 (Deep Research)2025年後 (Advanced Research)2025年3月前 (Copilot Voice)
定價Gemini Advanced訂閱 (Google AI Pro每月20美元)ChatGPT免費版;進階功能每月20美元未明確提及,但以引用來源為核心未明確提及整合Microsoft生態系統,部分功能免費
基準測試未提供特定基準測試數據,但被譽為最實用的AI代理之一在事實研究任務中,與Parallel Ultra並列97%準確度 (代理模型)在事實研究任務中,Sonar版本得分87.9%在事實研究任務中,Claude Code與Parallel Ultra並列97%準確度 (代理模型)未提供特定基準測試數據
主要優勢深度整合Google生態系統、長上下文視窗、可編輯研究計畫、非同步執行、多模態推理強大的對話能力、廣泛的知識範圍、多模態輸入強調資訊來源可追溯性與準確性擅長處理複雜圖表與技術插圖、跨模態推理無縫整合Microsoft Office應用程式

🛠️ 技術深入

  • Gemini Deep Research由Google DeepMind開發,採用代理式規劃、透明的用戶體驗設計(包含可編輯的研究計畫)及非同步協調機制。
  • 該功能最初基於Gemini 1.5 Pro模型,並逐步發展至Gemini 2.0 Flash,目前已整合Gemini 3.1 Pro。
  • Deep Research利用Gemini模型極長的上下文視窗,可達1-2百萬個tokens,以在多輪對話中維持所有瀏覽內容的上下文。
  • 當接近上下文限制時,系統會回退到檢索增強生成(RAG)方法。
  • Gemini模型採用統一的Transformer架構處理所有輸入,實現跨模態的深度整合與推理,支援文字、圖像、音訊和視訊等多模態數據。
  • Deep Research能夠自主瀏覽網路5-10分鐘,針對Gemini 3.1 Ultra版本甚至可達30分鐘,以收集和綜合資訊。
  • Deep Research Max版本透過模型上下文協定(Model Context Protocol, MCP)安全地連接到用戶的私人數據。
  • Gemini Live的語音引擎經過優化,提供更一致、富有情感表達且逼真的語音互動,支援即時打斷和追問。
  • Deep Research功能可透過Interactions API存取,提供兩個版本:deep-research-preview-04-2026(注重速度與效率)和deep-research-max-preview-04-2026(注重最大程度的全面性)。

🔮 前景展望AI analysis grounded in cited sources

AI研究將變得高度個人化且整合至日常工作流程。
Gemini Deep Research與Google Workspace(Gmail、雲端硬碟、聊天)的深度整合,以及其學習用戶工作流程的能力,將使AI研究從獨立工具轉變為無縫的個人化助理。
語音互動將成為複雜AI任務的主要介面。
Gemini Live透過語音指令啟動背景深度研究的能力,並支援即時打斷和追問,預示著語音將取代傳統的文字提示,成為與AI進行複雜、多步驟任務互動的首選方式。
AI代理將加速跨領域的知識發現與科學研究。
像Gemini Deep Research這樣的代理系統能夠自主規劃、執行多步驟研究、綜合多源資訊並生成帶引用的報告,這將極大地縮短研究週期,並在科學、商業分析等領域推動新的發現。

時間線

2023-12
Google發布Gemini 1.0模型家族,Bard後端切換至Gemini Pro。
2024-02
Bard正式更名為Gemini,並推出Gemini Advanced和智慧型手機應用程式。
2024-08
Gemini Live開始向Gemini Advanced訂閱者推出,實現自由流暢的對話。
2024-12
Google DeepMind推出Gemini Deep Research,作為Gemini Advanced的一部分。
2025-11
Gemini Deep Research實現與Google Workspace(Gmail、雲端硬碟、聊天)的深度整合。
2026-08
Gemini Live整合Deep Research,允許語音啟動背景研究。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Digital Trends

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。