📲Digital Trends•最新收集於 12h
Gemini Live 新增語音驅動的 Deep Research

💡可用語音啟動的背景研究,可能讓 Gemini 更適合處理長時間的 AI 調查。
⚡ 30-Second TL;DR
有什麼變化
使用者可透過 Gemini Live 的語音互動啟動 Deep Research 報告。
為什麼重要
這項更新讓長時間研究流程更具對話性,也減少使用者持續盯著螢幕的需求。對 AI 從業者而言,它可能改善資訊蒐集流程,但報告品質與來源驗證仍然重要。
下一步行動
請在 Gemini Live 中執行一項具代表性的研究任務,接著檢查引用來源,並與現有研究流程的結果進行比較。
誰應關注:Researchers & Academics
關鍵要點
- •使用者可透過 Gemini Live 的語音互動啟動 Deep Research 報告。
- •研究報告可在背景持續處理。
- •報告完成後,使用者能以對話方式討論研究結果。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 22 個來源。
🔑 增強重點摘要
- •Gemini Deep Research由Google DeepMind開發,能夠自主瀏覽網路約5-10分鐘,生成帶有引用的綜合研究報告。
- •此功能於2024年12月作為Gemini Advanced的一部分推出,被視為首批廣泛成功的消費者導向AI代理產品之一。
- •Deep Research利用Gemini極長的上下文視窗(1-2百萬個tokens),在多輪對話中保持所有瀏覽內容的上下文,允許用戶提出後續問題而無需重新進行網路搜尋。
- •該系統能夠整合來自網路頁面、文件及其他媒體等多種來源的資訊,並利用Gemini的多模態能力將其綜合呈現。
- •用戶可以對Gemini Deep Research所制定的研究計畫進行調整,從而控制研究的重點領域。
- •Deep Research還能自主搜尋並瀏覽用戶的Gmail、雲端硬碟和聊天記錄(若用戶選擇啟用),並且用戶可以上傳自己的文件進行分析。
- •Gemini Live與Deep Research的整合,允許用戶透過語音啟動研究任務,並讓其在背景非同步執行,即使切換應用程式或鎖定手機也能繼續進行。
📊 競品分析▸ Show
競爭者分析
| 功能/產品 | Google Gemini Deep Research | OpenAI Deep Research / ChatGPT Voice | Perplexity AI Deep Research | Claude Advanced Research | Microsoft Copilot Voice |
|---|---|---|---|---|---|
| 核心能力 | 語音啟動、背景執行、對話式討論、自主網路瀏覽、生成帶引用報告、整合Google Workspace、多模態 | 對話式AI、腦力激盪、研究、快速問答、多模態、自然語音對話 | 每次回答均提供引用來源、搜尋即時網路、多源資訊整合、內聯引用 | 多模態、良好視覺理解、良好跨模態推理、代理系統 | 整合Office應用、自由流暢語音對話 |
| 發布時間 | 2024年12月 (Deep Research) / 2024年8月 (Gemini Live) | 2025年2月 (Deep Research Agent) | 2024年後 (Deep Research) | 2025年後 (Advanced Research) | 2025年3月前 (Copilot Voice) |
| 定價 | Gemini Advanced訂閱 (Google AI Pro每月20美元) | ChatGPT免費版;進階功能每月20美元 | 未明確提及,但以引用來源為核心 | 未明確提及 | 整合Microsoft生態系統,部分功能免費 |
| 基準測試 | 未提供特定基準測試數據,但被譽為最實用的AI代理之一 | 在事實研究任務中,與Parallel Ultra並列97%準確度 (代理模型) | 在事實研究任務中,Sonar版本得分87.9% | 在事實研究任務中,Claude Code與Parallel Ultra並列97%準確度 (代理模型) | 未提供特定基準測試數據 |
| 主要優勢 | 深度整合Google生態系統、長上下文視窗、可編輯研究計畫、非同步執行、多模態推理 | 強大的對話能力、廣泛的知識範圍、多模態輸入 | 強調資訊來源可追溯性與準確性 | 擅長處理複雜圖表與技術插圖、跨模態推理 | 無縫整合Microsoft Office應用程式 |
🛠️ 技術深入
- Gemini Deep Research由Google DeepMind開發,採用代理式規劃、透明的用戶體驗設計(包含可編輯的研究計畫)及非同步協調機制。
- 該功能最初基於Gemini 1.5 Pro模型,並逐步發展至Gemini 2.0 Flash,目前已整合Gemini 3.1 Pro。
- Deep Research利用Gemini模型極長的上下文視窗,可達1-2百萬個tokens,以在多輪對話中維持所有瀏覽內容的上下文。
- 當接近上下文限制時,系統會回退到檢索增強生成(RAG)方法。
- Gemini模型採用統一的Transformer架構處理所有輸入,實現跨模態的深度整合與推理,支援文字、圖像、音訊和視訊等多模態數據。
- Deep Research能夠自主瀏覽網路5-10分鐘,針對Gemini 3.1 Ultra版本甚至可達30分鐘,以收集和綜合資訊。
- Deep Research Max版本透過模型上下文協定(Model Context Protocol, MCP)安全地連接到用戶的私人數據。
- Gemini Live的語音引擎經過優化,提供更一致、富有情感表達且逼真的語音互動,支援即時打斷和追問。
- Deep Research功能可透過Interactions API存取,提供兩個版本:
deep-research-preview-04-2026(注重速度與效率)和deep-research-max-preview-04-2026(注重最大程度的全面性)。
🔮 前景展望AI analysis grounded in cited sources
AI研究將變得高度個人化且整合至日常工作流程。
Gemini Deep Research與Google Workspace(Gmail、雲端硬碟、聊天)的深度整合,以及其學習用戶工作流程的能力,將使AI研究從獨立工具轉變為無縫的個人化助理。
語音互動將成為複雜AI任務的主要介面。
Gemini Live透過語音指令啟動背景深度研究的能力,並支援即時打斷和追問,預示著語音將取代傳統的文字提示,成為與AI進行複雜、多步驟任務互動的首選方式。
AI代理將加速跨領域的知識發現與科學研究。
像Gemini Deep Research這樣的代理系統能夠自主規劃、執行多步驟研究、綜合多源資訊並生成帶引用的報告,這將極大地縮短研究週期,並在科學、商業分析等領域推動新的發現。
⏳ 時間線
2023-12
Google發布Gemini 1.0模型家族,Bard後端切換至Gemini Pro。
2024-02
Bard正式更名為Gemini,並推出Gemini Advanced和智慧型手機應用程式。
2024-08
Gemini Live開始向Gemini Advanced訂閱者推出,實現自由流暢的對話。
2024-12
Google DeepMind推出Gemini Deep Research,作為Gemini Advanced的一部分。
2025-11
Gemini Deep Research實現與Google Workspace(Gmail、雲端硬碟、聊天)的深度整合。
2026-08
Gemini Live整合Deep Research,允許語音啟動背景研究。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Digital Trends ↗
每週 AI 簡報
每週一封,可隨時退訂。

