🐯虎嗅•較早收集於 7m
Google 發佈 Gemini 3.5 Flash 與 AI 智能體生態

💡Google 重磅更新:9 億用戶、激進定價與 Android 底層深度整合。
⚡ 30-Second TL;DR
有什麼變化
Gemini 3.5 Flash 採用極致知識蒸餾與 256 專家 MoE 架構,實現高效推理。
為什麼重要
Google 將 AI 垂直整合至龐大用戶群中,構建了強大的護城河,迫使競爭對手重新評估對純雲端 AI 策略的依賴。
下一步行動
評估 Gemini 3.5 Flash 在高吞吐量、低延遲任務中的表現,以顯著降低推理成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •Gemini 3.5 Flash 採用極致知識蒸餾與 256 專家 MoE 架構,實現高效推理。
- •Omni 模型提供原生端到端多模態對齊,延遲低至 120 毫秒。
- •Spark AI 助手獲得 Android 17 底層原生 API 控制權。
- •Google 通過激進的定價策略,旨在降低 AI 使用成本並搶佔市場份額。
🧠 深度解析
Web-grounded analysis with 24 cited sources.
🔑 增強重點摘要
- •Gemini 3.5 Flash 採用了「思考層級」(thinking_level)機制,允許開發者根據需求調整模型在品質、成本和延遲之間的平衡,並支援高達 100 萬個輸入 token 和 6.4 萬個輸出 token 的上下文視窗,其知識截止日期為 2025 年 1 月。
- •Omni 模型被定位為 Google 的首個「任意對任意」(any-to-any)原生多模態基礎模型,能夠在單一統一架構中處理並生成文字、圖像、音訊和視訊,無需依賴中間翻譯層,這代表著從鏈式單功能模型向統一協調引擎的重大轉變。
- •Spark AI 助手是一個「始終開啟」(always-on)的雲端 AI 智能體,旨在主動管理跨 Google 服務(如 Gmail、Docs)和第三方應用程式的工作流程,而 Android 17 將引入「Android Halo」作為智能體活動的專用通知層。
- •Google 在 I/O 2026 大會上宣布大幅調降其 AI 訂閱服務的價格,例如將頂級的 AI Ultra 方案從每月 250 美元降至 200 美元,並推出每月 100 美元的入門級 AI Ultra 方案,旨在降低 AI 使用門檻並擴大市場份額。
- •Gemini 3.5 Flash 在多項智能體和編碼基準測試中表現優於 Gemini 3.1 Pro,例如在 Terminal-Bench 2.1 達到 76.2%,在 GDPval-AA 達到 1656 Elo,在 MCP Atlas 達到 83.6%,並且其輸出 token 速度比其他前沿模型快 4 倍。
📊 競品分析▸ Show
| 特性/模型 | Google Gemini 3.5 Flash | Google Gemini Omni | Google Spark AI 助手 | OpenAI GPT-4o / GPT-5.4 | Anthropic Claude Opus 4.6 / Sonnet |
|---|---|---|---|---|---|
| 功能 | 高效率多模態(輸入:文字、圖像、音訊、視訊、PDF;輸出:文字),專為智能體和編碼任務優化,支援函數呼叫、結構化輸出、程式碼執行。 | 原生「任意對任意」多模態生成(文字、圖像、音訊、視訊),統一架構實現跨模態推理。 | 始終開啟的個人 AI 智能體,主動管理跨 Google 和第三方應用程式的工作流程,深度整合 Android 17。 | GPT-4o 支援文字、圖像、音訊輸入與文字輸出,GPT-5.4 在 SWE-bench Pro 編碼基準測試中領先。 | Claude Opus 4.6 擅長長篇寫作、程式碼品質和智能體工作流程,Sonnet 在編碼方面表現出色。 |
| 定價 | API 定價:輸入 $1.50/百萬 token,輸出 $9.00/百萬 token,快取輸入 90% 折扣。 | 透過 Vertex AI 提供企業客戶,具體定價未詳,但 Google 整體策略旨在降低 AI 使用成本。 | 需訂閱 Google AI Ultra 方案,每月 100 美元或 200 美元。 | GPT-4o:輸入 $2.5/百萬 token,輸出 $10/百萬 token。GPT-4o mini 更具成本效益。 | Claude 3.5 Sonnet:輸入 $3/百萬 token,輸出 $15/百萬 token。Claude 3.5 Haiku 更便宜。 |
| 基準測試 | 在 MCP Atlas (83.6%)、Toolathlon (56.5%)、CharXiv Reasoning (84.2%) 等智能體和編碼基準測試中超越 Gemini 3.1 Pro,輸出速度快 4 倍。 | 旨在實現低延遲(低至 120 毫秒),但獨立可重複的基準測試仍在等待中。 | 旨在實現上下文感知和多智能體協調,但無直接公開基準測試數據。 | GPT-5.4 在 SWE-bench Pro 領先 (59.10%),GPT-5.4 Pro 在 GPQA Diamond、ARC-AGI-2 Verified、BrowseComp 領先。 | Claude Opus 4.6 在寫作品質 (8.7/10) 和分析推理 (9.0/10) 方面表現最佳。 |
🛠️ 技術深入
- Gemini 3.5 Flash:
- 基於 Gemini 3 Flash 推理基礎,採用「思考層級」(thinking_level)來控制品質、成本和延遲,提供「極簡」、「低」、「中」(預設)和「高」選項。
- 支援 100 萬個輸入 token 的上下文視窗和 6.4 萬個輸出 token 的上限。
- 接受文字、圖像、音訊、視訊和 PDF 作為輸入,但僅限文字輸出。
- 內建函數呼叫、結構化輸出、程式碼執行和「搜尋即工具」(search-as-a-tool)功能。
- Gemini Omni:
- 採用「任意對任意」(any-to-any)架構,從底層原生處理即時串流的文字、音訊、圖像和視訊輸入/輸出。
- 透過消除傳統的 API 跳轉(API hops),實現了更流暢、更像人類的智能體工作流程。
- 這種統一模型可以在同一個前向傳播中跨模態進行推理,從而實現更連貫的編輯和更簡潔的 API 介面。
- Spark AI 助手:
- 是一個雲端智能體,即使關閉應用程式或筆記型電腦也能在後台持續運作。
- 整合了 Model Context Protocol (MCP) 開放標準,使其能夠連接 Google 服務套件之外的廣泛外部服務。
- 將與 Android 17 中的「Android Halo」通知層協同工作,提供智能體活動的即時狀態更新。
🔮 前景展望AI analysis grounded in cited sources
Google 積極的定價策略和智能體優先的願景將加速企業向自主化 AI 架構轉型。
Google 將其 AI 產品定位為統一的企業平台,旨在建立「自主智能體工廠」,並聲稱能為企業節省超過 10 億美元的年度成本,這將推動企業採用更自主的 AI 解決方案。
Gemini Omni 的原生多模態「任意對任意」架構將為 AI 模型整合樹立新標準,促使競爭對手超越鏈式單功能模型。
Omni 在單一統一系統中原生處理和生成所有模態的能力,消除了傳統的 API 跳轉,實現了更連貫的推理,從而降低了延遲和 API 開銷,對現有 AI 管道構成壓力。
Spark 與 Android 17 和 Google 生態系統的深度整合將顯著提升個人 AI 智能體體驗,開創主動式、背景運作 AI 協助的新範式。
Spark 的「始終開啟」特性、主動任務管理以及即將推出的 Android Halo 介面,預示著 AI 智能體將更深入地嵌入作業系統,學習用戶行為並自主行動。
⏳ 時間線
2023-03
Google 推出 Bard,基於 LaMDA 語言模型。
2023-04
Google Brain 和 DeepMind 合併,成立 Google DeepMind,整合 AI 研究工作。
2023-12-06
Google 宣布推出 Gemini 模型家族,標誌著向統一多模態基礎模型戰略的轉變。
2024-02
Bard 正式更名為 Gemini,並推出搭載 Ultra 1.0 模型的 Gemini Advanced。
2024-06
Google 推出 Gemini 1.5,在長上下文理解方面實現飛躍,支援處理大量數據。
2025-11-18
Google 宣布推出 Gemini 3 Pro 和 Gemini 3 Deep Think 模型。
2026-02-19
Google 推出 Gemini 3.1 Pro 模型。
2026-05-19
Google I/O 2026 大會上發佈 Gemini 3.5 Flash、原生多模態模型 Omni 及 AI 助手 Spark。
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



