🧬DeepMind Blog•較早收集於 25m
Gemini 3.1 Flash-Lite:Gemini 3 系列最快、最省

#cost-efficient#low-latency#model-optimizationgemini-3.1-flash-litedeepmindgemini-3.1-flash-litegemini-3
💡DeepMind 最快/最便宜的 Gemini 3 模型,大規模智能更實惠(28字)
⚡ 30-Second TL;DR
有什麼變化
Gemini 3 系列中最快的模型
為什麼重要
此發布降低可擴展 AI 推理的門檻,讓開發者能以更低成本運行智能應用。將 Gemini 模型在速度與定價上定位為強勁競爭者。
下一步行動
立即在 Google AI Studio 測試 Gemini 3.1 Flash-Lite,體驗更快、更便宜的推理。
誰應關注:Developers & AI Engineers
關鍵要點
- •Gemini 3 系列中最快的模型
- •Gemini 3 系列中成本效益最高的模型
- •專為大規模智能而建
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Gemini 3.1 Flash-Lite 達到 363 tokens/秒的輸出速度,相比 Gemini 2.5 Flash 的 249 tokens/秒提升約 45%,並實現 2.5 倍更快的首字元延遲[1][2]
- •定價策略大幅降低:輸入 token 價格從 $0.30 降至 $0.25/百萬 token,輸出價格從 $2.50 降至 $1.50/百萬 token,使企業級應用的基礎設施佔用空間顯著縮小[1][2]
- •在 Arena.ai 排行榜上獲得 1432 Elo 分數,在 GPQA Diamond (86.9%) 和 MMMU Pro (76.8%) 等推理與多模態基準測試中超越同級別競爭模型,甚至超越更大的 Gemini 2.5 變體[1][2]
- •模型在安全性和語氣方面相比 Gemini 2.5 Flash-Lite 全面改進,同時保持低誤拒率,適用於客戶支援、內容生成和資料分析等高容量應用[5]
- •已於 2026 年 3 月透過 Google AI Studio 的 Gemini API 和企業級 Vertex AI 平台開始預覽推出,早期測試者包括 Latitude、Cartwheel 和 Whering 等公司[2]
📊 競品分析▸ Show
| 特性 | Gemini 3.1 Flash-Lite | Gemini 2.5 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| 輸出速度 | 363 tokens/秒 | 249 tokens/秒 | 更高(推理模型) |
| 輸入價格 | $0.25/百萬 token | $0.30/百萬 token | 更高 |
| 輸出價格 | $1.50/百萬 token | $2.50/百萬 token | 更高 |
| Arena.ai Elo | 1432 | 低於 1432 | 57(推理指數) |
| GPQA Diamond | 86.9% | 低於 86.9% | 更高 |
| 首字元延遲 | 2.5 倍改進 | 基準 | 更高(含思考時間) |
| 目標用途 | 高容量、低延遲 | 通用 | 複雜推理任務 |
🛠️ 技術深入
• 模型層級:Gemini 3 系列中的輕量級變體,專為高容量、成本敏感的 LLM 流量優化 • 回應品質:旨在匹配 Gemini 2.5 Flash 的性能,同時在關鍵能力領域保持一致 • 指令遵循:針對複雜聊天機器人和指令密集型工作流程進行目標改進,提供可靠的遷移路徑 • 音訊輸入:改進音訊輸入品質,適用於自動語音識別 (ASR) 等任務[3] • 安全評估:在自動化安全評估中相比 Gemini 2.5 Flash-Lite 全面改進,保持低誤拒率,評估涵蓋推理、多模態、事實性、代理工具使用、多語言和長文本等基準[5] • 上下文窗口:支援大規模內容分析和排序(具體大小未在搜尋結果中明確指定)
🔮 前景展望AI analysis grounded in cited sources
高容量應用成本結構將重塑
45% 的速度提升與 17-40% 的價格下降結合,將使大規模 AI 部署的邊際成本大幅下降,可能推動企業採用 AI 驅動的客戶服務和內容生成。
輕量級模型將成為主流生產部署選擇
Flash-Lite 在保持 Gemini 2.5 Flash 品質的同時實現顯著成本節省,表明開發者將優先考慮效率而非原始能力,推動模型設計朝向邊際優化發展。
推理能力與成本效益的權衡邊界將移動
GPQA Diamond 86.9% 的成績表明輕量級模型已達到複雜推理任務的可用閾值,可能減少對更大型號的需求,進而影響 AI 基礎設施投資決策。
⏳ 時間線
2025-09
Gemini 2.5 Flash-Lite 發布,作為前一代成本效益模型
2026-03
Gemini 3.1 Flash-Lite 推出,在 Google AI Studio 和 Vertex AI 開始預覽,性能和成本效益相比前代大幅提升
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- officechai.com — Gemini 3 1 Flash Lite Benchmarks
- Google Blog — Gemini 3 1 Flash Lite
- docs.cloud.google.com — 3 1 Flash Lite
- artificialanalysis.ai — Gemini 3 1 Pro Preview vs Gemini 2 0 Flash Lite Preview
- Google DeepMind — Gemini 3 1 Flash Lite
- llm-stats.com — Gemini 2.5 Flash Lite vs Gemini 3.1 Pro Preview
- datacamp.com — Gemini 3 1
- docsbot.ai — Gemini 2 0 Flash Lite
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: DeepMind Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。