💼較早收集於 6h

Google 推出 Gemini 3.1 Flash-Lite,成本僅 Pro 的八分之一

Google 推出 Gemini 3.1 Flash-Lite,成本僅 Pro 的八分之一
PostLinkedIn
💼閱讀原文: VentureBeat
#low-latency#cost-efficiency#multimodal#benchmarksgemini-3.1-flash-litegooglegemini-3.1-flash-litegemini-3.1-progemini-2.5-flash

💡最便宜 Gemini:首 token 快 2.5 倍,基準強勁僅 Pro 八分之一成本。(38字)

⚡ 30-Second TL;DR

有什麼變化

企業版成本僅 Gemini 3.1 Pro 的八分之一

為什麼重要

這讓企業能以 Pro 成本八分之一在大規模即時應用如客服與審核部署 AI,提升採用率。其競爭性基準測試使其能挑戰更大模型,在效率上施壓對手。

下一步行動

在 Google AI Studio 測試 Gemini 3.1 Flash-Lite 的低延遲推理基準。

誰應關注:Developers & AI Engineers

關鍵要點

  • 企業版成本僅 Gemini 3.1 Pro 的八分之一
  • 首 token 時間比 Gemini 2.5 Flash 快 2.5 倍
  • 輸出速度每秒 363 token,提升 45%
  • Arena.ai 排行榜 Elo 分數 1432
  • 可調整思考等級控制推理深度

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • 支援輸入高達 1,048,576 個 token 與輸出 65,536 個 token,適用於長上下文任務。[1]
  • 多模態輸入涵蓋文字、圖像、影片、音訊與 PDF,並支援轉錄功能無需額外語音轉文字管線。[1]
  • 思考等級可設定為 minimal、low、medium 或 high,用於數學、編碼或多限制問題以提升準確度。[2]
  • 知識截止日期為 2025 年 1 月,目前為預覽版本 gemini-3.1-flash-lite-preview。[1]

🛠️ 技術深入

  • 模型代碼:gemini-3.1-flash-lite-preview,支持輸入類型包括文字、圖像、影片、音訊與 PDF,輸出為文字。[1]
  • 輸入 token 限制:1,048,576;輸出 token 限制:65,536。[1]
  • 支援功能:批次 API、快取、程式碼執行、檔案搜尋、函數呼叫、搜尋 grounding、結構化輸出、思考與 URL 上下文;不支援音訊生成、電腦使用、Google Maps grounding、圖像生成或 Live API。[1]
  • 思考等級預設為 minimal,可調整至 low、medium 或 high 以分配額外運算資源進行內部推理。[2]

🔮 前景展望AI analysis grounded in cited sources

將加速高量代理任務與低延遲應用的採用
其極低成本與最快性能適合大規模背景處理,如資料提取與轉錄,降低企業 AI 部署門檻。[1][2]
推動混合 AI 架構發展
可與 Pro 模型搭配,將 Flash-Lite 用於高效量任務以優化整體系統成本與速度。[2]

時間線

2026-02
Gemini 3.1 Pro 發佈,提供增強推理能力
2026-03
Gemini 3.1 Flash-Lite 預覽版推出,最具成本效益的多模態模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。