🐯虎嗅•最新收集於 6m
Gemini 3.8 Flash 挑戰頂級 AI 模型

#agent-evaluation#model-benchmarks#inference-cost#cybersecuritygemini-3.8-flashgooglegemini-3-8-flashgemini-3-8-flash-cyberclaude-opus-5gpt-5-6-sol
💡Gemini 3.8 Flash 以低成本追平旗艦程式設計基準,但真實 Agent 測試揭示了關鍵限制。
⚡ 30-Second TL;DR
有什麼變化
Gemini 3.8 Flash 的價格為每百萬輸入 Token 0.75 美元、每百萬輸出 Token 3.75 美元,與 Gemini 3.7 Flash 相同。
為什麼重要
這次發布提高了程式設計與 Agent 模型的性價比門檻,尤其適合重視推理成本的工作負載。不過,團隊應評估端到端 Agent 的可靠性,而不能只看基準測試,因為工具呼叫、驗證迴圈與 Token 用量都會實質影響成本與品質。
下一步行動
在遷移程式設計 Agent 前,使用 Gemini 3.8 Flash API 執行固定評測集,記錄工具呼叫、輸出 Token、延遲與任務完成品質。
誰應關注:Developers & AI Engineers
關鍵要點
- •Gemini 3.8 Flash 的價格為每百萬輸入 Token 0.75 美元、每百萬輸出 Token 3.75 美元,與 Gemini 3.7 Flash 相同。
- •它在 DeepSWE v1.1 得分 73.7%、Terminal-Bench 2.1 得分 89.4%、HLE-Verified 得分 54.9%。
- •更高的推理投入使 DeepSWE 平均輸出量從 10.7 萬 Token 增至 14.3 萬 Token,執行步驟則從 125 步增至 166 步。
- •Gemini 3.8 Flash Cyber 僅透過 Google 的 Fairwind 計畫向受信任的防禦者提供。
- •開發者回報它在 Terminal-Bench 4.0、OSWorld 2.0,以及複雜 3D 或遊戲生成任務上的表現不如官方示範所暗示。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。



