來源极客公园•較早收集於 22h
Gemini 4 Pro 上市前疑似洩露測試成績

#benchmarks#agent-security#model-competitiongemini-4-progemini 4 proopenaiclaude opus 5anthropichacktron ai
Gemini 未驗證的基準分數,伴隨 AI 輔助攻擊與代理權限過大的真實警示。
30 秒速覽
有什麼變化
一張洩露圖片疑似顯示 Gemini 4 Pro 在多項代理基準測試中領先
為什麼重要
若獲得驗證,這些基準測試結果可能加劇前沿模型供應商之間的競爭。安全事件也顯示,AI 輔助漏洞利用與權限過大的企業帳戶,可能放大單一入侵事件的影響。
下一步行動
不要直接採信洩露的 Gemini 分數;請在自有測試框架中評估候選模型,並稽核 AI 代理對 GitHub、Slack 與雲端服務的權限。
誰應關注:Developers & AI Engineers
關鍵要點
- •一張洩露圖片疑似顯示 Gemini 4 Pro 在多項代理基準測試中領先
- •相關分數與測試條件尚未獲得獨立驗證
- •據報導,研究人員利用 Claude 輔助串聯漏洞,取得 OpenAI 帳戶與 GitHub 存取權
關鍵數字88%95.3%86.8%1,000 萬
深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
增強重點摘要
- •該神秘測試模型在競技場(Arena)以「gemini-3.8-flash」化名進行隱蔽測試,但因 Google 已於 2026 年 9 月 2 日正式發布過 Gemini 3.8 Flash,開發者對比異常優異的表現後推斷其為內部代號「Argon」的 Gemini 4 Pro。
- •流出的基準測試數據顯示該模型在代理編碼基準 DeepSWE v1.1 達到約 88%,並在終端操作 Terminal-bench 2.1 達 95.3%、OSWorld-2.0 電腦操作任務達 86.8%,以及知識工作評估 GDPval-AA v2 取得 2,064 Elo。
- •規格表顯示其支援高達 1,000 萬(10M)Tokens 的輸入上限、25.6 萬(256K)Tokens 的輸出上限,並具備跨工作階段的持久記憶(Persistent Memory)能力。
- •外洩的 API 定價策略為每百萬輸入 Tokens 2.25 美元、每百萬輸出 Tokens 11.25 美元,定價明顯低於同級前沿旗艦競品。
- •歷史脈絡指出 Google 在 7 個月前發布 Gemini 3.1 Pro 後,原定於年中推出的 Gemini 3.5 Pro 因世代升級幅度邊際遞減而遭取消,Google 遂將全部資源轉向由遞迴自我改進(RSI)架構催生的 Gemini 4 系列。
競品分析
Gemini 4 Pro (洩露數據)
- 開發商
- Google DeepMind
- 輸入定價 (每百萬 Tokens)
- $2.25
- 輸出定價 (每百萬 Tokens)
- $11.25
- 主要基準表現 (DeepSWE v1.1)
- ~88%
GPT-6 Astra
- 開發商
- OpenAI
- 輸入定價 (每百萬 Tokens)
- 尚未流出明確價格
- 輸出定價 (每百萬 Tokens)
- 尚未流出明確價格
- 主要基準表現 (DeepSWE v1.1)
- 比 Gemini 4 Pro 低約 2 個百分點 (~86%)
Claude Fable 5.1
- 開發商
- Anthropic
- 輸入定價 (每百萬 Tokens)
- 尚未流出明確價格
- 輸出定價 (每百萬 Tokens)
- 尚未流出明確價格
- 主要基準表現 (DeepSWE v1.1)
- 未詳細公開
| 模型名稱 | 開發商 | 輸入定價 (每百萬 Tokens) | 輸出定價 (每百萬 Tokens) | 主要基準表現 (DeepSWE v1.1) |
|---|---|---|---|---|
| Gemini 4 Pro (洩露數據) | Google DeepMind | $2.25 | $11.25 | ~88% |
| GPT-6 Astra | OpenAI | 尚未流出明確價格 | 尚未流出明確價格 | 比 Gemini 4 Pro 低約 2 個百分點 (~86%) |
| Claude Fable 5.1 | Anthropic | 尚未流出明確價格 | 尚未流出明確價格 | 未詳細公開 |
技術深入
- 內部研發代號:測試檢驗點代號為「Argon」。
- 架構突破技術:傳聞底層能力躍升核心來自 Google DeepMind 在「遞迴自我改進」(Recursive Self-Improvement, RSI)技術的落地突破。
- 上下文視窗與記憶限制:輸入 context window 支援最高 10,000,000(10M)Tokens,單次輸出限制提升至 256,000(256K)Tokens,並導入跨 session 的持久記憶機制。
- 前端與多模態渲染能力:社群實測該 checkpoint 展現單次 Prompt 即可在 14 分鐘內生成完整可互動的繪圖 UI 網站,並支援動態 Three.js 3D 儀表板及複雜 SVG 即時渲染。
- 代理操作基準測試:Terminal-bench 2.1 成績達 95.3%,OSWorld-2.0 電腦操作套件達 86.8%,GDPval-AA v2 真實世界知識工作評分達 2,064 Elo。
前景展望基於引用來源的 AI 分析
前沿模型 API 價格戰將進一步下探
若 Gemini 4 Pro 最終以每百萬輸入 Tokens 2.25 美元的定價上市,將迫使 OpenAI 與 Anthropic 等競品在前沿模型定價上大幅調整以維持競爭力。
「AI 撞牆/減速論」將被實質打破
在市場擔憂 AI 進步面臨邊際遞減之際,由 RSI 推動的高難度代理任務(如 DeepSWE 及 OSWorld)得分跳躍,將證實新架構路線能持續維持模型能力的擴展步伐。
時間線
2026-02
Google 發布前一代旗艦模型 Gemini 3.1 Pro
2026-05
Sundar Pichai 於 Google I/O 預告 Gemini 3.5 Pro 將於年中推出
2026-07
因代際提升幅度未達預期,Google 決定取消 Gemini 3.5 Pro 並全力轉向 Gemini 4
2026-09
Google 正式發布 Gemini 3.8 Flash;隨後 Arena 出現同名但能力大幅超越的「Argon」測試檢驗點,引發 Gemini 4 Pro 洩露關注
- 2026-02Google 發布前一代旗艦模型 Gemini 3.1 Pro
- 2026-05Sundar Pichai 於 Google I/O 預告 Gemini 3.5 Pro 將於年中推出
- 2026-07因代際提升幅度未達預期,Google 決定取消 Gemini 3.5 Pro 並全力轉向 Gemini 4
- 2026-09Google 正式發布 Gemini 3.8 Flash;隨後 Arena 出現同名但能力大幅超越的「Argon」測試檢驗點,引發 Gemini 4 Pro 洩露關注
來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
每週電子報
每週一封,可隨時退訂。

