來源較早收集於 22h

Gemini 4 Pro 上市前疑似洩露測試成績

閱讀原文: 极客公园
#benchmarks#agent-security#model-competition

Gemini 未驗證的基準分數,伴隨 AI 輔助攻擊與代理權限過大的真實警示。

30 秒速覽

有什麼變化

一張洩露圖片疑似顯示 Gemini 4 Pro 在多項代理基準測試中領先

為什麼重要

若獲得驗證,這些基準測試結果可能加劇前沿模型供應商之間的競爭。安全事件也顯示,AI 輔助漏洞利用與權限過大的企業帳戶,可能放大單一入侵事件的影響。

下一步行動

不要直接採信洩露的 Gemini 分數;請在自有測試框架中評估候選模型,並稽核 AI 代理對 GitHub、Slack 與雲端服務的權限。

誰應關注:Developers & AI Engineers

關鍵要點

  • •一張洩露圖片疑似顯示 Gemini 4 Pro 在多項代理基準測試中領先
  • •相關分數與測試條件尚未獲得獨立驗證
  • •據報導,研究人員利用 Claude 輔助串聯漏洞,取得 OpenAI 帳戶與 GitHub 存取權
關鍵數字88%95.3%86.8%1,000 萬

深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

增強重點摘要

  • •該神秘測試模型在競技場(Arena)以「gemini-3.8-flash」化名進行隱蔽測試,但因 Google 已於 2026 年 9 月 2 日正式發布過 Gemini 3.8 Flash,開發者對比異常優異的表現後推斷其為內部代號「Argon」的 Gemini 4 Pro。
  • •流出的基準測試數據顯示該模型在代理編碼基準 DeepSWE v1.1 達到約 88%,並在終端操作 Terminal-bench 2.1 達 95.3%、OSWorld-2.0 電腦操作任務達 86.8%,以及知識工作評估 GDPval-AA v2 取得 2,064 Elo。
  • •規格表顯示其支援高達 1,000 萬(10M)Tokens 的輸入上限、25.6 萬(256K)Tokens 的輸出上限,並具備跨工作階段的持久記憶(Persistent Memory)能力。
  • •外洩的 API 定價策略為每百萬輸入 Tokens 2.25 美元、每百萬輸出 Tokens 11.25 美元,定價明顯低於同級前沿旗艦競品。
  • •歷史脈絡指出 Google 在 7 個月前發布 Gemini 3.1 Pro 後,原定於年中推出的 Gemini 3.5 Pro 因世代升級幅度邊際遞減而遭取消,Google 遂將全部資源轉向由遞迴自我改進(RSI)架構催生的 Gemini 4 系列。

競品分析

Gemini 4 Pro (洩露數據)
開發商
Google DeepMind
輸入定價 (每百萬 Tokens)
$2.25
輸出定價 (每百萬 Tokens)
$11.25
主要基準表現 (DeepSWE v1.1)
~88%
GPT-6 Astra
開發商
OpenAI
輸入定價 (每百萬 Tokens)
尚未流出明確價格
輸出定價 (每百萬 Tokens)
尚未流出明確價格
主要基準表現 (DeepSWE v1.1)
比 Gemini 4 Pro 低約 2 個百分點 (~86%)
Claude Fable 5.1
開發商
Anthropic
輸入定價 (每百萬 Tokens)
尚未流出明確價格
輸出定價 (每百萬 Tokens)
尚未流出明確價格
主要基準表現 (DeepSWE v1.1)
未詳細公開

技術深入

  • 內部研發代號:測試檢驗點代號為「Argon」。
  • 架構突破技術:傳聞底層能力躍升核心來自 Google DeepMind 在「遞迴自我改進」(Recursive Self-Improvement, RSI)技術的落地突破。
  • 上下文視窗與記憶限制:輸入 context window 支援最高 10,000,000(10M)Tokens,單次輸出限制提升至 256,000(256K)Tokens,並導入跨 session 的持久記憶機制。
  • 前端與多模態渲染能力:社群實測該 checkpoint 展現單次 Prompt 即可在 14 分鐘內生成完整可互動的繪圖 UI 網站,並支援動態 Three.js 3D 儀表板及複雜 SVG 即時渲染。
  • 代理操作基準測試:Terminal-bench 2.1 成績達 95.3%,OSWorld-2.0 電腦操作套件達 86.8%,GDPval-AA v2 真實世界知識工作評分達 2,064 Elo。

前景展望基於引用來源的 AI 分析

前沿模型 API 價格戰將進一步下探
若 Gemini 4 Pro 最終以每百萬輸入 Tokens 2.25 美元的定價上市,將迫使 OpenAI 與 Anthropic 等競品在前沿模型定價上大幅調整以維持競爭力。
「AI 撞牆/減速論」將被實質打破
在市場擔憂 AI 進步面臨邊際遞減之際,由 RSI 推動的高難度代理任務(如 DeepSWE 及 OSWorld)得分跳躍,將證實新架構路線能持續維持模型能力的擴展步伐。

時間線

2026-02
Google 發布前一代旗艦模型 Gemini 3.1 Pro
2026-05
Sundar Pichai 於 Google I/O 預告 Gemini 3.5 Pro 將於年中推出
2026-07
因代際提升幅度未達預期,Google 決定取消 Gemini 3.5 Pro 並全力轉向 Gemini 4
2026-09
Google 正式發布 Gemini 3.8 Flash;隨後 Arena 出現同名但能力大幅超越的「Argon」測試檢驗點,引發 Gemini 4 Pro 洩露關注

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。