🤖較早收集於 57m

學生尋求封閉模型實驗點數

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#student-credits#api-access#benchmarking#ml-experimentsclosed-source-frontier-modelsgemini-3.1-progpt-5.2

💡學生基準測試昂貴前沿LLM的免費點數提示(24字)

⚡ 30-Second TL;DR

有什麼變化

在900題推理基準上評估前沿模型

為什麼重要

突顯學生主導AI研究使用專有模型的成本障礙。社群回應可能揭示補助計劃,有助降低學術基準測試門檻。

下一步行動

申請Google Cloud研究點數或OpenAI學術存取計劃。

誰應關注:Researchers & Academics

關鍵要點

  • 在900題推理基準上評估前沿模型
  • Gemini 3.1 Pro 平均每運行輸出30k token
  • GPT 5.2 實驗每次約15分鐘
  • 學生研究者需要封閉源API點數

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Gemini 3.1 Pro在ARC-AGI-2基準上達到77.1%的準確率,相比Gemini 3 Pro的31.1%提升了2.5倍,超越Claude Opus 4.6(68.8%)和GPT-5.2(52.9%),成為當前最強的推理模型[1][2]
  • Gemini 3.1 Pro在自主代理任務(APEX-Agents)上得分33.5%,顯著超越GPT-5.2(23.0%)和Claude Opus 4.6(29.8%),表明其在多步驟複雜任務自動完成方面的優勢[1][2]
  • Gemini 3.1 Pro的定價為每百萬輸入token $2、輸出token $12,相比Claude Opus 4.6便宜7.5倍(輸入)和6.25倍(輸出),同時在18個追蹤基準中排名第一的有12個[4]
  • Gemini 3.1 Pro解決了前代模型的輸出截斷問題,用戶報告可以在單次運行中生成大規模回應而無截斷,同時JetBrains確認該模型提供更可靠的結果且所需輸出token更少[6]
  • GPT-5.2在GDPval基準上達到70.9%的人類專家水平表現,在金融試算表生成、企業演示結構化和多層數據分析等知識工作任務上表現突出[3]
📊 競品分析▸ Show
基準測試Gemini 3.1 ProClaude Opus 4.6GPT-5.2
ARC-AGI-277.1%68.8%52.9%
APEX-Agents(代理任務)33.5%29.8%23.0%
GPQA Diamond94.3%92.4%
SWE-Bench Verified80.6%80.8%80.0%
LiveCodeBench Pro2887 Elo2393 Elo
輸入token定價$2/百萬$15/百萬$2.50/百萬
輸出token定價$12/百萬$75/百萬$10/百萬

🛠️ 技術深入

• Gemini 3.1 Pro採用無中斷的大規模上下文記憶架構,針對付費層用戶優化,可無需手動切換或強制推理延遲即可自動適應複雜問題解決[3] • GPT-5.2配備400,000 token上下文窗口,採用回應壓縮技術處理歷史數據,在多日工作流中維持連貫性[3] • Gemini 3.1 Pro在Deep Think模式下的RE-Bench(機器學習研發前沿安全評估)中得分1.27(相比Gemini 3 Pro的1.04),在特定挑戰「Optimise LLM Foundry」上將微調腳本運行時間從300秒減少至47秒[2] • Gemini 3.1 Pro在MCP Atlas工具使用協調基準上得分69.2%,領先所有測試模型[4] • 兩個模型均支持思維模式(Thinking modes),允許模型在輸出最終回應前花費數分鐘構建邏輯推理鏈以最小化幻覺[3]

🔮 前景展望AI analysis grounded in cited sources

推理密集型研究的成本結構將重塑學術AI評估方法
Gemini 3.1 Pro在推理基準上的卓越表現與其低廉定價結合,將使大規模模型評估對學生研究者更具可行性,可能推動更多開源基準的採用以降低成本。
自主代理能力將成為模型差異化的主要戰場
Gemini 3.1 Pro在APEX-Agents上的領先優勢(33.5% vs 23-29.8%)表明多步驟任務自動化正成為前沿模型競爭的關鍵指標,將驅動企業應用的採用決策。

時間線

2025-12
Gemini 3 Pro發布,ARC-AGI-2基準得分31.1%
2026-02
Gemini 3.1 Pro發布,ARC-AGI-2得分躍升至77.1%,創造2.5倍性能提升
2026-02
Gemini 3.1 Pro在GPQA Diamond上創造有史以來最高得分94.3%
2026-02
Gemini 3.1 Pro解決輸出截斷問題,用戶報告長文本生成能力改善
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。