
阿里巴巴 Qwen3.7-Max 在程式編寫能力上超越 OpenAI 與 Google
阿里巴巴最新的 AI 模型 Qwen3.7-Max 在全球 Code Arena 排行榜上奪得第四名。它是除 Anthropic 之外唯一進入前五名的開發者,顯示了程式編寫大型語言模型競爭格局的重大轉變。
Tag: #llm-benchmark24 results

阿里巴巴最新的 AI 模型 Qwen3.7-Max 在全球 Code Arena 排行榜上奪得第四名。它是除 Anthropic 之外唯一進入前五名的開發者,顯示了程式編寫大型語言模型競爭格局的重大轉變。

阿里巴巴的 Qwen 3.7 模型在全球編程基準測試中獲得了頂尖排名。目前其表現僅次於 Claude,標誌著中國大型語言模型的重要里程碑。

ThermoQA 推出 293 道熱力學問題,分三層:性質查詢、組件分析與完整循環分析。它評估六款前沿 LLM,由 Claude Opus(94.1%)、GPT-5.4(93.1%)及 Gemini 3.1 Pro(92.5%)領先。開源資料集揭示 LLM 推理超出記憶的差距。
全新基準測試產生針對性物理題目,涵蓋 28 項定律,使用 sympy 和 pint 精準評分。Gemini 模型表現參差不齊,flash-image-preview 以 88.6% 領先。結果自動上傳 HuggingFace,預計測試更多模型。

GTO Wizard Benchmark 推出公共 API 和框架,用於評估 Heads-Up No-Limit Texas Hold'em 代理對抗超人級 GTO Wizard AI,後者以 19.4 bb/100 擊敗 Slumbot。它採用 AIVAT 實現 10 倍方差降低效率。基準測試顯示 LLM 進步,但所有模型遠低於基準線。

大型語言模型展現知行差距:辨識性提示下能偵測輸入缺陷,但生成回應時忽略。研究者推出 FaultyScience 基準與 DeIllusionLLM,任務級自迴歸框架透過自蒸餾統一判斷與推理。有效降低忽略錯誤的回應,同時維持推理效能。

CausalReasoningBenchmark 是全新基準測試,包含來自 85 篇論文與 4 本教科書的 138 個真實世界資料集,共 173 個查詢。它分別評估因果識別(結構化規格)與估計(數值輸出)。基準 LLM 結果顯示高階策略成功率 84%,但完整識別規格僅 30%。
研究人員推出 GPSBench,一個包含 57,800 個樣本、橫跨 17 項任務的資料集,用以探測大型語言模型(LLM)在無工具輔助下的地理空間推理能力。14 款最先進 LLM 在地理知識上較可靠,但在距離與方位等幾何計算上掙扎。資料集、程式碼與發現揭示微調的權衡及擴增的好處。

南京大學最新研究顯示,面對年化40%回報的騙局,AI模型比人類更理性。模擬投資者施壓下,七款主流大模型展現更強的金融防騙能力,堅守底線。此實測突顯AI在詐欺偵測上的優勢。

研究人員建置文字多代理《Clue》遊戲,評估 GPT-4o-mini 與 Gemini-2.5-Flash 的多步推論推理能力。在 18 場模擬遊戲中,代理僅獲四次正確勝利,難以維持一致推理。邏輯拼圖微調未可靠提升表現,有時僅增加推理冗長而非精準。