
GLM-5.3 降低成本,贏得 DeepSWE 路由測試
Together AI 在 904 次 DeepSWE rollout 中比較 GLM-5.3 與 GPT-5.6 Sol。GPT-5.6 Sol 的 pass@1 領先 3.7 個百分點,但 GLM-5.3 以約一半成本取得更高的 pass@4;GLM 優先的級聯策略達到 85.9%。
Tag: #coding-benchmarks12 results

Together AI 在 904 次 DeepSWE rollout 中比較 GLM-5.3 與 GPT-5.6 Sol。GPT-5.6 Sol 的 pass@1 領先 3.7 個百分點,但 GLM-5.3 以約一半成本取得更高的 pass@4;GLM 優先的級聯策略達到 85.9%。
據報導,Moonshot 與 ZAI 的模型效能正接近 OpenAI 和 Anthropic 的模型。這些模型據稱能以比 Claude 低 75% 的成本建構尚可使用的網站,凸顯其在重視成本的程式開發工作流程中的潛力。

Z.ai 發布 GLM-5.1,一款 754B 參數開源 MoE LLM,採用 MIT 授權在 Hugging Face 上提供,可自主工作長達 8 小時。它透過「階梯模式」優化,在 SWE-Bench Pro 上超越 Claude Opus 4.6 與 GPT 5.4。模型可處理 1,700 步驟與數千工具呼叫而不偏離策略。

Google 推出 Gemini 3.7 Flash,在程式設計基準測試中取得大幅進步,初始輸入價格為每百萬 token 0.75 美元。與此同時,Gemini 3.5 Pro 仍落後進度數個月,Google 也未確認該模型是否仍會推出。

AI Studio 程式碼中發現「models/gemma-4」參照,暗示即將發布,Kaggle 頁面已上線。兩測試模型—Significant-Otter (120B,不穩定但事實準確) 和 Pteronura (27B 密集型,視覺/程式強)—在 LMArena 表現優異。

MiniMax 平台因 M2.7 模型極度受歡迎,將於高峰時段實施動態限流。此舉針對高併發自動化任務,確保資源公平分配。M2.7 近期推出,在程式碼基準測試中表現媲美頂尖模型。

Together AI 在 900 次 DeepSWE 執行中比較 DeepSeek-V4 Flash 0731 與 GPT-5.6 Luna。GPT-5.6 Luna 的 pass@1 領先 14 個百分點,而 DeepSeek 每美元可完成的解題數量高出 4.8 倍。

文章實測DeepSeek V4長文本、程式碼與推理能力。DeepSeek被定位為主動「認輸」。

提出使用增強項目反應理論(IRT)框架,預測代理式編碼個別任務的成功/失敗。將代理能力分解為 LLM 和支架組件,以跨排行榜彙總資料。能預測未見基準與代理組合,協助基準難度校準。

Elon Musk 於 2023 年 3 月以 12 名共同創辦人推出 xAI,現已流失六名,並裁員,同時在程式碼基準測試落後。Musk 的應對是第二次從頭重建,以追求最強大 AI。