🤝Together AI Blog•近期收集於 30h
GLM-5.3 降低成本,贏得 DeepSWE 路由測試

#model-routing#coding-benchmarks#inference-cost#pass-at-4glm-5.3glm-5.3gpt-5.6 soldeepswetogether ai
💡了解更便宜的 GLM 優先級聯,何時能勝過首次嘗試更強的程式碼模型。
⚡ 30-Second TL;DR
有什麼變化
評估涵蓋 904 次 DeepSWE rollout。
為什麼重要
結果顯示,模型路由能在首次成功率、多次取樣成功率與推理成本之間取得平衡。若要最大化 pass@1,開發者可能偏好 GPT-5.6 Sol;但對重視預算的多候選程式碼工作流程而言,GLM-5.3 更具吸引力。
下一步行動
在你的程式碼任務上測試以 GLM-5.3 為優先的級聯流程與 GPT-5.6 Sol,並追蹤 pass@1、pass@4、延遲及每個解決任務的成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •評估涵蓋 904 次 DeepSWE rollout。
- •GPT-5.6 Sol 的 pass@1 比 GLM-5.3 高 3.7 個百分點。
- •GLM-5.3 在 pass@4 勝出,成本約低一半。
- •GLM 優先的級聯策略達到 85.9% 的結果。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •GLM-5.3 採用與 GLM-5.2 相同的 743B 混合專家(MoE)架構,效能提升完全歸功於大規模環境後訓練(Environment-scale post-training)。
- •該模型在 CyberGym 漏洞發現基準測試中表現卓越,其漏洞利用能力較前代版本提升超過兩倍。
- •GLM-5.3 強制啟用推理模式,並提供 low、high 與 max 三種努力程度(effort levels)供用戶選擇,無法關閉推理功能。
- •模型支援 100 萬 token 的上下文視窗,並具備高達 128K token 的最大輸出長度。
- •由於其在網路安全領域的強大能力,Z.ai 在發布前曾因進行額外的安全性審查而推遲了開源權重(open-weights)的釋出。
📊 競品分析▸ Show
| 特性/模型 | GLM-5.3 | GPT-5.6 Sol | Kimi K3 |
|---|---|---|---|
| 架構 | 743B MoE | 未公開 | 未公開 |
| 成本效益 | 高(約 GPT-5.6 一半) | 低 | 中 |
| 推理模式 | 強制啟用(三級) | 支援 | 支援 |
| 上下文視窗 | 1M tokens | 未公開 | 未公開 |
🛠️ 技術深入
- 基礎架構:基於 743B 參數的混合專家(MoE)模型。
- 推理機制:強制性推理架構,不支援關閉推理功能,透過調整 effort level(low/high/max)來控制運算資源。
- 效能優化:透過環境規模的後訓練(Environment-scale post-training)提升編碼與網路安全任務表現。
- 處理能力:支援 1M token 輸入上下文,最大輸出長度為 128K tokens。
🔮 前景展望AI analysis grounded in cited sources
級聯策略將成為企業級 AI 代理開發的標準配置。
GLM-5.3 在 DeepSWE 測試中證明了透過成本優化模型進行路由能有效平衡效能與預算,將推動更多開發者採用混合模型架構。
網路安全基準測試將成為評估大型語言模型能力的核心指標。
GLM-5.3 在 CyberGym 的突破性表現顯示,模型在漏洞發現與利用上的能力已成為衡量頂尖模型的重要維度。
⏳ 時間線
2026-08
Z.ai 正式發布 GLM-5.3,並在 DeepSWE 路由測試中展現成本優勢。
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。
