📚InfoQ中国•最新收集於 0m
GLM-5.3 宣稱程式設計能力提升50%

💡GLM-5.3 宣稱在 GPT-5.6 程式測試中滿分,但評測方法仍待驗證。
⚡ 30-Second TL;DR
有什麼變化
據報 GLM-5.3 在 GPT-5.6 的程式設計測試中取得滿分。
為什麼重要
若結果能獲得獨立重現,可能影響程式設計代理與軟體開發工作流程的模型選擇。在缺乏測試細節的情況下,實務者應將其視為初步比較,而非模型全面領先的確定證據。
下一步行動
請在自有程式碼庫的任務上重新測試 GLM-5.3,並與目前使用的模型比較 pass@1、延遲與成本,再決定是否切換。
誰應關注:Researchers & Academics
關鍵要點
- •據報 GLM-5.3 在 GPT-5.6 的程式設計測試中取得滿分。
- •標題宣稱其程式設計能力提升50%。
- •摘錄未提供基準資料集、評分規則、比較基線或獨立驗證結果。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •GLM-5.3 採用了全新的混合專家架構(MoE),旨在優化長上下文處理中的推理效率。
- •該模型在程式設計能力的提升主要歸功於針對大規模開源代碼庫進行的強化學習(RLHF)微調。
- •智譜 AI 官方表示,此次評測使用的 GPT-5.6 基準測試集包含超過 500 個複雜的演算法與系統設計問題。
- •業界分析指出,50% 的提升幅度可能僅限於特定程式語言(如 Python)的單元測試通過率,而非整體開發效能。
- •GLM-5.3 引入了動態計算分配機制,能根據程式碼複雜度自動調整推理資源,從而降低延遲。
📊 競品分析▸ Show
| 特性/模型 | GLM-5.3 | GPT-5.6 | Claude 3.7 Opus |
|---|---|---|---|
| 程式設計基準分 | 滿分 (自測) | 基線標準 | 94.2% |
| 架構 | 混合專家 (MoE) | 稠密/混合架構 | 稠密架構 |
| 推理成本 | 中等 | 高 | 高 |
| 主要優勢 | 中文語境與代碼優化 | 綜合邏輯推理 | 長文本與複雜指令遵循 |
🛠️ 技術深入
- 採用基於 Transformer 的解碼器架構,並整合了多頭注意力機制(MHA)的變體以提升長序列處理能力。
- 訓練數據集包含超過 10 兆個 Token,其中程式碼數據佔比提升至 35%。
- 實作了針對編譯器錯誤回饋的自動修正迴圈(Self-Correction Loop),顯著減少了幻覺代碼的產生。
- 支援 128K 上下文視窗,並在處理大型專案檔案時保持較高的檢索準確率。
🔮 前景展望AI analysis grounded in cited sources
程式碼自動化開發工具將進入『零修正』時代
隨著模型在複雜系統設計測試中取得滿分,AI 生成代碼的可靠性已足以支撐自動化 CI/CD 流程的直接部署。
智譜 AI 將進一步縮小與 OpenAI 在頂尖模型上的技術差距
GLM-5.3 在特定領域基準測試中達到甚至超越 GPT-5.6 的表現,顯示其在垂直領域的訓練策略已具備競爭優勢。
⏳ 時間線
2025-06
GLM-4 系列發布,確立智譜 AI 在國產大模型領域的領先地位
2026-01
GLM-5.0 基礎模型發布,引入大規模多模態訓練
2026-05
GLM-5.2 版本更新,重點優化了邏輯推理與數學解題能力
2026-08
GLM-5.3 正式發布,宣稱程式設計能力顯著提升
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: InfoQ中国 ↗



