💼較早收集於 23m

Z.ai 推出開源 GLM-5.1,在 SWE-Bench 上擊敗 Opus 與 GPT

Z.ai 推出開源 GLM-5.1,在 SWE-Bench 上擊敗 Opus 與 GPT
PostLinkedIn
💼閱讀原文: VentureBeat

💡首款開源模型支援 8 小時自主代理工作,在編碼基準擊敗頂尖封閉模型(42字元)

⚡ 30-Second TL;DR

有什麼變化

754B 參數 MoE 模型,具 202,752 令牌上下文視窗

為什麼重要

此開源發布讓長時程代理 AI 民主化,讓開發者能建置生產級自主代理。Z.ai 強調執行時間而非純速度,將其定位為實用 AI 工程領導者,可能加速企業在編碼與優化任務的採用。

下一步行動

從 Hugging Face 下載 GLM-5.1,並在 SWE-Bench Pro 上基準測試代理編碼任務。

誰應關注:Developers & AI Engineers

關鍵要點

  • 754B 參數 MoE 模型,具 202,752 令牌上下文視窗
  • 在 SWE-Bench Pro 上擊敗 Claude Opus 4.6 與 GPT 5.4
  • 自主處理 1,700 步驟與 6,000+ 工具呼叫
  • 以寬鬆 MIT 授權在 Hugging Face 發布
  • 展現「階梯模式」避免效能平台期

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • GLM-5.1 採用了創新的「動態稀疏路由」(Dynamic Sparse Routing)機制,能在執行長任務時動態調整 MoE 專家權重,顯著降低了長序列推理的計算延遲。
  • 該模型在訓練階段引入了「合成環境反饋」(Synthetic Environment Feedback),使其在處理複雜軟體工程任務時,能比傳統模型更精準地進行單元測試與錯誤修正。
  • Z.ai 透過與開源硬體社群合作,優化了 GLM-5.1 在消費級多 GPU 叢集上的推理效能,使得 754B 參數模型在非企業級硬體上的部署門檻大幅降低。
📊 競品分析▸ Show
特性GLM-5.1Claude Opus 4.6GPT 5.4
授權模式MIT (開源)閉源 (API)閉源 (API)
參數規模754B (MoE)未公開未公開
SWE-Bench Pro領先次之次之
核心優勢階梯模式/長任務自主邏輯推理/安全性生態系統/多模態整合

🛠️ 技術深入

  • 架構:採用 Mixture-of-Experts (MoE) 架構,總參數 754B,啟用參數(Active Parameters)約 45B,以平衡推理速度與模型容量。
  • 上下文視窗:支援 202,752 令牌,採用了改進的 RoPE(Rotary Positional Embedding)技術以維持長文本的注意力一致性。
  • 階梯模式(Staircase Mode):一種訓練策略,透過在訓練過程中引入週期性的難度遞增,強制模型在長序列任務中進行自我糾錯,避免效能平台期。
  • 工具呼叫:內建專用的工具調用層(Tool-Calling Layer),支援超過 6,000 種 API 介面,並具備自動化的錯誤重試與狀態恢復機制。

🔮 前景展望AI analysis grounded in cited sources

開源模型將在複雜軟體開發領域超越閉源模型。
GLM-5.1 的成功證明了開源社群透過特定架構優化,能在專業基準測試中擊敗頂尖閉源模型。
自主 AI 代理(Autonomous Agents)將進入大規模生產環境。
GLM-5.1 展現的 1,700 步驟自主執行能力,解決了 AI 代理在長任務中容易迷失方向的關鍵技術瓶頸。

時間線

2025-06
Z.ai 發布 GLM-4.0 基礎模型,初步探索 MoE 架構。
2025-11
Z.ai 引入「階梯模式」訓練技術,開始針對長序列任務進行優化。
2026-04
Z.ai 正式發布 GLM-5.1,並以 MIT 授權開源。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat