🦙Reddit r/LocalLLaMA•較早收集於 7h
Qwen3.5-35B-A3B 逼近 Claude Opus 在 SWE-bench 難題

#moe-model#agent-verificationqwen3.5-35b-a3bqwen3.5-35b-a3bswe-benchclaude-opusvllm
💡3B MoE 達 SWE-bench Hard 38%,簡單驗證技巧勝基準(24字元)
⚡ 30-Second TL;DR
有什麼變化
SWE-bench Hard(45 任務)37.8%,驗證後編輯 vs 基準 22.2%
為什麼重要
證明高效驗證可將小型 MoE 模型提升至頂級編碼代理表現。為開發者帶來具成本效益的自託管 SWE 代理。
下一步行動
在 vLLM 代理迴圈中實作 verify-on-edit 以測試 SWE-bench。
誰應關注:Researchers & Academics
關鍵要點
- •SWE-bench Hard(45 任務)37.8%,驗證後編輯 vs 基準 22.2%
- •全 500 任務 SWE-bench 67%,匹敵大型系統
- •簡單提示:每 file_edit 後以 python/bash 測試變更
- •MCTS/樹搜尋表現不如基準;無需複雜設定
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
📊 競品分析▸ Show
| 模型 | 創建者 | 上下文窗口 | 輸入成本(每百萬令牌) | 輸出成本(每百萬令牌) | SWE-bench Hard 性能 |
|---|---|---|---|---|---|
| Qwen3.5 35B A3B (推理) | Qwen | 262k 令牌 | $0.25 | $0.80 | 37.8% |
| Claude Opus 4.6 (自適應推理) | Anthropic | 200k 令牌 | $15.00 | $75.00 | 40% |
| Claude Opus 4.5 (推理) | Anthropic | 200k 令牌 | $15.00 | $75.00 | 未公開 |
| Qwen3 VL 30B A3B (思考) | Qwen | 131.1k 令牌 | $0.16 | $0.80 | 未公開 |
🛠️ 技術深入
• 模型架構:Qwen3.5-35B-A3B 採用混合專家 (MoE) 設計,僅 3B 活躍參數,相比密集模型實現更高的推理效率[1][2] • 上下文窗口:262k 令牌(約 393 頁 A4 紙,12pt Arial 字體),超過 Claude Opus 4.6 的 200k 令牌[1][2] • 推理策略:編輯後驗證方法使用簡單的 Python/Bash 測試,避免複雜的蒙特卡洛樹搜尋 (MCTS),從 22.2% 基準提升至 37.8%[1][2] • 輸出速度:搜尋結果未提供 Qwen3.5-35B-A3B 的具體令牌/秒數據,但 Qwen 系列模型通常在速度與成本間實現平衡[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2024-03
Claude 3 Opus 發佈,成為專有模型基準[3]
2025-10
Qwen3 VL 30B A3B Thinking 版本發佈[3]
2025-12
Qwen3.5-35B-A3B 模型發佈,採用 MoE 架構[1][2]
2026-02
Qwen3.5-35B-A3B 在 SWE-bench Hard 達成 37.8% 性能,驗證編輯後測試策略[1][2]
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。