🤖Reddit r/MachineLearning•較早收集於 23h
層複製登頂開放 LLM 排行榜
#model-hacking#layer-duplication#open-weightsopen-llm-leaderboardqwen2-72bopen-llm-leaderboardqwen3.5
💡簡單層技巧以 2x4090 登榜—複製改進您的開放 LLM(22字)
⚡ 30-Second TL;DR
有什麼變化
精準複製 Qwen2-72B 中間 7 層,提升所有基準
為什麼重要
證明小運算即可打造排行榜頂尖開放模型,民主化 SOTA 改進。暗示 LLM 有可複製保存的離散功能電路。
下一步行動
使用部落格程式碼,在 Qwen2-72B 複製 7 層測試開放 LLM 排行榜。
誰應關注:Researchers & Academics
關鍵要點
- •精準複製 Qwen2-72B 中間 7 層,提升所有基準
- •僅 ~7 層電路區塊有效;單層或過多失效
- •於 2x RTX 4090 打造;2026 年頂尖模型仍其後代
- •即將推出:Qwen3.5 27B/35A3B 的 RYS 版本於雙 GH200
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
📊 競品分析▸ Show
| 模型 | MMLU | BBH | MMLU-Pro | MultiPL-E |
|---|---|---|---|---|
| Qwen2.5-72B | 86.1 | 86.3 | 58.1 | 60.5 |
| Llama-3-70B | 79.5 | 81.0 | 52.8 | 46.3 |
| Mixtral-8x22B | 77.8 | 78.9 | 51.6 | 46.7 |
| Llama-3-405B | 85.2 | 85.9 | 61.6 | - |
🔮 前景展望AI analysis grounded in cited sources
層複製技術將成為開放 LLM 優化標準
該方法僅用 2x 4090 GPU 即登頂排行榜,且前四模型皆其後代,顯示高效性易於複製推廣。[原文]
Qwen3.5 RYS 版本將主導高階硬體基準
Qwen3.5 27B/35A3B RYS 版將於雙 GH200 推出,結合層複製預期進一步提升效能。[原文]
⏳ 時間線
2024-06
Qwen2 系列發布,包括 Qwen2-72B 奠基模型
2025-09
Qwen2.5 系列推出,72B 版基準大幅提升
2026-02
Qwen3.5 Plus 發布,Wolfram 基準達 99.1%
2026-03
層複製 Qwen2-72B 登頂開放 LLM 排行榜
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- qwenlm.github.io — Qwen2.5 LLM
- artificialanalysis.ai — Providers
- llm-stats.com — Qwen2 72b Instruct vs Qwen3.5 4b
- llm-stats.com — Qwen 2.5 72b Instruct vs Qwen2 72b Instruct
- macstories.net — Notes on Early Mac Studio AI Benchmarks with Qwen3 235b A22b and Qwen2 5 Vl 72b
- llm-stats.com — Qwen2 72b Instruct
- pricepertoken.com — Benchmark
- crazyrouter.com — LLM Benchmarks Complete Guide 2026
- wolfram.com — LLM Benchmarking Project
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。