🤖較早收集於 23h

層複製登頂開放 LLM 排行榜

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#model-hacking#layer-duplication#open-weightsopen-llm-leaderboardqwen2-72bopen-llm-leaderboardqwen3.5

💡簡單層技巧以 2x4090 登榜—複製改進您的開放 LLM(22字)

⚡ 30-Second TL;DR

有什麼變化

精準複製 Qwen2-72B 中間 7 層,提升所有基準

為什麼重要

證明小運算即可打造排行榜頂尖開放模型,民主化 SOTA 改進。暗示 LLM 有可複製保存的離散功能電路。

下一步行動

使用部落格程式碼,在 Qwen2-72B 複製 7 層測試開放 LLM 排行榜。

誰應關注:Researchers & Academics

關鍵要點

  • 精準複製 Qwen2-72B 中間 7 層,提升所有基準
  • 僅 ~7 層電路區塊有效;單層或過多失效
  • 於 2x RTX 4090 打造;2026 年頂尖模型仍其後代
  • 即將推出:Qwen3.5 27B/35A3B 的 RYS 版本於雙 GH200

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Qwen2.5-72B 在 MMLU 基準從 Qwen2-72B 的 84.2 提升至 86.1,並在 BBH 達 86.3,超越 Llama-3-70B 等競爭對手。[1]
  • Qwen2.5-72B 在多語言任務如 MultiPL-E 達 60.5、多理解任務達 89.6,顯著優於 Llama-3-70B 和 Mixtral-8x22B。[1]
  • Qwen3.5 系列已推出,包括 Qwen3-235B-A22B MoE 模型(235B 參數,22B 激活),在 Mac Studio 上 GGUF 達 16 tok/s,MLX 達 24 tok/s。[5]
📊 競品分析▸ Show
模型MMLUBBHMMLU-ProMultiPL-E
Qwen2.5-72B86.186.358.160.5
Llama-3-70B79.581.052.846.3
Mixtral-8x22B77.878.951.646.7
Llama-3-405B85.285.961.6-

🔮 前景展望AI analysis grounded in cited sources

層複製技術將成為開放 LLM 優化標準
該方法僅用 2x 4090 GPU 即登頂排行榜,且前四模型皆其後代,顯示高效性易於複製推廣。[原文]
Qwen3.5 RYS 版本將主導高階硬體基準
Qwen3.5 27B/35A3B RYS 版將於雙 GH200 推出,結合層複製預期進一步提升效能。[原文]

時間線

2024-06
Qwen2 系列發布,包括 Qwen2-72B 奠基模型
2025-09
Qwen2.5 系列推出,72B 版基準大幅提升
2026-02
Qwen3.5 Plus 發布,Wolfram 基準達 99.1%
2026-03
層複製 Qwen2-72B 登頂開放 LLM 排行榜
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。