🦙較早收集於 2h

本地 LLM 推理進展 13 個月

本地 LLM 推理進展 13 個月
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-inference#quantization#hardware-efficiency#model-progressqwen-3.5-35b-a3bdeepseek-r1qwen3-27bqwen3.5-35b-a3bkimi-2.5

💡本地推理:$600 PC 執行 Qwen3.5-35B 達 20 tps – 巨大進展!(22字)

⚡ 30-Second TL;DR

有什麼變化

$6000 DeepSeek R1 Q8 5 tps 對比 $600 PC Qwen3-27B Q4 同速

為什麼重要

展現平價本地 AI 爆發成長,讓從業者以預算硬體獲高速推理。

下一步行動

將 Qwen3.5-35B-A3B 量化至 Q4,在 $600 小型 PC 基準 17-20 tps。

誰應關注:Developers & AI Engineers

關鍵要點

  • $6000 DeepSeek R1 Q8 5 tps 對比 $600 PC Qwen3-27B Q4 同速
  • Qwen3.5-35B-A3B Q4/Q5 在小型 PC 達 17-20 tps
  • 強調小型模型品質與本地硬體快速進步
  • 預測明年 4B 模型超越 Kimi 2.5

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Qwen3-235B-A22B 在 ArenaHard 基準得分 95.6,超越 DeepSeek-R1,並僅次於 Gemini 2.5 Pro。[1]
  • Qwen3-4B 模型在 ArenaHard 達 76.6 分,在 AIME’24 達 73.8 分,優於許多更大規模的早期模型如 Gemma-27B-IT。[1]
  • Qwen3-30B-A3B 僅使用 3B 活躍參數,即在編碼與數學任務中匹敵或超越 GPT-4 Omni 等輕量模型,並展現高效基準表現。[2]
📊 競品分析▸ Show
模型關鍵基準表現架構特點許可
Qwen3-235B-A22BArenaHard: 95.6, AIME’24: 85.7 [1]MoE, 235B 總參數 (22B 活躍) [1][5]未指定
DeepSeek R1MATH-500: 97.3%, Codeforces: 96.3%, MMLU: 90.8% [3]推理優先, 671B 參數 [4]MIT 許可, 完全開源商業使用 [7]
QwQ-32BArenaHard: 91.0, 匹敵 DeepSeek R1 多項基準 [1][4]32B 參數 [4]未指定

🛠️ 技術深入

  • Qwen3 系列包含 8 個模型變體:6 個密集模型與 2 個混合專家 (MoE) 模型,參數規模從 6B 到 235B (30B/3B 活躍, 235B/22B 活躍)。[5]
  • Qwen3 MoE 架構優勢:總參數 235B 但活躍參數僅約 10%,推理成本與密集模型相當,知識容量提升 3 倍以上。[7]
  • DeepSeek R1 創新包括推理優先架構,將思考鏈作為輸出、自驗證邏輯一致性及逐步除錯,每步驟可檢查修正。[7]
  • Qwen3 訓練使用比 Qwen 2.5 多兩倍資料集,涵蓋網路與 PDF 文件,提升思考模式下回應準確性。[5]

🔮 前景展望AI analysis grounded in cited sources

2027 年 4B 模型將在多項基準超越 Kimi 2.5
基於 Qwen3-4B 已優於更大早期模型之趨勢,結合小型模型品質與硬體進步,預測小型模型效能持續躍升。
MoE 模型將主導本地推理,因活躍參數少而高效
Qwen3 MoE 如 235B/22B 活躍僅 10%,推理成本低且知識容量高,適合小型 PC 部署。

時間線

2025-05
DeepSeek R1 發布,引領開源推理模型革命
2025-11
Qwen3 系列推出,包含多規模 MoE 模型挑戰 DeepSeek R1
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。