🦙較早收集於 50m

Qwen 3.5-35B-A3B 在開發任務超越更大模型

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#local-llm#dev-toolsqwen-3.5-35b-a3bqwenqwen-3.5-35b-a3bunsloth

💡35B 模型勝 120B 真實開發任務—體積 1/3,本地推論遊戲規則改變者(34字元)

⚡ 30-Second TL;DR

有什麼變化

取代 GPT-OSS-120B 為日常主力

為什麼重要

強調小型模型在開發工作流程的效率優勢,鼓勵量化採用。可降低生產 AI 代理的硬體需求。

下一步行動

從 Hugging Face 下載 Qwen 3.5-35B-A3B Q4-K-XL,測試開發工作流程。

誰應關注:Developers & AI Engineers

關鍵要點

  • 取代 GPT-OSS-120B 為日常主力
  • 開發任務強項:N8N、系統生成、視覺、程式碼分析
  • 5090/3090 GPU 以 unsloth 量化支援 100k 上下文高效運行
  • 知曉自身限制,利用瀏覽器補缺

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用 MoE 架構,總參數 35B 但僅激活 3B 參數,支援 262K 上下文視窗。[1][2]
  • 在 Artificial Analysis Intelligence Index 得分 37,遠高於同尺寸開源模型中位數 15,並以 168 tokens/秒 輸出速度領先。[1]
  • Alibaba Cloud 定價為輸入每百萬 token 0.25 USD、輸出 2 USD,並提供原生視覺語言能力與混合注意力機制。[2][4][5]
📊 競品分析▸ Show
模型總參數激活參數上下文視窗Intelligence Index輸出速度 (t/s)定價 (輸入/輸出 per 1M USD)
Qwen3.5-35B-A3B35B3B262K371680.25 / 2 [1][2][4]
Qwen3-235B-A22B235B22B未指定低於 35B-A3B未指定未指定 [2]
Qwen3.5-27B (dense)27B27B未指定未指定未指定未指定 [3]
Liquid AI LFM2-24B-A2B24B2.3B未指定未指定未指定未指定 [3]

🛠️ 技術深入

  • MoE (Mixture of Experts) + Hybrid Attention 架構,僅激活 3B 參數處理 token,線性注意力層壓縮 KV-cache 記憶體以支援長上下文。[2]
  • 原生視覺語言模型 (vision-language),支援推理模式顯示逐步思考過程,並整合工具如 web search 與 code interpreter。[1][5]
  • Hugging Face 提供 GGUF 格式 (2-16 bits),Alibaba API 支援 1M token 上下文的 Flash 變體,記憶體需求適合消費級 GPU。[2][3]

🔮 前景展望AI analysis grounded in cited sources

MoE 架構將主導中型模型效率競爭
3B 激活參數超越 22B 前代證明架構優化勝過參數擴張,降低部署成本並提升邊緣推理可行性。[2]
消費者 GPU 將廣泛運行高智能模型
支援 262K 上下文且高效量化允許 5090/3090 GPU 運行,結合低激活參數推動本地 AI 開發普及。[1][2]

時間線

2026-02
Qwen3.5 系列發布,包括 Qwen3.5-35B-A3B、122B-A10B 與 27B 模型
2026-02-24
GitHub 官方發布 Qwen3.5-35B-A3B 模型卡至 Hugging Face 與 ModelScope
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。