🦙較早收集於 52m

Qwen3.5 小型模型少樣本基準驚人

Qwen3.5 小型模型少樣本基準驚人
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#few-shot#benchmarks#small-modelsqwen-3.5-smallqwen3.5lm-studio

💡少樣本傷 Qwen3.5 0.8B 程式表現;4B 閃耀—明智選擇 (26字元)

⚡ 30-Second TL;DR

有什麼變化

0.8B 程式碼修復零樣本 67% 加 1 例降 33%

為什麼重要

揭示微型模型程式碼任務少樣本陷阱,引導高效部署尺寸選擇。

下一步行動

在加例前以 Qwen3.5 0.8B 基準你的任務 0/1/2 樣本。

誰應關注:Researchers & Academics

關鍵要點

  • 0.8B 程式碼修復零樣本 67% 加 1 例降 33%
  • 分類:0.8B 8 樣本達 100%;大模型零樣本完美
  • 4B 程式碼/分類/摘要全穩定;速度最佳點
  • 9B 摘要低因思考偽影
  • LM Studio TF-IDF 例選測試

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen3.5 中型模型系列於 2026 年 2 月 24 日發布,包含 27B、35B-A3B、122B-A10B 等密集和稀疏混合專家模型,均採用 262,144 token 上下文窗口[1][4]
  • Qwen3.5-35B-A3B 僅激活 3B 參數(總計 35B)卻超越前代 Qwen3-235B-A22B(激活 22B 參數),證明架構改進和數據質量優於單純參數規模擴展[1][4]
  • Qwen3.5 系列採用原生多模態架構,整合文本、視覺、UI 互動和結構化內容的聯合訓練,支持視覺問答、文檔理解和像素級接地[2][5]
  • 所有四個中型模型均以 Apache 2.0 開源發布於 Hugging Face、ModelScope、Ollama 和 GitHub,無門控、無使用限制、無許可協商[4]
  • Qwen3.5-27B 密集模型在 SWE-bench Verified 上達到 72.4 分,與 GPT-5 mini 相當,為完全開源權重的 27B 模型中的顯著成果[4]
📊 競品分析▸ Show
模型總參數激活參數上下文窗口主要優勢
Qwen3.5-35B-A3B35B3B262K推理成本最低,激活率 8.6%,超越 Qwen3-235B
Qwen3.5-122B-A10B122B10B262K基準測試領先,MMMU-Pro 76.9,MMLU-Pro 86.7
Qwen3.5-27B27B27B262K密集模型,SWE-bench 72.4,與 GPT-5 mini 相當
Kimi K2.51T32B未指定參數規模大,但激活參數多於 Qwen3.5
GLM-5744B40B未指定參數規模大,激活參數多於 Qwen3.5
DeepSeek V3.2671B37B未指定參數規模大,激活參數多於 Qwen3.5

🛠️ 技術深入

混合專家架構:Qwen3.5-35B-A3B 採用 256 個路由專家,每個 token 通過 8 個路由專家加 1 個共享專家,實現高度專業化的稀疏激活[1]上下文窗口:所有中型模型支持 262,144 token 上下文長度,Qwen3.5-Plus 擴展至 100 萬 token[1][2]多模態融合:原生整合文本、視覺、UI 截圖和結構化內容的聯合訓練,支持視覺問答、文檔理解、圖表/表格解釋和像素級接地[2][5]推理性能:Qwen3.5-397B-A17B 相比 Qwen3-Max 在 256k token 長上下文任務上解碼速度快 19 倍,標準工作流快 8.6 倍[2]量化部署:全模型(FP16/BF16)需約 800GB VRAM;4 位量化需約 220GB 統一記憶體,可在 Mac Studio/Pro M-series Ultra(256GB RAM)或多 GPU 配置上運行[2]線性注意力機制:Qwen3.5 系列採用混合架構,整合線性注意力機制和門控三角網絡[5][6]專家配置:Qwen3.5-397B-A17B 包含 256 個專家,每個 token 激活 17B 參數[3]

🔮 前景展望AI analysis grounded in cited sources

稀疏混合專家架構將成為大型模型的主流部署方式
Qwen3.5-35B-A3B 以 3B 激活參數超越 22B 激活參數的前代模型,證明 MoE 架構在成本效益上的優勢將推動業界採用稀疏激活設計。
開源多模態模型將加速企業級 AI 應用的本地部署
Qwen3.5 系列以 Apache 2.0 開源發布且無使用限制,結合 4 位量化可在消費級硬體上運行,將降低企業採用先進 AI 的成本門檻。
小型密集模型(27B)將與大型稀疏模型形成差異化競爭格局
Qwen3.5-27B 在編碼任務上與 GPT-5 mini 相當,表明密集模型在特定任務上的效率優勢將與稀疏模型並存,而非被完全取代。

時間線

2025-12
Qwen3 系列發布,包含 235B-A22B 推理模型和 VL 視覺語言模型
2026-02-24
Qwen3.5 中型模型系列正式發布,包含 27B、35B-A3B、122B-A10B 四個模型
2026-03
Qwen3.5 模型在 Azure AI Foundry、NVIDIA GPU 加速端點和 Alibaba ModelStudio 上線部署
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。