🦙Reddit r/LocalLLaMA•較早收集於 75m
Qwen3-8B 微調基準測試稱霸 SLM

#fine-tuning#benchmarks#slmsqwen3-8bqwen3-8blfm2-350mllama-3.2gemma-3
💡Qwen3-8B 微調 SLM 第一名—數據支持選擇省時省力。(28字元)
⚡ 30-Second TL;DR
有什麼變化
Qwen3-8B 微調後所有任務平均排名 2.33 ±0.57
為什麼重要
引導 AI 開發者選擇 Qwen3-8B 獲得可靠微調結果。強調 LFM2 適合邊緣裝置最大化參數增益。驗證小型模型微調後可匹敵巨型模型。
下一步行動
使用 LoRA rank 64 和 lr 5e-5 在你的資料集上微調 Qwen3-8B。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3-8B 微調後所有任務平均排名 2.33 ±0.57
- •LFM2-350M 可調性最佳,平均排名 2.11 ±0.89 增益
- •Qwen3-4B-Instruct-2507 在 8/9 基準測試勝過 120B 教師
- •相同設定:LoRA r=64、4 個 epoch、每任務 10k 合成範例
- •Llama-3.2-3B 適合記憶體受限的穩固替代方案
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Qwen3系列於2025年4月29日發布,包含8種模型規格(從600M到235B參數),採用密集模型和混合專家(MoE)架構,在36兆個跨119種語言的代幣上訓練[4]
- •Qwen3-8B具有雙模式操作能力,可在思考模式(複雜邏輯推理、數學、編碼)和非思考模式(高效對話)之間無縫切換,超越先前QwQ和Qwen2.5指令模型的推理能力[3]
- •Qwen3-4B在編程任務上的表現超越某些早期72B模型,且Qwen3 7B在HumanEval基準測試中獲得76.0的最高分數,超越Llama 3.3的72.6分[4][5]
- •Qwen3 Swallow 32B(日語特化版本)在32B或更少參數的開源LLM中達到最高性能,在日語任務上平均得分0.609,在英語任務上達0.792[2]
- •超小型模型Qwen3.5-0.8B支援262K代幣的原生上下文長度和200+語言,適合邊緣設備部署,但思考模式在小型變體中可能不穩定[6]
📊 競品分析▸ Show
| 特性 | Qwen3-8B | Qwen3-4B | Llama-3.2-3B | Meta-Llama-3.1-8B-Instruct |
|---|---|---|---|---|
| 參數數量 | 8.2B | 4B | 3B | 8B |
| 微調後平均排名 | 2.33 ±0.57 | 最佳整體 | 記憶體受限替代 | 多語言對話基準 |
| 基礎性能排名 | 1.75(最佳) | N/A | N/A | N/A |
| 雙模式操作 | 是 | 否 | 否 | 否 |
| 語言支援 | 100+語言 | 100+語言 | N/A | 多語言 |
| HumanEval得分 | N/A | N/A | N/A | 低於Qwen3 7B(76.0) |
| 主要優勢 | 一致性、速度 | 微調性能 | 可調性 | 多語言對話 |
🛠️ 技術深入
- 訓練資料:36兆個代幣,包含網頁數據、書籍、PDF和合成代碼/數學資料[4]
- 架構變體:密集模型(600M-32B)和MoE模型(235B),MoE模型在任何時間僅激活總參數的一小部分(例如235B模型中的22B)[4]
- 微調配置:LoRA r=64、4個epoch、每任務10k合成範例[1]
- 上下文長度:Qwen3.5-0.8B支援262K代幣原生上下文[6]
- 多模態能力:Qwen3.5-0.8B支援文本、圖像和視頻處理[6]
- 推理能力:Qwen3-8B在數學、代碼生成和常識邏輯推理中超越先前模型,支援工具使用、規劃和代理功能[3][4]
- 語言覆蓋:Qwen3支援119種語言和方言;Qwen3.5支援200+語言和方言[4][6]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-04
Qwen3系列發布,包含8種模型規格(600M-235B參數),在36兆代幣上訓練
2025-04
Qwen3-4B-Instruct-2507版本發布,微調後在8/9基準測試中超越120B教師模型
2026-02
Qwen3 Swallow日語特化版本達到32B或更少參數開源LLM中的最高日語任務性能
2026-03
Distill Labs發布12款小型語言模型的微調基準測試,Qwen3-8B在基礎性能中排名第一
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- distillabs.ai — We Benchmarked 12 Small Language Models Across 8 Tasks to Find the Best Base Model for Fine Tuning
- swallow-llm.github.io — Qwen3 Swallow.en
- siliconflow.com — Fastest Open Source Llms
- dev.to — Qwen 3 Benchmarks Comparisons Model Specifications and More 4hoa
- sitepoint.com — Best Local LLM Models 2026
- bentoml.com — The Best Open Source Small Language Models
- llm-stats.com — Qwen3 Vl 8b Thinking
- till-freitag.com — Open Source LLM Comparison
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
