🦙較早收集於 2h

Qwen3.5-9B 接近贏得艱難數學遊戲

Qwen3.5-9B 接近贏得艱難數學遊戲
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#reasoning-benchmark#small-llms#math-gameqwen3.5-9bqwen3.5-9bcogito-v1gpt-oss

💡9B Qwen3.5-9B 幾乎贏得更大模型失敗的推理遊戲(20字)

⚡ 30-Second TL;DR

有什麼變化

遊戲規則:10次猜測,高/低 + 正確位數字反饋

為什麼重要

展示 9B 緊湊模型強大雙重推理,適合 16GB VRAM 使用者。本地小型 LLM 在複雜邏輯任務的潛力。

下一步行動

將 Qwen3.5-9B 量化為 q4_k_m,並在提供的數學猜謎提示上基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • 遊戲規則:10次猜測,高/低 + 正確位數字反饋
  • Qwen3.5-9B q4_k_m 第10輪僅差1位(322785 vs 322755)
  • 超越更大模型如 Cogito v1 14B 和 gpt-oss 20B
  • 提示引導前期二元搜尋、後期熵,並追蹤邊界

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Qwen3.5-9B 採用 Gated DeltaNet 混合注意力機制,支持 262K 至 1M 上下文長度,並具備恆定記憶體使用。[1]
  • 該模型在視覺任務上大幅超越 GPT-5-Nano,包括 MMMU-Pro (70.1 vs 57.2)、MathVision (78.9 vs 62.2) 及 OmniDocBench (87.7 vs 55.9)。[1]
  • Qwen3.5-9B 的優異表現歸功於 Scaled Reinforcement Learning (RL) 訓練方法,提升了其基準測試成績。[4]
  • 模型預設啟用思考模式,類似思維鏈推理,並在 GPU 上載入需約 44GB VRAM。[3]
📊 競品分析▸ Show
模型參數規模關鍵基準架構類型
Qwen3.5-9B9BGPQA Diamond 81.7, MMMU-Pro 70.1Dense, Gated DeltaNet [1][3]
Qwen3-30B30BGPQA Diamond (低 8 分), IFEval (低 3 分)前代 Dense [1]
GPT-5-Nano未明MMMU-Pro 57.2, MathVision 62.2未明 [1]
Qwen3-80B80BGPQA Diamond (略低), 多任務競爭前代 Dense [3]

🛠️ 技術深入

  • 參數規模:9B 密集模型,使用 Gated DeltaNet 混合注意力,支持 262K 至 1M 上下文長度,具恆定記憶體效率。[1]
  • 隱藏維度:4096,前饋網路中間維度:12,888,提升模型容量。[3]
  • 預設思考模式:自動進行推理類似思維鏈,支援多模態(文字、影像、視訊)。[3]
  • 推理需求:全載入 GPU 需約 44GB VRAM,可透過縮減上下文降低。[3]
  • 訓練強化:採用 Scaled Reinforcement Learning (RL),優化基準表現。[4]

🔮 前景展望AI analysis grounded in cited sources

小型模型將主導邊緣設備部署
Qwen3.5-9B 以 9B 參數超越 30B 及 80B 模型,證明高效架構適用於低資源環境。[1]
視覺語言任務競爭力提升
在 MMMU-Pro 及 MathVision 等視覺基準上雙位數領先 GPT-5-Nano,推動多模態應用普及。[1]
開源小型模型基準新標準
發佈於 Hugging Face 後迅速獲 625 星,加速社區採用及衍生開發。[5]

時間線

2026-02-24
Qwen3.5 系列初始發佈
2026-03-02
Qwen3.5-9B 等小型模型上架 Hugging Face 及 ModelScope
2026-03-02
Alibaba 正式發布 Qwen 3.5 Small 模型家族(0.8B 至 9B)
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。