🦙Reddit r/LocalLLaMA•較早收集於 2h
Qwen3.5-9B 接近贏得艱難數學遊戲

#reasoning-benchmark#small-llms#math-gameqwen3.5-9bqwen3.5-9bcogito-v1gpt-oss
💡9B Qwen3.5-9B 幾乎贏得更大模型失敗的推理遊戲(20字)
⚡ 30-Second TL;DR
有什麼變化
遊戲規則:10次猜測,高/低 + 正確位數字反饋
為什麼重要
展示 9B 緊湊模型強大雙重推理,適合 16GB VRAM 使用者。本地小型 LLM 在複雜邏輯任務的潛力。
下一步行動
將 Qwen3.5-9B 量化為 q4_k_m,並在提供的數學猜謎提示上基準測試。
誰應關注:Researchers & Academics
關鍵要點
- •遊戲規則:10次猜測,高/低 + 正確位數字反饋
- •Qwen3.5-9B q4_k_m 第10輪僅差1位(322785 vs 322755)
- •超越更大模型如 Cogito v1 14B 和 gpt-oss 20B
- •提示引導前期二元搜尋、後期熵,並追蹤邊界
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •Qwen3.5-9B 採用 Gated DeltaNet 混合注意力機制,支持 262K 至 1M 上下文長度,並具備恆定記憶體使用。[1]
- •該模型在視覺任務上大幅超越 GPT-5-Nano,包括 MMMU-Pro (70.1 vs 57.2)、MathVision (78.9 vs 62.2) 及 OmniDocBench (87.7 vs 55.9)。[1]
- •Qwen3.5-9B 的優異表現歸功於 Scaled Reinforcement Learning (RL) 訓練方法,提升了其基準測試成績。[4]
- •模型預設啟用思考模式,類似思維鏈推理,並在 GPU 上載入需約 44GB VRAM。[3]
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02-24
Qwen3.5 系列初始發佈
2026-03-02
Qwen3.5-9B 等小型模型上架 Hugging Face 及 ModelScope
2026-03-02
Alibaba 正式發布 Qwen 3.5 Small 模型家族(0.8B 至 9B)
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
