🦙Reddit r/LocalLLaMA•最新收集於 90m
QwenMix-3.7 合併 Qwen 3.8 與 3.6

💡草根實驗測試 Qwen3.8 與 3.6 能否合併成一個可用模型。
⚡ 30-Second TL;DR
有什麼變化
結合 Qwen3.8-27B 與 Qwen3.6-27B 檢查點
為什麼重要
這為探索模型合併與檢查點相容性的實作者提供了低成本實驗素材。不過,由於缺乏系統性基準測試,目前不應將其視為可用於生產環境的 Qwen 變體。
下一步行動
在考慮本地部署前,先對 QwenMix-3.7 執行困惑度、指令遵循與生成品質基準測試。
誰應關注:Researchers & Academics
關鍵要點
- •結合 Qwen3.8-27B 與 Qwen3.6-27B 檢查點
- •使用 Qwen3.8-27B-UD-Q6_K_XL.gguf 建立
- •目前只完成冒煙測試,模型品質尚未獲得驗證
- •合併腳本與相關方法已提供於模型儲存庫中
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 22 個來源。
🔑 增強重點摘要
- •Qwen 3.8-27B 是一個原生的多模態密集模型,內建圖像和影片理解能力,而非後續附加的功能,使其在處理STEM圖表、密集文件和長達數小時的影片方面表現出色。
- •Qwen 3.6-27B 引入了「思維保留」(Thinking Preservation)機制,能夠在多輪對話中保留鏈式思考的推理上下文,從而簡化迭代開發並減少開銷。
- •Qwen 3.6-27B 和 Qwen 3.8-27B 都採用了混合注意力架構,結合了門控DeltaNet(線性注意力)和門控注意力(二次注意力)層,以實現高效的長上下文處理。
- •Qwen 3.8-27B 提供了靈活的「推理努力」(reasoning_effort)控制功能,允許用戶調整推理深度(如xhigh、medium、low),以平衡準確性和速度,並控制成本。
- •模型合併技術,如簡單線性合併、層級平滑合併和帶評估的貪婪合併,已被證明能夠有效結合不同領域專家模型的優勢,甚至在某些情況下超越單獨微調的模型,尤其是在較大規模的模型上。
📊 競品分析▸ Show
| 特性/模型 | Qwen 3.6-27B | Qwen 3.8-27B | Llama 3.1 8B | Mistral 7B v0.3 | Gemma 2 9B |
|---|---|---|---|---|---|
| 開發者 | 阿里巴巴雲 | 阿里巴巴雲 | Meta AI | Mistral AI | |
| 模型類型 | 密集型 | 密集型,原生多模態 | 密集型 | 密集型 | 密集型 |
| 參數數量 | 27B | 27B | 8B | 7B | 9B |
| 許可證 | Apache 2.0 | Apache 2.0 | 開源 | 開源 | 開源 |
| 原生上下文窗口 | 256K tokens (可擴展至1M) | 262K tokens (可擴展至1M) | - | - | - |
| SWE-bench Verified | 77.2% | 聲稱超越Opus 4.6 | - | - | - |
| 本地運行VRAM需求 (Q4) | 約16.8 GB (Q4_K_M) | 約16-17 GB (Unsloth Dynamic GGUFs) | - | - | - |
| 主要優勢 | 代理編碼能力強,高效能,適合消費級硬體 | 原生多模態(圖像/影片),靈活推理控制,聲稱超越競爭對手 | MT-Bench表現優異,生態系統廣泛,通用推理強 | 速度敏感型代理應用,函數調用 | 在特定工作負載下表現合理 |
| 其他備註 | 引入「思維保留」機制 | 支援FP8和NVFP4量化 | - | - | - |
🛠️ 技術深入
- GGUF格式:GGUF(GPT-Generated Unified Format)是一種二進制文件格式,專為高效儲存和部署大型語言模型(LLM)而設計,尤其適用於消費級硬體。它將模型參數、元數據、分詞器數據和量化信息整合到一個可移植的文件中,取代了舊的GGML格式。GGUF支援記憶體映射、模型微調和儲存提示模板,顯著提高了模型加載和保存的速度,對於即時應用至關重要。
- Qwen 3.6-27B 架構:這是一個270億參數的密集型模型,意味著每個token都會激活所有參數。它包含64層,隱藏維度為5120。其混合注意力佈局由16個重複塊組成,每個塊包含三個門控DeltaNet子層(線性注意力)和一個門控注意力子層(二次注意力)。原生上下文窗口為256,000個token,可透過YaRN擴展至1,010,000個token。模型還支援多token預測(MTP)以加速生成。
- Qwen 3.8-27B 架構:基於Qwen 3.5的架構基礎,擁有270億參數,64層,隱藏維度為5120。它採用混合線性與全注意力堆疊的混合注意力佈局。該模型原生支援文本、圖像和影片等多模態輸入。與Qwen 3.6類似,它也支援多token預測(MTP),並經過多步驟訓練以實現推測性解碼。此外,它支援FP8和NVFP4量化,以優化性能和記憶體使用。
- 模型合併技術:研究探索了多種合併LLM的方法,包括簡單線性合併(對模型權重進行加權平均)、層級平滑合併(使用Sigmoid曲線在層間插值權重,早期層偏向通用知識,深層偏向領域特定知識)以及帶評估的貪婪合併(根據在小型評估集上的表現,從不同專家模型中選擇層)。這些技術旨在將不同領域專家模型的優勢結合到單一模型中。
🔮 前景展望AI analysis grounded in cited sources
社區驅動的模型合併將加速利基AI應用的發展。
QwenMix-3.7的實驗性合併表明,社群能夠利用現有基礎模型創建針對特定需求優化的新模型,無需從頭開始訓練,這將促進更多專業化AI解決方案的出現。
Qwen系列模型將持續推動本地AI推理的效能與可及性。
Qwen 3.6-27B和Qwen 3.8-27B在保持高效能的同時,能運行於消費級硬體上,並支援GGUF等高效格式,降低了本地部署的門檻,使更多用戶和開發者能夠利用先進的LLM。
多模態與長上下文處理能力將成為主流開源LLM的標準配置。
Qwen 3.6和3.8原生支援多模態輸入和百萬級token上下文窗口,顯示這些功能對於滿足複雜的代理任務和實際應用至關重要,預計將成為未來開源模型的基本要求。
⏳ 時間線
2023-04
阿里巴巴正式推出通義千問(Qwen)模型。
2025-01
Qwen2.5-VL、Qwen2.5-Omni-7B等模型發布,擴展多模態能力。
2026-04-22
Qwen 3.6-27B 開源權重發布,為密集型模型,在代理編碼方面表現出色。
2026-05
Qwen3.7 Max 和 Plus 專有模型發布。
2026-08-03
Qwen3.8-Max 雲端版本發布,採用MoE架構,支援百萬級token上下文。
2026-08-14
Qwen3.8-27B 開源權重發布,為原生多模態密集型模型。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
