🦙Reddit r/LocalLLaMA•較早收集於 67m
Unsloth 發布 Cohere 30B A3B 模型 GGUF 版本

💡Cohere 的新款 30B 模型現已透過 Unsloth 提供 GGUF 格式,可進行本地推論。
⚡ 30-Second TL;DR
有什麼變化
發布 Cohere 30B A3B 的 GGUF 格式
為什麼重要
GGUF 格式的可用性讓開發者能在消費級硬體上執行高效能模型,實現大規模 AI 的普及化。
下一步行動
從 Hugging Face 下載 GGUF 檔案,並使用 llama.cpp 進行測試,以評估其在您本地硬體上的效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •發布 Cohere 30B A3B 的 GGUF 格式
- •支援該新款 30B 模型進行本地執行
- •可能與 llama.cpp PR #24260 的架構支援有關
🧠 深度解析
Web-grounded analysis with 23 cited sources.
🔑 增強重點摘要
- •Unsloth 的核心價值在於透過其專有技術,將大型語言模型 (LLM) 的微調速度提升高達 30 倍,並減少 90% 的記憶體使用量,從而降低了高效能 AI 模型訓練的門檻,使其可在消費級硬體上運行。
- •Cohere 30B A3B 模型,又稱 North Mini Code,是一個稀疏混合專家 (MoE) 模型,總參數為 300 億,但僅有 30 億活躍參數,專為程式碼生成和代理任務優化,使其在本地部署時效率更高。
- •Unsloth 採用了其 Dynamic v2.0 量化技術,該技術在 MMLU 基準測試和 KL 散度方面優於傳統的 imatrix 和 QAT 方法,能在大幅縮小模型尺寸的同時,最大程度地保留模型準確性。
- •GGUF 格式已成為本地 LLM 部署的事實標準,它將模型架構、分詞器配置和超參數等所有必要元數據整合到單一檔案中,增強了可擴展性和跨平台兼容性。
- •近期
llama.cppGGUF 解析器中發現的漏洞(例如 2026 年 5 月披露的六個未修補缺陷)強調了從可信來源載入 GGUF 模型的重要性,以避免潛在的遠端程式碼執行 (RCE) 和阻斷服務 (DoS) 攻擊。
📊 競品分析▸ Show
| 特性/平台 | Unsloth | llama.cpp | Ollama | ExLlamaV2 | MLX (Apple) |
|---|---|---|---|---|---|
| 主要功能 | 快速微調與 GGUF 量化 | GGUF 推論引擎 | 本地 LLM 推論與模型庫 | NVIDIA GPU 最快推論 | Apple Silicon 最快推論與微調 |
| 優化重點 | 訓練速度 (30x)、記憶體 (90% 少)、Dynamic v2.0 量化 | 消費級硬體上的高效能 C/C++ 推論 | 易用性、硬體自動偵測、CPU/GPU 卸載 | NVIDIA 消費級 GPU (RTX 3000/4000/5000 系列) 速度 | Apple Silicon 統一記憶體架構 |
| 模型格式 | GGUF (優化) | GGUF (原生) | GGUF (支援) | EXL2 | MLX 格式 |
| 平台支援 | 廣泛 (透過 GGUF) | 廣泛 (透過 GGUF) | Mac, Linux, Windows (預覽) | NVIDIA GPU (Windows/Linux) | macOS (Apple Silicon 專用) |
| API 伺服器 | Unsloth Studio | llama.cpp 伺服器模式 (OpenAI 兼容) | OpenAI 兼容端點 | 較不適合 | mlx-server, LM Studio |
| 性能基準 | Dynamic v2.0 在 MMLU 和 KL 散度優於 imatrix/QAT | 基礎引擎,通常比 Ollama 快 | 略慢於 llama.cpp | NVIDIA 消費級 GPU 最快 | Apple Silicon 上 TPS 表現最佳 |
| 定價模式 | 開源 (核心庫),可能提供商業服務/API | 開源 | 開源 | 開源 | 開源 |
| 生態系統整合 | Hugging Face, llama.cpp, Ollama | 作為許多本地推論工具的基礎 | 良好,易於整合 Python 應用 | 較少 | 較小模型生態系統,有限工具整合 |
🛠️ 技術深入
- Cohere 30B A3B (North Mini Code) 模型架構: 該模型是一個解碼器專用 (decoder-only) 的 Transformer-based 稀疏混合專家 (MoE) 模型。
- 參數規模: 總參數為 300 億,其中活躍參數為 30 億。
- 專家配置: 包含 128 個專家,每個 token 激活 8 個專家。
- 層數: 具有 48 或 49 層。
- 隱藏層大小: 2048。
- 分組查詢注意力 (GQA): 32 個查詢頭 (Q),4 個鍵值頭 (KV)。
- 注意力機制: 採用混合式注意力,結合了滑動窗口注意力 (RoPE) 和全局注意力,比例為 3:1。
- 最大位置: 500k (非訓練上下文窗口)。
- 上下文長度: 原生支援 256K token,使用 YaRN 技術可擴展至 1M token (適用於 Qwen3-Coder-30B-A3B-Instruct 變體)。
- Unsloth Dynamic v2.0 量化: 該方法智能且廣泛地選擇性量化層,動態調整每個可能層的量化類型,並為每個模型定制量化方案。
- 校準數據集: 使用超過 150 萬個 token 的高品質、人工策劃和清理的校準數據集,以顯著增強對話式聊天性能。
- GGUF 格式: 作為 GGML 的繼任者,GGUF 旨在通過靈活的鍵值元數據系統實現可擴展性,將模型架構、分詞器配置和超參數等所有必要信息打包到單一檔案中,避免了外部配置文件和兼容性問題。
- GGUF 量化方案: 支援多種量化方案,包括 Q2_K 到 Q8_0、IQ 變體和 K-Quants。K-Quants 採用分層超級塊結構和雙重量化,以顯著減少開銷。
🔮 前景展望AI analysis grounded in cited sources
Cohere 的企業級模型將在本地部署中獲得更廣泛的採用。
Unsloth 發布的 GGUF 版本使 Cohere 強大且針對程式碼優化的 MoE 模型能夠在消費級硬體上運行,降低了企業開發人員進行本地實驗和整合的門檻。
量化技術的持續創新將進一步普及高效能 LLM。
Unsloth 的 Dynamic v2.0 量化技術證明,即使進行激進的量化,也能保持顯著的準確性,這將推動消費級硬體上 LLM 性能的極限。
本地 LLM 生態系統的安全性將變得至關重要。
近期
llama.cpp GGUF 解析器漏洞的披露,凸顯了對模型來源進行嚴格驗證和使用可信模型的關鍵需求,以防範潛在的遠端程式碼執行和阻斷服務攻擊。⏳ 時間線
2019
Cohere 公司成立,由 Aidan Gomez 等人創立。
2022
Cohere 推出其公共 API 平台,向開發者提供文本生成、嵌入和分類模型。
2023
Unsloth AI 成立,旨在加速大型語言模型的微調和訓練。
2023-08
GGUF 格式作為 GGML 的繼任者被引入,成為 `llama.cpp` 專案的標準。
2025-04
Unsloth 推出其 Dynamic v2.0 量化方法,顯著提升了量化模型的準確性和效率。
2026-06
Cohere 發布 North Mini Code (30B A3B) 作為開源研究模型,專為程式碼生成優化。
📎 來源 (23)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗