🦙較早收集於 67m

Unsloth 發布 Cohere 30B A3B 模型 GGUF 版本

Unsloth 發布 Cohere 30B A3B 模型 GGUF 版本
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡Cohere 的新款 30B 模型現已透過 Unsloth 提供 GGUF 格式,可進行本地推論。

⚡ 30-Second TL;DR

有什麼變化

發布 Cohere 30B A3B 的 GGUF 格式

為什麼重要

GGUF 格式的可用性讓開發者能在消費級硬體上執行高效能模型,實現大規模 AI 的普及化。

下一步行動

從 Hugging Face 下載 GGUF 檔案,並使用 llama.cpp 進行測試,以評估其在您本地硬體上的效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 發布 Cohere 30B A3B 的 GGUF 格式
  • 支援該新款 30B 模型進行本地執行
  • 可能與 llama.cpp PR #24260 的架構支援有關

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • Unsloth 的核心價值在於透過其專有技術,將大型語言模型 (LLM) 的微調速度提升高達 30 倍,並減少 90% 的記憶體使用量,從而降低了高效能 AI 模型訓練的門檻,使其可在消費級硬體上運行。
  • Cohere 30B A3B 模型,又稱 North Mini Code,是一個稀疏混合專家 (MoE) 模型,總參數為 300 億,但僅有 30 億活躍參數,專為程式碼生成和代理任務優化,使其在本地部署時效率更高。
  • Unsloth 採用了其 Dynamic v2.0 量化技術,該技術在 MMLU 基準測試和 KL 散度方面優於傳統的 imatrix 和 QAT 方法,能在大幅縮小模型尺寸的同時,最大程度地保留模型準確性。
  • GGUF 格式已成為本地 LLM 部署的事實標準,它將模型架構、分詞器配置和超參數等所有必要元數據整合到單一檔案中,增強了可擴展性和跨平台兼容性。
  • 近期 llama.cpp GGUF 解析器中發現的漏洞(例如 2026 年 5 月披露的六個未修補缺陷)強調了從可信來源載入 GGUF 模型的重要性,以避免潛在的遠端程式碼執行 (RCE) 和阻斷服務 (DoS) 攻擊。
📊 競品分析▸ Show
特性/平台Unslothllama.cppOllamaExLlamaV2MLX (Apple)
主要功能快速微調與 GGUF 量化GGUF 推論引擎本地 LLM 推論與模型庫NVIDIA GPU 最快推論Apple Silicon 最快推論與微調
優化重點訓練速度 (30x)、記憶體 (90% 少)、Dynamic v2.0 量化消費級硬體上的高效能 C/C++ 推論易用性、硬體自動偵測、CPU/GPU 卸載NVIDIA 消費級 GPU (RTX 3000/4000/5000 系列) 速度Apple Silicon 統一記憶體架構
模型格式GGUF (優化)GGUF (原生)GGUF (支援)EXL2MLX 格式
平台支援廣泛 (透過 GGUF)廣泛 (透過 GGUF)Mac, Linux, Windows (預覽)NVIDIA GPU (Windows/Linux)macOS (Apple Silicon 專用)
API 伺服器Unsloth Studiollama.cpp 伺服器模式 (OpenAI 兼容)OpenAI 兼容端點較不適合mlx-server, LM Studio
性能基準Dynamic v2.0 在 MMLU 和 KL 散度優於 imatrix/QAT基礎引擎,通常比 Ollama 快略慢於 llama.cppNVIDIA 消費級 GPU 最快Apple Silicon 上 TPS 表現最佳
定價模式開源 (核心庫),可能提供商業服務/API開源開源開源開源
生態系統整合Hugging Face, llama.cpp, Ollama作為許多本地推論工具的基礎良好,易於整合 Python 應用較少較小模型生態系統,有限工具整合

🛠️ 技術深入

  • Cohere 30B A3B (North Mini Code) 模型架構: 該模型是一個解碼器專用 (decoder-only) 的 Transformer-based 稀疏混合專家 (MoE) 模型。
  • 參數規模: 總參數為 300 億,其中活躍參數為 30 億。
  • 專家配置: 包含 128 個專家,每個 token 激活 8 個專家。
  • 層數: 具有 48 或 49 層。
  • 隱藏層大小: 2048。
  • 分組查詢注意力 (GQA): 32 個查詢頭 (Q),4 個鍵值頭 (KV)。
  • 注意力機制: 採用混合式注意力,結合了滑動窗口注意力 (RoPE) 和全局注意力,比例為 3:1。
  • 最大位置: 500k (非訓練上下文窗口)。
  • 上下文長度: 原生支援 256K token,使用 YaRN 技術可擴展至 1M token (適用於 Qwen3-Coder-30B-A3B-Instruct 變體)。
  • Unsloth Dynamic v2.0 量化: 該方法智能且廣泛地選擇性量化層,動態調整每個可能層的量化類型,並為每個模型定制量化方案。
  • 校準數據集: 使用超過 150 萬個 token 的高品質、人工策劃和清理的校準數據集,以顯著增強對話式聊天性能。
  • GGUF 格式: 作為 GGML 的繼任者,GGUF 旨在通過靈活的鍵值元數據系統實現可擴展性,將模型架構、分詞器配置和超參數等所有必要信息打包到單一檔案中,避免了外部配置文件和兼容性問題。
  • GGUF 量化方案: 支援多種量化方案,包括 Q2_K 到 Q8_0、IQ 變體和 K-Quants。K-Quants 採用分層超級塊結構和雙重量化,以顯著減少開銷。

🔮 前景展望AI analysis grounded in cited sources

Cohere 的企業級模型將在本地部署中獲得更廣泛的採用。
Unsloth 發布的 GGUF 版本使 Cohere 強大且針對程式碼優化的 MoE 模型能夠在消費級硬體上運行,降低了企業開發人員進行本地實驗和整合的門檻。
量化技術的持續創新將進一步普及高效能 LLM。
Unsloth 的 Dynamic v2.0 量化技術證明,即使進行激進的量化,也能保持顯著的準確性,這將推動消費級硬體上 LLM 性能的極限。
本地 LLM 生態系統的安全性將變得至關重要。
近期 llama.cpp GGUF 解析器漏洞的披露,凸顯了對模型來源進行嚴格驗證和使用可信模型的關鍵需求,以防範潛在的遠端程式碼執行和阻斷服務攻擊。

時間線

2019
Cohere 公司成立,由 Aidan Gomez 等人創立。
2022
Cohere 推出其公共 API 平台,向開發者提供文本生成、嵌入和分類模型。
2023
Unsloth AI 成立,旨在加速大型語言模型的微調和訓練。
2023-08
GGUF 格式作為 GGML 的繼任者被引入,成為 `llama.cpp` 專案的標準。
2025-04
Unsloth 推出其 Dynamic v2.0 量化方法,顯著提升了量化模型的準確性和效率。
2026-06
Cohere 發布 North Mini Code (30B A3B) 作為開源研究模型,專為程式碼生成優化。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA