來源Hugging Face Blog•近期收集於 23h
Transformers 新增 llama.cpp 量化模型支援
#quantization#local-inferencehugging-face-transformershugging facetransformersllama.cpp
透過 Transformers API 使用 llama.cpp 量化模型,打造更彈性的本機推論流程。
30 秒速覽
有什麼變化
Transformers 現已支援執行 llama.cpp 量化模型。
為什麼重要
這項整合可能簡化模型在實驗環境與輕量本機部署之間的轉移。對希望使用 Transformers API、同時採用 llama.cpp 量化的開發者尤其有用。
下一步行動
安裝最新版 Transformers,並將一個 GGUF 或 llama.cpp 量化模型與現有本機執行環境進行基準比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •Transformers 現已支援執行 llama.cpp 量化模型。
- •此功能改善 Hugging Face 工作流程與 llama.cpp 模型資產之間的互通性。
- •量化執行有助於降低本機模型推論的記憶體需求。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 12 個來源。
增強重點摘要
- •此技術整合源於 2026 年 2 月 Georgi Gerganov 及 ggml.ai 核心團隊正式加入 Hugging Face,推動開源社群兩大主流架構的深層技術融合。
- •開發者可直接透過既有的 AutoModelForCausalLM API 並指定 gguf_file 參數載入 GGUF 權重檔案,無需切換或依賴額外的外部封裝庫。
- •擺脫早期版本將量化權重反量化為 fp32/bf16 的限制,新版本在 Apple Silicon (Metal) 上支援直接於緊湊量化區塊(packed quantized weights)進行矩陣乘法運算。
- •底層整合了 ggml-attn 等低階 GGML 原生核心,大幅縮小 Python 執行環境與原生 C++ 執行速度之間的效能差距,推論吞吐量直逼原生 llama.cpp。
- •針對微調與 LoRA 適配器訓練需求,系統提供 GgufConfig(dequantize=True) 回退機制,可將權重解包為 torch.bfloat16 或 float32 密集模型以供更新。
競品分析
Hugging Face Transformers (本次更新)
- 核心定位與運行環境
- 原生 Python/PyTorch API,優先支援 Apple Silicon (Metal)
- 量化推論機制
- 呼叫底層 GGML 原生核心直接在打包量化區塊上運算,支援反量化回退微調
- Python 生態整合度
- 極高(直接相容標準 Transformers 管線與 Hugging Face Hub)
llama.cpp 原生 / llama-cpp-python
- 核心定位與運行環境
- 純 C/C++ 高效跨平台本機推論引擎
- 量化推論機制
- 原生 GGUF 多平台自訂核心,極低記憶體開銷與高吞吐量
- Python 生態整合度
- 中等(需透過 Python C-API 綁定包裝,與 PyTorch 生態互通性有限)
Apple MLX
- 核心定位與運行環境
- 專為 Apple Silicon 打造的陣列框架
- 量化推論機制
- 專門針對 Metal 最佳化的 4-bit/8-bit 量化核心
- Python 生態整合度
- 中等(局限於 Apple 生態,需重寫模型定義或轉檔)
LiteRT (原 TensorFlow Lite)
- 核心定位與運行環境
- 跨邊緣與行動裝置推論架構
- 量化推論機制
- 採用 TFLite/FlatBuffers 格式與邊緣專屬量化核心
- Python 生態整合度
- 低(主要面向端側部署,與 PyTorch 研究與開源模型生態脫節)
| 解決方案 / 框架 | 核心定位與運行環境 | 量化推論機制 | Python 生態整合度 |
|---|---|---|---|
| Hugging Face Transformers (本次更新) | 原生 Python/PyTorch API,優先支援 Apple Silicon (Metal) | 呼叫底層 GGML 原生核心直接在打包量化區塊上運算,支援反量化回退微調 | 極高(直接相容標準 Transformers 管線與 Hugging Face Hub) |
| llama.cpp 原生 / llama-cpp-python | 純 C/C++ 高效跨平台本機推論引擎 | 原生 GGUF 多平台自訂核心,極低記憶體開銷與高吞吐量 | 中等(需透過 Python C-API 綁定包裝,與 PyTorch 生態互通性有限) |
| Apple MLX | 專為 Apple Silicon 打造的陣列框架 | 專門針對 Metal 最佳化的 4-bit/8-bit 量化核心 | 中等(局限於 Apple 生態,需重寫模型定義或轉檔) |
| LiteRT (原 TensorFlow Lite) | 跨邊緣與行動裝置推論架構 | 採用 TFLite/FlatBuffers 格式與邊緣專屬量化核心 | 低(主要面向端側部署,與 PyTorch 研究與開源模型生態脫節) |
技術深入
- API 介面延伸:於
AutoModelForCausalLM.from_pretrained()與AutoTokenizer.from_pretrained()中新增gguf_file參數,實現一鍵載入本機或遠端 GGUF 模型檔案。 - Packed Kernel 原生運算:在 Apple Silicon (Metal/MPS) 裝置上,權重以 GGUF 量化格式直接保留於記憶體中,矩陣運算直接在壓縮數據塊上執行,避免完整載入時的記憶體膨脹。
- 底層核心整合:動態調用 GGML 低階核心(包含用於 prefill 與 decoding 階段的
ggml-attnFlashAttention 核心),顯著降低 Python 生成循環中的同步負擔。 - 微調與反量化回退:提供
GgufConfig(dequantize=True)設定選項,在需要進行參數微調或掛載 LoRA adapter 時,可將 GGUF 權重解包轉回 densetorch.bfloat16或float32。 - 模型支援度:初期優先最佳化 Qwen3.5 等常見密集模型與混合專家(MoE)架構,後續計劃推廣至非 Apple GPU 架構。
前景展望基於引用來源的 AI 分析
本機 AI 開發將顯著減少對 Ollama 或 llama-cpp-python 等中間封裝層的依賴
主流開發者可直接在熟悉的 Transformers 管線中以接近 C++ 的效能載入 GGUF 模型,省去維護多套推論依賴的複雜度。
GGUF 格式將加速確立為開源社群跨研發與部署的通用模型交換標準
當研究端主流標準(Transformers)直接原生支援部署端主流標準(GGUF),將進一步壓縮 safetensors 轉檔工作流的摩擦力。
時間線
2026-02
Georgi Gerganov 及 ggml.ai 核心團隊正式加入 Hugging Face
2026-09
Transformers 正式發布原生執行 llama.cpp GGUF 量化模型功能
- 2026-02Georgi Gerganov 及 ggml.ai 核心團隊正式加入 Hugging Face
- 2026-09Transformers 正式發布原生執行 llama.cpp GGUF 量化模型功能
來源 (12)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Ggml Joins Hfhuggingface.co2Nd72e3e8549d7note.com3hatenadiary.comuepon.hatenadiary.com4Ggufhuggingface.co5Ggufhuggingface.co6Aipresso 20260922 31aipresso.com7Bloghuggingface.co8Bloghuggingface.co9Lysandrehuggingface.co106aa8c26a533f95b100bc676a46b085dahyper.ai11Comparison Between Hugging Face Transformers and Llama Cpp 5ee8affe1f27medium.com12Llama Cpphuggingface.co
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗
每週電子報
每週一封,可隨時退訂。