來源近期收集於 23h

Transformers 新增 llama.cpp 量化模型支援

閱讀原文: Hugging Face Blog
#quantization#local-inference

透過 Transformers API 使用 llama.cpp 量化模型,打造更彈性的本機推論流程。

30 秒速覽

有什麼變化

Transformers 現已支援執行 llama.cpp 量化模型。

為什麼重要

這項整合可能簡化模型在實驗環境與輕量本機部署之間的轉移。對希望使用 Transformers API、同時採用 llama.cpp 量化的開發者尤其有用。

下一步行動

安裝最新版 Transformers,並將一個 GGUF 或 llama.cpp 量化模型與現有本機執行環境進行基準比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Transformers 現已支援執行 llama.cpp 量化模型。
  • •此功能改善 Hugging Face 工作流程與 llama.cpp 模型資產之間的互通性。
  • •量化執行有助於降低本機模型推論的記憶體需求。

深度解析

背景與延伸:來自公開資料,非原文內容。引用 12 個來源。

增強重點摘要

  • •此技術整合源於 2026 年 2 月 Georgi Gerganov 及 ggml.ai 核心團隊正式加入 Hugging Face,推動開源社群兩大主流架構的深層技術融合。
  • •開發者可直接透過既有的 AutoModelForCausalLM API 並指定 gguf_file 參數載入 GGUF 權重檔案,無需切換或依賴額外的外部封裝庫。
  • •擺脫早期版本將量化權重反量化為 fp32/bf16 的限制,新版本在 Apple Silicon (Metal) 上支援直接於緊湊量化區塊(packed quantized weights)進行矩陣乘法運算。
  • •底層整合了 ggml-attn 等低階 GGML 原生核心,大幅縮小 Python 執行環境與原生 C++ 執行速度之間的效能差距,推論吞吐量直逼原生 llama.cpp。
  • •針對微調與 LoRA 適配器訓練需求,系統提供 GgufConfig(dequantize=True) 回退機制,可將權重解包為 torch.bfloat16 或 float32 密集模型以供更新。

競品分析

Hugging Face Transformers (本次更新)
核心定位與運行環境
原生 Python/PyTorch API,優先支援 Apple Silicon (Metal)
量化推論機制
呼叫底層 GGML 原生核心直接在打包量化區塊上運算,支援反量化回退微調
Python 生態整合度
極高(直接相容標準 Transformers 管線與 Hugging Face Hub)
llama.cpp 原生 / llama-cpp-python
核心定位與運行環境
純 C/C++ 高效跨平台本機推論引擎
量化推論機制
原生 GGUF 多平台自訂核心,極低記憶體開銷與高吞吐量
Python 生態整合度
中等(需透過 Python C-API 綁定包裝,與 PyTorch 生態互通性有限)
Apple MLX
核心定位與運行環境
專為 Apple Silicon 打造的陣列框架
量化推論機制
專門針對 Metal 最佳化的 4-bit/8-bit 量化核心
Python 生態整合度
中等(局限於 Apple 生態,需重寫模型定義或轉檔)
LiteRT (原 TensorFlow Lite)
核心定位與運行環境
跨邊緣與行動裝置推論架構
量化推論機制
採用 TFLite/FlatBuffers 格式與邊緣專屬量化核心
Python 生態整合度
低(主要面向端側部署,與 PyTorch 研究與開源模型生態脫節)

技術深入

  • API 介面延伸:於 AutoModelForCausalLM.from_pretrained() 與 AutoTokenizer.from_pretrained() 中新增 gguf_file 參數,實現一鍵載入本機或遠端 GGUF 模型檔案。
  • Packed Kernel 原生運算:在 Apple Silicon (Metal/MPS) 裝置上,權重以 GGUF 量化格式直接保留於記憶體中,矩陣運算直接在壓縮數據塊上執行,避免完整載入時的記憶體膨脹。
  • 底層核心整合:動態調用 GGML 低階核心(包含用於 prefill 與 decoding 階段的 ggml-attn FlashAttention 核心),顯著降低 Python 生成循環中的同步負擔。
  • 微調與反量化回退:提供 GgufConfig(dequantize=True) 設定選項,在需要進行參數微調或掛載 LoRA adapter 時,可將 GGUF 權重解包轉回 dense torch.bfloat16 或 float32。
  • 模型支援度:初期優先最佳化 Qwen3.5 等常見密集模型與混合專家(MoE)架構,後續計劃推廣至非 Apple GPU 架構。

前景展望基於引用來源的 AI 分析

本機 AI 開發將顯著減少對 Ollama 或 llama-cpp-python 等中間封裝層的依賴
主流開發者可直接在熟悉的 Transformers 管線中以接近 C++ 的效能載入 GGUF 模型,省去維護多套推論依賴的複雜度。
GGUF 格式將加速確立為開源社群跨研發與部署的通用模型交換標準
當研究端主流標準(Transformers)直接原生支援部署端主流標準(GGUF),將進一步壓縮 safetensors 轉檔工作流的摩擦力。

時間線

2026-02
Georgi Gerganov 及 ggml.ai 核心團隊正式加入 Hugging Face
2026-09
Transformers 正式發布原生執行 llama.cpp GGUF 量化模型功能

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。