
Hugging Face 收購 GGML.AI
GGML.AI,本地 LLM 推理關鍵基礎設施,已被 Hugging Face 收購。公告發布於 r/LocalLLaMA。此舉強化 Hugging Face 在高效模型部署工具的地位。
Tag: #inference-engine11 results

GGML.AI,本地 LLM 推理關鍵基礎設施,已被 Hugging Face 收購。公告發布於 r/LocalLLaMA。此舉強化 Hugging Face 在高效模型部署工具的地位。
ggml (b9820) 的最新更新透過減少同步需求,顯著提升了 CUDA 的性能。這些變更優化了 Tensor 運算與非同步複製。

一個基於 ggml 的原生 C++ 推論框架,將 12 款音訊模型整合至單一執行環境。該框架在 CUDA 上顯著優於 Python 推論,最高可達 5 倍速度提升。
cuTile Rust 引入了一種基於 Tile 的程式設計模型,利用 Rust 的所有權和借用檢查機制來確保 GPU 核心的記憶體安全與無資料競爭。研究團隊開發了 Grout 推論引擎,在 Qwen3 模型上展現了與 vLLM 和 SGLang 相當的效能。

Redis之父親自開發專屬DeepSeek V4的推理引擎。此工具讓Mac電腦能本地運行該模型。它為Apple硬體帶來高效本地LLM推理。
ZINC 是用 Zig 撰寫的新 LLM 推理引擎,可在 $550 AMD GPU 上運行 35B 模型,透過 Vulkan。它載入 GGUF 模型,在 RDNA4 上達 7.1 tok/s,解決 AMD 消費級 GPU 缺口。儲存庫:github.com/zolotukhin/zinc。
ik_llama.cpp 分支在 RTX PRO 4000 上讓 Qwen 3.5 27B Q4_K_M 的提示評估快 26 倍 (43 至 1,122 tok/s),生成速 3.5 倍。融合 GDN 核心將圖形分割從 34 減至 2,全 GPU 利用。有預建 Windows 二進位檔作為直接替換。

Krasis LLM Runtime 針對 GPU 全載預填充與解碼優化,在單一 5090 上達 llama.cpp 的 8.9 倍預填充與 4.7 倍解碼。支援如 122B-A10B 等大型 Qwen 模型,RAM 使用極少。GitHub 一行安裝,相容 OpenAI 伺服器。

Atlas 是純 Rust LLM 推論引擎,針對 GB10 的 SM121 架構自訂 CUDA 核心,在 Qwen3.5-35B-A3B 上達 102 安定 tok/s,比 vLLM 快 2.3 倍。具 2 分鐘冷啟動、僅 2GB 映像,並在 Qwen3-Next-80B-A3B 上達 82 tok/s。解決 DGX Spark 的軟體問題,實現桌面 petaflop 運算。
Hipfire是專為所有AMD GPU設計的新推理引擎,採用mq4量化。創作者在Hugging Face分享量化模型。Localmaxxing基準測試顯示RDNA3及舊卡大幅加速。