
LFM2.5 推出 Q4_0 蒸餾檢查點
Hugging Face Blog 宣布推出透過量化感知蒸餾產生的 LFM2.5 Q4_0 檢查點。這些檢查點旨在為評估高效推論的實務開發者提供量化版 LFM2.5 模型選項。
Tag: #efficient-inference6 results

Hugging Face Blog 宣布推出透過量化感知蒸餾產生的 LFM2.5 Q4_0 檢查點。這些檢查點旨在為評估高效推論的實務開發者提供量化版 LFM2.5 模型選項。

Qwen3.6-35B-A3B 是全新開源稀疏 MoE 模型,總參數 35B,活躍參數 3B,採用 Apache 2.0 許可。代理編碼能力媲美活躍參數大 10 倍的模型,並具強大多模態感知與思考/非思考模式。可於 HuggingFace、ModelScope 及 Qwen Studio 下載。
PentaNet 是一種新 LLM 架構,使用原生五元 {-2,-1,0,1,2} 量化,在 WikiText-103 上比 BitNet 改善 6.4% 困惑度,同時透過位元移位保留零乘法推理。權重分佈穩定而不崩潰為三元,提供更多模型容量。程式碼、PyTorch 層與模型已在 GitHub 和 HuggingFace 開源。

Liquid AI 發布 LFM2-24B-A2B,其最大稀疏 MoE 模型,總參數 24B、每 token 活躍 2B。支援 32GB RAM 推理,使用 llama.cpp、vLLM。開放權重於 Hugging Face 提供 GGUF 量化。

Hugging Face 探討如何讓知識蒸餾的成本降低至足以大規模運行。文章聚焦於降低將大型模型能力轉移至小型模型時的實際成本門檻。
Reddit 貼文探討三元權重量化(+1、0、-1)用於高效神經網路,強調優於二元的好處。提及 2016 TWN 論文及 Qubic 的 Aigarth 專案,使用原生三元訓練透過演化優化而非反向傳播。尋求社群對研究嚴肅度及既有同行評審論文的意見。