
透過裁剪層打造更小的 Qwen3.8
一名社群開發者透過策略性移除 Qwen3.8-27B 的層,製作出約 22.7B 參數的 Qwen3.8-23B-Mini-Me,且推理能力沒有嚴重退化。據稱該模型適合程式設計、代理任務與多輪對話,但尚未進行基準測試,在邊界案例與資訊不完整的提示上較弱。
Tag: #model-compression25 results

一名社群開發者透過策略性移除 Qwen3.8-27B 的層,製作出約 22.7B 參數的 Qwen3.8-23B-Mini-Me,且推理能力沒有嚴重退化。據稱該模型適合程式設計、代理任務與多輪對話,但尚未進行基準測試,在邊界案例與資訊不完整的提示上較弱。
Bonsai 27B 正式發布,成為首款可在行動裝置上運行的 27B 參數級模型。這標誌著行動 AI 優化的一個重要里程碑。

NVIDIA 推出了 Nemotron-Labs-3-Puzzle-75B-A9B,這是一款使用「Iterative Puzzle」壓縮框架進行部署優化的模型。其吞吐量較前代提升 2 倍,同時保持了高準確度。

這項研究介紹了一種能為大型語言模型實現統計無損性能的新型量化方法。該技術旨在降低記憶體佔用與計算需求,同時不犧牲模型的準確性。

Apple 正與新創公司 PrismML 進行初步洽談,計畫利用其技術將大型 AI 模型壓縮至裝置端執行。此舉旨在減少 Siri 等功能對雲端處理的依賴。
獨立創辦人推出 Spiral,使用 INT3 模型壓縮(+0.14 nats)和 2-bit KV 快取,搭配 Apple M 系列的自訂融合 Metal 核心。Qwen 7B 預覽版可透過 brew 安裝。未來將支援 Triton GPU 核心並推出更多 100B 以下模型。
Cloudflare 的 Unweight 以無損方式壓縮 LLM 15-22%,在 H100 GPU 上為 Llama-3.1-8B 節省約 3GB VRAM。GPU 核心已上 GitHub 並發布技術論文;接下來壓縮注意力權重。

Cloudflare 開發了 Unweight,這是一種無損推論時壓縮系統,用於 LLM。它將模型佔用空間減少高達 22%,而不損品質。這優化了 GPU 記憶體頻寬,提供更快速、更便宜的推論服務。

PrismML 發布 Ternary Bonsai,1.58 位元模型系列(8B、4B、1.7B),使用三元權重 {-1, 0, +1} 實現 9 倍記憶體縮減。在基準測試中超越同級模型,並適用嚴格記憶體限制。模型於 Hugging Face 提供,包括標準工具的 FP16 safetensors。

美國AI三巨頭圍剿模型蒸餾技術。中國公司面臨重大考驗。此舉視為封鎖亦警醒,危機轉為轉機。