Search

Tag: #model-compression25 results

透過裁剪層打造更小的 Qwen3.8

透過裁剪層打造更小的 Qwen3.8

一名社群開發者透過策略性移除 Qwen3.8-27B 的層,製作出約 22.7B 參數的 Qwen3.8-23B-Mini-Me,且推理能力沒有嚴重退化。據稱該模型適合程式設計、代理任務與多輪對話,但尚未進行基準測試,在邊界案例與資訊不完整的提示上較弱。

Reddit r/LocalLLaMACommunity2d ago#model-pruning#model-compression#apple-silicon
Unweight 無損壓縮 LLM 22%

Unweight 無損壓縮 LLM 22%

Cloudflare 開發了 Unweight,這是一種無損推論時壓縮系統,用於 LLM。它將模型佔用空間減少高達 22%,而不損品質。這優化了 GPU 記憶體頻寬,提供更快速、更便宜的推論服務。

Cloudflare BlogMediaApr 17#model-compression#edge-ai
Page 1 of 3