
Cohere 發布採用 Apache 2.0 授權的開源權重模型 Command A+
Cohere 推出了 Command A+,這是一款擁有 2180 億參數的稀疏混合專家模型(MoE),並採用 Apache 2.0 授權發布。該模型針對複雜推理與代理工作流進行了優化,並透過先進的量化技術保持了極高的執行效率。
Tag: #quantization201 results

Cohere 推出了 Command A+,這是一款擁有 2180 億參數的稀疏混合專家模型(MoE),並採用 Apache 2.0 授權發布。該模型針對複雜推理與代理工作流進行了優化,並透過先進的量化技術保持了極高的執行效率。
Empirisch Tech 開源 Chaperone-Thinking-LQ-1.0,這是 4-bit GPTQ 量化與 QLoRA 微調的 DeepSeek-R1-32B 模型,在 MedQA 上達 84%。可在單一 L40 GPU 的 20GB VRAM 運行,比基底快 1.6 倍。設計用於本地醫療保健,尊重資料主權。
基準測試顯示 Gemma-4-31B 使用 TurboQuant KV 快取壓縮,在單張 RTX 5090 上實現完整 256K 上下文。速度從 4K 的 3,362 t/s 到 256K 的 899 t/s,生成速度為 61.5 t/s。VRAM 使用量峰值 27.7GB,得益於 4.5 倍 KV 壓縮。

PrismML 宣布 1-bit Bonsai,被稱為首個商業可行的 1-bit 大型語言模型。此突破承諾極端量化以實現高效推論。細節見連結公告。

FOMOE 讓 397B Qwen3.5 MoE 模型在配備兩張 $500 GPU 與 32GB RAM 的 $2,100 桌上型電腦上,以 Q4_K_M 量化達到 5-9 tokens/s。利用 VRAM 快取常見專家、滾動快取及快取感知路由 (CAR) 將 NVMe 讀取降至 7%。透過雙 GPU 交替與僅 3.5% 困惑度下降實現此效能。
HauhauCS 發布了 Qwen3.5-122B-A10B Aggressive 的無審查 GGUF 版本,拒絕率為零且無能力損失。它引入了新的 K_P 量化方法,以最小檔案大小增加提供優越品質。模型支援 262K 上下文及多模態輸入。

Qwen3.5-397B 的新無審查 NVFP4 量化版本已分享。在 Reddit r/LocalLLaMA 發布,附連結。可能實現巨型模型高效本地推理。

來自港科大、北航與商湯的 QVGen,為影片擴散模型提出 QAT 範式,在 3/4bit 量化下逼近滿精度品質。論文獲 ICLR 2026 高分錄取。程式碼與模型已在 GitHub 與 Hugging Face 釋出。

一名 Reddit 使用者在 8GB VRAM 系統上測試 Unsloth 的 Qwen3.8 27B 1-bit 量化版本。作者以幽默方式形容結果嚴重劣化,突顯極端壓縮所帶來的取捨。

一名開發者訓練了可生成 32×32 像素影像的 diffusion model,並部署在僅有 264KB SRAM 的 Shrike Lite micro控制器上。雖然大量量化讓專案成為可能,但受記憶體限制的 I/O 使 FPGA 加速版本反而比僅使用 MCU 的實作更慢。