SHADOW-250M:僅 60 MB 的長上下文 LLM
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。
Tag: #quantization201 results
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。

全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。
一套搭載 DFlash2 的高度最佳化 Qwen3.8-27B 推論堆疊,在受限功耗的 RTX 3090 上達到約每秒 138 個 token,64 個請求的吞吐量則達到 942 TPS。前綴快取也將長對話後續回合的延遲,從約 23 秒降至 1.4 秒以下。

一名 Reddit 使用者表示,Qwen3.8-27B Q6 已連續近 20 小時執行目標導向的代理式程式設計。模型在 RTX 3090 與 RTX 3060 的配置上,持續維持約每秒 60–63 個 tokens 的速度。
一名 Reddit 使用者表示,Qwen 3.8 27B 即使採用 Q3_xxs 量化,仍保有很強的能力,能一次完成多項嚴肅的程式設計任務。據稱它在 RTX 4060 Ti 16GB 上完整載入 VRAM 時可達每秒 30–35 個 token,但在基本計數、排序與日常對話中偶爾表現較弱。
一項在搭載 ROCm 的 AMD R9700 上進行的社群測試指出,Qwen3.8-27B 使用 FP16 與 q8_0 KV cache 時,在品質與長上下文記憶方面存在明顯差異。測試者表示,FP16 能產生更謹慎的結構化輸出,並在超過 120k token 後維持表現,這挑戰了兩種格式等效的普遍假設。

Hugging Face Blog 宣布推出透過量化感知蒸餾產生的 LFM2.5 Q4_0 檢查點。這些檢查點旨在為評估高效推論的實務開發者提供量化版 LFM2.5 模型選項。

社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。

PrismML 發布了 Bonsai 27B,這是 Qwen3.6 的三元量化版本,僅需 10GB 記憶體即可達到接近 fp16 的精度。此突破使高效能的 27B 模型能在消費級硬體上運行。

NVIDIA 發布了使用 NVFP4 資料類型的 Alibaba Qwen3.6-35B-A3B 量化版本。此優化在保持與原始 BF16 模型相當效能的同時,顯著降低了 GPU 記憶體與磁碟空間需求。