Search

Tag: #quantization201 results

🤖

Qwen KV 精度顯示實際品質差異

一項在搭載 ROCm 的 AMD R9700 上進行的社群測試指出,Qwen3.8-27B 使用 FP16 與 q8_0 KV cache 時,在品質與長上下文記憶方面存在明顯差異。測試者表示,FP16 能產生更謹慎的結構化輸出,並在超過 120k token 後維持表現,這挑戰了兩種格式等效的普遍假設。

Reddit r/LocalLLaMACommunity2d ago#kv-cache#long-context#quantization
Page 1 of 21