Search

Tag: #quantization201 results

🤖

Qwen3.5-35B GGUF 量化基準測試

基準測試比較 Hugging Face 上 Qwen3.5-35B GGUF 量化版本(16-22 GiB)的 KLD 差異和速度。使用多語言 FLORES 200 和校準資料集。表格依 KLD 平均值和 99% 排名,在 RTX 3090 上 TG/s 最高達 143。

Reddit r/LocalLLaMACommunityMar 16#quantization#benchmarks#kld
PocketBot iPhone AI 代理 Beta 上線

PocketBot iPhone AI 代理 Beta 上線

PocketBot 是一款完全本機的 iPhone AI 代理,將英文轉換為手機自動化,使用 llama.cpp on Metal 執行量化 3B 模型。團隊尋求社群建議:更好 sub-4B 模型用於工具呼叫、最佳量化如 Q4_K_M vs Q5_K_S、動態取樣及脈絡管理。Beta 已於 TestFlight 上線。

Reddit r/LocalLLaMACommunityMar 16#on-device#iphone-agent#quantization
Page 14 of 21