
Q4 量化基準測試揭曉最佳量化檔
Qwen3.5-35B-A3B 的 Q4 量化詳細比較,使用 KLD 測忠實度及 PPL 測困惑度。AesSedai 的 Q4_K_M 以保護關鍵張量獲最低 KLD 而卓越。效率冠軍 AesSedai IQ4_XS 僅 16GB 表現優異。
Tag: #perplexity6 results

Qwen3.5-35B-A3B 的 Q4 量化詳細比較,使用 KLD 測忠實度及 PPL 測困惑度。AesSedai 的 Q4_K_M 以保護關鍵張量獲最低 KLD 而卓越。效率冠軍 AesSedai IQ4_XS 僅 16GB 表現優異。

三星內部調查顯示,近八成用戶日常使用兩個以上 AI 助手,這促使 Galaxy AI 從單一助手升級為多代理生態系統。新版在作業系統層面加入多款 AI 助手的整合支援,讓多 AI 同時使用更順暢一致。深度整合 Perplexity AI 以提升使用者體驗。
在 RTX 4050 上訓練 RWKV v6 (~193M),有效批量=8 時停滯於 50 PPL,但使用 gradient_accumulation=64 (有效=128) 降至 20 PPL。作者訓練 4 天無效後才發現此訣竅。適用於從頭訓練或微調生成式 LM。
如 35B A3B 的 Qwen 3.5 模型在 llama.cpp 中需要 bf16 KV 快取以確保準確困惑度,而非預設 f16。測試顯示 bf16 PPL 為 6.5497,f16/f32 為 6.5511。vLLM 正確預設 bf16,但 llama.cpp 需要手動旗標。

Perplexity is preparing to launch ultra-fast Gamma mode. It enables rapid, agent-driven searches powered by Grok 4.1 or possibly Grok 4.20.

Perplexity is testing Gamma mode for ultra-fast, agent-driven searches. It is powered by Grok 4.1 or possibly Grok 4.20.