🔬
TurboQuant:4位元 LLM 權重,3.2倍節省
TurboQuant 演算法從 KV-cache 適應至模型權重,提供 nn.Linear 直接替換,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen2.5-0.5B 基準測試中,體積減半卻 PPL 零增加;4B 測試確認損失極小。GitHub 含 Triton 核心與完整文件。
Tag: #llm-efficiency12 results
TurboQuant 演算法從 KV-cache 適應至模型權重,提供 nn.Linear 直接替換,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen2.5-0.5B 基準測試中,體積減半卻 PPL 零增加;4B 測試確認損失極小。GitHub 含 Triton 核心與完整文件。

LDP 是多代理 LLM 系統的新 AI 原生通訊協議,包含代理身份卡、漸進式負載、受控會話、來源追蹤及信任域等五項機制。以 JamJet 外掛形式實作,在簡單任務上降低 12 倍延遲、減少 37% 權重使用量,並在模擬中提升安全性。評估顯示效率優勢,但小代理池及雜訊來源有局限。