
torch-nvenc-compress 提升 PCIe 頻寬
新函式庫利用 GPU NVENC 即時壓縮張量,解決多 GPU PCIe 瓶頸。在擴散模型激活達 6.1 倍壓縮,LLM KV 快取 2.7 倍。包含 PCA 預處理及純 ctypes SDK 包裝。
Tag: #compression10 results

新函式庫利用 GPU NVENC 即時壓縮張量,解決多 GPU PCIe 瓶頸。在擴散模型激活達 6.1 倍壓縮,LLM KV 快取 2.7 倍。包含 PCA 預處理及純 ctypes SDK 包裝。
turboquant-pro 推出 autotune CLI,從 PostgreSQL/pgvector 取樣嵌入向量,測試 12 種壓縮配置,在約 10 秒內依最小召回率推薦最佳方案。在 194K 生產嵌入上達 20.9 倍壓縮、96% 召回率,將 758MB 縮至 36MB。僅需 CPU、無需訓練,使用 PCA-Matryoshka + TurboQuant。

Google 於週二發表研究部落格文章,介紹用於 AI 模型的新壓縮演算法。數小時內,記憶體股票大跌:Micron 跌 3%、Western Digital 跌 4.7%、SanDisk 跌 5.7%。投資者重新評估 AI 產業的實體記憶體需求。
OpenAI Parameter Golf 實證顯示,SSMs 在微型模型(25M 參數、16MB、10分訓練)壓縮比 transformer 差,且大詞彙時架構優勢喪失。部落格詳述 Mamba-3 Triton kernel 實驗,揭露融合延遲、量化 bug 與精度修正。
實驗結合 entropy 選擇、OLS 重建、SVD 壓縮用於 KV 快取。低記憶體下錯誤低 3 倍,勝 Top-K 剪枝且避開尖峰。原型部落格徵求回饋。

Cloudflare 搶先展示針對代理網的共享壓縮字典。這大幅提升頁面載入時間。Beta 版即將開放測試。
r/MachineLearning 分享 TriAttention 論文,為長上下文推理提供高效 KV 快取壓縮方法。針對 LLM 改進。連結完整論文與討論。

研究人員使用階層式定義和單子,將人類數學建模為形式數學的可壓縮子集。對 MathLib 的分析顯示,展開長度隨深度呈指數增長,符合阿貝爾單子模型。這建議將自動推理導向可壓縮區域。
瑪特廖什卡表示學習在嵌入壓縮下維持優異效能。然而,近期研究顯示在某些檢索任務中效能下降。社群徵求其他限制的論文與實驗。

文章記錄了一項 AI 輔助最佳化實驗,據稱在不修改 7-Zip 核心程式碼的情況下,讓壓縮速度提升 97%。這項實驗凸顯非專業使用者如何運用 AI,為成熟的開源工具找出並實作效能改進。