Deepseek 發布 DeepEP V2 與 TileKernels
Deepseek-ai 透過 GitHub pull request 發布 DeepEP V2,並推出全新 TileKernels 儲存庫。提供直接存取連結。在 r/LocalLLaMA 發佈。
Tag: #optimization77 results
Deepseek-ai 透過 GitHub pull request 發布 DeepEP V2,並推出全新 TileKernels 儲存庫。提供直接存取連結。在 r/LocalLLaMA 發佈。

Cloudflare 推出 Agent Readiness 分數,幫助網站擁有者評估 AI 代理支援度。它探討新興標準、分享 Radar 數據洞見,並詳述優化使 Cloudflare 文件成為最代理友善的線上資源。

Amazon SageMaker JumpStart 推出優化部署,提供特定使用案例的預定義配置。提升自訂化、可見度與效能。客戶可依約束高效部署模型。

Unsloth 支援在 8GB VRAM 上本地微調 Gemma 4 E2B/E4B,比 FlashAttention-2 快 1.5 倍且 VRAM 少 60%。修復梯度累積損失爆炸、26B/31B 索引錯誤、use_cache 問題及 float16 音頻溢位等 bug。提供文字、視覺、音頻的免費 Colab 筆記本及 Unsloth Studio UI。

attn-rot 功能,一種類似 TurboQuant 的 KV 快取優化,已整合至 llama.cpp。它帶來 TurboQuant 80% 的效益,幾無缺點。Q8 量化現效能近似 F16。

研究人員推出首個多目標搜尋(MOS)全面基準測試套件,以解決評估碎片化問題。套件涵蓋道路網、合成圖形、遊戲格網及機器人運動規劃路徑圖,並提供固定實例與參考Pareto解集。此舉實現從強相關到獨立目標的穩健、可重現比較。

Google 的 TurboQuant 壓縮 LLM 推論中的 KV 快取及向量搜尋,在 Nvidia H100 上對 Gemma/Mistral 模型實現 6 倍記憶體節省及 8 倍加速。它解決關鍵瓶頸,提升硬體效率而不損準確度。分析師強調擴展潛力,但指出可能增加使用而非節省。

LP2Graph 是一種新方法,能將散亂的混合整數線性規劃 (MILP) 公式解析為結構化且可重現的數據集。它建立了變數與約束的規範分類法,為鐵路調度等複雜領域的自動化模型開發奠定了基礎。
TorchJD 是一個 PyTorch 函式庫,透過實作純量化(scalarization)與雅可比下降(Jacobian descent)方法,簡化了多損失函數模型的訓練過程。該專案近期已加入 PyTorch 生態系統,目標是成為多任務與約束優化訓練的標準工具。

本文探討了大規模實例表徵學習中 MLE 目標函數的計算挑戰。討論重點在於如何從非參數 Softmax 轉向雜訊對比估計 (NCE),以實現更高效的梯度近似。