TokenSpeed-Kernel:用於 LLM 推論的可攜式高效能核心
TokenSpeed-Kernel 是一個全新的開源子系統,旨在簡化 LLM 推論中的後端複雜性。它提供了一套分層 API 與註冊系統,將高階執行環境與硬體特定的實作進行解耦。
Tag: #llm-inference43 results
TokenSpeed-Kernel 是一個全新的開源子系統,旨在簡化 LLM 推論中的後端複雜性。它提供了一套分層 API 與註冊系統,將高階執行環境與硬體特定的實作進行解耦。

NVIDIA 引入了 DFlash 推測解碼技術,旨在解決自回歸大型語言模型 (LLM) 的延遲瓶頸。該技術透過輕量級模型來預測生成 Token,顯著提升了 Blackwell 架構上的吞吐量。

針對 M5 MacBook、DGX Spark、Strix Halo 與 RTX 6000 進行的本地 AI 硬體效能比較分析。研究強調了記憶體頻寬對 Token 生成速度的影響,以及在高負載 AI 任務下的散熱表現。

Google DeepMind工程師論文揭露,針對訓練優化的GPU/TPU無法應付記憶體密集的LLM推理解碼,導致成本飆升。MoE與長上下文趨勢放大差距,記憶體頻寬遠落後運算。他們提出HBF、PNM與3D堆疊解決核心痛點。
Skymizer Taiwan 推出 PCIe 卡,搭載六顆 HTX301 晶片與 384GB 記憶體,可在 ~240W 下運行 700B 參數 LLM 推理。專攻記憶體密集解碼階段,將預填充交由 GPU。六月 Computex 將有演示。

DeepSeek 將全系 API 輸入快取命中價格降至原價 1/10,即日生效。Pro 模型至 5 月 5 日前再享 2.5 折優惠。更新價格:V4-Pro 快取命中 0.025 元,V4-Flash 0.02 元。
單 GPU 開源重現 Cartridges(語料特定 KV 壓縮)與 STILL(可重用神經壓縮)。包含與全上下文、截斷及 Cartridges 的基準測試。可讀代碼適用長上下文推理與 KV 快取系統權衡。

Tiny Corp 推出 NVIDIA RTX 5090 macOS 開源驅動,經 Thunderbolt 5/USB4 直連 Apple Silicon,無需虛擬機。Mac mini M4 Pro 示範運行 Llama 3.1 8B 達 7.48 Token/s。較 Metal 原生慢 10 倍,但首 Token 反應快 3-4 倍。

蒙特卡羅樹搜索(MCTS)提升LLM推理但造成長尾延遲。新負早退機制修剪無效路徑,自適應加速重新分配計算資源。整合至vLLM,大幅降低p99延遲、提升吞吐量並維持準確度。
kernel-anvil 在 AMD GPU 上剖析 GGUF 模型形狀,並產生最適 llama.cpp 核心配置,無需重新編譯即可實現解碼速度提升 2 倍。它針對 RDNA3 GPU 如 7900 XTX,在 Qwen3.5-27B Q4_K_M 上達到 27 tok/s。使用方式為快速剖析並套用小型 llama.cpp 修補。