解鎖 Continuous Batching 中的非同步處理能力
Hugging Face 引入了用於 Continuous Batching 的非同步處理機制,旨在提升推論吞吐量。此方法將請求處理與批次執行解耦,有效降低高負載環境下的延遲。
Tag: #inference127 results
Hugging Face 引入了用於 Continuous Batching 的非同步處理機制,旨在提升推論吞吐量。此方法將請求處理與批次執行解耦,有效降低高負載環境下的延遲。

總部位於倫敦的初創公司 Fractile 獲得 2.2 億美元融資,旨在將其獨特的記憶體內運算(in-memory-compute)推理晶片投入生產。該硬體架構將運算與記憶體整合在同一晶片上,以優化 AI 推理效能。

TextGen(前身為 text-generation-webui)現已推出無需安裝的桌面應用程式,支援 Windows、Linux 和 macOS。它提供了一個注重隱私的 LM Studio 替代方案,並具備自定義工具調用與 SOTA 量化支援等進階功能。

TokenArena 推出一個連續基準測試,針對端點層級評估 AI 推論的輸出速度、價格、能量、上下文與品質。它分析 78 個端點來自 12 個模型家族,顯示準確度差異高達 12.5 點,以及每正確答案能量差異達 6.2 倍。框架、架構與排行榜以 CC BY 4.0 開放發布。

Amazon SageMaker 為推論端點新增容量感知實例池。使用者定義優先實例類型;SageMaker 在容量限制時自動回退。支援單一模型、推論元件及非同步端點。
開發者為 hipfire 推理引擎新增實驗性 MMQ 預填充路徑,在 AMD Strix Halo (gfx1151) 上將 HFQ4-G256 提示處理加速 3 倍。基準測試顯示長預填充達 1140-1260 tok/s,橫跨多種 KV 模式。透過 HIPFIRE_MMQ=1 啟用,針對 RDNA3/3.5 GPU。

曦望成為國內首家百億人民幣估值純推理GPU獨角獸。聯席CEO王湛強調推理成本最低者勝出。目標將百萬Token成本降至1分錢。
Google 的 AI 晶片成為科技業熱門商品,連最大競爭對手也在採購。Alphabet 計劃推出專用推理新晶片以延續勢頭。這讓 Google 在蓬勃發展的 AI 半導體領域挑戰 Nvidia。
Google 計劃推出專注推理的新 AI 晶片,挑戰 Nvidia。Cerebras 在先前撤回後計劃 IPO。