Search

Tag: #inference127 results

TextGen 轉型為原生桌面應用程式

TextGen 轉型為原生桌面應用程式

TextGen(前身為 text-generation-webui)現已推出無需安裝的桌面應用程式,支援 Windows、Linux 和 macOS。它提供了一個注重隱私的 LM Studio 替代方案,並具備自定義工具調用與 SOTA 量化支援等進階功能。

Reddit r/LocalLLaMACommunityMay 13#local-llm#privacy#inference
TokenArena:AI推論基準測試發布

TokenArena:AI推論基準測試發布

TokenArena 推出一個連續基準測試,針對端點層級評估 AI 推論的輸出速度、價格、能量、上下文與品質。它分析 78 個端點來自 12 個模型家族,顯示準確度差異高達 12.5 點,以及每正確答案能量差異達 6.2 倍。框架、架構與排行榜以 CC BY 4.0 開放發布。

ArXiv AIResearchMay 5#benchmark#inference#endpoints
⚙️

Strix Halo 上 HFQ4 預填充加速 3 倍

開發者為 hipfire 推理引擎新增實驗性 MMQ 預填充路徑,在 AMD Strix Halo (gfx1151) 上將 HFQ4-G256 提示處理加速 3 倍。基準測試顯示長預填充達 1140-1260 tok/s,橫跨多種 KV 模式。透過 HIPFIRE_MMQ=1 啟用,針對 RDNA3/3.5 GPU。

Reddit r/LocalLLaMACommunityApr 28#amd#inference#mmq
⚙️

推測解碼儲存庫上線

新 GitHub 儲存庫從頭實作推測解碼方法:EAGLE-3、Medusa-1、PARD、草稿模型、n-gram、尾綴解碼。針對 Qwen2.5-7B-Instruct 提供共享訓練/推論,基準測試澄清提案者品質對驗證者成本及吞吐量細微差異。定位為演算法-系統教育資源。

Reddit r/MachineLearningCommunityApr 26#speculative-decoding#inference#benchmarks
Page 6 of 13