
智譜 AI 實現每秒 400 tokens 的破紀錄推理速度
智譜 AI 大幅優化了模型推理效能,達到每秒 400 tokens 的吞吐量。此更新使該模型成為目前頂尖大型語言模型中速度最快的模型之一。
Tag: #inference-speed24 results

智譜 AI 大幅優化了模型推理效能,達到每秒 400 tokens 的吞吐量。此更新使該模型成為目前頂尖大型語言模型中速度最快的模型之一。

Google 推出了 Gemini 3.5 Flash,這是一款針對高效率與速度進行優化的模型。Google 將此更新定位為實現響應式代理型 AI 應用的關鍵組件。

Google 使用 MTP Drafters 讓 Gemma 4 模型速度提升 3 倍。這採用推測解碼,將重型主模型與輕量級草稿模型配對預先生成權重。模型現可在消費級 GPU 與邊緣裝置高效運行。

使用者實驗顯示,使用 llamacpp 的推測解碼,Qwen-3.6-27B 推論速度從 13.6 t/s 提升至 136.75 t/s。模型迭代生成水族箱程式的完整程式碼、修復錯誤並新增功能。在具 40GB VRAM 的硬體上實現,並需更新 llama.cpp。

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

VAST執行長曹炎培討論2秒3D生成才是真正速度標準。這標誌AI 3D 2.0範式來臨,帶來更快工作流程。
擴散模型在深度思考任務中達到前所未有的每秒1009個tokens速度,超越自迴歸模型。此轉變預示AI生成更高效。英偉達與微軟已投資此突破性技術。

由前AMD高管領導的24人團隊推出挑戰英偉達的新AI晶片。每秒處理17000個token的推理效能。成本僅為同類英偉達產品的1/10。
使用者在 Devstral small 以 llama.cpp 推測解碼獲 665% 加速 (--spec-type ngram-map-k, ngram-size 24)。依模型而異:Gemma 2 倍、Qwen 3.6 初僅 40%,調整後達 140%。編輯新增重複懲罰與 ngram-mod 改善。

小紅書發布 FireRed-Image-Edit 1.1,這是一款強調身份一致性和高效生成的圖像編輯模型。它使用 30GB VRAM 僅需 4.5 秒即可產生高品質結果。