🤖較早收集於 87m

Monokernel 推論引擎在 MI300X 上達到每秒 3,300 token

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡看看 AMD MI300X 上的客製化核心工程如何將推論速度推向每秒 3,300 token。

⚡ 30-Second TL;DR

有什麼變化

在 8x MI300X 上每個請求達到每秒 3,300 個輸出 token。

為什麼重要

這證明了 AMD 硬體透過客製化核心工程可以達到極致的推論效能,挑戰了標準 CUDA 架構的主導地位。

下一步行動

造訪 playground.kog.ai 以測試其引擎在 MI300X 平台上的推論速度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 8x MI300X 上每個請求達到每秒 3,300 個輸出 token。
  • 將完整的解碼序列作為單一 GPU 常駐程式執行。
  • 透過將記憶體存取與物理晶片拓撲對齊進行優化。
  • 目前支援 2B 模型,未來計畫支援大型 MoE 模型。

🧠 深度解析

Web-grounded analysis with 17 cited sources.

🔑 增強重點摘要

  • Kog AI 是一家成立於 2023 年的歐洲新創公司,總部位於法國,專注於開發即時 AI 平台,並獲得創投資金支持。
  • Kog AI 的推論引擎透過其專有的 KCCL(Kog Collective Communications Library)實現了 4 微秒的超低跨 GPU 通訊延遲,這對於多 GPU 配置下的高效能推論至關重要。
  • 該 Monokernel 引擎在單一請求、批次大小為 1、無推測解碼、無量化的條件下,於 8 個 MI300X GPU 上實現了每秒 3,300 個輸出 token 的效能,這表明其專注於優化單一請求的低延遲推論,而非傳統上常見的聚合吞吐量優化。
  • Kog AI 的推論引擎在 1B 至 32B 參數模型上,相較於 vLLM 和 TensorRT-LLM 等領先的推論解決方案,在 AMD MI300X、NVIDIA H100、H200 和 B200 GPU 上實現了高達 3.5 倍的 token 生成速度提升。
  • AMD MI300X 加速器於 2023 年 12 月 6 日正式發布,採用 CDNA 3 架構和小晶片設計,配備 192GB HBM3 記憶體和 5.3 TB/s 頻寬,旨在挑戰 NVIDIA 在 AI GPU 市場的主導地位,特別是在記憶體密集型應用方面。
📊 競品分析▸ Show

Kog AI 的 Monokernel 推論引擎主要與其他針對大型語言模型 (LLM) 推論進行優化的軟體框架競爭,尤其是在 AMD MI300X 硬體平台上。其主要競爭對手包括:

特性/產品Kog AI Monokernel 推論引擎vLLMTensorRT-LLMNVIDIA H100/H200/B200 (硬體)
目標硬體AMD MI300X (主要), NVIDIA H100/H200/B200AMD MI300X, NVIDIA GPUAMD MI300X, NVIDIA GPUNVIDIA GPU 生態系統
效能基準在 8x MI300X 上每個請求 3,300 token/s (批次大小 1);比 vLLM 和 TensorRT-LLM 快 3.5 倍 (1B-32B 模型)聚合吞吐量優化,但在單一請求速度上可能較慢聚合吞吐量優化,但在單一請求速度上可能較慢H100 在中等批次大小和計算密集型任務上表現較好;H200/B200 提供更高記憶體和頻寬
優化方法Monokernel 架構,將記憶體存取模式直接映射到物理晶片拓撲,單一 GPU 常駐程式執行解碼序列,自訂 KCCL 實現低延遲跨 GPU 通訊PagedAttention 等技術,主要優化聚合吞吐量和 KV 快取管理針對 NVIDIA GPU 優化,利用 Transformer Engine 加速低精度操作硬體層面優化,如 Transformer Engine、HBM3 記憶體、NVLink/Infinity Fabric 互連
記憶體容量利用 MI300X 的 192GB HBM3 記憶體優勢依賴底層 GPU 記憶體容量依賴底層 GPU 記憶體容量H100 80GB HBM3,H200 141GB HBM3e,B200 192GB 記憶體
軟體生態基於 AMD ROCm,提供 API 和 Docker 部署廣泛的社群支持和框架整合NVIDIA CUDA/TensorRT 生態系統,成熟且工具豐富成熟的 CUDA 軟體堆疊和開發工具
目標應用代理、深度研究、推理模型等需要快速連續 token 輸出的應用聊天機器人等聚合吞吐量優先的應用廣泛的 LLM 推論應用廣泛的生成式 AI 和 HPC 工作負載

🛠️ 技術深入

  • Monokernel (MegaKernel) 架構: Kog AI 的推論引擎採用 Monokernel 方法,將完整的解碼序列作為單一 GPU 常駐程式執行。這種設計消除了傳統多核心啟動的開銷和 GPU 記憶體 (HBM) 往返延遲,透過將多個操作融合到一個持久性核心中來實現。
  • 記憶體存取與物理晶片拓撲對齊: 引擎透過將記憶體存取模式直接映射到 AMD MI300X 的物理晶片拓撲來進行優化。計算單元根據其相關的 IOD (I/O Die) 進行分組,確保硬體以其完整的設計效能運行。
  • 跨 GPU 通訊優化: Kog AI 開發了 KCCL (Kog Collective Communications Library) 以實現創紀錄的低延遲跨 GPU 通訊,達到 4 微秒。這對於在多 GPU 環境中運行大型模型至關重要,因為它減少了資料移動的瓶頸。
  • 硬體-軟體協同設計: Kog AI 的推論引擎被描述為一種硬體-軟體協同設計,旨在讓 GPU 達到其絕對極限,確保計算不間斷運行。
  • AMD MI300X 硬體特性: MI300X 採用 AMD 的 CDNA 3 架構,具有小晶片設計,包含 8 個加速計算晶片 (XCDs) 和 192GB 的 HBM3 記憶體,頻寬超過 5TB/s。它還利用 Infinity Fabric™ 互連技術,允許多個 MI300X GPU 無縫協同工作。
  • 支援模型: 目前支援 2B 參數模型,並計劃未來支援大型 MoE (Mixture-of-Experts) 模型。MoE 模型在 2026 年日益普及,因為它們能夠以較低的每 token 計算成本提供高密度的模型品質,但需要足夠的 VRAM 來儲存所有專家權重。

🔮 前景展望AI analysis grounded in cited sources

Kog AI 的 Monokernel 方法將推動 AI 推論引擎設計的典範轉移,特別是在低延遲應用方面。
透過將整個解碼序列作為單一 GPU 常駐程式執行並優化記憶體存取與硬體拓撲對齊,Kog AI 解決了傳統推論引擎的瓶頸,為即時 AI 應用設定了新標準。
AMD MI300X 在 AI 推論市場的競爭力將因 Kog AI 等軟體優化而顯著增強。
儘管 MI300X 在硬體規格上具有優勢,但 AMD 的 ROCm 軟體生態系統仍被認為不如 NVIDIA 的 CUDA 成熟;Kog AI 的深度優化證明了 MI300X 在特定工作負載下可以超越競爭對手,從而提升其市場吸引力。
未來大型 MoE 模型的高效能推論將越來越依賴於底層硬體-軟體協同設計和專門的記憶體管理策略。
MoE 模型雖然計算效率高,但對 VRAM 容量和跨 GPU 通訊延遲有嚴格要求,Kog AI 針對 MI300X 的優化以及其對 MoE 模型的未來支援計畫,凸顯了這種深度整合的重要性。

時間線

2023-01
Kog AI 成立於法國。
2023-12-06
AMD Instinct MI300X 加速器正式發布。
2024-03-01
Kog AI 完成早期種子輪融資 (Early Stage VC)。
2025-07-14
Kog AI 宣布其推論引擎在 AMD Instinct MI300X GPU 上實現高達 3.5 倍的突破性推論速度。
2025-11-06
Kog AI 完成加速器/孵化器輪融資。
2026-05-28
Kog AI 推出其 Monokernel 推論引擎的實時預覽,展示在 8x MI300X 上每秒 3,300 token 的效能。

📎 來源 (17)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. amd.com
  2. pitchbook.com
  3. tracxn.com
  4. reddit.com
  5. reddit.com
  6. tensorwave.com
  7. amd.com
  8. clarifai.com
  9. runpod.io
  10. neysa.ai
  11. amd.com
  12. medium.com
  13. arxiv.org
  14. kog.ai
  15. amd.com
  16. spheron.network
  17. gmicloud.ai
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning