🤖Reddit r/MachineLearning•較早收集於 87m
Monokernel 推論引擎在 MI300X 上達到每秒 3,300 token
💡看看 AMD MI300X 上的客製化核心工程如何將推論速度推向每秒 3,300 token。
⚡ 30-Second TL;DR
有什麼變化
在 8x MI300X 上每個請求達到每秒 3,300 個輸出 token。
為什麼重要
這證明了 AMD 硬體透過客製化核心工程可以達到極致的推論效能,挑戰了標準 CUDA 架構的主導地位。
下一步行動
造訪 playground.kog.ai 以測試其引擎在 MI300X 平台上的推論速度。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 8x MI300X 上每個請求達到每秒 3,300 個輸出 token。
- •將完整的解碼序列作為單一 GPU 常駐程式執行。
- •透過將記憶體存取與物理晶片拓撲對齊進行優化。
- •目前支援 2B 模型,未來計畫支援大型 MoE 模型。
🧠 深度解析
Web-grounded analysis with 17 cited sources.
🔑 增強重點摘要
- •Kog AI 是一家成立於 2023 年的歐洲新創公司,總部位於法國,專注於開發即時 AI 平台,並獲得創投資金支持。
- •Kog AI 的推論引擎透過其專有的 KCCL(Kog Collective Communications Library)實現了 4 微秒的超低跨 GPU 通訊延遲,這對於多 GPU 配置下的高效能推論至關重要。
- •該 Monokernel 引擎在單一請求、批次大小為 1、無推測解碼、無量化的條件下,於 8 個 MI300X GPU 上實現了每秒 3,300 個輸出 token 的效能,這表明其專注於優化單一請求的低延遲推論,而非傳統上常見的聚合吞吐量優化。
- •Kog AI 的推論引擎在 1B 至 32B 參數模型上,相較於 vLLM 和 TensorRT-LLM 等領先的推論解決方案,在 AMD MI300X、NVIDIA H100、H200 和 B200 GPU 上實現了高達 3.5 倍的 token 生成速度提升。
- •AMD MI300X 加速器於 2023 年 12 月 6 日正式發布,採用 CDNA 3 架構和小晶片設計,配備 192GB HBM3 記憶體和 5.3 TB/s 頻寬,旨在挑戰 NVIDIA 在 AI GPU 市場的主導地位,特別是在記憶體密集型應用方面。
📊 競品分析▸ Show
Kog AI 的 Monokernel 推論引擎主要與其他針對大型語言模型 (LLM) 推論進行優化的軟體框架競爭,尤其是在 AMD MI300X 硬體平台上。其主要競爭對手包括:
| 特性/產品 | Kog AI Monokernel 推論引擎 | vLLM | TensorRT-LLM | NVIDIA H100/H200/B200 (硬體) |
|---|---|---|---|---|
| 目標硬體 | AMD MI300X (主要), NVIDIA H100/H200/B200 | AMD MI300X, NVIDIA GPU | AMD MI300X, NVIDIA GPU | NVIDIA GPU 生態系統 |
| 效能基準 | 在 8x MI300X 上每個請求 3,300 token/s (批次大小 1);比 vLLM 和 TensorRT-LLM 快 3.5 倍 (1B-32B 模型) | 聚合吞吐量優化,但在單一請求速度上可能較慢 | 聚合吞吐量優化,但在單一請求速度上可能較慢 | H100 在中等批次大小和計算密集型任務上表現較好;H200/B200 提供更高記憶體和頻寬 |
| 優化方法 | Monokernel 架構,將記憶體存取模式直接映射到物理晶片拓撲,單一 GPU 常駐程式執行解碼序列,自訂 KCCL 實現低延遲跨 GPU 通訊 | PagedAttention 等技術,主要優化聚合吞吐量和 KV 快取管理 | 針對 NVIDIA GPU 優化,利用 Transformer Engine 加速低精度操作 | 硬體層面優化,如 Transformer Engine、HBM3 記憶體、NVLink/Infinity Fabric 互連 |
| 記憶體容量 | 利用 MI300X 的 192GB HBM3 記憶體優勢 | 依賴底層 GPU 記憶體容量 | 依賴底層 GPU 記憶體容量 | H100 80GB HBM3,H200 141GB HBM3e,B200 192GB 記憶體 |
| 軟體生態 | 基於 AMD ROCm,提供 API 和 Docker 部署 | 廣泛的社群支持和框架整合 | NVIDIA CUDA/TensorRT 生態系統,成熟且工具豐富 | 成熟的 CUDA 軟體堆疊和開發工具 |
| 目標應用 | 代理、深度研究、推理模型等需要快速連續 token 輸出的應用 | 聊天機器人等聚合吞吐量優先的應用 | 廣泛的 LLM 推論應用 | 廣泛的生成式 AI 和 HPC 工作負載 |
🛠️ 技術深入
- Monokernel (MegaKernel) 架構: Kog AI 的推論引擎採用 Monokernel 方法,將完整的解碼序列作為單一 GPU 常駐程式執行。這種設計消除了傳統多核心啟動的開銷和 GPU 記憶體 (HBM) 往返延遲,透過將多個操作融合到一個持久性核心中來實現。
- 記憶體存取與物理晶片拓撲對齊: 引擎透過將記憶體存取模式直接映射到 AMD MI300X 的物理晶片拓撲來進行優化。計算單元根據其相關的 IOD (I/O Die) 進行分組,確保硬體以其完整的設計效能運行。
- 跨 GPU 通訊優化: Kog AI 開發了 KCCL (Kog Collective Communications Library) 以實現創紀錄的低延遲跨 GPU 通訊,達到 4 微秒。這對於在多 GPU 環境中運行大型模型至關重要,因為它減少了資料移動的瓶頸。
- 硬體-軟體協同設計: Kog AI 的推論引擎被描述為一種硬體-軟體協同設計,旨在讓 GPU 達到其絕對極限,確保計算不間斷運行。
- AMD MI300X 硬體特性: MI300X 採用 AMD 的 CDNA 3 架構,具有小晶片設計,包含 8 個加速計算晶片 (XCDs) 和 192GB 的 HBM3 記憶體,頻寬超過 5TB/s。它還利用 Infinity Fabric™ 互連技術,允許多個 MI300X GPU 無縫協同工作。
- 支援模型: 目前支援 2B 參數模型,並計劃未來支援大型 MoE (Mixture-of-Experts) 模型。MoE 模型在 2026 年日益普及,因為它們能夠以較低的每 token 計算成本提供高密度的模型品質,但需要足夠的 VRAM 來儲存所有專家權重。
🔮 前景展望AI analysis grounded in cited sources
Kog AI 的 Monokernel 方法將推動 AI 推論引擎設計的典範轉移,特別是在低延遲應用方面。
透過將整個解碼序列作為單一 GPU 常駐程式執行並優化記憶體存取與硬體拓撲對齊,Kog AI 解決了傳統推論引擎的瓶頸,為即時 AI 應用設定了新標準。
AMD MI300X 在 AI 推論市場的競爭力將因 Kog AI 等軟體優化而顯著增強。
儘管 MI300X 在硬體規格上具有優勢,但 AMD 的 ROCm 軟體生態系統仍被認為不如 NVIDIA 的 CUDA 成熟;Kog AI 的深度優化證明了 MI300X 在特定工作負載下可以超越競爭對手,從而提升其市場吸引力。
未來大型 MoE 模型的高效能推論將越來越依賴於底層硬體-軟體協同設計和專門的記憶體管理策略。
MoE 模型雖然計算效率高,但對 VRAM 容量和跨 GPU 通訊延遲有嚴格要求,Kog AI 針對 MI300X 的優化以及其對 MoE 模型的未來支援計畫,凸顯了這種深度整合的重要性。
⏳ 時間線
2023-01
Kog AI 成立於法國。
2023-12-06
AMD Instinct MI300X 加速器正式發布。
2024-03-01
Kog AI 完成早期種子輪融資 (Early Stage VC)。
2025-07-14
Kog AI 宣布其推論引擎在 AMD Instinct MI300X GPU 上實現高達 3.5 倍的突破性推論速度。
2025-11-06
Kog AI 完成加速器/孵化器輪融資。
2026-05-28
Kog AI 推出其 Monokernel 推論引擎的實時預覽,展示在 8x MI300X 上每秒 3,300 token 的效能。
📎 來源 (17)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗

