⚡雷峰网•較早收集於 42h
Approaching.AI 發佈 ATaaS Token 生產平台

#kv-cache#token-productionataasapproaching-aiataas
💡透過 ATaaS 異構優化與 KV Cache 突破,壓降 AI 推理成本 20% 以上(78字)
⚡ 30-Second TL;DR
有什麼變化
四大核心技術:六合異構推理 2.0 壓降叢集成本 20% 以上
為什麼重要
ATaaS 為國產算力優化提供標杆,助力 Token 需求激增下的成本有效擴展。它彌合軟硬體差距,減少大規模部署中的浪費。
下一步行動
聯繫 Approaching.AI 試用 ATaaS 優化您的異構推理叢集。
誰應關注:Enterprise & Security Teams
關鍵要點
- •四大核心技術:六合異構推理 2.0 壓降叢集成本 20% 以上
- •月餅 KV Cache 技術擴展儲存百至千倍,削減 90% GPU 開銷
- •雙儀算子級 SLO 仿真,將資源利用率提升數倍
- •萬象實現萬卡級彈性擴展,吞吐量翻倍提升
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •Approaching.AI 的 ATaaS 平台採用了軟硬體協同設計策略,特別針對 NVIDIA H100/A100 等主流 GPU 叢集進行了底層算子優化,以解決大模型推理中的記憶體牆(Memory Wall)問題。
- •該平台整合了動態批次處理(Dynamic Batching)與連續批次處理(Continuous Batching)技術,能有效降低長文本生成任務中的首字延遲(Time to First Token, TTFT)。
- •ATaaS 平台不僅限於單一模型架構,其異構整合能力支援混合專家模型(MoE)與稠密模型(Dense Model)在同一叢集上的並行部署,顯著提升了多租戶環境下的資源調度靈活性。
📊 競品分析▸ Show
| 特性 | Approaching.AI (ATaaS) | vLLM (開源框架) | NVIDIA TensorRT-LLM |
|---|---|---|---|
| 核心定位 | 企業級 Token 生產平台 | 高效能推理引擎 | 硬體加速推理庫 |
| 異構整合 | 支援多種硬體混合調度 | 較弱,偏向單一架構 | 強,深度綁定 NVIDIA 硬體 |
| 資源利用率 | 宣稱提升至 90% | 依賴硬體配置 | 依賴算子優化 |
| 商業模式 | 軟體即服務 (SaaS/PaaS) | 開源免費 | 隨硬體附贈/開源 |
🛠️ 技術深入
- 六合異構推理 2.0:透過自研的編譯器技術,將不同架構的 GPU 算力抽象化,實現跨硬體平台的統一調度,減少因硬體異質性導致的效能損耗。
- 月餅 KV Cache 技術:採用了基於區塊(Block-based)的記憶體管理機制,類似於作業系統的分頁記憶體管理,大幅減少了 KV Cache 的碎片化,並支援長序列的動態擴展。
- 雙儀算子級 SLO 仿真:在推理前進行算子級的效能預測,透過數位孿生技術模擬不同負載下的延遲與吞吐量,從而實現精確的資源預留與自動擴縮容。
🔮 前景展望AI analysis grounded in cited sources
AI 推理成本將進入「Token 單位成本」競爭時代
隨著 ATaaS 等平台將推理轉化為標準化工業生產,企業將更關注每千個 Token 的邊際生產成本而非單純的 GPU 採購量。
推理引擎將從單一模型優化轉向叢集級資源調度
單點模型優化已達瓶頸,未來的競爭焦點在於如何在大規模異構叢集中實現極致的資源利用率與彈性。
⏳ 時間線
2024-05
Approaching.AI 趨境科技正式對外發佈其核心推理加速技術架構。
2025-02
完成針對大規模異構 GPU 叢集的初步壓力測試,驗證了異構推理技術的可行性。
2026-03
正式發佈 ATaaS (AI Token as a Service) 生產平台,標誌著產品從技術驗證轉向商業化落地。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网 ↗
每週 AI 簡報
每週一封,可隨時退訂。