🐼Pandaily•較早收集於 9m
Infinigence 平台代幣調用量六個月內成長 20 倍

#maas#inferenceinfinigence-agentic-maasinfinigence
💡推理運算支出現已超越訓練;了解此基礎設施層如何擴展代幣吞吐量。
⚡ 30-Second TL;DR
有什麼變化
六個月內代幣調用量成長超過 20 倍
為什麼重要
從訓練轉向推理支出的趨勢,凸顯了市場對可擴展部署基礎設施的成熟需求。這顯示了對中立中間件以優化硬體與模型互通性的需求日益增長。
下一步行動
如果您希望將推理堆疊與特定硬體供應商解耦,請評估 Infinigence 的 MaaS 平台。
誰應關注:Developers & AI Engineers
關鍵要點
- •六個月內代幣調用量成長超過 20 倍
- •推理運算支出已超越訓練支出
- •公司定位為 AI 模型的中立基礎設施層
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •Infinigence(無限智能)的核心技術架構採用了異構計算資源調度,旨在解決不同晶片架構(如 NVIDIA、AMD、國產晶片)之間的推理效能差異。
- •該平台透過其專有的推理優化引擎,宣稱能將大模型推理的延遲降低 30% 以上,並顯著提升 GPU 的利用率。
- •Infinigence 積極推動「模型即服務」(MaaS)的標準化,試圖降低企業部署開源模型(如 Llama 3, Qwen 等)的技術門檻。
- •公司近期獲得了多家頂級風險投資機構的青睞,資金主要用於擴大其在邊緣計算與雲端推理基礎設施的佈局。
- •Infinigence 的商業模式不僅限於代幣調用,還包括為企業提供私有化部署的推理加速解決方案,以滿足對數據隱私有高要求的客戶。
📊 競品分析▸ Show
| 特性 | Infinigence | Groq | Fireworks AI |
|---|---|---|---|
| 核心定位 | 中立基礎設施層 (異構) | LPU 專用硬體加速 | 高效能模型推理 API |
| 硬體支援 | 多種 GPU/NPU 混合 | 自研 LPU 架構 | NVIDIA GPU 優化 |
| 價格策略 | 彈性代幣計費 | 按時間/容量計費 | 按 Token 計費 |
| 推理速度 | 極高 (優化驅動) | 極高 (硬體驅動) | 高 |
🛠️ 技術深入
- 採用異構算力池化技術,透過軟體層抽象化底層硬體差異,實現模型在不同晶片上的無縫切換。
- 實作了動態批處理 (Dynamic Batching) 與連續批處理 (Continuous Batching) 技術,最大化吞吐量。
- 支援 KV Cache 壓縮與量化技術 (如 INT8/FP8),以減少記憶體頻寬瓶頸。
- 提供統一的 API 介面,相容 OpenAI API 標準,降低開發者遷移成本。
🔮 前景展望AI analysis grounded in cited sources
推理成本將在未來 12 個月內下降 50% 以上
隨著異構算力調度技術的成熟與硬體利用率的提升,推理基礎設施的邊際成本將持續壓縮。
中立基礎設施層將成為 AI 產業鏈的關鍵節點
企業為避免單一供應商鎖定(Vendor Lock-in),將更傾向於採用能跨硬體平台運行的推理基礎設施。
⏳ 時間線
2023-09
Infinigence(無限智能)正式成立,專注於 AI 推理基礎設施。
2024-05
發布首個版本的 Agentic MaaS 平台,開始支援主流開源模型。
2025-12
平台代幣調用量達到重要里程碑,標誌著推理業務進入快速成長期。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週 AI 簡報
每週一封,可隨時退訂。