🐼較早收集於 9m

Infinigence 平台代幣調用量六個月內成長 20 倍

Infinigence 平台代幣調用量六個月內成長 20 倍
PostLinkedIn
🐼閱讀原文: Pandaily
#maas#inferenceinfinigence-agentic-maasinfinigence

💡推理運算支出現已超越訓練;了解此基礎設施層如何擴展代幣吞吐量。

⚡ 30-Second TL;DR

有什麼變化

六個月內代幣調用量成長超過 20 倍

為什麼重要

從訓練轉向推理支出的趨勢,凸顯了市場對可擴展部署基礎設施的成熟需求。這顯示了對中立中間件以優化硬體與模型互通性的需求日益增長。

下一步行動

如果您希望將推理堆疊與特定硬體供應商解耦,請評估 Infinigence 的 MaaS 平台。

誰應關注:Developers & AI Engineers

關鍵要點

  • 六個月內代幣調用量成長超過 20 倍
  • 推理運算支出已超越訓練支出
  • 公司定位為 AI 模型的中立基礎設施層

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Infinigence(無限智能)的核心技術架構採用了異構計算資源調度,旨在解決不同晶片架構(如 NVIDIA、AMD、國產晶片)之間的推理效能差異。
  • 該平台透過其專有的推理優化引擎,宣稱能將大模型推理的延遲降低 30% 以上,並顯著提升 GPU 的利用率。
  • Infinigence 積極推動「模型即服務」(MaaS)的標準化,試圖降低企業部署開源模型(如 Llama 3, Qwen 等)的技術門檻。
  • 公司近期獲得了多家頂級風險投資機構的青睞,資金主要用於擴大其在邊緣計算與雲端推理基礎設施的佈局。
  • Infinigence 的商業模式不僅限於代幣調用,還包括為企業提供私有化部署的推理加速解決方案,以滿足對數據隱私有高要求的客戶。
📊 競品分析▸ Show
特性InfinigenceGroqFireworks AI
核心定位中立基礎設施層 (異構)LPU 專用硬體加速高效能模型推理 API
硬體支援多種 GPU/NPU 混合自研 LPU 架構NVIDIA GPU 優化
價格策略彈性代幣計費按時間/容量計費按 Token 計費
推理速度極高 (優化驅動)極高 (硬體驅動)

🛠️ 技術深入

  • 採用異構算力池化技術,透過軟體層抽象化底層硬體差異,實現模型在不同晶片上的無縫切換。
  • 實作了動態批處理 (Dynamic Batching) 與連續批處理 (Continuous Batching) 技術,最大化吞吐量。
  • 支援 KV Cache 壓縮與量化技術 (如 INT8/FP8),以減少記憶體頻寬瓶頸。
  • 提供統一的 API 介面,相容 OpenAI API 標準,降低開發者遷移成本。

🔮 前景展望AI analysis grounded in cited sources

推理成本將在未來 12 個月內下降 50% 以上
隨著異構算力調度技術的成熟與硬體利用率的提升,推理基礎設施的邊際成本將持續壓縮。
中立基礎設施層將成為 AI 產業鏈的關鍵節點
企業為避免單一供應商鎖定(Vendor Lock-in),將更傾向於採用能跨硬體平台運行的推理基礎設施。

時間線

2023-09
Infinigence(無限智能)正式成立,專注於 AI 推理基礎設施。
2024-05
發布首個版本的 Agentic MaaS 平台,開始支援主流開源模型。
2025-12
平台代幣調用量達到重要里程碑,標誌著推理業務進入快速成長期。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。