🤗Hugging Face Blog•較早收集於 17h
DeepInfra 加入 Hugging Face 推理提供者 🔥

💡Hugging Face 新增推理提供者,擴大開發者廉價快速部署選項。(38字)
⚡ 30-Second TL;DR
有什麼變化
DeepInfra 整合至 Hugging Face 推理提供者
為什麼重要
此推出為 AI 從業人員提供另一個可靠且可能更具成本效益的 Hugging Face 推理提供者,增加競爭並擴大生產部署選項。
下一步行動
造訪 Hugging Face 推理提供者頁面,並測試 DeepInfra 端點以部署您的模型。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepInfra 整合至 Hugging Face 推理提供者
- •透過 Hugging Face 部落格宣布,附帶興奮表情符號
- •提升開發者模型推理主機選擇
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •DeepInfra 透過 Hugging Face 的 Inference Endpoints 整合,允許開發者直接在 Hugging Face 平台上調用其伺服器無狀態(serverless)推理基礎設施,無需自行管理基礎架構。
- •此整合支援多種熱門開源模型(如 Llama 3、Mistral 等),並強調其按使用量付費(pay-as-you-go)的定價模式,旨在降低開發者部署高性能 AI 模型的門檻。
- •DeepInfra 的技術堆疊針對高吞吐量與低延遲進行了優化,特別是在處理大規模語言模型(LLM)的推理任務時,能提供比傳統雲端 GPU 實例更具成本效益的解決方案。
📊 競品分析▸ Show
| 特色 | DeepInfra | Together AI | Fireworks AI |
|---|---|---|---|
| 定價模式 | 按 Token 計費 (Serverless) | 按 Token 計費 (Serverless) | 按 Token 計費 (Serverless) |
| 模型支援 | 廣泛開源模型 | 廣泛開源模型 | 廣泛開源模型 |
| 推理優化 | vLLM / 自研優化 | FlashAttention / vLLM | 自研 FireInfer 引擎 |
| Hugging Face 整合 | 原生支援 | 透過 API 整合 | 透過 API 整合 |
🛠️ 技術深入
- 推理引擎:DeepInfra 廣泛採用 vLLM 等高效能推理框架,支援 PagedAttention 技術以優化 KV 快取記憶體管理。
- 基礎設施:利用異構 GPU 叢集(包括 NVIDIA H100/A100),並透過自動化排程器實現毫秒級的冷啟動與動態擴展。
- API 相容性:提供與 OpenAI API 完全相容的介面,使開發者能無縫遷移現有應用程式。
- 部署架構:支援 Serverless 推理模式,透過負載平衡器將請求分發至最優化的 GPU 節點,確保高可用性。
🔮 前景展望AI analysis grounded in cited sources
Hugging Face 將進一步鞏固其作為開源 AI 推理中樞的地位。
透過將更多第三方推理提供者納入生態系,Hugging Face 降低了開發者在模型部署時的供應商鎖定風險。
Serverless 推理服務將成為開源模型商業化的主流模式。
DeepInfra 等服務商的整合顯示市場正從傳統的雲端虛擬機部署轉向更具成本效益的按量付費模式。
⏳ 時間線
2023-05
DeepInfra 正式推出其 Serverless 推理 API 服務。
2024-02
DeepInfra 宣布支援 Llama 2 及其他主流開源模型的快速部署。
2025-01
DeepInfra 完成基礎設施升級,全面支援 NVIDIA H100 叢集以加速推理。
2026-03
DeepInfra 正式整合進入 Hugging Face 推理提供者生態系。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗