較早收集於 41h

Vercel AI Gateway:生產環境數據揭示模型使用趨勢

Vercel AI Gateway:生產環境數據揭示模型使用趨勢
PostLinkedIn
閱讀原文: Vercel News

💡看看 20 萬個團隊如何分配 AI 預算:Anthropic 用於推理,Google 用於流量。立即優化您的技術棧。

⚡ 30-Second TL;DR

有什麼變化

Anthropic 在高風險、重推理的工作負載中佔據主導地位,佔據了 61% 的支出。

為什麼重要

這些數據透過將特定模型能力與應用架構的成本敏感度及風險狀況對齊,協助開發者優化模型選擇策略。

下一步行動

審查您目前的 AI 模型路由策略,確保在高流量、低風險的任務中使用高性價比模型,並僅在關鍵工作負載中使用頂級推理模型。

誰應關注:Developers & AI Engineers

關鍵要點

  • Anthropic 在高風險、重推理的工作負載中佔據主導地位,佔據了 61% 的支出。
  • Google 的 Gemini Flash 因在消費級應用中的高效能,在 Token 使用量上領先(38%)。
  • 由於對推理品質的要求較高,B2B 應用的單位 Token 成本約為 B2C 應用的兩倍。
  • 市場出現明顯分歧:支出集中於高風險、低流量的調用,而流量則集中於低風險、快速的調用。

🧠 深度解析

Web-grounded analysis with 21 cited sources.

🔑 增強重點摘要

  • Vercel AI Gateway 提供單一 API 端點,可存取數百種 AI 模型,透過抽象化 API 金鑰、速率限制和供應商帳戶,簡化開發人員的整合與管理流程。
  • 該閘道提供自動故障轉移機制,可在模型供應商停機時自動將請求重新導向至可用的替代方案,確保 AI 應用程式的高可靠性和持續運作時間。
  • Vercel AI Gateway 支援「自帶金鑰」(BYOK)身份驗證,允許開發人員使用其自身的供應商 API 金鑰,且 Vercel 不會對 Token 使用量收取額外費用。
  • Vercel AI Gateway 建立在 Vercel 的 Fluid 運算平台上,透過「活躍 CPU 定價」優化成本,僅在 CPU 實際運行時收取費用,而非等待 AI 供應商回應的閒置時間。
  • 平台內建全面的可觀測性功能,包括詳細的日誌、效能指標和按請求、模型、供應商甚至自訂標籤進行的成本追蹤,實現精細的支出監控和除錯。
📊 競品分析▸ Show
特性/產品Vercel AI GatewayOpenRouterPortkeyLiteLLMCloudflare AI Gateway
主要用途簡化 Vercel 生態系統內的多模型整合、可靠性與可觀測性。統一介面存取多種模型,強調模型探索與定價透明度。生產級系統,提供可靠性、可觀測性、守護機制。開源 LLM 代理,將 OpenAI API 呼叫轉換為多個供應商。邊緣網路上的託管服務,提供快取、速率限制、日誌記錄。
模型支援數百種模型 (文字、圖像、影片),與 AI SDK 深度整合。300+ 模型,來自 60+ 供應商。200+ LLM。100+ LLM 供應商。支援多種模型。
定價模式按量付費,無 Token 加價,支援 BYOK,提供免費額度。統一介面,強調供應商定價透明。未明確說明,但提供成本追蹤。開源,自託管成本。託管服務,提供免費層級。
可靠性自動故障轉移、高吞吐量、低延遲 (<20ms)。提供模型回退策略。自動重試、回退、負載平衡、快取。提供標準化介面以提高穩定性。自動重試、邊緣快取。
可觀測性詳細日誌、效能指標、成本追蹤、自訂報告。記錄基本請求元數據,可選擇是否記錄提示/完成。詳細請求日誌、成本追蹤、效能分析。提供日誌記錄功能。請求日誌、基本分析。
部署方式託管服務,優化 Vercel 託管應用程式。託管服務。託管服務 + 開源。開源,可自託管。託管服務。

🛠️ 技術深入

  • Vercel AI Gateway 作為一個 Node.js 服務運行,部署在 Vercel 平台上,並利用 Next.js 框架。
  • 它提供單一 API 端點,用於存取來自 OpenAI、Anthropic、Google 等多個供應商的數百種大型語言模型及生成模型。
  • 請求路由延遲低於 20 毫秒,旨在確保推理時間的穩定性,無論底層供應商如何。
  • 內建自動故障轉移機制,當一個模型供應商遇到停機時,閘道會自動將請求重新導向至可用的替代方案。
  • 支援高請求吞吐量,並設有速率限制以滿足生產級流量需求。
  • 利用 Vercel 的 Fluid 運算平台,透過「活躍 CPU 定價」模型優化成本,僅在 CPU 實際處理請求時計費,而非等待 AI 供應商回應的閒置時間。
  • 使用 Redis 進行全球一致性和配額追蹤,並結合暫時性記憶體快取以提高本地速度,將頻繁存取的憑證和元數據儲存在實例記憶體中。
  • 與 Vercel AI SDK (v5 和 v6) 以及 OpenAI 相容的端點無縫整合。
  • 預設採用零數據保留 (ZDR) 策略,在請求完成後永久刪除提示和回應,並提供團隊範圍的 ZDR 選項。
  • 支援多模態功能,包括文字生成、圖像生成、影片生成、網路搜尋、嵌入和重新排名。

🔮 前景展望AI analysis grounded in cited sources

AI 閘道解決方案將成為生產級 AI 應用程式的標準基礎設施。
管理多個快速發展的 AI 模型、確保可靠性並優化成本的複雜性,使得 AI 閘道等抽象層成為必要。
AI 閘道服務市場將出現更專業化和功能差異化。
從競爭對手的情況來看,閘道正在從簡單的代理工具演變為提供高級路由、A/B 測試以及與特定生態系統或用例深度整合的基礎設施。
成本優化和透明計費將仍然是 AI 閘道供應商的關鍵競爭差異化因素。
隨著企業 LLM API 支出激增,開發人員優先選擇提供無加價、BYOK 和精細成本追蹤的解決方案,以管理不斷上升的推理成本。

時間線

2025-05
Vercel AI Gateway 宣布進入 Alpha 測試階段,提供約 100 種 AI 模型的統一存取。
2025-08
Vercel AI Gateway 正式全面上市 (GA),提供單一統一 API 存取數百種 AI 模型,並具備透明定價和內建可觀測性。
2025-09
InfoQ 報導 Vercel 已為生產工作負載推出 AI Gateway,強調其簡化整合和管理的能力。
2025-11
Vercel 詳細說明 AI Gateway 如何在其 Fluid 運算平台上運行,強調其成本效益和擴展性。
2026-02
Vercel 更新 AI Gateway 的定價細節,確認按量付費模式、無加價和免費層級,並提供可觀測性功能更新。
2026-03
AI Gateway 的自訂報告 API 推出 Beta 版,適用於 Pro 和 Enterprise 方案,提供程式化存取成本、Token 使用量和請求量數據。
2026-04
Vercel AI Gateway 文件更新,強調其推理、圖像生成、影片生成和零數據保留等功能。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Vercel News