較早收集於 21h

AI Gateway 新增依成本、延遲或吞吐量排序供應商功能

AI Gateway 新增依成本、延遲或吞吐量排序供應商功能
PostLinkedIn
閱讀原文: Vercel News

💡無需手動介入或修改程式碼,即可自動將 AI 流量導向成本最低或速度最快的供應商。

⚡ 30-Second TL;DR

有什麼變化

支援依成本、TTFT 或 TPS 動態排序供應商

為什麼重要

此功能讓團隊能透過自動將流量導向最符合需求的供應商,建構更具彈性且具成本效益的 AI 應用程式。

下一步行動

在您的 AI Gateway 供應商選項中設定 'sort' 參數,以針對延遲或成本優化您的 LLM 呼叫。

誰應關注:Developers & AI Engineers

關鍵要點

  • 支援依成本、TTFT 或 TPS 動態排序供應商
  • 請求時自動更新排名,無需修改程式碼
  • 可與零資料保留 (ZDR) 及自訂順序等路由控制功能並用

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Vercel AI Gateway 提供統一的 API 端點,可存取來自 OpenAI、Anthropic、Google 等多個供應商的數百種模型,從而簡化了 AI 模型的整合與管理。
  • 該服務內建自動故障轉移、負載平衡、速率限制以及跨供應商的詳細可觀察性(成本、代幣使用量、延遲),顯著提升了 AI 應用程式的可靠性和營運洞察力。
  • Vercel AI Gateway 預設支援零資料保留 (ZDR),並提供團隊級或按請求執行的選項,確保敏感資料在處理後立即刪除,且不被用於模型訓練,目前已涵蓋 Anthropic、OpenAI 和 Google 等供應商。
  • Vercel AI Gateway 採用按用量付費模式,對代幣價格不加價,即使使用自帶金鑰 (BYOK) 也是如此;然而,團隊級 ZDR 會產生少量費用,且購買點數時可能會有支付處理費。
  • 動態排序功能利用每小時更新的即時效能指標(P50 首字延遲和吞吐量),這些指標來自 AI Gateway 的客戶請求,並可透過 REST API 和儀表板存取,以實現更明智的模型選擇。
📊 競品分析▸ Show
特性/供應商Vercel AI GatewayOpenRouterCloudflare AI GatewayHigress (阿里巴巴雲)
定位輕量級、託管式、前端開發者友好,專注於 Vercel 生態系統內的低延遲路由和開發者體驗統一介面,強調模型發現、價格透明度和多模型實驗邊緣導向的可觀察性與控制層,專注於分析、日誌、快取、速率限制開源、基於 Envoy/Istio,專為 LLM/MCP 場景設計,提供企業級流量治理和私有部署
主要功能統一 API、自動故障轉移、負載平衡、ZDR、動態排序(成本/延遲/吞吐量)、與 AI SDK 深度整合統一 API 存取 300+ 模型、價格透明、模型切換、ZDR 無額外費用全球邊緣快取、統一計費、動態路由、閘道級重試、日誌和分析多模型切換與回退、基於代幣的限流、請求級監控與審計、API 金鑰隔離
定價模式按用量付費,代幣無加價 (BYOK 亦同),團隊級 ZDR 額外收費 (每千次請求 $0.10),信用卡處理費靈活定價,強調供應商價格透明,ZDR 無額外費用整合計費,將第三方模型費用整合到 Cloudflare 帳單,免費層有日誌限制開源免費,但需自行部署和維護,初期投資較高,後期成本壓縮潛力大
效能/基準低於 20 毫秒的穩定請求路由延遲未明確提供具體基準,但強調模型聚合和快速實驗透過全球邊緣快取可將延遲降低高達 90%針對企業級流量治理和監控設計,強調「可控、可觀察、安全」

🛠️ 技術深入

  • 統一 API 介面: 提供單一 API 端點,抽象化不同供應商的 API 差異,以存取數百種 AI 模型。
  • 與 AI SDK 整合: 基於 AI SDK v5 和 v6 建構,支援工具呼叫、函數參數、串流、重試、附件和結構化輸出等功能。
  • 動態路由邏輯: 預設根據近期正常運行時間和延遲動態選擇供應商。新功能允許透過 providerOptions.gateway.sort 參數,根據 cost(成本)、ttft(首字延遲)或 tps(每秒代幣數)明確排序供應商。同時支援 order(指定順序)和 only(白名單)選項。
  • 故障轉移機制: 當某個模型供應商發生故障或效能下降時,自動將請求重試轉發至其他可用供應商,確保高可靠性。
  • 可觀察性: 提供詳細的日誌、效能指標(P50/P95 延遲、吞吐量)和每個請求的成本追蹤,可透過儀表板和 REST API 存取。
  • 零資料保留 (ZDR): 透過僅將請求路由至與 Vercel 簽訂 ZDR 協議的供應商來強制執行。可配置為團隊級或按請求執行。如果沒有符合 ZDR 的路由,請求將會出錯,以確保資料政策的遵守。
  • 邊緣網路: 利用 Vercel 的邊緣網路實現低於 20 毫秒的路由延遲。
  • 部署模型: 主要作為 Vercel 基礎設施上的託管無伺服器 API 運行;目前沒有官方支援的 Docker/Kubernetes 自託管發行版。
  • 無 GPU 託管: 不支援原生 GPU 託管;繁重的模型推論必須在 Vercel 平台之外運行。

🔮 前景展望AI analysis grounded in cited sources

多模型策略的採用將會增加。
動態切換供應商的便利性將鼓勵開發者針對特定任務利用最佳模型,而非受限於單一模型。
AI 應用程式的成本和效能最佳化將得到顯著提升。
基於即時指標的自動路由將帶來更高效的 AI 應用程式操作,並可能降低整體推論成本。
AI 閘道功能將成為 AI 基礎設施的標準期望。
隨著 AI 應用程式的成熟,動態路由、ZDR 和統一可觀察性等功能將成為 AI 基礎設施的標準要求。

時間線

2025-05
Vercel AI Gateway 啟動 Alpha 測試
2025-08
Vercel AI Gateway 正式發布 (GA)
2026-01
Vercel AI Gateway 推出即時模型效能指標
2026-02
Vercel AI Gateway 公布定價細節並支援 GPT 5.3 Codex
2026-03
Vercel AI Gateway 詳述供應商篩選、排序和排序選項
2026-04
Vercel AI Gateway 擴展 ZDR 支援範圍並提供 GPT 5.5 Pro
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Vercel News