🛡️較早收集於 3h

Cloudflare 內部 AI 堆疊處理 241B 令牌

Cloudflare 內部 AI 堆疊處理 241B 令牌
PostLinkedIn
🛡️閱讀原文: Cloudflare Blog

💡了解 Cloudflare 如何擴展內部 AI:Workers AI 處理 2410 億令牌。

⚡ 30-Second TL;DR

有什麼變化

AI Gateway 路由 20 百萬請求

為什麼重要

展現 Cloudflare AI 工具的生產級可靠性,為企業內部 AI 管道提供藍圖。

下一步行動

透過 Cloudflare AI Gateway 路由 AI 請求以實現可擴展推論。

誰應關注:Developers & AI Engineers

關鍵要點

  • AI Gateway 路由 20 百萬請求
  • 內部處理 2410 億令牌
  • Workers AI 服務超過 3,683 名內部用戶

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Cloudflare 的內部 AI 堆疊利用了 Workers AI 的無伺服器架構,實現了跨全球邊緣節點的低延遲模型推論,無需管理基礎設施。
  • AI Gateway 在處理 2000 萬次請求時,整合了快取(Caching)與速率限制(Rate Limiting)功能,顯著降低了對外部 LLM API 的依賴並節省了成本。
  • 該內部堆疊不僅用於單一任務,還支援了 Cloudflare 內部多種應用場景,包括自動化程式碼審查、安全威脅分析以及客戶支援自動化。
📊 競品分析▸ Show
特色/競爭對手Cloudflare Workers AIAWS BedrockGoogle Vertex AI
架構全球邊緣無伺服器 (Edge)區域性託管服務區域性託管服務
定價模式按執行時間與令牌計費按 API 呼叫與令牌計費按 API 呼叫與令牌計費
部署靈活性極高 (邊緣執行)中 (需選擇區域)中 (需選擇區域)
模型生態專注於開源模型混合 (專有+開源)混合 (專有+開源)

🛠️ 技術深入

  • 架構層級:利用 Cloudflare Workers 作為計算層,透過 Workers AI 介面直接呼叫部署在邊緣節點的 GPU 資源。
  • 路由機制:AI Gateway 作為中介層,實作了動態模型路由(Model Routing),可根據延遲或成本自動切換後端模型提供商。
  • 快取策略:採用語義快取(Semantic Caching),針對相似的提示詞(Prompt)直接回傳快取結果,大幅減少對 GPU 的推論需求。
  • 整合性:與 Cloudflare D1 資料庫及 R2 物件儲存深度整合,用於儲存向量嵌入(Vector Embeddings)與歷史對話記錄。

🔮 前景展望AI analysis grounded in cited sources

Cloudflare 將進一步推動邊緣 AI 推論的普及化。
透過降低邊緣部署的技術門檻,企業將更傾向於將敏感資料處理移至邊緣以提升隱私與效能。
AI Gateway 將成為企業管理多模型供應商的標準工具。
隨著企業採用多模型策略,集中化的路由與監控需求將使 AI Gateway 的市場地位更加穩固。

時間線

2023-09
Cloudflare 正式推出 Workers AI,允許開發者在邊緣執行 AI 模型。
2023-11
Cloudflare 推出 AI Gateway,旨在為 AI 應用提供快取、速率限制與分析功能。
2024-05
Workers AI 擴展支援更多開源模型,並強化了與 Vectorize 資料庫的整合。
2025-02
Cloudflare 宣布其內部 AI 堆疊已全面轉向使用自家產品進行大規模生產環境部署。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Cloudflare Blog