🗾較早收集於 81m

Google 為 Gemini API 新增 Flex 與 Priority 服務層級

Google 為 Gemini API 新增 Flex 與 Priority 服務層級
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)

💡將非關鍵工作負載切換至全新的 Flex 層級,即可節省 50% 的 Gemini API 使用成本。

⚡ 30-Second TL;DR

有什麼變化

Flex 層級提供較標準定價便宜 50% 的成本優勢

為什麼重要

此定價更新讓開發者能針對非延遲敏感型任務優化營運成本,同時維持對 Google 頂級模型的存取權。

下一步行動

審視您目前的 Gemini API 使用模式,並將非關鍵的背景任務遷移至 Flex 層級,以降低每月雲端支出。

誰應關注:Developers & AI Engineers

關鍵要點

  • Flex 層級提供較標準定價便宜 50% 的成本優勢
  • 同步推出 Priority 層級以滿足高效能需求
  • 開發者需評估工作負載需求,以選擇最適合的服務層級

🧠 深度解析

Web-grounded analysis with 13 cited sources.

🔑 增強重點摘要

  • Flex 與 Priority 服務層級透過單一同步介面運作,開發者可透過 API 請求中的 service_tier 參數來設定優先級,從而簡化代理系統的架構。
  • Flex 推理服務專為不需即時回應的後台任務設計,以降低可靠性和增加延遲為代價,實現成本節約,適用於背景 CRM 更新或大規模研究模擬等場景。
  • Priority 推理服務的定價比標準費率高出 75% 至 100%,旨在為客戶服務機器人、即時詐欺偵測等關鍵應用提供毫秒級至秒級的快速回應時間。
  • 除了 Flex 和 Priority,Google 還推出了「Batch」(非緊急工作負載可享 50% 折扣,延遲時間最長 24 小時)和「Cache」(根據令牌計數和儲存持續時間計費,適用於高頻率、複雜指令)等服務層級。
  • 這些新的服務層級旨在解決企業在從簡單的 AI 聊天機器人轉向複雜、多步驟的代理工作流程時,對 AI 推理成本和可靠性日益增長的管理需求。
📊 競品分析▸ Show
提供者模型 (代表性)輸入 (每百萬令牌)輸出 (每百萬令牌)主要特點
Google GeminiGemini 3.1 Pro$2.00 (≤200K 上下文) / $4.00 (>200K 上下文)$12.00 (≤200K 上下文) / $18.00 (>200K 上下文)多模態、長上下文視窗、代理工作流程。Flex 層級提供 50% 折扣,Priority 層級價格高 75%-100%。
Gemini 3 Flash$0.50$3.00速度快、成本效益高,適用於通用應用和聊天機器人。
Gemini 2.5 Flash-Lite$0.10$0.40極致成本效益,適用於高吞吐量、簡單任務。
OpenAIGPT-5.4$2.50$15.00通用目的,針對超過 272K 上下文有分級定價。
GPT-5 Mini$0.25$2.00預算選項,適用於較簡單任務。
AnthropicClaude Opus 4.6$5.00$25.00旗艦推理模型,適用於複雜推理和代理任務。
Claude Sonnet 4.6$3.00$15.00成本/性能平衡點。
Claude Haiku 4.5$1.00$5.00適用於高吞吐量任務。

🛠️ 技術深入

  • Gemini 3 採用全模態 Transformer 架構,從頭開始同時訓練多種模態,實現對文本、程式碼、圖像和影片的統一理解。
  • Gemini 3 引入了專門的「推理令牌」(Reasoning Tokens)和優化的上下文快取機制,以降低大規模應用中的延遲。
  • Gemini 3 中的高保真時間編碼將影片視為連續的令牌流,使其不僅能理解畫面中的「內容」,還能理解動作背後的「意圖」。
  • Gemini API 提供多種主要端點,包括 Interactions API(推薦用於代理工作流程和多輪對話)、Standard content generation(generateContent 用於非互動任務)、Streaming content generation(streamGenerateContent 用於聊天機器人)和 Live API(BidiGenerateContent 用於即時對話場景)。
  • Flex 和 Priority 層級透過單一同步介面運作,開發者可透過 API 請求中的 service_tier 參數來設定優先級,以適應不同的工作負載需求。
  • Gemini 模型原生支援多模態,能夠理解文本、程式碼、音訊、圖像和影片。
  • Gemini Pro 模型的上下文視窗大小通常比同等價位的競爭對手更大,例如 Gemini 3.1 Pro 支援 1M 令牌上下文視窗,而 Gemini 3 Pro 支援 2M 令牌。

🔮 前景展望AI analysis grounded in cited sources

Google 將在企業 AI 推理市場中獲得更大的市佔率。
Flex、Priority、Batch 和 Cache 等細粒度服務層級的推出,直接滿足了企業對跨多樣 AI 工作負載的成本控制和可靠性需求,使 Gemini 對於複雜的代理系統更具吸引力。
AI 推理成本持續下降的趨勢將因競爭而加劇。
Google 積極的定價策略(例如 Flash-Lite 的低價、Flex/Batch 的 50% 折扣)以及與 OpenAI 和 Anthropic 的整體競爭格局,預示著基礎推理成本將持續走低。
開發者將越來越多地採用代理架構來構建 AI 應用程式。
新的服務層級,特別是 Flex 和 Priority,明確旨在透過提供統一介面來管理不同延遲和成本要求,從而簡化多步驟代理工作流程的開發。

時間線

2023-12-06
Google 宣布推出 Gemini 模型
2023-12-13
開發者可透過 Gemini API 存取 Gemini Pro
2025-11-18
推出首個 Gemini 3 系列模型 `gemini-3-pro-preview`
2026-03-23
Gemini API 和 AI Studio 的預付和後付計費方案生效
2026-04-03
Google 推出 Gemini API 的分層定價策略,包括 Flex 和 Priority 等服務層級
2026-05-19
Gemini 3.5 Flash 全面上市 (GA) 並推出 Managed Agents API 公開預覽版

📎 來源 (13)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. infoworld.com
  2. kucoin.com
  3. phemex.com
  4. seekingalpha.com
  5. metacto.com
  6. github.io
  7. nicolalazzari.ai
  8. cloudidr.com
  9. dev.to
  10. google.dev
  11. laozhang.ai
  12. findskill.ai
  13. intuitionlabs.ai
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)