🗾ITmedia AI+ (日本)•較早收集於 81m
Google 為 Gemini API 新增 Flex 與 Priority 服務層級

💡將非關鍵工作負載切換至全新的 Flex 層級,即可節省 50% 的 Gemini API 使用成本。
⚡ 30-Second TL;DR
有什麼變化
Flex 層級提供較標準定價便宜 50% 的成本優勢
為什麼重要
此定價更新讓開發者能針對非延遲敏感型任務優化營運成本,同時維持對 Google 頂級模型的存取權。
下一步行動
審視您目前的 Gemini API 使用模式,並將非關鍵的背景任務遷移至 Flex 層級,以降低每月雲端支出。
誰應關注:Developers & AI Engineers
關鍵要點
- •Flex 層級提供較標準定價便宜 50% 的成本優勢
- •同步推出 Priority 層級以滿足高效能需求
- •開發者需評估工作負載需求,以選擇最適合的服務層級
🧠 深度解析
Web-grounded analysis with 13 cited sources.
🔑 增強重點摘要
- •Flex 與 Priority 服務層級透過單一同步介面運作,開發者可透過 API 請求中的
service_tier參數來設定優先級,從而簡化代理系統的架構。 - •Flex 推理服務專為不需即時回應的後台任務設計,以降低可靠性和增加延遲為代價,實現成本節約,適用於背景 CRM 更新或大規模研究模擬等場景。
- •Priority 推理服務的定價比標準費率高出 75% 至 100%,旨在為客戶服務機器人、即時詐欺偵測等關鍵應用提供毫秒級至秒級的快速回應時間。
- •除了 Flex 和 Priority,Google 還推出了「Batch」(非緊急工作負載可享 50% 折扣,延遲時間最長 24 小時)和「Cache」(根據令牌計數和儲存持續時間計費,適用於高頻率、複雜指令)等服務層級。
- •這些新的服務層級旨在解決企業在從簡單的 AI 聊天機器人轉向複雜、多步驟的代理工作流程時,對 AI 推理成本和可靠性日益增長的管理需求。
📊 競品分析▸ Show
| 提供者 | 模型 (代表性) | 輸入 (每百萬令牌) | 輸出 (每百萬令牌) | 主要特點 |
|---|---|---|---|---|
| Google Gemini | Gemini 3.1 Pro | $2.00 (≤200K 上下文) / $4.00 (>200K 上下文) | $12.00 (≤200K 上下文) / $18.00 (>200K 上下文) | 多模態、長上下文視窗、代理工作流程。Flex 層級提供 50% 折扣,Priority 層級價格高 75%-100%。 |
| Gemini 3 Flash | $0.50 | $3.00 | 速度快、成本效益高,適用於通用應用和聊天機器人。 | |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 極致成本效益,適用於高吞吐量、簡單任務。 | |
| OpenAI | GPT-5.4 | $2.50 | $15.00 | 通用目的,針對超過 272K 上下文有分級定價。 |
| GPT-5 Mini | $0.25 | $2.00 | 預算選項,適用於較簡單任務。 | |
| Anthropic | Claude Opus 4.6 | $5.00 | $25.00 | 旗艦推理模型,適用於複雜推理和代理任務。 |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 成本/性能平衡點。 | |
| Claude Haiku 4.5 | $1.00 | $5.00 | 適用於高吞吐量任務。 |
🛠️ 技術深入
- Gemini 3 採用全模態 Transformer 架構,從頭開始同時訓練多種模態,實現對文本、程式碼、圖像和影片的統一理解。
- Gemini 3 引入了專門的「推理令牌」(Reasoning Tokens)和優化的上下文快取機制,以降低大規模應用中的延遲。
- Gemini 3 中的高保真時間編碼將影片視為連續的令牌流,使其不僅能理解畫面中的「內容」,還能理解動作背後的「意圖」。
- Gemini API 提供多種主要端點,包括 Interactions API(推薦用於代理工作流程和多輪對話)、Standard content generation(
generateContent用於非互動任務)、Streaming content generation(streamGenerateContent用於聊天機器人)和 Live API(BidiGenerateContent用於即時對話場景)。 - Flex 和 Priority 層級透過單一同步介面運作,開發者可透過 API 請求中的
service_tier參數來設定優先級,以適應不同的工作負載需求。 - Gemini 模型原生支援多模態,能夠理解文本、程式碼、音訊、圖像和影片。
- Gemini Pro 模型的上下文視窗大小通常比同等價位的競爭對手更大,例如 Gemini 3.1 Pro 支援 1M 令牌上下文視窗,而 Gemini 3 Pro 支援 2M 令牌。
🔮 前景展望AI analysis grounded in cited sources
Google 將在企業 AI 推理市場中獲得更大的市佔率。
Flex、Priority、Batch 和 Cache 等細粒度服務層級的推出,直接滿足了企業對跨多樣 AI 工作負載的成本控制和可靠性需求,使 Gemini 對於複雜的代理系統更具吸引力。
AI 推理成本持續下降的趨勢將因競爭而加劇。
Google 積極的定價策略(例如 Flash-Lite 的低價、Flex/Batch 的 50% 折扣)以及與 OpenAI 和 Anthropic 的整體競爭格局,預示著基礎推理成本將持續走低。
開發者將越來越多地採用代理架構來構建 AI 應用程式。
新的服務層級,特別是 Flex 和 Priority,明確旨在透過提供統一介面來管理不同延遲和成本要求,從而簡化多步驟代理工作流程的開發。
⏳ 時間線
2023-12-06
Google 宣布推出 Gemini 模型
2023-12-13
開發者可透過 Gemini API 存取 Gemini Pro
2025-11-18
推出首個 Gemini 3 系列模型 `gemini-3-pro-preview`
2026-03-23
Gemini API 和 AI Studio 的預付和後付計費方案生效
2026-04-03
Google 推出 Gemini API 的分層定價策略,包括 Flex 和 Priority 等服務層級
2026-05-19
Gemini 3.5 Flash 全面上市 (GA) 並推出 Managed Agents API 公開預覽版
📎 來源 (13)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗
