
每分鐘語音代理背後的真實成本
文章指出,語音代理標示的每分鐘價格並不能反映完整的生產成本。更實際的計算必須納入語音辨識、文字轉語音、模型用量、電信服務與基礎設施等支出。
Tag: #inference-costs50 results

文章指出,語音代理標示的每分鐘價格並不能反映完整的生產成本。更實際的計算必須納入語音辨識、文字轉語音、模型用量、電信服務與基礎設施等支出。

Gartner 預測,到 2030 年 LLM token 成本可能下降 95%,但 Agent 工作流程的推理成本可能在兩年內增加五倍以上。更複雜的推理、結果驗證、多模態輸入,以及 Agent 之間的協作,正推高日益嚴重的推理成本。

中國頭部模型供應商正圍繞以 Token 計價的 AI 服務,進入更精細化的價格戰。競爭焦點可能逐漸轉向定價權與差異化成本結構。
某開源模型在三個月前永久降價 75%,如今卻再次上漲 350%。文章將這次反轉主要歸因於需求爆發,並探討這是否代表商業模式難以支撐,或是市場走向更健康的訊號。

Writer 推出旗艦模型 Palmyra X6,以及旨在降低 AI Agent Token 用量的升級版「harness」。該模型是 Z.ai 開源 GLM-5.2 的後訓練變體,現已提供給 Writer 客戶使用。

Google 推出 Gemini 3.7 Flash,定位為更強大的工作型模型,主攻程式開發、代理工作流程與知識工作。在 2026 年底前,其 API 每百萬輸入 token 收費 0.75 美元、輸出 token 收費 3.75 美元,2027 年起價格將翻倍。
DeepSeek 大幅提高旗艦 V4 模型的價格,削弱了其過去的重要成本優勢。新價格使 DeepSeek 更接近主要 AI 競爭對手的收費水準。

NVIDIA NeMo Switchyard 用於在具備不同能力、成本與效能特性的模型之間路由 AI Agent 工作負載。它支援在分類與推理等步驟使用專門模型,並將例行後續任務交給較小的模型,避免所有請求都傳送給最大模型。

DeepSeek 宣布計畫在近期大幅提高 API 服務價格。這項公告正值其低成本 AI 模型全球需求激增之際,但具體價格細節尚未公布。
DeepSeek 計畫大幅提高旗下 AI 服務的價格。這項舉措在中國科技產業中相當罕見,可能改變其激進定價對美國競爭對手造成壓力的市場格局。