🐯較早收集於 31m

Token 經濟學:AI 時代的貨幣戰爭

PostLinkedIn
🐯閱讀原文: 虎嗅

💡了解 AI 經濟學的轉變,Token 消耗已成為 Agent 運作的主要成本驅動力。

⚡ 30-Second TL;DR

有什麼變化

AI 競爭日益聚焦於 Token 消耗與營運成本。

為什麼重要

優化 Token 效率正成為 AI 新創與企業的關鍵競爭優勢。

下一步行動

審計您的 Agent 工作流以識別冗餘的 Token 調用,並評估針對特定任務切換至更高性價比的模型。

誰應關注:Founders & Product Leaders

關鍵要點

  • AI 競爭日益聚焦於 Token 消耗與營運成本。
  • 基於 Agent 的工作流導致 Token 用量激增,對基礎設施預算造成壓力。
  • 中國大模型憑藉高性價比在全球開發者社群中獲得關注。
  • 開發者生態系統中出現了「Token 套利」的新商業模式。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • Token消耗不僅是成本問題,也是效能問題,會影響推論速度和錯誤率,因為臃腫的上下文會減慢推論速度並增加錯誤率。
  • AI代理任務的成本遠高於簡單的程式碼推理或聊天,消耗的token量可能高出1000倍,其中輸入token是主要成本驅動因素。
  • 在2025年,中國開源模型在Hugging Face和OpenRouter等平台上的累計下載量超越美國開源模型,全球市佔率從13%增至30%,尤其在程式碼編寫和代理工作流程中表現突出。
  • AI優先的公司毛利率(50-60%)低於傳統SaaS(80-90%),僅推論成本就佔收入的約23%,這表明科技產業的利潤結構發生了結構性轉變。
  • 在固定效能水準下,AI推論的價格每年以5到10倍的速度快速下降,這歸因於經濟因素、硬體效率提升和演算法效率改進。
📊 競品分析▸ Show

主要大型語言模型API定價與效能比較 (截至2026年2月/5月)

模型提供商模型名稱 (最新版本)輸入Token價格 (每百萬)輸出Token價格 (每百萬)上下文視窗 (Tokens)備註
OpenAIGPT-5.2$1.75$14.00N/A旗艦模型,推理和代理任務效能卓越。
GPT-5.2 Pro$21.00$168.00N/A頂級效能,最高能力。
GPT-5 nano$0.05$0.4032K預算友好,價格與DeepSeek接近。
GoogleGemini 3.1 Pro$2.00$12.00N/A3.x世代,效能提升。
Gemini 3 Flash$0.50$3.00N/A成本效益高,速度快。
AnthropicClaude Opus 4.6$5.00$25.00N/A顯著降價。
Claude Haiku 4.5$1.00$5.00N/A成本優化模型。
xAIGrok 4$3.00$15.00N/A旗艦模型。
Grok 4 Fast$0.20$0.50N/A快速模式,價格低廉。
DeepSeek (中國)DeepSeek V3.2-Exp (Thinking)$0.28 (快取未命中) / $0.028 (快取命中)$0.42128K價格極具競爭力,2025年末價格減半。
DeepSeek-R1$0.55$2.19N/A效能接近GPT-4/o1,價格低10-30倍。
阿里巴巴 (中國)Qwen Turbo$0.05$0.20N/A價格極低。
月之暗面 (中國)Kimi K2-Thinking$0.60$2.50N/A價格低廉。

🛠️ 技術深入

  • Token化機制:大型語言模型將文本分解為稱為token的更小單元,這些單元不嚴格受語言邊界定義,可以是單個字符、單詞片段或整個單詞。不同的模型使用不同的token化器,導致相同文本的token計數不同。
  • 輸入與輸出Token成本差異:輸出token通常比輸入token貴2到5倍,因為它們需要自回歸生成,即模型必須一次預測一個token,並為每個輸出token執行完整的詞彙機率計算。
  • AI代理Token消耗激增的原因:常見的token膨脹來源包括冗長的JSON回應、龐大的工具Schema定義(即使代理不呼叫該工具,其Schema也會佔用大量token),以及盲目地重複發送整個對話歷史。
  • Token優化技術
    • 精簡系統提示:將指令轉換為規則和約束,而非冗長的自然語言描述。
    • 選擇性記憶:僅保留最近的對話輪次,並將較舊的上下文總結為緊湊的狀態,將事實與對話分開儲存。
    • 檢索增強生成 (RAG):使用檢索而非上下文填充,僅檢索相關的資訊塊並注入最少的證據,然後讓模型在此基礎上進行推理。
    • MCP優化:讓AI編寫程式碼來獲取和處理數據,僅返回摘要,而不是將所有數據流經模型的上下文視窗,可節省60-70%的token。
  • GPU記憶體瓶頸:Token成本成為AI專案成功與否的關鍵因素,尤其是在GPU計算中,提示預填充(prompt prefill)會造成最大的推論瓶頸。
  • 混合專家 (MoE) 架構:部分中國模型(如DeepSeek-V3、Kimi K2、Qwen)積極採用MoE架構,以較少的活躍參數實現高效能,有助於降低成本。

🔮 前景展望AI analysis grounded in cited sources

AI服務的定價模式將從固定月費轉向基於使用量、代理或成果的模式。
隨著AI成本結構的變化,提供商將需要更精確地反映實際的資源消耗和產出價值,以維持利潤,例如GitHub Copilot已轉向token使用量計費。
AI代理將從受監督的實習生演變為自主決策的員工。
隨著AI技術的進步和成本效率的提升,代理將能夠獨立執行更複雜的任務,減少人類監督的需求,從而實現更高的自動化水平。
中國AI模型將在全球南方市場建立主導地位,形成「數位絲綢之路」策略。
憑藉其高性價比和開源策略,中國模型正成為這些地區開發者的首選,可能導致西方閉源模型在這些市場中成為「遺留高級插件」。

時間線

2022-11
OpenAI推出ChatGPT,引發全球AI技術競賽。
2023
OpenAI將其GPT-3.5 Turbo模型的token價格減半,開啟AI模型價格戰。
2024-07
OpenAI推出GPT-4o mini,大幅降低每百萬輸入/輸出token的價格達60%。
2025-01
AI token消耗量在企業中顯著增長,自2025年1月以來,每家公司的AI token支出增長了13倍。
2025-11
DeepSeek將其模型價格減半,進一步推動AI成本快速下降的趨勢。
2026-04-27
GitHub Copilot宣布將從6月1日起採用基於token使用量的計費模式,標誌著AI服務定價模式的轉變。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅