🐯較早收集於 21m

LLM中文Token稅:為何更貴

LLM中文Token稅:為何更貴
PostLinkedIn
🐯閱讀原文: 虎嗅

💡中文LLM省30-65%成本—選最佳分詞器建多語應用。(32字)

⚡ 30-Second TL;DR

有什麼變化

Claude/GPT:中文Token比英文多1.1-1.64倍;新聞最糟(64%多)。

為什麼重要

多語開發者在西方模型付「中文稅」;中文任務轉Qwen省成本。

下一步行動

在Qwen分詞器 vs GPT-4o測試提示,減中文Token成本30-50%。

誰應關注:Developers & AI Engineers

關鍵要點

  • Claude/GPT:中文Token比英文多1.1-1.64倍;新聞最糟(64%多)。
  • Qwen/DeepSeek:中文0.65-1倍英文,經漢字/詞分詞。
  • Claude 4.7新分詞:英文+24-63%,中文不變約1 Token/字。
  • 影響上下文窗:同Token中文塞40-70%少內容。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 多語言分詞器(Tokenizer)的訓練數據分佈偏差是導致中文Token膨脹的核心原因,西方模型在訓練時通常採用以英語為主的語料庫,導致其詞彙表(Vocabulary)中對中文字符的覆蓋率極低。
  • 除了Token數量差異,中文在LLM中的處理還面臨「語義密度」問題,即同樣的Token數量下,中文承載的資訊量通常高於英文,這使得中文用戶在使用按Token計費的API時,實際獲得的資訊處理效率更高。
  • 部分開源模型如Qwen系列採用了針對中文優化的Tiktoken分詞器,通過擴充詞彙表中的中文字符和常用詞組,顯著降低了中文文本的Token化長度,從而變相提升了上下文窗口的有效利用率。
📊 競品分析▸ Show
模型/廠商中文分詞效率詞彙表大小 (約略)針對性優化
GPT-4o (OpenAI)中等 (通用型)~100k基礎多語言支持
Claude 3.5/4.7 (Anthropic)中等 (通用型)~200k針對英文優化較多
Qwen 2.5 (阿里雲)高 (中文優化)~150k顯著擴充中文詞彙
DeepSeek-V3高 (中文優化)~128k針對中文語料深度訓練

🛠️ 技術深入

  • BPE (Byte Pair Encoding) 算法在處理非拉丁語系時,若詞彙表未包含足夠的中文字符,會將漢字拆解為多個UTF-8字節序列,導致Token數量激增。
  • Tiktoken 是 OpenAI 開發的高效分詞器,其核心在於預編譯的詞彙表映射,中文優化模型通常會通過在訓練階段加入大規模中文語料,強制將高頻中文詞組納入詞彙表。
  • 上下文窗口(Context Window)的限制不僅取決於物理Token上限,還受限於模型在長文本下的注意力機制(Attention Mechanism)衰減,中文Token化效率的提升直接減少了注意力矩陣的計算負擔。

🔮 前景展望AI analysis grounded in cited sources

未來LLM API計費模式將從Token-based轉向Character-based或Semantic-based。
隨著多語言模型普及,基於Token的計費對非英語用戶不公平,市場競爭將迫使廠商提供更透明的計費標準。
中文原生分詞器將成為國產大模型與國際模型競爭的標配技術門檻。
分詞效率直接影響推理成本與上下文容量,是決定模型在中文市場商業化落地能力的關鍵技術指標。

時間線

2023-03
OpenAI 發布 GPT-4,其分詞器(cl100k_base)對中文的處理效率仍顯著低於英文。
2024-02
Qwen 系列模型發布,強調針對中文語料進行了分詞器詞彙表的深度優化。
2025-06
DeepSeek 發布 V3 版本,進一步優化了中文處理的Token密度,提升了長文本處理能力。
2026-03
Anthropic 發布 Claude 4.7,更新了分詞器機制,主要針對英文進行了擴展,引發關於中文Token成本的討論。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅