🐯虎嗅•較早收集於 21m
LLM中文Token稅:為何更貴

💡中文LLM省30-65%成本—選最佳分詞器建多語應用。(32字)
⚡ 30-Second TL;DR
有什麼變化
Claude/GPT:中文Token比英文多1.1-1.64倍;新聞最糟(64%多)。
為什麼重要
多語開發者在西方模型付「中文稅」;中文任務轉Qwen省成本。
下一步行動
在Qwen分詞器 vs GPT-4o測試提示,減中文Token成本30-50%。
誰應關注:Developers & AI Engineers
關鍵要點
- •Claude/GPT:中文Token比英文多1.1-1.64倍;新聞最糟(64%多)。
- •Qwen/DeepSeek:中文0.65-1倍英文,經漢字/詞分詞。
- •Claude 4.7新分詞:英文+24-63%,中文不變約1 Token/字。
- •影響上下文窗:同Token中文塞40-70%少內容。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •多語言分詞器(Tokenizer)的訓練數據分佈偏差是導致中文Token膨脹的核心原因,西方模型在訓練時通常採用以英語為主的語料庫,導致其詞彙表(Vocabulary)中對中文字符的覆蓋率極低。
- •除了Token數量差異,中文在LLM中的處理還面臨「語義密度」問題,即同樣的Token數量下,中文承載的資訊量通常高於英文,這使得中文用戶在使用按Token計費的API時,實際獲得的資訊處理效率更高。
- •部分開源模型如Qwen系列採用了針對中文優化的Tiktoken分詞器,通過擴充詞彙表中的中文字符和常用詞組,顯著降低了中文文本的Token化長度,從而變相提升了上下文窗口的有效利用率。
📊 競品分析▸ Show
| 模型/廠商 | 中文分詞效率 | 詞彙表大小 (約略) | 針對性優化 |
|---|---|---|---|
| GPT-4o (OpenAI) | 中等 (通用型) | ~100k | 基礎多語言支持 |
| Claude 3.5/4.7 (Anthropic) | 中等 (通用型) | ~200k | 針對英文優化較多 |
| Qwen 2.5 (阿里雲) | 高 (中文優化) | ~150k | 顯著擴充中文詞彙 |
| DeepSeek-V3 | 高 (中文優化) | ~128k | 針對中文語料深度訓練 |
🛠️ 技術深入
- •BPE (Byte Pair Encoding) 算法在處理非拉丁語系時,若詞彙表未包含足夠的中文字符,會將漢字拆解為多個UTF-8字節序列,導致Token數量激增。
- •Tiktoken 是 OpenAI 開發的高效分詞器,其核心在於預編譯的詞彙表映射,中文優化模型通常會通過在訓練階段加入大規模中文語料,強制將高頻中文詞組納入詞彙表。
- •上下文窗口(Context Window)的限制不僅取決於物理Token上限,還受限於模型在長文本下的注意力機制(Attention Mechanism)衰減,中文Token化效率的提升直接減少了注意力矩陣的計算負擔。
🔮 前景展望AI analysis grounded in cited sources
未來LLM API計費模式將從Token-based轉向Character-based或Semantic-based。
隨著多語言模型普及,基於Token的計費對非英語用戶不公平,市場競爭將迫使廠商提供更透明的計費標準。
中文原生分詞器將成為國產大模型與國際模型競爭的標配技術門檻。
分詞效率直接影響推理成本與上下文容量,是決定模型在中文市場商業化落地能力的關鍵技術指標。
⏳ 時間線
2023-03
OpenAI 發布 GPT-4,其分詞器(cl100k_base)對中文的處理效率仍顯著低於英文。
2024-02
Qwen 系列模型發布,強調針對中文語料進行了分詞器詞彙表的深度優化。
2025-06
DeepSeek 發布 V3 版本,進一步優化了中文處理的Token密度,提升了長文本處理能力。
2026-03
Anthropic 發布 Claude 4.7,更新了分詞器機制,主要針對英文進行了擴展,引發關於中文Token成本的討論。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



