⚛️較早收集於 57m

數據品質是降低 Token 成本的關鍵

數據品質是降低 Token 成本的關鍵
PostLinkedIn
⚛️閱讀原文: 量子位

💡關於透過專注數據品質而非僅僅模型規模來降低 LLM 成本的專家見解。

⚡ 30-Second TL;DR

有什麼變化

高 Token 消耗與數據品質不佳有關(垃圾進,垃圾出)

為什麼重要

開發者透過實施更嚴格的數據過濾與清洗策略,可降低營運成本並提升模型效能。

下一步行動

審查您的訓練數據集是否存在雜訊與冗餘,以優化 LLM 的 Token 使用效率。

誰應關注:Developers & AI Engineers

關鍵要點

  • 高 Token 消耗與數據品質不佳有關(垃圾進,垃圾出)
  • 提倡在模型訓練前優化數據管線
  • 聚焦世界模型向多智能體模擬的演進

🧠 深度解析

Web-grounded analysis with 26 cited sources.

🔑 增強重點摘要

  • 高品質數據,即使數量較少,也能顯著提升大型語言模型(LLM)在對齊(如監督式微調SFT和人類回饋強化學習RLHF)和泛化能力方面的表現,從而降低對海量數據集的需求及預訓練成本。
  • 除了數據品質,降低Token成本的實用方法還包括精確簡潔的提示詞工程、優化系統提示詞、採用結構化輸出、對重複請求實施快取機制,以及使用能區分用戶陳述和查詢請求的記憶高效算法。
  • 從單智能體世界模型過渡到多智能體世界模型面臨嚴峻的架構挑戰,例如需要維持多個智能體之間的時間、跨視角和交互一致性,並避免身份編碼破壞對稱性以及全連接注意力導致的可擴展性瓶頸。
  • 亞馬遜近期廢除了其內部AI排行榜「Kirorank」,原因是員工為達成關鍵績效指標(KPI)而進行「Token灌水」(人為誇大AI Token使用量),導致運算成本增加並降低效率,這凸顯了企業在AI治理和價值導向指標方面的挑戰。
📊 競品分析▸ Show
公司/模型特性/策略輸入Token成本 (每百萬)輸出Token成本 (每百萬)
亞馬遜強調數據品質優化、數據管線優化、AI治理以降低Token成本。N/A (文章未提供具體模型定價,但強調成本控制)N/A
DeepSeek V4-Pro價格大幅調降,鍵值快取(KV cache)優化,推理成本顯著降低。$0.12 (調降後)$0.87 (調降後)
小米 MiMo-V2.5-Pro價格最高調降99%,記憶容量提升5倍,儲存與處理成本降低約80%。$0.0036 (快取輸入)N/A (文章未提供具體輸出定價)
OpenAI GPT-5.5價格上漲,但文章未提及具體數據品質或Token優化策略。N/A (文章未提供具體輸入定價)$30 (輸出價格翻倍)
Anthropic Claude Opus 4.7較高定價,更新的tokenizer可能導致實際成本增加。$5$25
Google Gemini 2.5 Pro提供具體定價。$1.25$10
通用優化策略上下文快取(Gemini, DeepSeek, Claude等支援)、提示詞壓縮、模型分級路由、流式輸出、請求快取。降低50%~90% (上下文快取)降低50%~90% (上下文快取)

🛠️ 技術深入

  • 數據品質對預訓練的影響:大型語言模型的預訓練是計算成本最高的步驟,其性能與訓練數據的規模、質量和多樣性直接相關。少量高品質數據的微調(如LIMA模型)可有效提升模型對齊能力,而重複數據則可能損害模型的泛化能力。
  • 數據管線優化:在訓練前構建準備充分的預訓練語料庫至關重要,因為千億級參數模型的每次預訓練成本高昂。這包括數據的收集、預處理、快取和多層儲存,以確保GPU能不間斷地獲得數據,避免瓶頸。
  • Token化與優化:Token是模型處理文本的基本單位,不同語言的Token化方法存在差異(例如中文通常1-2個字一個Token)。優化Token使用涉及精簡提示詞以減少冗餘信息,例如Lingua等壓縮方法能針對提示詞不同部分進行迭代壓縮。
  • 記憶高效算法:針對LLM API成本,可採用智能化的Token管理機制,例如區分用戶的「陳述」與「查詢」,僅在必要時生成響應,類似於檢索增強生成(RAG)機制,可顯著降低Token消耗。
  • 多智能體世界模型架構
    • Solaris:早期多智能體視頻世界模型,基於單智能體DiT模型修改,引入擴展動作空間和多智能體注意力機制,通過可學習的智能體ID嵌入交換信息。但其身份編碼破壞了對稱性,且全連接注意力機制存在計算成本隨玩家數量平方增長的擴展性天花板。
    • Gamma-World:NVIDIA與清華大學等團隊提出的新框架,通過重新設計底層組件解決多智能體挑戰。其核心設計包括「單純形旋轉智能體編碼」(simplex rotating agent encoding)以實現身份的對稱表示、「稀疏樞紐注意力」(sparse hub attention)以高效建模交互,以及「條件師生蒸餾」(conditional teacher-student distillation)以兼顧質量與實時性。
  • 世界模型分類:世界模型可分為隱式表示類(如大型語言模型,將世界狀態編碼為高維連續向量)和預測類(如Dreamer、Sora,在像素或特徵級重構環境觀測)。具身世界模型則可基於視頻生成、融合三維重建或以壓縮表徵為核心的潛在世界模型。

🔮 前景展望AI analysis grounded in cited sources

AI開發將更注重數據策劃與治理,而非單純擴大數據量。
亞馬遜「Token灌水」事件及業界對數據品質的強調,預示著企業將從「數據量」轉向「數據價值」的精細化管理,以控制成本並提升模型效能。
多智能體世界模型將成為物理AI和複雜系統模擬的關鍵基礎設施。
隨著Gamma-World等研究突破多智能體交互的技術瓶頸,這類模型將能為機器人協同、自動駕駛和社會仿真等現實世界應用提供更高效、更通用的數據生產和策略訓練平台。
LLM的成本優化將從模型本身延伸至整個應用生命週期。
除了數據品質,提示詞工程、上下文快取、模型分級路由等策略的普及,將促使開發者從系統層面全面考量並降低LLM的總體運營成本。

時間線

2018-06
Jurgen Schmidhuber和David Ha發表《Recurrent World Models Facilitate Policy Evolution》,將「世界模型」概念引入深度學習領域。
2024-02-15
OpenAI發布Sora模型,並首次明確將其定義為「世界模擬器」,使世界模型成為AI產業熱點。
2025-09-21
清華大學團隊在ACM Computing Surveys發表世界模型全面綜述,系統回顧其發展與應用。
2026-03-11
紐約大學謝賽寧研究團隊開源Solaris多智能體視頻世界模型,可在《我的世界》中模擬一致多人視角。
2026-05-29
亞馬遜宣布廢除內部AI排行榜「Kirorank」,以應對員工為衝KPI而「Token灌水」的問題。
2026-05-30
NVIDIA聯合清華大學等團隊發布Gamma-World,提出一套系統性的多智能體世界模型框架,解決多智能體交互的底層架構問題。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位