🐯最新收集於 14m

ByteDance 拒絕蒸餾外部模型

ByteDance 拒絕蒸餾外部模型
PostLinkedIn
🐯閱讀原文: 虎嗅

💡ByteDance 放棄重要的模型訓練捷徑;其理由將影響資料策略、合規與研究品質。

⚡ 30-Second TL;DR

有什麼變化

這項政策同時禁止蒸餾美國閉源模型,以及 Kimi K3 等中國開放權重模型。

為什麼重要

若能持續執行,這項政策短期可能使 ByteDance 的模型開發速度變慢,但有助於改善資料來源可追溯性、研究可重現性與法律防禦能力。這也顯示產業可能正從能力模仿,轉向自有資料與基礎模型研發。

下一步行動

稽核你的訓練流程是否含有第三方模型輸出,標記合成資料來源,並在資料進入預訓練前加入來源追蹤閘門。

誰應關注:Researchers & Academics

關鍵要點

  • 這項政策同時禁止蒸餾美國閉源模型,以及 Kimi K3 等中國開放權重模型。
  • ByteDance 早前已禁止將 GPT 生成資料加入訓練集,後來也承認 Project Seed 初期曾有限度使用相關資料。
  • Seed-OSS-36B 同時發布含合成資料與不含合成資料的版本,反映其對合成資料污染問題的重視。
  • 這項決定放棄快速提升模型能力的捷徑,轉而強調自主訓練與對模型底層機理的理解。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • ByteDance 內部推動此政策旨在規避潛在的智慧財產權訴訟風險,特別是針對美國科技巨頭(如 OpenAI、Google)的版權主張。
  • 此舉反映了 ByteDance 試圖在國際市場(特別是歐美地區)建立「合規 AI」的品牌形象,以緩解 TikTok 面臨的數據安全審查壓力。
  • Seed 團隊目前轉向強調「高品質人類反饋強化學習(RLHF)」與「大規模真實數據清洗」,而非依賴合成數據來提升模型邏輯推理能力。
  • 業界分析指出,禁止蒸餾模型可能導致 ByteDance 在短期內模型性能迭代速度落後於採取合成數據策略的競爭對手。
  • ByteDance 正在開發一套內部的數據溯源系統,以確保其訓練數據集完全符合「自主生成」的合規標準,防止數據污染。
📊 競品分析▸ Show
特性ByteDance (Seed)OpenAI (o系列/GPT)Moonshot AI (Kimi)
訓練數據策略禁止蒸餾,強調自主訓練混合策略,包含合成數據早期依賴蒸餾,現轉向混合
數據合規性極高(防訴訟導向)中(面臨版權訴訟)中(依賴開源生態)
核心優勢數據清洗與 RLHF模型推理能力與生態快速迭代與長文本能力

🛠️ 技術深入

  • Seed-OSS-36B 採用了混合專家模型(MoE)架構的變體,旨在優化推理效率與參數利用率。
  • 該模型在訓練過程中引入了嚴格的數據去重與過濾算法,以剔除潛在的蒸餾痕跡。
  • 為了彌補不使用蒸餾數據的性能缺口,ByteDance 強化了基於大規模真實用戶行為數據的獎勵模型(Reward Model)訓練。
  • 訓練流程中整合了多階段的監督微調(SFT),特別針對邏輯推理與程式碼生成任務進行了針對性優化。

🔮 前景展望AI analysis grounded in cited sources

ByteDance 將在 2027 年前完全實現訓練數據的 100% 自主化。
該公司目前已建立嚴格的數據審核機制,並持續投入資源開發數據溯源技術以確保合規。
此政策將導致 ByteDance 模型在複雜推理任務上的基準測試分數出現短期停滯。
放棄蒸餾技術意味著失去了快速獲取頂尖模型邏輯能力的捷徑,模型性能提升將完全依賴於自主訓練的效率。

時間線

2023-08
ByteDance 啟動 Project Seed,旨在開發通用大模型基礎設施。
2024-03
ByteDance 內部發布禁令,禁止將 GPT 生成資料用於模型訓練。
2024-09
ByteDance 承認 Project Seed 初期曾有限度使用外部模型數據進行訓練。
2025-05
Seed-OSS-36B 發布,並首次區分含合成數據與不含合成數據的訓練版本。
2026-02
張一鳴正式確立「禁止蒸餾」政策,要求團隊全面轉向自主訓練路徑。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅