💰較早收集於 6h

日本「最高性能AI模型」僅DeepSeek V3改名

日本「最高性能AI模型」僅DeepSeek V3改名
PostLinkedIn
💰閱讀原文: 钛媒体
#rebranding#model-fraud#open-sourcedeepseek-v3deepseek-v3

💡日本「頂級模型」揭穿為DeepSeek V3—檢查你模型的配置文件(22字)

⚡ 30-Second TL;DR

有什麼變化

宣傳為日本最高性能AI模型

為什麼重要

侵蝕區域AI模型公告信任,促使從業人員驗證來源,以應對開放模型改名潮。

下一步行動

整合DeepSeek V3分支前,務必檢查模型配置文件驗證真實來源。

誰應關注:Researchers & Academics

關鍵要點

  • 宣傳為日本最高性能AI模型
  • 配置文件揭露為DeepSeek V3未改版
  • 無原創開發,純粹改名

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • 樂天集團(Rakuten)於2025年推出的「樂天AI 3.0」日語專用模型在Hugging Face的config.json文件中被發現包含「model_type: deepseek_v3」的條目,引發對其是否基於DeepSeek V3技術的爭議[1]
  • DeepSeek-V3採用671億參數的混合專家(MoE)架構,每個token僅激活37億參數,在14.8兆tokens的多語言語料庫上進行預訓練,相比GPT-4使用更少的訓練成本和計算資源[2][6]
  • DeepSeek-V3的技術創新包括多頭潛在注意力(MLA)、無輔助損失的負載均衡策略,以及從DeepSeek-R1系列模型蒸餾推理能力的後訓練方法[6]
  • 樂天AI 3.0聲稱在日語文化和歷史背景下的性能優於GPT-4o,但其開發基於開源社區模型和專有雙語數據,引發關於模型獨立開發程度和中國視角對齊的質疑[1]

🛠️ 技術深入

DeepSeek-V3架構與訓練細節

  • 模型規模:671億總參數,混合專家(MoE)架構,每個token激活37億參數[6]
  • 預訓練數據:14.8兆tokens的多語言語料庫,主要為英文和中文,包含更高比例的數學和編程內容[2][6]
  • 上下文長度擴展:使用YaRN技術,從4K擴展至32K,再擴展至128K tokens[2]
  • 核心架構創新:採用多頭潛在注意力(MLA)和DeepSeekMoE架構,經DeepSeek-V2驗證[6]
  • 負載均衡策略:首創無輔助損失策略,最小化負載均衡對模型性能的負面影響[6]
  • 後訓練流程:包括監督微調(SFT)和強化學習(RL)階段,從DeepSeek-R1系列蒸餾推理能力[6]
  • 訓練效率:使用256個服務器節點,每個節點配備8個H800 GPU加速器,相比同等性能模型訓練成本顯著降低[5]

🔮 前景展望AI analysis grounded in cited sources

AI模型透明度標準化將成為監管焦點
樂天AI 3.0事件暴露了模型來源聲明與實際技術基礎的不匹配,預示未來AI廠商需要更嚴格的配置文件透明度和來源溯源要求。
開源模型改進與商業化的邊界模糊化
DeepSeek-V3作為開源基礎模型被廣泛採用進行微調和重新包裝,表明未來AI產業將面臨如何界定「原創開發」與「基於開源改進」的法律和倫理挑戰。
多語言AI模型的地域化競爭加劇
樂天AI 3.0針對日語優化的策略反映出各地區廠商正在開發本地化AI模型,但基於相同的全球開源基礎,導致功能同質化和差異化困難。

時間線

2023-10
DeepSeek公司成立,由梁文峰創辦,專注開源AI模型開發
2024-12
DeepSeek-V3發佈,671億參數MoE模型,在14.8兆tokens上預訓練,性能與GPT-4o相當但訓練成本更低
2025-01
DeepSeek-R1推出,基於V3-Base模型,通過強化學習增強推理能力,性能對標OpenAI o1
2025-03
樂天集團推出樂天AI 3.0日語專用模型,聲稱性能優於GPT-4o,但配置文件揭露基於DeepSeek-V3
2025-12
DeepSeek發佈V3.2版本,引入DeepSeek稀疏注意力(DSA)機制,強化長上下文處理效率
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。