🏠IT之家•較早收集於 5m
微軟 MAI 系列模型訓練數據透明度引發爭議

💡微軟的訓練數據宣稱遭到質疑;了解為何模型來源的透明度正成為重大風險。
⚡ 30-Second TL;DR
有什麼變化
微軟曾宣稱 MAI 模型僅使用乾淨且具商業授權的數據。
為什麼重要
此落差可能導致企業 AI 模型的透明度受到更嚴格審查,並可能引發關於數據使用政策的法律挑戰。
下一步行動
審查您自己的數據來源管道,確保行銷宣傳與實際訓練數據組成之間的一致性。
誰應關注:Researchers & Academics
關鍵要點
- •微軟曾宣稱 MAI 模型僅使用乾淨且具商業授權的數據。
- •技術論文顯示模型實際包含了 Common Crawl 等開放網路數據。
- •微軟聲稱使用自有爬蟲並遵守 robots.txt 協議。
- •此爭議凸顯了 AI 訓練數據抓取中「預設同意」的倫理問題。
🧠 深度解析
Web-grounded analysis with 22 cited sources.
🔑 增強重點摘要
- •此次爭議的核心是微軟的推理語言模型MAI-Thinking-1,該公司在Build 2026大會上聲稱其訓練數據為「企業級、乾淨且經商業授權的數據」,但其發布的技術預印本(MAI-Thinking-1 preprint)卻揭示了Common Crawl數據的包含。
- •Common Crawl是一個非營利性的網路爬取內容檔案庫,它不對所索引的材料提供任何授權聲明,也不向權利人支付費用,這可能使微軟及其企業客戶面臨潛在的版權侵權法律風險。
- •MAI-Thinking-1訓練語料庫中,經過濾和去重後的Common Crawl部分包含了242億個頁面。
- •微軟在Build 2026上的行銷宣稱,是為了迎合金融、醫療保健和政府等受監管行業中對合規性敏感的企業買家,這些買家因智慧財產權風險和供應商依賴問題,正嚴格審查AI模型的訓練數據來源。
- •截至2026年6月5日,微軟尚未就其Build 2026的行銷聲明與MAI-Thinking-1技術論文中訓練數據文檔之間的矛盾發表公開聲明。
📊 競品分析▸ Show
| 特性/公司 | Microsoft MAI | Google (Gemini) | OpenAI (GPT) | Anthropic (Claude) |
|---|---|---|---|---|
| 訓練數據來源透明度 | 聲稱「乾淨、商業授權」,但技術論文揭示包含Common Crawl等開放網路數據。 | 使用Common Crawl等開放網路數據,透明度有待提高。 | 使用Common Crawl等開放網路數據,透明度有待提高。 | 使用Common Crawl等開放網路數據,透明度有待提高。 |
| 數據授權與合規性 | 聲稱遵守robots.txt協議,但Common Crawl不提供商業授權,存在潛在法律風險。 | 普遍使用Common Crawl,面臨類似的版權和合規挑戰。 | 普遍使用Common Crawl,面臨類似的版權和合規挑戰。 | 普遍使用Common Crawl,面臨類似的版權和合規挑戰。 |
| 模型架構 | MAI-Thinking-1採用稀疏專家混合(MoE)架構,350億活躍參數,總參數約1兆。 | Gemini系列模型,具體架構未詳述,但為多模態。 | GPT系列模型,通常為Transformer架構。 | Claude系列模型,通常為Transformer架構。 |
| 性能/成本定位 | MAI-Thinking-1在程式碼基準測試中媲美Claude Opus 4.6,且成本效益更高;MAI-Transcribe-1聲稱比競品快5倍,GPU算力需求減半。 | Gemini 3.5 Flash已於2026年5月推出,強調速度與效率。 | 領先的前沿模型,但企業使用成本可能較高。 | Claude Opus 4.6為領先模型,但成本可能較高。 |
| 對第三方模型的依賴 | 旨在降低對OpenAI的依賴,發展自有模型生態系統。 | 發展自有模型,如Gemini系列。 | 作為領先模型提供者,被許多公司依賴。 | 發展自有模型,如Claude系列。 |
🛠️ 技術深入
- MAI-Thinking-1是微軟AI(MAI)團隊開發的推理型語言模型,採用稀疏專家混合(MoE)架構。
- 該模型在推理時具有350億個活躍參數,總參數約為1兆。
- MAI-Thinking-1專為複雜、多步驟的推理任務設計,而非僅僅是模式匹配。
- 微軟強調MAI-Thinking-1是「從頭開始」訓練的,沒有使用第三方模型進行蒸餾,旨在讓模型「真正學習」任務。
- 訓練數據管線中,經過濾和去重後,包含了242億個來自Common Crawl的頁面。
- 微軟採用內部稱為「爬山機」(Hill-Climbing Machine)的系統進行端到端模型開發,涵蓋數據管線、訓練框架、強化學習環境、獎勵機制、評估套件和安全測試。
- MAI-Thinking-1運行在微軟自主研發的MAIA-200晶片上,在相同機櫃功耗下,其token生成吞吐量比GB200部署高出40%以上。
- MAI系列還包括其他模型,如MAI-Image-2.5(文生圖和圖像編輯)、MAI-Transcribe-1.5(語音轉文字,支援43種語言)、MAI-Voice-2(文字轉語音)和MAI-Code-1-Flash(針對GitHub Copilot優化的程式碼模型)。
🔮 前景展望AI analysis grounded in cited sources
AI訓練數據來源的透明度將成為企業採購AI解決方案的關鍵考量因素。
此次爭議凸顯了企業法律和合規團隊對數據來源的嚴格審查,這將加速對可驗證、經商業授權數據的需求,進而影響採購決策。
監管機構,特別是歐盟,將推動更嚴格的AI訓練數據透明度法規執行。
歐盟AI法案已要求通用AI模型公開訓練數據摘要,此類事件將加強對AI開發者進行更詳細、可驗證披露的要求。
微軟將面臨壓力,需要協調其公開聲明與技術披露之間關於數據來源的差異。
行銷聲明與技術論文之間的直接矛盾會造成信任赤字,微軟必須解決此問題以維持其信譽,特別是對於企業客戶而言。
⏳ 時間線
2019
微軟與OpenAI建立長期合作關係,據報導原始協議限制微軟獨立開發通用人工智慧(AGI)。
2024-12-10
微軟股東要求公司提交一份報告,評估在AI訓練中使用不道德或不當外部數據的風險。
2025
微軟成功與OpenAI重新談判協議,解除獨立開發AGI的限制。
2025-06-24
微軟發布第二份年度《負責任AI透明度報告》。
2026-04-02
微軟MAI團隊發布MAI-Transcribe-1、MAI-Voice-1和MAI-Image-2,這是其首批獨立開發的競爭性基礎模型。
2026-06-02
微軟在Build 2026大會上發布MAI系列模型,包括MAI-Thinking-1,並聲稱其訓練數據為「企業級、乾淨且經商業授權的數據」。
2026-06-05
MAI-Thinking-1的技術預印本發布,揭示其訓練數據中包含Common Crawl,與先前的聲明相矛盾。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗