🗾ITmedia AI+ (日本)•較早收集於 79m
Microsoft 發布七款自研 AI 模型

💡Microsoft 正透過自研模型多元化其 AI 技術堆疊。看看這些模型是否能取代您目前的 API 依賴。
⚡ 30-Second TL;DR
有什麼變化
發布七款獨特的自研 AI 模型
為什麼重要
此舉標誌著 Microsoft 轉向垂直整合,減少對第三方模型供應商的依賴。這為開發者提供了更多專門的 Microsoft 原生工具,適用於企業應用。
下一步行動
查閱 Microsoft AI Models 文件,評估這些自研模型在您的工作流程中,是否比 OpenAI 模型具有更好的延遲表現或成本效益。
誰應關注:Developers & AI Engineers
關鍵要點
- •發布七款獨特的自研 AI 模型
- •包含專門的圖像處理功能
- •具備先進的語音識別技術
🧠 深度解析
Web-grounded analysis with 20 cited sources.
🔑 增強重點摘要
- •微軟發布的七款自研AI模型系列,涵蓋了MAI-Thinking-1(推理)、MAI-Image-2.5(圖像生成與編輯)、MAI-Transcribe-1.5(語音轉錄)、MAI-Voice-2(語音生成)及MAI-Code-1(程式碼生成)等多元功能,超越了原始文章中提及的圖像編輯與語音識別範疇。
- •此次發布標誌著微軟在AI領域追求「長期自給自足」的戰略轉變,旨在減少對OpenAI和Anthropic等合作夥伴模型的依賴,特別是考量到這些合作夥伴與Google、Amazon等競爭對手也有聯繫。
- •這些MAI模型已深度整合至微軟的產品生態系統中,例如PowerPoint、OneDrive、Copilot和VS Code,並可透過Microsoft Foundry和MAI Playground供開發者使用,部分模型也將在Fireworks AI、Baseten和OpenRouter等第三方平台提供。
📊 競品分析▸ Show
| 功能/指標 | Microsoft MAI 模型 | OpenAI (GPT系列) | Anthropic (Claude系列) | Google (Gemini系列) |
|---|---|---|---|---|
| 推理模型 | MAI-Thinking-1:中型模型,350億參數,256K上下文視窗,低token成本;盲測中優於Sonnet 4.6,程式碼能力與Opus 4.6相當。 | GPT-4o:旗艦模型,推理能力強,價格適中;GPT-4o Mini:輕量級,成本約為GPT-4o的1/15。 | Claude 3 Opus:旗艦模型,能力最強,成本最高;Claude 3.5 Sonnet:性能與價格平衡;Claude 3 Haiku:輕量級,適用於高吞吐量任務。 | Gemini Pro:處理大多數通用任務;Gemini Ultra:針對複雜推理。 |
| 圖像模型 | MAI-Image-2.5:支援文字轉圖像及圖像編輯,在圖像編輯排行榜上超越Google的Nano Banana Pro,位居第二。 | (未明確提及特定圖像模型,但GPT-4o具備多模態能力) | (未明確提及特定圖像模型) | Nano Banana Pro (被MAI-Image-2.5超越) |
| 語音轉錄 | MAI-Transcribe-1.5:號稱全球最佳轉錄模型,SOTA準確度,比競爭對手快五倍,支援43種語言。 MAI-Transcribe-1:在25種語言上表現卓越,WER低於4%,GPU成本比替代方案低約50%。 | GPT-Transcribe:WER為4.2%。 | (未明確提及特定轉錄模型) | Gemini 3.1 Flash:WER為4.9%。 |
| 語音生成 | MAI-Voice-2:支援15種額外語言及多種語音選項。 MAI-Voice-1:可在1秒內生成60秒音訊,強調自然、富有情感的語音。 | (未明確提及特定語音生成模型) | (未明確提及特定語音生成模型) | (未明確提及特定語音生成模型) |
| 程式碼生成 | MAI-Code-1:50億參數,推論效率高,專為GitHub Copilot和VS Code優化,比Haiku更便宜。 | (GPT系列模型廣泛用於程式碼生成) | Claude 3 Haiku (被MAI-Code-1-Flash提及為競爭對手) | (Gemini系列模型具備程式碼生成能力) |
| 定價 (部分舊模型) | MAI-Transcribe-1:每小時0.36美元;MAI-Voice-1:每百萬字元22美元;MAI-Image-2:文字輸入每百萬token 5美元,圖像輸出每百萬token 33美元。 | GPT-4o:輸入每百萬token 2.50美元。 | Claude 3 Opus:輸入每百萬token 15美元,輸出每百萬token 75美元。 | Gemini Pro:輸入每百萬token 0.50美元,輸出每百萬token 1.50美元。 |
🛠️ 技術深入
- MAI-Thinking-1: 微軟首個推理模型,為中型模型,擁有350億活躍參數和256K的上下文視窗,旨在實現高效率和高性能,同時強調低token成本。該模型從零開始訓練,未使用其他公司模型的蒸餾技術,專為處理複雜的多步驟指令、長上下文推理和程式碼生成而設計。
- MAI-Code-1-Flash: 一個推論高效的代理程式碼模型,擁有50億參數,專為GitHub Copilot、VS Code和微軟技術棧量身定制並深度整合。
- MAI-Image-2.5: 支援世界級的文字轉圖像和圖像編輯功能,包括其超高效的Flash變體。
- MAI-Transcribe-1.5: 具備最先進的準確性,比競爭模型快五倍,並內建支援43種語言的特定領域術語。
- MAI-Voice-2: 及其Flash變體,支援額外15種語言和多種語音選項。
- 訓練方法: 所有MAI模型均強調「從零開始訓練,零蒸餾」,使用企業級、乾淨且商業授權的數據,以確保數據血緣的清晰性。
- 基礎設施支援: 微軟同時推出了Surface RTX Spark Dev Box,這是一款搭載Nvidia Blackwell架構RTX Spark處理器和128GB統一記憶體的緊湊型桌面電腦,能夠在本地運行超過1200億參數的AI模型,無需依賴雲端GPU實例。
🔮 前景展望AI analysis grounded in cited sources
微軟將大幅降低對第三方AI模型的依賴。
此次發布明確表達了微軟追求「長期自給自足」的目標,並積極開發涵蓋多種模態的內部模型,以減少對外部合作夥伴的依賴。
「代理優先」(agent-first)的範式將成為微軟軟體生態系統的核心。
微軟正將Windows定位為AI代理的運行平台,推出Microsoft Scout等工具,並開發基於Android的代理作業系統Project Soltera,預示著AI將從輔助工具轉變為自主執行任務的角色。
微軟將推動企業用戶AI推論成本的下降。
MAI-Thinking-1強調「低token成本」,MAI-Code-1-Flash聲稱比競爭對手更便宜,以及早期MAI模型具有競爭力的定價,都表明微軟正採取積極策略提供高性價比的AI解決方案。
⏳ 時間線
2025-11
微軟AI成立超級智能團隊,旨在實現AI自給自足
2025-12
微軟預測2026年AI趨勢,強調AI從工具轉變為合作夥伴
2026-01
Rand Group分析微軟2026年AI趨勢,聚焦公民開發者與AI代理
2026-02
Stellium Consulting闡述微軟2026年AI願景,強調AI的普及性、責任感和影響力
2026-04
微軟發布首批三款自研MAI模型:MAI-Transcribe-1、MAI-Voice-1和MAI-Image-2
2026-06
微軟在Build 2026大會上發布七款MAI模型家族,包括MAI-Thinking-1、MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2和MAI-Code-1
📎 來源 (20)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗

