🇨🇳cnBeta (Full RSS)•較早收集於 4h
Microsoft MAI-Image-2.5 登上 Arena 文生圖排行榜前三名

💡Microsoft 新模型擠進前三名,標誌著圖像生成領域競爭格局的重大轉變。
⚡ 30-Second TL;DR
有什麼變化
MAI-Image-2.5 在 Arena 圖像生成排行榜中獲得前三名。
為什麼重要
此排名預示著圖像生成領域的競爭將更加激烈,可能挑戰 OpenAI 與 Midjourney 的現有主導地位。這為開發者提供了一個用於視覺 AI 整合的高性能新選擇。
下一步行動
評估 MAI-Image-2.5 API 與您當前圖像生成流程的效能,看看它是否能提供更好的性價比。
誰應關注:Developers & AI Engineers
關鍵要點
- •MAI-Image-2.5 在 Arena 圖像生成排行榜中獲得前三名。
- •該模型在與 OpenAI 的 gpt-image-2 競爭中展現了顯著的進步。
- •Microsoft 正積極擴展其在視覺領域的生成式 AI 能力。
🧠 深度解析
Web-grounded analysis with 13 cited sources.
🔑 增強重點摘要
- •MAI-Image-2.5 是 MAI-Image 系列的最新版本,繼 MAI-Image-1(2025 年 10 月發布)、MAI-Image-2(2026 年 4 月發布)及 MAI-Image-2-Efficient(2026 年 4 月發布)之後推出,顯示出微軟在該領域的快速迭代能力。
- •相較於其前身 MAI-Image-2,MAI-Image-2.5 在文字渲染、風格化插圖和商業圖像方面取得了顯著進步,使其更適用於專業創意工作。
- •該模型在處理物體、場景結構、光照、比例和空間關係方面展現出強大的視覺推理能力,能將簡單的指令轉化為精緻的圖像。
- •MAI-Image-2.5 預計將在發布後兩週內在 Microsoft 的 MAI Playground 和 Foundry 上提供,這表明微軟正積極將其內部開發的 AI 模型整合到其生態系統中。
- •微軟正透過 MAI-Image 系列等內部模型,積極建立其生成式 AI 能力,以減少對 OpenAI 等合作夥伴在圖像生成領域的依賴。
📊 競品分析▸ Show
| 模型名稱 | 提供者 | Arena ELO 分數 (截至 2026 年 5 月 25 日) | 主要特點 | 每圖價格 (低品質/中品質/高品質) |
|---|---|---|---|---|
| gpt-image-2 (medium) | OpenAI | 1388±6 | 近乎完美的文字渲染、UI/螢幕截圖生成、整體寫實度顯著提升 | $0.006 / $0.053 / $0.211 |
| gemini-3.1-flash-image-preview (nano-banana-2) | 1271±5 | 針對多種使用案例的強大性能 | null | |
| mai-image-2.5-preview | Microsoft AI | 1254±8 | 廣泛的風格、緊密遵循指令、可靠的文字渲染、詳細且連貫的圖像、強大的視覺推理 | null |
| gemini-3-pro-image-preview-2k (nano-banana-pro) | 1245±4 | null | null | |
| gpt-image-1.5-high-fidelity | OpenAI | 1241±4 | 更好的多物件佈局處理、更準確的色彩遵循、改進的文字連貫性 | $0.009 / $0.034 / $0.133 |
🛠️ 技術深入
- MAI-Image-2.5 在廣泛的風格中表現出色,能緊密遵循指令,更可靠地渲染文字,並產生細緻、連貫的圖像。
- 其前身 MAI-Image-2 的訓練語料庫主要由大規模、多領域、經過安全過濾、監督式微調 (SFT)/合成圖像標註數據集組成。
- 訓練過程中使用了合成的 AI 生成數據,包括文字和圖像,其中視覺語言模型 (VLM) 如 GPT-4o 用於圖像標註,而開源 3D 創作套件則用於手動渲染以提升文字渲染能力。
- 微軟的研究還利用多模態大型語言模型創建了「VisionPrefer」,這是一個高品質、細粒度的偏好數據集,用於指令微調,並從 AI 註釋者那裡收集了關於提示遵循、美學、保真度和無害性等多方面的反饋。
- MAI-Image-2-Efficient(MAI-Image-2 的變體)在 NVIDIA H100 硬體上以 1024x1024 解析度運行時,速度提升 22%,每 GPU 吞吐量效率提高 4 倍,且定價比 MAI-Image-2 低約 41%。
🔮 前景展望AI analysis grounded in cited sources
微軟將繼續快速迭代其 MAI-Image 系列,並可能更頻繁地發布新版本或專業化變體。
MAI-Image-1、MAI-Image-2、MAI-Image-2-Efficient 和 MAI-Image-2.5 在短時間內(2025 年 10 月至 2026 年 5 月)的快速發布,表明微軟正在加速開發週期並致力於持續改進。
微軟內部開發的 AI 圖像生成能力將越來越多地整合到其產品生態系統中,從而減少對外部合作夥伴的依賴。
MAI-Image-2.5 預計將在 MAI Playground 和 Foundry 上提供,而 MAI-Image-2 等早期版本已整合到 Copilot 和 Bing Image Creator 中,這表明微軟正朝著內部開發和更廣泛整合的戰略轉變。
MAI-Image-2.5 對可靠文字渲染和商業圖像的重視,將使微軟成為企業和專業創意應用領域的有力競爭者。
該模型在「更清晰的文字、更強的品牌作品」以及適用於「風格化插圖和商業圖像」方面的改進,直接解決了海報、標籤和產品照片等專業級創意工作的關鍵需求。
⏳ 時間線
2014-05
微軟發布 COCO (Common Objects in Context) 數據集,成為文本到圖像模型訓練的常用數據集之一。
2018-04
微軟研究人員開發了一種深度學習系統,利用生成對抗網路 (GAN) 從對話中生成圖像。
2024-10
微軟研究院發表關於「VisionPrefer」的研究,利用多模態大型語言模型創建高質量偏好數據集,以改善文本到圖像的對齊。
2025-10
微軟發布 MAI-Image-1,這是其首個內部開發的圖像生成 AI 模型。
2026-03
微軟推出 MAI-Image-2,並在 Arena.ai 文本到圖像排行榜上首次亮相即獲得第三名。
2026-04
微軟發布 MAI-Image-2-Efficient,這是 MAI-Image-2 的一個更快、更便宜的變體,專為生產工作負載設計。
2026-05
微軟宣布 MAI-Image-2.5,在 Arena 文本到圖像排行榜中位列第三,顯示出在圖像品質和文字渲染方面的顯著提升。
📎 來源 (13)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS) ↗



