⚛️量子位•較早收集於 2h
HiDream-O1-Image-1.5 登頂全球文生圖榜單

💡一款新的中國模型在全球文生圖基準測試中超越了 Google 和 Nvidia。
⚡ 30-Second TL;DR
有什麼變化
HiDream-O1-Image-1.5 在圖像生成領域排名中國第一、全球第二。
為什麼重要
此突破顯示中國生成式模型在全球舞台上的競爭力提升,挑戰了西方科技巨頭在高品質圖像合成領域的主導地位。
下一步行動
評估 HiDream-O1-Image-1.5 與您當前的圖像生成流程,以衡量潛在的品質提升。
誰應關注:Researchers & Academics
關鍵要點
- •HiDream-O1-Image-1.5 在圖像生成領域排名中國第一、全球第二。
- •該模型在性能上超越了 Google 和 Nvidia 的相關產品。
- •這標誌著中國 AI 研究在生成式視覺模型領域的重要里程碑。
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •HiDream-O1-Image-1.5 是由智象未來(HiDream.ai)推出的一款商用版圖像生成模型,其在基準測試中的頂尖表現,標誌著該公司在生成式AI領域的商業化進展。
- •該模型採用了獨特的像素級統一Transformer (UiT) 架構,直接在原始像素空間操作,無需傳統文生圖模型中常見的變分自編碼器(VAE)或分離的文本編碼器,從而簡化了生成流程並提升了細節表現。
- •HiDream-O1-Image 不僅限於文生圖,還支援多種任務,包括長文本渲染、基於指令的圖像編輯、主題驅動的個性化以及故事板生成,並能原生輸出高達 2048x2048 的圖像解析度。
- •該模型整合了「推理驅動提示代理」(Reasoning-Driven Prompt Agent),旨在生成前解析隱含知識、佈局和文本渲染,以更好地理解複雜提示並提高圖像生成準確性。
📊 競品分析▸ Show
| 模型名稱 | 開發者 | 類型 | 基準分數 (LLM Stats/AA, 2026年6月) | 價格 (每千張圖片) | 主要特點 |
|---|---|---|---|---|---|
| HiDream-O1-Image (開源版) | HiDream.ai | 開源 | 1124±7 (Arena AI ELO) | 免費 (開源) | 像素級統一Transformer,無VAE,多任務支援,原生2K解析度 |
| GPT Image 2 | OpenAI | 專有 | 469 | $50.0 / $50.0 | 最佳提示遵循度及圖像內文本渲染 |
| GPT Image 1.5 | OpenAI | 專有 | 275 | $0.00 / $50.0 | 最佳提示遵循度及圖像內文本渲染 |
| Gemini 3.1 Flash Image | 專有 | 175 | $20.0 / $20.0 | Google最廣泛可用的強大模型 | |
| Gemini 3 Pro Image | 專有 | 57 | $130.0 / $130.0 | Google主流前沿模型 | |
| Flux 2 Max | Black Forest Labs | 開源權重 | 91 | $60.0 / $60.0 | Black Forest Labs擴散模型家族 |
| Seedream 4.5 | ByteDance | 專有 | 20 | 未公開 | 高品質圖像生成 |
| Qwen Image | Alibaba | 專有 | -105 | 未公開 | 圖像生成 |
| NVIDIA Sana Sprint | Nvidia | 專有 | 未公開 | 未公開 | 圖像生成 |
🛠️ 技術深入
- 架構核心: HiDream-O1-Image 採用像素級統一Transformer (UiT) 架構,這是一種端到端模型,直接在原始像素上操作,摒棄了傳統文生圖模型中常用的變分自編碼器(VAE)和分離的文本編碼器。
- 統一輸入空間: 模型將原始圖像像素、文本標記和任務特定條件映射到單一共享的標記空間中,實現了多模態輸入的結構統一。
- 原生高解析度: 支援直接合成高達 2048 × 2048 像素的圖像,並能保持清晰細緻的細節,無需額外的升頻器。
- 多任務能力: 單一架構即可處理文生圖、長文本渲染、指令編輯、主題驅動個性化和故事板生成等多種任務。
- 推理驅動提示代理: 內建的「思考」代理在生成前解析隱含知識、佈局和文本渲染,以增強提示理解和生成質量。
- 參數規模: 開源版本 HiDream-O1-Image (Dev) 具有 80 億參數,而大規模版本 HiDream-O1-Image-Pro 則擴展至超過 2000 億參數。
🔮 前景展望AI analysis grounded in cited sources
中國在生成式AI領域的國際地位提升
HiDream-O1-Image-1.5 取得的頂尖排名,顯示中國AI研究在生成式視覺模型領域的技術實力已達到全球領先水平,有望挑戰現有市場格局。
推動圖像生成技術架構創新
其像素級統一Transformer架構,放棄了傳統VAE和分離文本編碼器,可能為未來多模態模型的設計和優化提供新的方向。
加速商業化應用落地
作為商用版模型,HiDream-O1-Image-1.5 的優異性能將吸引更多企業將其整合到商業營銷、影視創作等實際應用場景中,推動AI內容生成工具的普及。
⏳ 時間線
2023
智象未來 (HiDream.ai) 公司成立
2025-05
HiDream-I1 (早期模型) 發布
2026-05-08
HiDream-O1-Image (80億參數開源版) 在MIT許可下開源
2026-05-10
HiDream-O1-Image 技術報告發布
2026-05-19
超2000億參數的HiDream-O1-Image-Pro發布,智象未來完成新一輪億級融資
2026-06-10
量子位報導 HiDream-O1-Image-1.5 登頂全球文生圖榜單,超越Google和Nvidia主流模型
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
