⚛️較早收集於 2h

HiDream-O1-Image-1.5 登頂全球文生圖榜單

HiDream-O1-Image-1.5 登頂全球文生圖榜單
PostLinkedIn
⚛️閱讀原文: 量子位

💡一款新的中國模型在全球文生圖基準測試中超越了 Google 和 Nvidia。

⚡ 30-Second TL;DR

有什麼變化

HiDream-O1-Image-1.5 在圖像生成領域排名中國第一、全球第二。

為什麼重要

此突破顯示中國生成式模型在全球舞台上的競爭力提升,挑戰了西方科技巨頭在高品質圖像合成領域的主導地位。

下一步行動

評估 HiDream-O1-Image-1.5 與您當前的圖像生成流程,以衡量潛在的品質提升。

誰應關注:Researchers & Academics

關鍵要點

  • HiDream-O1-Image-1.5 在圖像生成領域排名中國第一、全球第二。
  • 該模型在性能上超越了 Google 和 Nvidia 的相關產品。
  • 這標誌著中國 AI 研究在生成式視覺模型領域的重要里程碑。

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • HiDream-O1-Image-1.5 是由智象未來(HiDream.ai)推出的一款商用版圖像生成模型,其在基準測試中的頂尖表現,標誌著該公司在生成式AI領域的商業化進展。
  • 該模型採用了獨特的像素級統一Transformer (UiT) 架構,直接在原始像素空間操作,無需傳統文生圖模型中常見的變分自編碼器(VAE)或分離的文本編碼器,從而簡化了生成流程並提升了細節表現。
  • HiDream-O1-Image 不僅限於文生圖,還支援多種任務,包括長文本渲染、基於指令的圖像編輯、主題驅動的個性化以及故事板生成,並能原生輸出高達 2048x2048 的圖像解析度。
  • 該模型整合了「推理驅動提示代理」(Reasoning-Driven Prompt Agent),旨在生成前解析隱含知識、佈局和文本渲染,以更好地理解複雜提示並提高圖像生成準確性。
📊 競品分析▸ Show
模型名稱開發者類型基準分數 (LLM Stats/AA, 2026年6月)價格 (每千張圖片)主要特點
HiDream-O1-Image (開源版)HiDream.ai開源1124±7 (Arena AI ELO)免費 (開源)像素級統一Transformer,無VAE,多任務支援,原生2K解析度
GPT Image 2OpenAI專有469$50.0 / $50.0最佳提示遵循度及圖像內文本渲染
GPT Image 1.5OpenAI專有275$0.00 / $50.0最佳提示遵循度及圖像內文本渲染
Gemini 3.1 Flash ImageGoogle專有175$20.0 / $20.0Google最廣泛可用的強大模型
Gemini 3 Pro ImageGoogle專有57$130.0 / $130.0Google主流前沿模型
Flux 2 MaxBlack Forest Labs開源權重91$60.0 / $60.0Black Forest Labs擴散模型家族
Seedream 4.5ByteDance專有20未公開高品質圖像生成
Qwen ImageAlibaba專有-105未公開圖像生成
NVIDIA Sana SprintNvidia專有未公開未公開圖像生成

🛠️ 技術深入

  • 架構核心: HiDream-O1-Image 採用像素級統一Transformer (UiT) 架構,這是一種端到端模型,直接在原始像素上操作,摒棄了傳統文生圖模型中常用的變分自編碼器(VAE)和分離的文本編碼器。
  • 統一輸入空間: 模型將原始圖像像素、文本標記和任務特定條件映射到單一共享的標記空間中,實現了多模態輸入的結構統一。
  • 原生高解析度: 支援直接合成高達 2048 × 2048 像素的圖像,並能保持清晰細緻的細節,無需額外的升頻器。
  • 多任務能力: 單一架構即可處理文生圖、長文本渲染、指令編輯、主題驅動個性化和故事板生成等多種任務。
  • 推理驅動提示代理: 內建的「思考」代理在生成前解析隱含知識、佈局和文本渲染,以增強提示理解和生成質量。
  • 參數規模: 開源版本 HiDream-O1-Image (Dev) 具有 80 億參數,而大規模版本 HiDream-O1-Image-Pro 則擴展至超過 2000 億參數。

🔮 前景展望AI analysis grounded in cited sources

中國在生成式AI領域的國際地位提升
HiDream-O1-Image-1.5 取得的頂尖排名,顯示中國AI研究在生成式視覺模型領域的技術實力已達到全球領先水平,有望挑戰現有市場格局。
推動圖像生成技術架構創新
其像素級統一Transformer架構,放棄了傳統VAE和分離文本編碼器,可能為未來多模態模型的設計和優化提供新的方向。
加速商業化應用落地
作為商用版模型,HiDream-O1-Image-1.5 的優異性能將吸引更多企業將其整合到商業營銷、影視創作等實際應用場景中,推動AI內容生成工具的普及。

時間線

2023
智象未來 (HiDream.ai) 公司成立
2025-05
HiDream-I1 (早期模型) 發布
2026-05-08
HiDream-O1-Image (80億參數開源版) 在MIT許可下開源
2026-05-10
HiDream-O1-Image 技術報告發布
2026-05-19
超2000億參數的HiDream-O1-Image-Pro發布,智象未來完成新一輪億級融資
2026-06-10
量子位報導 HiDream-O1-Image-1.5 登頂全球文生圖榜單,超越Google和Nvidia主流模型

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. qbitai.com
  2. theresanaiforthat.com
  3. huggingface.co
  4. wavespeed.ai
  5. startupfortune.com
  6. reddit.com
  7. arxiv.org
  8. arena.ai
  9. llm-stats.com
  10. wavespeed.ai
  11. promptingpixels.com
  12. hidream.ai
  13. qbitai.com
  14. pedaily.cn
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位