
DiSCO 為文字生成圖像加入黑箱安全防護
DiSCO 是一種零樣本、黑箱式防禦方法,透過最佳化提示詞降低文字生成圖像模型產生有害內容的機率。它利用分佈導向的後綴擴展,以及安全與不安全圖像池的對比評分,在 I2P 基準測試中最多可降低 37.7% 的攻擊成功率。
Tag: #text-to-image16 results

DiSCO 是一種零樣本、黑箱式防禦方法,透過最佳化提示詞降低文字生成圖像模型產生有害內容的機率。它利用分佈導向的後綴擴展,以及安全與不安全圖像池的對比評分,在 I2P 基準測試中最多可降低 37.7% 的攻擊成功率。
在社交平台上表示,团队通过持续的技术攻坚,使该模型超越了 Nano Banana、Meta 以及 Grok 等同类竞争产品。在榜单表现上,MAI-Image-2.6 目前距离榜首 OpenAI 的 GPT-Image-2(中等版本)仅相差 45 分,同时领先第三名 Grok Imagine Image 2.0(低版本)20 分。</p><p><img src="https://static.cnbetacdn.com/article/2026/0811/e29bdb279824d65.jpg)
Microsoft 已推出新一代文字生成圖像模型 MAI-Image-2.6。該模型發布後迅速登上 Arena 文字生成圖像榜單第二名,目前僅次於 OpenAI 的 GPT-Image-2。
阿里正式推出 Qwen-Image-3.0,這是其圖像生成基礎模型的第三代產品。該模型具備更強的性能,包括支援 4.5k token 輸入、10px 小字精準渲染以及 12 種語言的原生渲染能力。

DeepMind 推出了 DiffusionGemma,這是一種優化文字生成圖像的新方法。該研究旨在顯著提升生成模型的推論速度。

HiDream-O1-Image-1.5 在全球文生圖基準測試中取得頂尖表現,據稱超越了 Google 和 Nvidia 的主流模型。

Microsoft 發布了最新的文字生成圖像模型 MAI-Image-2.5,並在 Arena 排行榜中首發即拿下第三名。此表現顯示 Microsoft 在 AI 圖像生成領域正迅速縮小與產業領先者(如 OpenAI)的差距。
微軟推出 MAI-Image-2-Efficient,這是比 MAI-Image-2 便宜近一半、更快速的文字轉圖像模型。該模型立即在 Microsoft Foundry 和 MAI Playground 可用,速度快 22%,GPU 吞吐量提升 4 倍。模型針對高容量生產工作負載,並在延遲基準測試中超越 Google 的 Gemini 模型。

阿里巴巴高德團隊推出SpatialGenEval,一個針對文生圖模型空間智能的全面基準,已被ICLR 2026錄用。它使用長文本、高資訊密度提示詞,評估空間感知、推理與互動的10大維度,涵蓋25個真實應用場景。對23個SOTA模型的測試顯示當前文生圖能力仍有重大缺陷。

Recraft V4 是一款專為專業設計與行銷打造的文字轉圖像模型,現已在 Vercel 的 AI Gateway 上線。它在寫實度上大幅提升,具備逼真肌膚、自然紋理、乾淨光線與多樣構圖,並能產生原創角色插圖。有兩種版本:標準 V4 適合日常迭代,V4 Pro 適用於高解析列印資產。

xAI 透過 Grok 推廣的 Imagine Image 2.0,不只競逐生成品質,也以互動式圖片編輯能力脫穎而出。它能自動將圖片分割成圖層,支援精準區域編輯與透明背景匯出,並可融合最多五張參考圖片。