
微軟推出語音與影像新 AI 模型
微軟公布三款自家機器學習模型的公開預覽版,專注於語音辨識、語音合成及影像生成。此舉使微軟儘管與 OpenAI 合作,仍成為其競爭對手。
Tag: #image-generation59 results

微軟公布三款自家機器學習模型的公開預覽版,專注於語音辨識、語音合成及影像生成。此舉使微軟儘管與 OpenAI 合作,仍成為其競爭對手。

Wan2.7-Image推出,被稱為國內最強生圖模型。它具備文生圖、圖生組圖、圖像指令編輯及互動式編輯等全鏈路能力。
阿里於4月1日發布Wan2.7-Image,圖像生成與編輯統一模型,支持「千人千面」個人化。新「調色盤」功能精準控制色彩。涵蓋文生圖、圖生組圖、指令編輯與互動編輯全鏈路。
OpenClaw 2026.3.28 引入重大變更,如移除過時的 Qwen OAuth 並放棄舊版配置遷移。主要新增包括 xAI Responses API 與 x_search 工具、MiniMax 圖像生成,以及非同步工具批准鉤子。其他改進涵蓋 OpenAI 修補、CLI 後端與 Slack 檔案上傳。

西安交通大學與 A*STAR 的 PaCo-RL 透過 VLM 成對獎勵建模,用於 RL 訓練一致影像生成。PaCo-Reward 在 ConsistencyRank 準確率達 0.449(較基準 +10%)。在 Text-to-ImageSet 一致性提升 10%以上,低解析訓練減半時間。

Adobe正式開放Firefly自訂模型(Custom Models)公測。創作者與品牌可用自身美術與照片素材訓練專屬AI圖像生成模型。此舉確保大規模內容製作中維持統一視覺風格與角色設定。

研究人員完全在 RTX 2050 GPU(僅 4GB VRAM)上訓練並基準測試了四個擴散模型版本。令人驚訝的是,最小的 17.8 百萬參數模型優於較大的 143.8 百萬參數模型。此結果在 Reddit 的 r/LocalLLaMA 上分享,展示了在消費級硬體上的高效訓練。

一款新工具或模型已在 AI 圖像生成領域登頂。文章還介紹如何建立擁有專屬電話號碼的 AI 助手。

Google 的 Nano Banana 2(Gemini 3.1 Flash Image)將專業級 AI 影像生成帶給 Gemini app 免費用戶。具備即時資訊、網路搜尋、更快渲染。媲美付費 Pro 模型。
Google 發布 Nano Banana 2,這是由 Gemini 3.1 Flash Image 驅動的更快速影像生成模型,具備 Nano Banana Pro 的能力。它支援快速編輯、即時網路資料整合,以及最高 4K 高解析度輸出。此模型將取代 Pro 成為 Gemini 應用程式、搜尋和 Flow 工作室的預設模型。