
ChatGPT Images 2.0:AI 先思考再繪圖
OpenAI 宣布推出 ChatGPT Images 2.0,這是一款先進的圖像生成模型,AI 會逐步推理後再產生視覺內容。它比前版大幅提升日文文字渲染的準確度。
Tag: #multimodal329 results

OpenAI 宣布推出 ChatGPT Images 2.0,這是一款先進的圖像生成模型,AI 會逐步推理後再產生視覺內容。它比前版大幅提升日文文字渲染的準確度。

Zibian Robotics 推出 WALL-B,這是一款下一代具身 AI 模型,專為家庭部署設計。它整合多模態學習與物理推理,適用於現實世界互動。

OpenAI 推出 ChatGPT Images 2.0 全球免費開放,推動多模態 AI 實用化。Meta 投資 10 億美元建資料中心;Nvidia 發布 DLSS 4.5 SDK 及 Jetson 記憶體優化;Intel 提出智能體 PC 概念。OpenAI 擬售 Codex,Copilot 因運算成本暫停付費註冊。

OpenAI 推出 ChatGPT Images 2.0,可從單一提示透過網路搜尋生成精細圖像。由 GPT Image 2 提供思考能力,提升指令遵循、細節保留與文字生成。適用於 ChatGPT Plus、Pro、Business 與 Enterprise 用戶。
OpenAI 的 ChatGPT Images 2.0 是最新圖像生成模型。該模型意外擅長生成文字,突顯近年 AI 能力快速演進。

Daimon Infinit 是全球最大規模含觸覺的全模態物理世界數據集,已聯合發布。吸引谷歌及眾多高校參與。

GIST 將消費級行動點雲轉換為具語義註解的導航拓撲,透過 2D 佔用圖、拓撲佈局及輕量語義疊加層。支援意圖驅動語義搜尋、一-shot 定位(1.04m 誤差)、區域分類及視覺 grounding 指令生成等任務。評估顯示優於基準,並以語音提示達 80% 導航成功率。
團隊微調與部署 Gemma-4 的經驗揭露關鍵問題:PEFT 與自訂層不相容、SFTTrainer 因 KV 共享靜默失敗、DeepSpeed 儲存空適配器,以及伺服工具缺乏即時 LoRA 支援。修復包括解包層、更新 transformers、避免 DeepSpeed,以及手動合併權重。

Canva 與 Anthropic 推出 Claude Design,這是 Anthropic Labs 產品,由 Claude Opus 4.7 與 Canva 的 Design Engine 驅動。可從文字描述生成完全可編輯、符合品牌的視覺內容。此發布與 Canva AI 2.0 同步,引入對話式設計與代理協作。

使用者指示 Qwen3.6-35B 使用 MCP 截圖建構塔防遊戲,它成功實作並測試升級功能。模型自行偵測並修復畫布渲染與波次完成錯誤。對即將推出的 Qwen Coder 模型充滿期待。