
豆包之後,千問也想要「臉」
繼豆包之後,阿里巴巴的千問也追求「臉」或人設。大廠開始為 AI 模型注入人格化。
Tag: #multimodal329 results

繼豆包之後,阿里巴巴的千問也追求「臉」或人設。大廠開始為 AI 模型注入人格化。

OpenAI 已重新奪回 AI 圖像生成領域的領先地位。此更新強調其在該領域的新領導力。此外,還提到使用 Claude Live Artifacts 建置每日指令中心。

ChatGPT Images 2.0 升級圖像生成,具備更強的推理能力,產生更清晰的文字與更可靠的輸出。此進展使其更接近真正的多模態 AI,有望徹底改變 AI 圖像創作流程。
Kimi K2.6 被推薦為 Opus 4.7 的強力替代品,在大多數任務上達到 85% 的品質。具備視覺、瀏覽器使用功能,並擅長長時程任務。由於使用限制,偏好本地部署。

Google 的 Gemini 現在可存取使用者 Google Photos 圖庫,產生個人化 AI 圖像。此更新簡化將個人照片輸入稱為 Nano Banana 的圖像生成系統,提供更相關的輸出。它提升了 AI 生成視覺內容的個人化程度。

Google 的 Gemini 應用程式現提供建立個人化圖像的新方式。Nano Banana 2 利用您的個人脈絡與 Google Photos,生成反映您獨特生活的圖像。

Gemma 4 31B 從複雜圖像如 F1 賽車生成優質 3D 模型,勝過 Claude Sonnet 4.6、Gemini 3.1 Pro、ChatGPT 及 Qwen3.5 27B。僅用 3600 令牌產生優異結果,對手需 6800+ 且有缺陷。同時擅長編碼、數學、推理及對話。

智象未來完成新一輪融資,金額超過5億元人民幣。公司計劃全力打造下一代原生全模態世界模型。此融資加速其AI研究野心。
Hugging Face 部落格詳述使用 Sentence Transformers 訓練與微調多模態嵌入及重排序模型。涵蓋文字與影像處理,用於進階檢索任務。開發者獲得開源工具建構優異 RAG 系統。

前Google DeepMind研究員Andrew Dai正推出專注視覺AI的新創公司。他批評大型實驗室AI模型在處理視覺提示時,智能僅相當於3歲孩童。