
DeepSeek 聊天機器人新增視覺功能
中國 AI 新創 DeepSeek 為其旗艦聊天機器人新增多模態功能,能處理圖像與影片,結合文字。該首次功能限特定用戶測試,繼 V4 模型推出與大幅降價後。使 DeepSeek 與具視覺功能的競爭對手看齊。
Tag: #multimodal329 results

中國 AI 新創 DeepSeek 為其旗艦聊天機器人新增多模態功能,能處理圖像與影片,結合文字。該首次功能限特定用戶測試,繼 V4 模型推出與大幅降價後。使 DeepSeek 與具視覺功能的競爭對手看齊。

DeepSeek V4 發布僅5天,網頁端已進入灰度測試識圖模式,能理解圖像資訊。使用者可直接上傳截圖,讓DeepSeek分析,比自行描述問題更簡單。它甚至能讀懂CT圖。

商湯科技推出並開源 SenseNova U1,這是一款統一多模態模型。基於 NEO-unify 架構,它將理解與生成合併至單一框架。此舉推動邁向統一模型時代。

一款新型開源模型採用低參數捲積架構,將圖像理解與生成任務統一。已全網開源,即刻可用。

面壁智能發布MiniCPM-o 4.5技術報告,強調其在消費級顯卡上快速上手運行。該模型下載量已突破25萬,顯示高度人氣。

Apple 推出 StereoFoley,一個從影片生成語義對齊、時間同步且空間精準的 48 kHz 立體音頻框架。它克服先前模型的單聲道限制及立體資料集不足。基礎模型在語義準確度和同步性達到最先進水準。

Kimi K2.6 在 3D 設計任務基準中名列第一。被形容為最佳模型評估基準之一。

X Square Robot 推出 WALL-B,這是一款下一代具身 AI 模型,專為現實世界家用部署設計。它具備多模態學習與物理推理功能,用於家居互動。

OpenAI 已於 ChatGPT、Codex 及其 API 推出 Images 2.0。它引入兩種模式、先進文字支援,以及 4K 輸出解析度。Codex 整合可實現創意與商業應用。

Koharu 是 Rust 撰寫的本地漫畫/圖像翻譯器,已更新更可靠且易用。整合 llama.cpp 支援 Gemma/Qwen 模型、物件偵測、OCR 與修補。完全開源於 GitHub,含示範影片與編輯功能。