
DeepSeek 上線多模態識圖模式
DeepSeek 已正式在網頁與 App 端推出多模態識圖功能。目前網頁端已可使用,但 App 端仍顯示該功能處於內部測試階段。
Tag: #computer-vision379 results

DeepSeek 已正式在網頁與 App 端推出多模態識圖功能。目前網頁端已可使用,但 App 端仍顯示該功能處於內部測試階段。

MolmoMotion 引入了一種利用語言引導進行 3D 動作預測的新方法。這項研究探討了文字描述如何提高生成動作序列的準確性與語義相關性。

Rivian 執行長 RJ Scaringe 宣布,公司正按計畫於今年稍晚發布一套監督式自動駕駛系統。該系統旨在直接與 Tesla 的 FSD 功能競爭。

Roblox 正逐步淘汰簡單的年齡勾選框,轉而採用基於影片自拍的臉部估算技術。該公司聲稱這種 AI 驅動的方法能將用戶年齡估算的誤差範圍控制在 1.4 年以內。
地球觀測衛星首次在無需地面干預的情況下,成功自主識別特定目標。這項突破展示了邊緣運算與電腦視覺在太空硬體中的整合應用。
本討論探討在區分癌症與視覺相似的「模擬病灶」時,應採用異常檢測還是監督式分類。內容針對醫學影像數據集中高度形態相似性所帶來的建模挑戰進行分析。

據報導,中國的 Tesla 車主正利用玩偶頭部、照片及閃爍螢幕等簡單物理物件繞過駕駛監控系統。這凸顯了目前基於攝影機的注意力追蹤技術存在重大漏洞。

Apple 在 iOS 27 中更新的 Clean Up 工具出現了重大故障。該 AI 驅動的功能本應模糊臉部,卻錯誤地生成並替換為新的臉部。

從 Pokémon Go 收集的地理位置數據已被用於訓練 AI 模型,協助軍用無人機在戰區進行定位。這些來自全球玩家的真實空間掃描數據,為電腦視覺系統提供了獨特的訓練素材。

Maket 推出了一項新功能,允許使用者上傳 PDF、JPG 或 PNG 格式的現有平面圖。該工具利用 AI 在幾分鐘內將這些靜態影像轉換為可完全編輯的住宅設計佈局。