
LingBot-Vision:用於自監督預訓練的遮罩邊界建模新方法
LingBot-Vision 引入了一種新的自監督預訓練方法,專注於邊界特徵標記以提升視覺表徵學習。該模型在 NYUv2 深度補全基準測試中表現優異,且訓練數據量遠少於 DINOv3。
Tag: #computer-vision379 results

LingBot-Vision 引入了一種新的自監督預訓練方法,專注於邊界特徵標記以提升視覺表徵學習。該模型在 NYUv2 深度補全基準測試中表現優異,且訓練數據量遠少於 DINOv3。

洩露的 iOS 27 原始碼中出現了型號為 B790 的新設備引用。該設備明確與「視覺智能」(Visual Intelligence)功能相關聯。

VideoFlexTok 引入了一種從粗到細的標記化方法,擺脫了僵化的 3D 網格表示。這種方法允許根據影片複雜度進行可變長度的標記化,從而提高效率與資訊保留能力。
ETH Zurich 的研究人員開發出一種能夠同時發光與記錄光線的雙向像素。這項創新可能使螢幕無需外部感測器即可作為相機使用。

由 Toshihiko 牽頭的研究團隊發布了 TacForeSight,這是一套能讓機器人提前 200 毫秒預判物理接觸的新系統,旨在解決機器人精細操作的難題。

PP-OCRv6 已於 Hugging Face 發布,支援 50 種語言。該模型系列涵蓋從 1.5M 參數的輕量級版本到 34.5M 參數的高效能版本。

Waymo 宣布召回超過 3,800 輛搭載第五代自動駕駛系統的車輛。此舉源於車輛未能識別匝道封閉標誌,導致誤闖高速公路施工區域的安全隱患。
Apple 正在開發具備內建相機的新款 AirPods,預計於 2027 年發布。該產品旨在成為 Apple 更廣泛 AI 硬體策略中的關鍵裝置。

Rivian 執行長 RJ Scaringe 宣布,監督式點對點自動駕駛功能將於今年稍晚推向第二代車型及 R2。該系統被定位為 Tesla FSD 的直接競爭對手。
PrintGuard 2.0 是 FDM 故障檢測系統的全面重構,現在採用 5MB 的 TFLite 模型,可在 CPython 和瀏覽器端的 Pyodide 上無縫運行。該系統使用 ShuffleNetV2 作為骨幹網路,結合原型網路(prototypical network)實現高效的少樣本故障檢測。