計算機視覺最新動態

檢測、分割、OCR 與視覺理解——支撐機器人、自動駕駛與內容工具的感知層。

341 篇文章

⚛️
Ars Technica AI17h ago

AI 讓烏克蘭自殺式無人機自主追蹤目標

美國公司 Auterion 提供 AI 能力,讓烏克蘭的低成本自殺式無人機能夠自主追蹤目標。一項價值 1 億美元的交易將為 5 萬架烏克蘭無人機配備這項美國開發的技術。

🐼
Pandaily13h ago

Xunying 在 EWC 巴黎賽事部署 500 台 AI 攝影機

Xunying Tail 2 連續第二年成為 Esports World Cup 官方合作夥伴,並在巴黎賽事部署 500 台 AI 攝影機。其 AI 追蹤與 PTZR 雲台據稱讓單一操作員可控制 60 至 70 台設備,降低對大型攝影團隊的依賴。

🤖
Reddit r/MachineLearning2d ago

建立可編輯教科書圖表提取流程

開發者正在尋求一種具成本效益且結合人機協作的流程,將靜態學術教科書圖表轉換為結構化、可編輯的數位資產。目標是偵測圖表、移除現有標籤並保留底層圖像,以供前端渲染使用。

🏠
IT之家2d ago

傳前五大手機廠商明年將全面跟進 1:1 前置鏡頭

據報導,主要手機製造商計畫在 2025 年採用 1:1 方形前置鏡頭感測器,以提升數位變焦效果並改善橫豎屏切換時的畫質。此舉跟進了 Apple 在 iPhone 17 系列中的技術應用。

🐯
虎嗅20d ago

攝影正成為智慧硬體的新生意

隨著相機硬體成本下降,創新的焦點正轉向機器人和無人機等「自主攝影」硬體。這些設備旨在自動化構圖、追蹤和內容創作的全過程。

🏠
IT之家22d ago

SenseNova-Vision:統一開源視覺基礎模型發布

商湯科技發布 SenseNova-Vision,這是一款將目標檢測、分割、3D 重建等任務整合的統一視覺基礎模型。該模型已全面開源,並同步釋出 5000 萬條視覺指令語料庫。

🐯
虎嗅27d ago

高中生利用AI透過視網膜掃描篩查自閉症

一名17歲學生開發了名為「RetinaMind」的AI工具,利用卷積神經網路分析視網膜影像以篩查自閉症與ADHD。該項目在測試中達到89%的準確率,展示了AI在神經發育診斷中的潛力。

🐼
Pandaily28d ago

Ant Group 的 LingBot-Vision 效能超越 Meta 的 DINOv3

Ant Group 擁有 11 億參數的 LingBot-Vision 基礎模型,在效能上超越了 Meta 的 70 億參數 DINOv3。該模型屬於 LingBot-Depth 2.0 空間感知套件的一部分,並創下了 12 項世界第一的基準測試紀錄。

🌍
The Next Web (TNW)29d ago

Worldmodeldata 獲 700 萬英鎊融資,將遊戲數據轉化為 AI 訓練資料

位於劍橋的新創公司 Worldmodeldata 籌集了 700 萬英鎊,用於開發將電玩遊戲畫面轉化為高品質 AI 訓練資料的技術。該公司旨在協助 AI 模型更好地理解物理世界的互動。

🏠
IT之家44d ago

Tesla Cybercab 側視鏡頭新增噴淋清洗系統以優化 FSD

Tesla 為其 Cybercab 原型車的側視鏡頭整合了噴淋清洗系統,以確保自動駕駛時的視覺清晰度。此硬體解決方案解決了鏡頭因污垢或天氣因素受阻的關鍵痛點。

🏠
IT之家66d ago

NVIDIA 發布 LocateAnything,主打高速高精度對象檢測

NVIDIA 與多所大學合作推出 LocateAnything 模型,專為機器人和 AI Agent 的即時對象檢測而優化。該模型採用創新的 Parallel Box Decoding 框架,實現了高速且精確的視覺語言定位。

🇨🇳
cnBeta (Full RSS)17d ago

TikTok 測試 AI 肖像檢測工具以打擊深度偽造

TikTok 正在測試一項新工具,讓創作者能識別其肖像是否被 AI 未經授權使用。該功能目前正針對美國創作者進行小範圍測試,旨在協助他們舉報深度偽造內容。

🇨🇳
cnBeta (Full RSS)17d ago

研究揭示 AI 與人類大腦視覺處理的關鍵差異

University of York 的研究人員發現,儘管人工神經網絡(ANN)在預測物體識別方面表現出色,但其內部處理機制與靈長類動物大腦存在顯著差異。這表明目前的 AI 模型可能透過非生物學模擬的方式達成結果。

📄
ArXiv AI18d ago

DialogueVPR:用於視覺地點識別的互動式推理

DialogueVPR 引入了一種用於地理定位的對話式推理範式,超越了靜態檢索。它包含 DlgQuest-Cities 基準測試和 DQ-pilot 框架,透過互動式提問來處理模糊的自然語言查詢。

🐼
Pandaily18d ago

SenseTime 發布統一視覺模型 SenseNova-Vision

SenseTime 開源了 SenseNova-Vision,這是一個整合了檢測、分割、深度預測和 3D 重建的統一模型。該模型目前在 HuggingFace 的 Any-to-Any 排行榜上名列前茅。

🟩
NVIDIA Developer Blog19d ago

使用 NVIDIA DeepStream 9.1 構建多鏡頭 3D 追蹤應用

NVIDIA DeepStream 9.1 引入了多鏡頭 3D 物體追蹤的進階功能,解決了傳統 2D 追蹤的侷限性。此更新使開發者能夠在倉庫和智慧建築等複雜環境中,跨不同鏡頭視角保持物體識別的連續性。

☁️
AWS Machine Learning Blog19d ago

利用 Amazon Bedrock 與 MCP 伺服器構建視覺智慧

本指南介紹了電腦視覺 MCP 伺服器,這是一種將視覺處理整合至 AI 代理的標準化介面。它簡化了將複雜電腦視覺功能整合至更廣泛應用架構的過程。

📊
Bloomberg Technology19d ago

CIA:AI 無人機大幅縮短戰場生存時間

CIA 局長 John Ratcliffe 指出,烏克蘭使用的 AI 攻擊無人機已將俄軍士兵的平均生存時間縮短至 20 至 30 分鐘。

🇨🇳
TechNode21d ago

SenseTime 開源 SenseNova-Vision 統一視覺模型

SenseTime 發布了 SenseNova-Vision,這是一個能處理物件偵測、3D 重建等多項視覺任務的統一基礎模型。它將多種功能整合至單一系統,取代了以往需依賴多個專用模型的做法。

🤖
Reddit r/MachineLearning25d ago

IMGNet:透過符號模式而非餘弦相似度進行人臉驗證

IMGNet 是一種新型人臉驗證模型,以滑動視窗符號模式匹配取代了傳統的餘弦相似度。該模型在 LFW 基準測試中表現優異,且模型大小僅為 10.58 MB。

🦙
Reddit r/LocalLLaMA27d ago

Mistral AI 推出 Robostral Navigate 單鏡頭導航技術

Mistral AI 發布了 Robostral Navigate,這是一項專注於僅使用單一鏡頭進行 AI 導航的新解決方案。此發展標誌著 Mistral 正式跨足具身智能 (Embodied AI) 與機器人應用領域。

🇭🇰
SCMP Technology28d ago

Ant Group 發表突破性機器人視覺技術,解決透明物體識別難題

Ant Group 旗下的具身智能部門 Robbyant 發布了 LingBot-Depth 2.0 與 LingBot-Vision 模型。這些模型旨在協助機器人精確感知並繞過玻璃、鏡面及其他透明物體。

🤖
Reddit r/MachineLearning28d ago

LingBot-Depth 2.0 在遮蔽深度基準測試中達到 SOTA

LingBot-Depth 2.0 引入了感測器有效性遮蔽技術,針對 RGB-D 相機的特定故障分佈進行模型訓練。透過專注於透明表面和無紋理區域等真實感測器限制,該模型在 8 個基準測試中的 7 個表現優於現有方法。

💰
钛媒体28d ago

NovoViz 研發高速低功耗 SPAD 邊緣成像感測器

瑞士企業 NovoViz 研發出一款單光子雪崩二極管(SPAD)邊緣成像傳感器,大幅降低了輸出功耗。該技術可將等效幀率提升至每秒 1 億幀。

⚛️
量子位28d ago

首個空間原生具身視覺基模正式開源

螞蟻靈波發布了首個空間原生具身視覺基模。該模型顯著提升了機器人對三維空間環境的感知與理解能力。

🔥
36氪28d ago

螞蟻集團發布 LingBot-Depth 2.0 空間感知模型

螞蟻集團旗下靈波科技發布 LingBot-Depth 2.0 空間感知模型,該模型基於 1.5 億數據訓練。同步推出的 LingBot-Vision 視覺基座模型旨在提升機器人的空間感知與精細識別能力。

🤖
Reddit r/MachineLearning28d ago

LingBot-Vision:用於自監督預訓練的遮罩邊界建模新方法

LingBot-Vision 引入了一種新的自監督預訓練方法,專注於邊界特徵標記以提升視覺表徵學習。該模型在 NYUv2 深度補全基準測試中表現優異,且訓練數據量遠少於 DINOv3。

🇨🇳
cnBeta (Full RSS)30d ago

iOS 27 原始碼暗示蘋果全新可穿戴設備

洩露的 iOS 27 原始碼中出現了型號為 B790 的新設備引用。該設備明確與「視覺智能」(Visual Intelligence)功能相關聯。

🍎
Apple Machine Learning33d ago

VideoFlexTok:彈性長度影片標記化技術

VideoFlexTok 引入了一種從粗到細的標記化方法,擺脫了僵化的 3D 網格表示。這種方法允許根據影片複雜度進行可變長度的標記化,從而提高效率與資訊保留能力。

🌍
The Next Web (TNW)36d ago

ETH Zurich 開發雙向像素,將螢幕變為相機

ETH Zurich 的研究人員開發出一種能夠同時發光與記錄光線的雙向像素。這項創新可能使螢幕無需外部感測器即可作為相機使用。