
利用 Amazon Bedrock 與 MCP 伺服器構建視覺智慧
本指南介紹了電腦視覺 MCP 伺服器,這是一種將視覺處理整合至 AI 代理的標準化介面。它簡化了將複雜電腦視覺功能整合至更廣泛應用架構的過程。
Tag: #computer-vision379 results

本指南介紹了電腦視覺 MCP 伺服器,這是一種將視覺處理整合至 AI 代理的標準化介面。它簡化了將複雜電腦視覺功能整合至更廣泛應用架構的過程。
CIA 局長 John Ratcliffe 指出,烏克蘭使用的 AI 攻擊無人機已將俄軍士兵的平均生存時間縮短至 20 至 30 分鐘。

SenseTime 發布了 SenseNova-Vision,這是一個能處理物件偵測、3D 重建等多項視覺任務的統一基礎模型。它將多種功能整合至單一系統,取代了以往需依賴多個專用模型的做法。

IMGNet 是一種新型人臉驗證模型,以滑動視窗符號模式匹配取代了傳統的餘弦相似度。該模型在 LFW 基準測試中表現優異,且模型大小僅為 10.58 MB。

Mistral AI 發布了 Robostral Navigate,這是一項專注於僅使用單一鏡頭進行 AI 導航的新解決方案。此發展標誌著 Mistral 正式跨足具身智能 (Embodied AI) 與機器人應用領域。

Ant Group 旗下的具身智能部門 Robbyant 發布了 LingBot-Depth 2.0 與 LingBot-Vision 模型。這些模型旨在協助機器人精確感知並繞過玻璃、鏡面及其他透明物體。

LingBot-Depth 2.0 引入了感測器有效性遮蔽技術,針對 RGB-D 相機的特定故障分佈進行模型訓練。透過專注於透明表面和無紋理區域等真實感測器限制,該模型在 8 個基準測試中的 7 個表現優於現有方法。

瑞士企業 NovoViz 研發出一款單光子雪崩二極管(SPAD)邊緣成像傳感器,大幅降低了輸出功耗。該技術可將等效幀率提升至每秒 1 億幀。

螞蟻靈波發布了首個空間原生具身視覺基模。該模型顯著提升了機器人對三維空間環境的感知與理解能力。
螞蟻集團旗下靈波科技發布 LingBot-Depth 2.0 空間感知模型,該模型基於 1.5 億數據訓練。同步推出的 LingBot-Vision 視覺基座模型旨在提升機器人的空間感知與精細識別能力。