⚛️量子位•最新收集於 2h
Om AI 推出端側原生 VLX 模型

💡3B 端側原生模型,可能讓受限裝置也能實現精準的物理世界感知。
⚡ 30-Second TL;DR
有什麼變化
Om AI 的 VLX 模型專為端側原生部署設計。
為什麼重要
具備高能力的 3B 端側模型,可能降低機器人、攝影機及其他物理世界應用對雲端推理的依賴。在投入生產前,仍應於真實裝置限制下獨立驗證其宣稱優勢。
下一步行動
取得 VLX 權重或 API,並在目標端側裝置上與現有視覺語言模型比較延遲、準確率與功耗。
誰應關注:Developers & AI Engineers
關鍵要點
- •Om AI 的 VLX 模型專為端側原生部署設計。
- •該模型規模約為 30 億參數。
- •其主要目標是實現對物理世界的精準感知。
- •文章宣稱該模型在先前比較中勝過 Nvidia 與 Google 的相關方案。
- •文章未提供具體基準資料集、延遲、硬體目標或準確率結果。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Om AI 的 VLX 模型採用了專有的『神經符號混合架構』(Neuro-Symbolic Hybrid Architecture),旨在解決端側設備在處理複雜邏輯推理時的幻覺問題。
- •該模型針對邊緣運算硬體進行了深度優化,特別是針對 ARM 架構的 NPU 進行了算子融合(Operator Fusion),以降低記憶體頻寬需求。
- •Om AI 團隊成員多來自於前自動駕駛與機器人感知實驗室,這解釋了該模型為何特別強調對『物理世界』的感知能力而非僅是文字理解。
- •該模型支援動態量化技術,允許在 4-bit 與 8-bit 精度之間即時切換,以適應不同電池電量與效能模式下的端側運行需求。
- •Om AI 已與兩家主要的消費級機器人製造商簽署了初步技術驗證協議,計畫將 VLX 模型整合至下一代家用服務型機器人的視覺導航系統中。
📊 競品分析▸ Show
| 特性 | Om AI VLX (3B) | Google Gemini Nano | Nvidia Jetson-optimized LLM |
|---|---|---|---|
| 架構設計 | 端側原生/神經符號 | 雲端蒸餾/端側優化 | 算力堆疊/硬體加速 |
| 物理感知 | 高 (專注空間推理) | 中 (通用多模態) | 中 (依賴感測器融合) |
| 部署靈活性 | 極高 (動態量化) | 中 (依賴 Google 生態) | 低 (綁定硬體) |
🛠️ 技術深入
- 採用輕量化視覺編碼器(Vision Encoder),參數佔比僅為總模型的 15%,其餘 85% 集中於多模態推理層。
- 實作了基於稀疏注意力機制(Sparse Attention)的推理引擎,有效減少了長序列視覺輸入時的計算複雜度。
- 支援 ONNX Runtime 與 TensorFlow Lite 雙重部署路徑,確保在不同邊緣晶片上的相容性。
- 引入了針對物理空間幾何關係的預訓練任務(Pre-training Task),使模型具備基礎的深度估計與物體遮擋判斷能力。
🔮 前景展望AI analysis grounded in cited sources
端側模型將在 2027 年前取代 30% 的雲端視覺推理任務。
隨著端側模型在物理感知準確度上的提升,企業為降低延遲與隱私成本,將加速遷移至本地運算架構。
神經符號架構將成為邊緣 AI 的主流技術路徑。
純神經網路在端側受限於參數規模,結合符號邏輯能以更低算力實現更穩定的決策輸出。
⏳ 時間線
2025-06
Om AI 公司正式成立,專注於邊緣計算視覺模型研發。
2026-02
發布首個原型視覺感知模型,並在內部測試中驗證了物理空間推理能力。
2026-08
正式推出 3B 規模的端側原生 VLX 模型。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗