
Qwen 預告全新 27B 模型
Qwen 開發團隊表示全新的 27B 模型即將發布,並稱其能力將大幅提升,而不只是重新訓練版本。他們也透露 Qwen3.8 的細節,包括 2.4T 總參數、95B 活躍參數、大量後訓練運算,以及用於處理超過 100 小時影片的階層式影片記憶方法。
Tag: #video-understanding6 results

Qwen 開發團隊表示全新的 27B 模型即將發布,並稱其能力將大幅提升,而不只是重新訓練版本。他們也透露 Qwen3.8 的細節,包括 2.4T 總參數、95B 活躍參數、大量後訓練運算,以及用於處理超過 100 小時影片的階層式影片記憶方法。

字節跳動升級 Doubao-Seed-2.0-lite,為豆包家族首款全模態模型,原生統一理解影片、圖像、音訊與文字。在視覺/音訊基準達 SOTA,超越 Gemini-3.1-Pro,Agent、Coding 與 GUI 能力同步強化。現已在火山方舟上線,適合企業部署。

Amazon Bedrock 的多模態基礎模型透過三種架構方法實現可擴展的影片理解。每種方法適用於不同的使用案例與成本效能權衡。本文探討大規模影片洞察的實作方式。

ViSAGE 是一套用於長篇影片理解的多模態代理記憶框架,能建立以實體為中心且可自我修正的記憶。它透過提升身份一致性與證據驗證能力,較最強基準模型取得高出 5.9% 的準確率。

豐田於4月22日發表獨家「Woven AI」,能從攝影機影像高精度理解並語言化街頭空間中人車移動等實際事象。具備世界最高水準的影片理解性能,可預測事象變化。
貼文質疑人類與人形機器人動作可預測性差異,用於長影片理解。人形機器人不可預測性挑戰 VLMs 在影片問答生成與辨識。凸顯以人類資料訓練 AI 模型的問題。