生數科技發布 Vidu S1 即時交互模型
生數科技正式發布 Vidu S1,這是一款具備即時交互能力的新一代影片生成模型,支援語音控制與高畫質輸出。
Tag: #multimodal328 results
生數科技正式發布 Vidu S1,這是一款具備即時交互能力的新一代影片生成模型,支援語音控制與高畫質輸出。

杭州的一個團隊成功將流式多模態模型部署到端側,標誌著 CVPR 2026 趨勢的一個重要里程碑。

佛羅里達國際大學的研究人員發現,圖像中不可見的像素級修改可以迫使 AI 聊天機器人繞過其安全防護機制,並生成受限內容。

Google DeepMind 發布了 Gemma 4 12B,這是一款全新的無編碼器多模態模型。此次發布擴展了 Gemma 系列,增強了處理多樣化數據類型的能力。

Google 發布了 Gemma 4 12B 多模態模型,旨在於消費級硬體上本地運行。該模型在僅需 16GB 記憶體的條件下,提供了媲美 26B 版本的效能。

頂尖 AI 實驗室發布了全球首個全模態 API,即日起無限期免費開放。該 API 支援文字、圖像與影片數據的無縫處理。

Google 發布了 Gemini 3.5 Flash 與 Omni 模型,同時產業迎來重大變革,包括 Anthropic 延攬 Andrej Karpathy 以及 AMD 擴展本土 AI 算力基礎設施。AI 競爭正從參數比拼轉向生態構建與行業滲透。

Google 正式發布了 Gemini 3.5 模型,並同步推出全新的 AI Agent 功能與先進的影片生成模型。此次發布標誌著 Google 的產品策略正顯著轉向自主 AI Agent。

Intern-S2-Preview 是一款全新的 35B 科學基礎模型,透過擴展任務難度與多樣性來提升效能。該模型具備增強的代理能力,並利用思維鏈(CoT)壓縮技術實現高效的強化學習。