
Gemma 4 模型現已登陸 Amazon Bedrock
Google DeepMind 的 Gemma 4 模型系列現已於 Amazon Bedrock 上架。此次發布包含三種經過指令微調的變體,涵蓋密集架構與混合專家模型 (MoE),並具備多模態處理能力。
Tag: #multimodal329 results

Google DeepMind 的 Gemma 4 模型系列現已於 Amazon Bedrock 上架。此次發布包含三種經過指令微調的變體,涵蓋密集架構與混合專家模型 (MoE),並具備多模態處理能力。

Orchestra-o1 是一個專為多代理系統設計的新框架,旨在處理文字、圖像、音訊和影片等異質模態。它改進了任務分解與協作能力,並在 OmniGAIA 基準測試中達到了頂尖效能。

Meta 的智慧眼鏡正被重新應用,為盲人退伍軍人提供視覺輔助。此應用展示了穿戴式 AI 技術在無障礙領域的正面應用案例。

包括 Meta、Google、Samsung、Apple 和 Amazon 在內的主要科技公司正競相將多模態 AI 與攝影機整合至智慧眼鏡中。此趨勢象徵著全天候 AI 互動的轉變,但也面臨大眾對隱私的擔憂。

本文針對 Claude 最新模型 Fable 5 進行實測。報導指出該模型在視覺推理能力上有顯著提升,特別是能準確識別圖像中的手指數量。
NVIDIA 推出了 Nemotron 3.5 Content Safety,這是一款專為企業級 AI 應用提供可自定義多模態安全防護的新工具。它使企業能夠在文字與視覺輸入中執行特定的安全策略,以確保 AI 部署的可靠性。

VAMPS 是一個包含 1,168 個問題的多模態基準測試,旨在評估大型語言模型是否能有效利用視覺化工具解決複雜的代數與微積分問題。研究顯示,目前的模型在整合工具生成的圖表時表現不佳,直接進行分析推理的效果往往更好。
網易有道旗下的 LobsterAI 整合了一系列先進生成式模型,包括 Seedream、Seedance、HappyHorse 及 MiniMax-Hailuo。此更新大幅擴展了平台在圖片與影片合成方面的能力。

Vercel 已將具備 100 萬 token 上下文窗口與原生多模態能力的 MiniMax M3 模型整合至 AI Gateway。開發者現在可以透過統一的 API 使用其強大的代理(agentic)功能與多模態輸入。

快手 2026 年第一季財報顯示,可靈 AI 業務成長強勁,單季營收超過 65 億人民幣。其影片生成技術已擴展至全球 42 個國家與地區,商業化進程顯著加速。