
以 NVIDIA FLARE 建構聯邦多模態 AI 工作流程
NVIDIA FLARE 讓組織能在不集中敏感影像與文字資料的情況下,協調 vision-language models 的訓練。此方法支援視覺問答、圖片描述及圖文推理等多模態應用,同時讓原始資料保留在各機構本地。
Tag: #multimodal-ai55 results

NVIDIA FLARE 讓組織能在不集中敏感影像與文字資料的情況下,協調 vision-language models 的訓練。此方法支援視覺問答、圖片描述及圖文推理等多模態應用,同時讓原始資料保留在各機構本地。

昆侖科技的 SkyReels-V4 模型在 Artificial Analysis 排行榜的「文字轉影片(含音訊)」類別中獲得全球第一名。它超越了 Kling 3.0、Google Veo 3.1 和 OpenAI Sora 2 等主流競爭對手。

字節跳動推出Seedance 2.0,多模態AI影片生成器媲美Sora,具「全能參考」支援圖片/影片/音頻輸入及「分身」單張照片生成逼真虛擬人。能產出電影風格、物理準確動作,用於央視春晚;引發好萊塢版權訴訟。全球用戶湧入中國App即夢。

一款全新的 99.99 美元 AI 智慧眼鏡,將視覺辨識、即時翻譯、語音助理與開放式音訊整合到外觀平凡的鏡框中。眼鏡亦搭載 12MP Sony 相機,可理解使用者周遭環境。

Alibaba 為 Qwen App 新增五項免費功能,全部由 Qwen3.8-MAX 旗艦模型驅動。Alibaba Cloud 同時開放 Wan 3.0 公開測試,加入文件輸入影片生成能力,並推出面向中小企業的價格方案。

據報導,Meta 正在開發具備「超級感知」功能的智慧眼鏡原型,能夠持續錄製音訊並每隔幾秒拍攝照片。該系統旨在讓使用者能向 Meta AI 詢問周遭環境資訊,但原始數據可能不會直接提供給使用者。

Meta 正在測試一款搭載 AI 的智慧眼鏡原型,配備攝影機與錄音模組。該設備旨在實現對使用者周遭環境的持續即時記錄,標誌著 Meta 正式切入全天候穿戴式 AI 硬體市場。

Google 推出了 Nano Banana 2 Lite,這是一款可透過 Gemini API 存取的經濟型文字轉圖像模型。此外,Gemini Omni Flash 現已開放預覽,支援從文字、圖像和片段生成 10 秒影片。

Google 對使用了 25 年的搜尋框進行了重大改版,將其從關鍵字輸入轉變為支援文字、圖片、PDF 和影片的多模態動態介面。此次更新將 AI Overviews 與 AI Mode 合併為單一流程,旨在引導使用者進行更複雜的對話式查詢。

Meta 正在擴展其智慧眼鏡生態系統,允許第三方開發者構建自定義應用程式。此舉旨在透過整合更多樣化的軟體體驗,提升硬體的實用性。