
Grok 4.6 登陸 Vercel AI Gateway
來自 xAI 的 Grok 4.6 現已透過 Vercel AI Gateway 提供,支援 500K token 上下文視窗,以及文字和圖片輸入。開發者可選擇 low、medium、high 或 xhigh 推理等級,預設為 high,也能透過 AI SDK 或 coding agents 使用該模型。
Tag: #multimodal328 results

來自 xAI 的 Grok 4.6 現已透過 Vercel AI Gateway 提供,支援 500K token 上下文視窗,以及文字和圖片輸入。開發者可選擇 low、medium、high 或 xhigh 推理等級,預設為 high,也能透過 AI SDK 或 coding agents 使用該模型。

MiniMax H3 現已開放模型權重,並在單一工作流程中結合文字、圖片、影片與音訊作為上下文。模型可原生輸出最長 15 秒、2K 規格的立體聲音訊,而 768p Base 模型據社群基準測試可在消費級 GPU 上於數分鐘內運行。
Meta 推出 Muse Glimmer,一套設計為可在本機執行的開源 AI 系統。該產品具備代理能力與多模態特性,表示其可跨多種輸入與輸出模態執行自主任務。

ByteDance 發布 SeedRealtime 音視頻全雙工大模型,旨在提供更自然的即時互動體驗。同篇報導亦提到 JD.com 開源 JoyAI-Video-Edit 模型,支援即時互動式影片編輯。

ByteDance 推出全雙工 AI 模型 SeedRealtime,專為持續性對話而設計。該模型整合音訊、影片與文字,並支援主動回應及更自然的對話節奏。
阿里正式推出 Qwen-Image-3.0,這是其圖像生成基礎模型的第三代產品。該模型具備更強的性能,包括支援 4.5k token 輸入、10px 小字精準渲染以及 12 種語言的原生渲染能力。

Thinking Machines Lab 推出了 Inkling,這是一個擁有 9750 億參數的開源模型。該模型專門用於處理並理解影片與音訊數據。

阿里巴巴發布了全新的即時語音大模型 Qwen-Audio-3.0-Realtime。此次更新針對速度與智慧化能力進行了四項關鍵功能升級。

SenseTime 發布了 SenseNova-Vision,這是一個能處理物件偵測、3D 重建等多項視覺任務的統一基礎模型。它將多種功能整合至單一系統,取代了以往需依賴多個專用模型的做法。

MedRealMM 是一個基於真實中文臨床諮詢的大規模多模態基準測試。它評估了大型語言模型處理圖文醫療數據的能力,並突顯了模型在安全性與推理能力上與人類醫師的差距。