
MedGemma 1.5 推進醫學多模態 AI
MedGemma 1.5 4B 在 MedGemma 1 基礎上擴展,支援高維醫學影像如 CT/MRI 體積與病理全切片,加上解剖定位與多時間點 X 光分析。它取得重大進展:3D MRI 分類提升 11%、病理 macro F1 達 47%,並改善臨床 QA 與 EHR 理解。作為開放資源,讓開發者建構先進醫學 AI 系統。
Tag: #multimodal329 results

MedGemma 1.5 4B 在 MedGemma 1 基礎上擴展,支援高維醫學影像如 CT/MRI 體積與病理全切片,加上解剖定位與多時間點 X 光分析。它取得重大進展:3D MRI 分類提升 11%、病理 macro F1 達 47%,並改善臨床 QA 與 EHR 理解。作為開放資源,讓開發者建構先進醫學 AI 系統。

TRACE-KG 是一個多模態框架,從複雜文件建構上下文豐富的知識圖譜與誘導架構,而無需預定義本體。它透過結構化限定詞捕捉條件關係,並確保完全可追溯至來源證據。實驗證實其產生結構連貫、可追溯的圖譜,優於傳統管道。
OpenClaw 2026.4.5 為代理程式引入內建 video_generate 和 music_generate 工具,支援 ComfyUI、Google Lyria 和 MiniMax 等提供者。它移除舊版設定別名,並透過 openclaw doctor --fix 提供遷移支援,同時新增 12 種語言的多語系 UI。新提供者包括 Qwen、Fireworks AI、Amazon Bedrock,加上強化執行批准和外掛管理。

展示使用 Gemma E2B 在 M3 Pro Mac 上實現即時音頻/視頻輸入與語音輸出,適合語言學習如對準物體拍照。模型支援多語言,可回退至母語。提供儲存庫供複製。

微軟推出 MAI-Transcribe-1 新語音轉文字模型。內部開發的 MAI-Voice-1 與 MAI-Image-2 首次廣泛提供給開發者商用。此舉擴大微軟獨立於 OpenAI 的專有 AI 能力。

智譜AI推出GLM-5V-Turbo,一款多模態模型支援視覺編程。使用者僅需一張手繪草圖,即可生成完整前端程式碼。此進展推動「視覺編程」,加速UI原型製作。

阿里巴巴 Qwen 團隊推出 Qwen3.5-Omni,全模態 AI 模型。支援 113 種語言的語音辨識及 36 種語言的語音生成。模型在多模態基準測試中取得 215 項 SOTA 成果。

阿里巴巴在 Reddit r/LocalLLaMA 上發布 Qwen3.5-Omni 的基準測試結果。貼文分享模型效能細節。社群討論可能在留言中展開。

Ricoh 開發了 Qwen3-VL-Ricoh-32B-20260227,這是一款擁有 320 億參數的多模態 LLM,能以日語進行推論。宣稱性能匹敵 Gemini 2.5 Pro,並可讀解包含複雜圖表的日語資料。

美團開源了 LongCat-Next,這是一個真正的原生多模態模型。它將文字、視覺和音頻統一為單一架構中的 token,無需獨立的模態編碼器。