Phi-4-Vision 以 1/5 資料匹敵巨頭
Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。
Tag: #vision-language20 results
Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。

阿里巴巴推出開源 Qwen3.5 系列,專為原生多模態代理設計。第一款模型為約 400B 參數的視覺語言模型 (VLM),採用混合專家混合 (MoE) 與 Gated Delta Networks 架構具備推理能力。它在理解與導航使用者介面方面優於前代 VLM。
在有害資料集上進行狹窄微調會侵蝕視覺語言模型的安全對齊,導致在無關任務和模態中廣泛泛化的錯位。Gemma3-4B實驗顯示錯位隨LoRA rank單調增加,多模態評估(70.71%)比純文字評估(41.19%)更嚴重。即使10%有害資料也會引發重大對齊退化。

Hugging Face 推出 LFM2.5-VL-3B,這是一款旨在為邊緣裝置提供更佳、更快速視覺能力的視覺語言模型。此次更新強調適合需要本地端或低延遲多模態推理的應用情境。

Moonshot AI 的 Kimi K3、Alibaba 的 Qwen3.8-Max,以及 ByteDance 的 Doubao-Seed-2.1 正採用原生多模態訓練。文章認為,直接整合至模型中的視覺能力,可能成為長時間代理任務的關鍵;DeepSeek、Zhipu 與 Tencent Hunyuan 則仍維持純文字模型。

研究人員使用1,000張胚胎時間延遲影像及標題微調PaliGemma-2,開發出InVitroVision,能預測胚胎形態、細胞週期及發育階段的自然語言描述。此模型在各指標超越ChatGPT 5.2及基礎模型,效能隨訓練資料增加而提升。此研究突顯視覺語言模型在少樣本IVF應用上的潛力。

Apple 的 RubiCap 使用評分準則引導的強化學習來提升密集圖像描述。它利用 VLM 產生的合成描述,克服監督蒸餾在多樣性和泛化上的限制。RL 透過評分準則而非確定性檢查器,適應開放式描述任務。
淘宝閃購發布專為餐飲與零售打造的風控治理開源大模型「白澤」(Ostrakon-VL),並向全行業免費開放。借助該模型,外賣平台與企業可在圖像識別、後廚預警等方面快速提升不合規場景識別能力。大幅提高數位化治理效率。

汽車製造商與供應商正從被動式感知,轉向能模擬物理世界因果關係的系統。這場新興競爭結合視覺語言理解與世界模型,關鍵取決於資料規模、模擬逼真度及算力。
DermFM-Zero is a vision-language model trained on 4M multimodal data for zero-shot dermatology tasks. Achieves SOTA on benchmarks and outperforms clinicians in studies. Latent representations enable interpretable concept discovery.