Search

Tag: #vision-language20 results

Phi-4-Vision 以 1/5 資料匹敵巨頭

Phi-4-Vision 以 1/5 資料匹敵巨頭

Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。

InVitroVision:AI自動描述胚胎發育

InVitroVision:AI自動描述胚胎發育

研究人員使用1,000張胚胎時間延遲影像及標題微調PaliGemma-2,開發出InVitroVision,能預測胚胎形態、細胞週期及發育階段的自然語言描述。此模型在各指標超越ChatGPT 5.2及基礎模型,效能隨訓練資料增加而提升。此研究突顯視覺語言模型在少樣本IVF應用上的潛力。

ArXiv AIResearchApr 24#multi-modal#ivf#vision-language
Page 2 of 2