🍎最新收集於 16h

對齊如何改善多模態 LLM

對齊如何改善多模態 LLM
PostLinkedIn
🍎閱讀原文: Apple Machine Learning

💡了解多模態模型對齊為何不能只測事實準確性,還必須衡量視覺一致性。

⚡ 30-Second TL;DR

有什麼變化

偏好對齊已廣泛用於提升 LLM 效能,但在 MLLM 領域仍相對缺乏研究。

為什麼重要

這項研究凸顯,僅針對文字進行的對齊方法可能無法充分解決視覺接地失敗。建構影像理解助理的實務人員,可能需要同時評估事實準確性與回應和影像內容的一致性。

下一步行動

建立影像接地評估資料集,分別評分每個 MLLM 回應的事實正確性,以及其與輸入影像的一致性。

誰應關注:Researchers & Academics

關鍵要點

  • 偏好對齊已廣泛用於提升 LLM 效能,但在 MLLM 領域仍相對缺乏研究。
  • MLLM 幻覺不僅包括錯誤事實,也包括與視覺證據不一致的回應。
  • 對齊的核心目標之一,是讓模型回應更忠實於影像所包含的資訊。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Apple 的研究指出,多模態對齊不僅依賴於文字偏好數據,還需要引入針對視覺內容的細粒度回饋機制,以解決模型在描述影像細節時的『視覺幻覺』。
  • 研究發現,透過強化學習(RLHF)或直接偏好優化(DPO)應用於多模態模型時,若缺乏視覺忠實度(Visual Faithfulness)的懲罰項,模型容易傾向於產生看似合理但與影像無關的敘述。
  • Apple 提出的對齊策略強調了『負面樣本』的重要性,即訓練模型識別並拒絕回答影像中不存在的物件或屬性,這能顯著提升模型在視覺問答(VQA)任務中的準確度。
  • 該研究進一步探討了多模態對齊中的『模態衝突』問題,即當文字指令與視覺資訊發生矛盾時,模型如何透過對齊機制優先採信視覺證據。
  • Apple 的方法論中整合了自動化評估指標,用以量化模型回應與輸入影像之間的語義一致性,這填補了目前多模態模型評估標準中缺乏客觀對齊度量工具的空白。
📊 競品分析▸ Show
特性/模型Apple MLLM AlignmentOpenAI GPT-4oGoogle Gemini 1.5 Pro
對齊核心視覺忠實度與幻覺抑制RLHF 與安全護欄多模態原生對齊與長文本記憶
幻覺控制強調視覺證據一致性透過系統提示與檢索增強透過多模態推理鏈與驗證
技術重點偏好對齊優化大規模人類回饋跨模態聯合訓練

🛠️ 技術深入

  • 採用基於視覺編碼器(Vision Encoder)與大型語言模型(LLM)的混合架構,透過投影層(Projection Layer)對齊特徵空間。
  • 實作了基於視覺偏好數據集(Visual Preference Dataset)的微調流程,該數據集包含針對同一影像的多種回應比較。
  • 引入了針對視覺幻覺的損失函數(Loss Function),懲罰模型在影像中不存在目標物時產生高置信度的描述。
  • 使用了對比學習(Contrastive Learning)技術,強化模型對影像中細微特徵(如文字、物件位置)的辨識能力。
  • 整合了指令微調(Instruction Tuning)與偏好對齊(Preference Alignment)的兩階段訓練策略,以平衡通用語言能力與視覺忠實度。

🔮 前景展望AI analysis grounded in cited sources

多模態對齊將成為未來端側 AI 的核心競爭力。
隨著 Apple 將 MLLM 整合至裝置端,如何在有限算力下維持高視覺忠實度將決定使用者體驗的優劣。
視覺幻覺評估標準將趨向標準化。
Apple 等企業的研究推動了量化視覺忠實度指標的發展,預計未來將出現業界通用的多模態對齊基準測試。

時間線

2023-09
Apple 發布關於多模態模型基礎架構的初步研究。
2024-06
Apple 在 WWDC 宣布 Apple Intelligence,強調多模態整合能力。
2025-03
Apple Machine Learning 發表關於提升 MLLM 視覺推理精確度的技術論文。
2026-02
Apple 擴展其偏好對齊框架,正式納入多模態視覺忠實度評估模組。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning