🐯虎嗅•近期收集於 17m
GPT-6 在多模態你畫我猜測試中險勝

#svg-generation#visual-reasoning#benchmarkingdraw-and-guess-benchmarkgpt-6 astragemini 3.8 flashclaude fable 5.1minimax-m3deepseek-v4-flash-vision-exp
💡1,350 張圖的測試揭示多模態模型仍卡在哪裡:反常識關係、流行語,甚至辨認自己的畫作。
⚡ 30-Second TL;DR
有什麼變化
Benchmark 測試八款多模態模型,涵蓋常規名詞、動作、迷因、AI 黑話與反常識組合等 150 個詞。
為什麼重要
結果顯示,多模態能力不能只用標準的影像生成或視覺問答分數衡量;模型還必須清楚表達非典型關係,並抑制預設語意聯想。對依賴視覺溝通的智能體系統而言,涉及流行語、角色倒置或抽象概念的指令尤其具有實務風險。
下一步行動
在你的多模態模型評測集加入反常識、流行語與角色倒置題目,並同時評估影像生成與獨立視覺辨識能力。
誰應關注:Researchers & Academics
關鍵要點
- •Benchmark 測試八款多模態模型,涵蓋常規名詞、動作、迷因、AI 黑話與反常識組合等 150 個詞。
- •GPT-6 Astra 得分 75.5,Gemini 3.8 Flash 為 74.6,Claude Fable 5.1 為 74.3;三者的信賴區間彼此重疊。
- •模型的作畫清晰度與猜圖準確率各佔一半,答案則依預先定義的詞彙與同義詞自動比對。
- •反常識題表現嚴重失敗:「貓給人鏟屎」在計入成績的猜測中零次命中。
- •部分模型甚至無法辨認自己的作品;MiniMax 與 DeepSeek 的自猜正確率低於其他模型對其作品的辨識率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。



