📄較早收集於 40m

CreativityBench:LLM創意工具再利用基準

CreativityBench:LLM創意工具再利用基準
PostLinkedIn
📄閱讀原文: ArXiv AI

💡新基準顯示 LLM 創意工具再利用失敗—立即基準測試您的模型!

⚡ 30-Second TL;DR

有什麼變化

推出 CreativityBench 評估 LLM 基於可供性的創意

為什麼重要

揭示 LLM 創意工具使用關鍵缺口,對代理開發至關重要。提供測試平台推進未來 AI 系統的規劃與推理。

下一步行動

從 arXiv:2605.02910v2 下載 CreativityBench 資料集並評估您的 LLM 代理。

誰應關注:Researchers & Academics

關鍵要點

  • 推出 CreativityBench 評估 LLM 基於可供性的創意
  • 建置 4K 實體、150K+ 註解的可供性知識庫
  • 生成 14K 需非明顯解決方案的接地任務
  • 10 款 SOTA LLM 在部件、可供性和物理機制上失敗
  • 模型擴展飽和;CoT 改善有限

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • CreativityBench 的核心設計理念源於認知心理學中的「功能固著」(Functional Fixedness)概念,旨在測試模型能否克服對物體既定用途的認知偏見。
  • 該基準測試特別強調「物理接地」(Physical Grounding),要求模型不僅要理解語義,還需模擬物體在三維空間中的幾何結構與力學交互。
  • 研究發現模型在處理「多步驟工具鏈」(Multi-step Tool Chaining)時表現最差,顯示現有 LLM 缺乏對複雜因果鏈條的規劃能力。

🛠️ 技術深入

  • 知識庫構建:採用基於 PartNet-Mobility 的數據集進行擴展,為 4,000 個實體標註了細粒度的部件層級可供性(Part-level Affordances)。
  • 任務生成機制:利用自動化腳本結合人工審核,生成包含「非顯而易見」解決方案的任務,要求模型在給定受限環境下選擇替代工具。
  • 評估指標:引入了「功能對齊分數」(Functional Alignment Score),用於衡量模型生成的解決方案在物理可行性與任務目標之間的匹配度。
  • 模型測試範圍:涵蓋了包括 GPT-4o、Claude 3.5 Sonnet 及開源模型 Llama 3 在內的 10 款主流模型,測試環境均在零樣本(Zero-shot)與少樣本(Few-shot)設置下進行。

🔮 前景展望AI analysis grounded in cited sources

具身智能(Embodied AI)將優先採用此基準進行訓練。
機器人需要具備超越語義理解的物理推理能力,CreativityBench 提供的可供性知識庫是訓練機器人操作未知物體的關鍵數據。
LLM 的推理架構將從純文本轉向多模態物理模擬。
現有模型在物理機制上的失敗證明,僅靠文本預訓練無法解決複雜的工具再利用問題,未來模型需整合物理引擎進行推理。

時間線

2025-11
CreativityBench 研究團隊開始構建基於 PartNet-Mobility 的可供性知識庫。
2026-03
完成 14K 受限任務集的自動化生成與人工校準。
2026-04
對 10 款 SOTA LLM 進行基準測試並完成數據分析。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI