
AEROBAT 自動化 AI Agent 行為研究
AEROBAT 是一套多代理系統,能自動化 AI agent 行為研究的完整流程,涵蓋假設生成、實驗設計、分析與報告撰寫。在 12 種目標行為中,系統測試了 79 項假設,執行 1,240 項控制實驗與 23,512 輪模擬,並為其中 26 項假設找到中度至強度的統計證據。
Tag: #behavioral-science8 results

AEROBAT 是一套多代理系統,能自動化 AI agent 行為研究的完整流程,涵蓋假設生成、實驗設計、分析與報告撰寫。在 12 種目標行為中,系統測試了 79 項假設,執行 1,240 項控制實驗與 23,512 輪模擬,並為其中 26 項假設找到中度至強度的統計證據。

Wharton 研究人員 Steven Shaw 與 Gideon Nave 提出了「認知投降」(cognitive surrender)一詞,用以描述使用者傾向於讓 AI 聊天機器人代為決策的現象。該研究探討了人類將批判性思考外包給人工智慧的心理轉變。

本研究重新分析了先前關於「較低 AI 素養會導致較高 AI 接受度」的說法。研究發現,這種相關性僅存在於非文字類 AI 工具中,而文字類 AI 的使用則無此關聯。

康乃爾大學的研究人員開發了一種 AI 工具,旨在透過凸顯使用者陳述的價值觀與實際選擇之間的差異,來改善決策品質。它更像是一面反思鏡,而非自動決策者。

本文探討了暴食的演化起源,解釋了人類對高熱量食物的生存本能如何被現代食品加工業所利用。文章並提供了透過改變環境與食物選擇來繞過這些生物學觸發機制的策略。
John Calhoun 的「25 號宇宙」小鼠實驗說明了消除稀缺性和挑戰如何導致社會紐帶和行為規範的徹底崩潰。這對於那些在沒有目標的情況下滿足所有物質需求的社會來說,是一個警示故事。

一項最新研究顯示,廣泛用於減重的 GLP-1 受體激動劑可能與攻擊性及暴力犯罪風險的降低有關。這一發現為這些熱門藥物的社會影響增添了新的討論維度。
ReplicatorBench tests LLM agents on replicating social/behavioral science claims end-to-end. Covers extraction, experiments, and interpretation with replicable/non-replicable cases. ReplicatorAgent baselines show strengths in execution but weaknesses in data retrieval.