📄ArXiv AI•最新收集於 17h
HarvestBench 為 AI 的慈悲定價

💡了解哪些 LLM 願意付出代價避免傷害,以及簡單道德提示如何改變其行為。
⚡ 30-Second TL;DR
有什麼變化
基準測試讓代理面對有價格的選擇:免費碾過動物,或支付燃料繞路。
為什麼重要
HarvestBench 顯示,模型能力本身並不是安全代理行為的可靠預測指標,尤其是在避免傷害需要付出明確操作成本時。其結果支持透過記錄行動、誘因與副作用來評估代理,而不只是依賴模型對安全議題的口頭判斷。
下一步行動
讓你的代理策略執行 HarvestBench 或類似的有價副作用模擬,並比較加入與移除明確安全提示時的日誌傷害率。
誰應關注:Researchers & Academics
關鍵要點
- •基準測試讓代理面對有價格的選擇:免費碾過動物,或支付燃料繞路。
- •在 7,201 次決策中,動物碾殺率介於 0.4% 到 98.8%,且與模型能力沒有明顯關聯。
- •六個受測模型中的四個對價格具有顯著反應,測得的價格彈性介於 0.09 到 1.69。
- •九個模型碾過野生動物的頻率都高於農場動物;道德提示則讓六個推理模型中的五個將碾殺率降至 6% 以下。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。
