Search

Tag: #content-moderation244 results

逃脫一致性陷阱:規則治理AI的防禦性信號

逃脫一致性陷阱:規則治理AI的防禦性信號

研究人員提出防禦性指數 (DI) 和歧義指數 (AI) 等新指標,用於評估規則治理的 AI 內容審核,避免人類標籤一致性的「一致性陷阱」。他們引入來自 token logprobs 的機率防禦性信號 (PDS),用於推理穩定性評估。在 193k+ Reddit 決策上驗證,顯示傳統指標的重大差距,並實現 78.6% 自動化覆蓋率。

Page 4 of 25