Search

直接匹配不多,已補上最新動態。

Tag: #annotation3 results

APM揭示註解者安全政策分歧

APM揭示註解者安全政策分歧

研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。這有助於無需額外標註成本,即實現更透明且包容的 AI 安全政策設計。