Search

直接匹配不多,已補上最新動態。

Tag: #model-robustness4 results

Debiasing-DPO 減偏見達84%

Debiasing-DPO 減偏見達84%

研究人員提出 Debiasing-DPO 以對抗 LLM 對無關社會脈絡(如教師人口統計)的偏見。使用 NCTE 課堂記錄,它將偏見降低84%,並在 Llama 和 Qwen 模型上提升準確度52%。標準 DPO 失效,但此自監督方法有效配對中立與偏見推理。