Search

Tag: #bias-mitigation9 results

Debiasing-DPO 減偏見達84%

Debiasing-DPO 減偏見達84%

研究人員提出 Debiasing-DPO 以對抗 LLM 對無關社會脈絡(如教師人口統計)的偏見。使用 NCTE 課堂記錄,它將偏見降低84%,並在 Llama 和 Qwen 模型上提升準確度52%。標準 DPO 失效,但此自監督方法有效配對中立與偏見推理。

Apple DSO 可控修正 VLM 偏差

Apple DSO 可控修正 VLM 偏差

Apple 推出 DSO,直接導向最佳化方法,用於緩解視覺語言模型 (VLM) 中的人口統計偏差,而不損失效能。它讓使用者可控平衡偏差減輕與模型能力。對視障使用者辨識影像中醫生的應用至關重要。

Apple Machine LearningOfficialApr 29#bias-mitigation
目標提示修正生成圖像偏差

目標提示修正生成圖像偏差

新型推理時框架無需重新訓練,即緩解如 Stable Diffusion 等文字轉圖像模型的人口統計偏差。使用者可選擇公平目標,從均勻分佈到 LLM 告知的分佈,生成比例對應的人口特定提示。在 36 個提示評估中,皮膚色調輸出符合使用者定義目標。

CAFP:反事實模型平均實現群體公平

CAFP:反事實模型平均實現群體公平

CAFP 是一個模型無關的後處理框架,透過平均事實輸入與翻轉敏感屬性的反事實預測來確保群體公平。它無需重新訓練或在訓練時存取受保護屬性。理論分析顯示,它消除對敏感屬性的直接依賴、降低預測與敏感屬性間的互信息,並界定相對於原始模型的預測扭曲。