
Debiasing-DPO 減偏見達84%
研究人員提出 Debiasing-DPO 以對抗 LLM 對無關社會脈絡(如教師人口統計)的偏見。使用 NCTE 課堂記錄,它將偏見降低84%,並在 Llama 和 Qwen 模型上提升準確度52%。標準 DPO 失效,但此自監督方法有效配對中立與偏見推理。
Tag: #bias-mitigation9 results

研究人員提出 Debiasing-DPO 以對抗 LLM 對無關社會脈絡(如教師人口統計)的偏見。使用 NCTE 課堂記錄,它將偏見降低84%,並在 Llama 和 Qwen 模型上提升準確度52%。標準 DPO 失效,但此自監督方法有效配對中立與偏見推理。
JudgeGPT 是開源工具,用於透過 Ollama 進行本地 LLM-as-judge 基準測試,解決偏誤問題,包含評分量規、CoT 與遙測。具 UI 可配置評審、人類融合與 GPU 監控。GitHub 儲存庫支援 Docker。

一項研究在三個基準上評估九種去偏差策略,涵蓋 Google、Anthropic、OpenAI 和 Meta 的五個 LLM 評判者。風格偏差最為顯著(0.76-0.92),模型能正確區分品質與長度。結合預算去偏差策略將 Claude Sonnet 4 提升 +11.2 個百分點,並在 GitHub 釋出程式碼與資料集。

Apple 推出 DSO,直接導向最佳化方法,用於緩解視覺語言模型 (VLM) 中的人口統計偏差,而不損失效能。它讓使用者可控平衡偏差減輕與模型能力。對視障使用者辨識影像中醫生的應用至關重要。

新型推理時框架無需重新訓練,即緩解如 Stable Diffusion 等文字轉圖像模型的人口統計偏差。使用者可選擇公平目標,從均勻分佈到 LLM 告知的分佈,生成比例對應的人口特定提示。在 36 個提示評估中,皮膚色調輸出符合使用者定義目標。

CAFP 是一個模型無關的後處理框架,透過平均事實輸入與翻轉敏感屬性的反事實預測來確保群體公平。它無需重新訓練或在訓練時存取受保護屬性。理論分析顯示,它消除對敏感屬性的直接依賴、降低預測與敏感屬性間的互信息,並界定相對於原始模型的預測扭曲。

NCA的Alex Murray承認打擊犯罪AI存在偏差,但承諾透過新115百萬英鎊AI中心緩解。工黨推動警察AI大幅擴張,以提升複雜調查效率。目標對抗新型犯罪威脅,而非變成「機器戰警」。

本文分析了「善意型」性別歧視與隱性偏見如何植根於社會結構中,並類比了 AI 模型如何繼承人類的認知捷徑與社會偏見。文章強調必須主動識別並解構這些偏見,以防止其成為自動化的社會規範。
UCLA 的 Safiya Noble 指出,由於訓練數據中存在固有的偏見與刻板印象,目前的 AI 系統並不安全。此評論發布於各大 AI 公司準備 IPO 之際。