Search

Tag: #bias-mitigation9 results

Debiasing-DPO Cuts LLM Bias 84%

Debiasing-DPO Cuts LLM Bias 84%

Researchers propose Debiasing-DPO to counter LLM biases from spurious social contexts like teacher demographics. Using NCTE classroom transcripts, it reduces bias by 84% and boosts accuracy 52% on Llama and Qwen models. Standard DPO fails, but this self-supervised method pairs neutral and biased reasoning effectively.

Bias Mitigation Evaluated in LLM Judges

Bias Mitigation Evaluated in LLM Judges

A study evaluates nine debiasing strategies across five LLM judges from Google, Anthropic, OpenAI, and Meta on three benchmarks. Style bias dominates (0.76-0.92), while models correctly distinguish quality from length. Combined budget debiasing improves Claude Sonnet 4 by +11.2 pp, with code and dataset released on GitHub.

Apple's DSO Fixes VLM Bias Controllably

Apple's DSO Fixes VLM Bias Controllably

Apple introduces DSO, a direct steering optimization method to mitigate demographic biases in vision-language models (VLMs) without performance loss. It enables users to controllably balance bias reduction with model capabilities. Key for applications like identifying doctors in images for visually impaired users.

Apple Machine LearningOfficialApr 29#bias-mitigation
Target Prompting Fixes T2I Bias

Target Prompting Fixes T2I Bias

New inference-time framework mitigates demographic bias in text-to-image models like Stable Diffusion without retraining. Users select fairness targets, from uniform to LLM-informed distributions, generating proportional demographic-specific prompts. Evaluated on 36 prompts, it aligns skin-tone outputs with user-defined targets.

CAFP: Fairness via Counterfactual Averaging

CAFP: Fairness via Counterfactual Averaging

CAFP is a model-agnostic post-processing framework that ensures group fairness by averaging predictions from factual inputs and counterfactuals with flipped sensitive attributes. It requires no retraining or protected attribute access during training. Theoretical analysis shows it eliminates direct sensitive attribute dependence, reduces mutual information, and bounds prediction distortion.

Unmasking Implicit Bias in AI and Social Systems

Unmasking Implicit Bias in AI and Social Systems

The article analyzes how 'benevolent' sexism and implicit biases are embedded in social structures, drawing parallels to how AI models inherit human cognitive shortcuts and societal prejudices. It emphasizes the need for active identification and deconstruction of these biases to prevent them from becoming automated norms.