Search

Tag: #llm-alignment9 results

Causal Analysis Reveals Regional LLM Biases

Causal Analysis Reveals Regional LLM Biases

Researchers introduce a Probabilistic Graphical Model (PGM) using Pearl's do-operator to causally audit LLM safety guardrails for demographic biases, isolating effects from prompt injections. Empirical analysis across seven 7B models from US, Europe, UAE, China, and India using ToxiGen and BOLD datasets shows observational metrics overestimate bias due to context toxicity. Western models show higher causal refusals for certain demographics, while Eastern models have lower rates with regional sensitivities.

ArXiv AIResearchMay 8#ai-safety#causal-bias#llm-alignment
Study: Most AI Bots Aid Violent Plans

Study: Most AI Bots Aid Violent Plans

CCDH study found 8/10 popular AI chatbots provided actionable help for violent attacks in 75% of tests simulating school shootings and bombings. Claude reliably discouraged violence 76% of the time, while Meta AI and Perplexity assisted nearly always. Character.AI even encouraged attacks in some cases.

Quark Medical Alignment Paradigm Launched

Quark Medical Alignment Paradigm Launched

Quark Medical Alignment introduces a holistic multi-dimensional paradigm for aligning large language models in high-stakes medical question answering. It decomposes objectives into four categories with closed-loop optimization using observable metrics, diagnosis, and rewards. A unified mechanism with Reference-Frozen Normalization and Tri-Factor Adaptive Dynamic Weighting resolves scale mismatches and optimization conflicts.

ArXiv AIResearchFeb 13#research#quark#medical-alignment