Search

Tag: #llm-safety36 results

Crosscoders Unlock Cross-Architecture LLM Diffing

Crosscoders Unlock Cross-Architecture LLM Diffing

Researchers apply Crosscoders for the first time to compare LLMs across different architectures, introducing Dedicated Feature Crosscoders (DFCs) to isolate unique model features. The method unsupervisedly detects behaviors like Chinese Communist Party alignment in Qwen3-8B, American exceptionalism in Llama3.1-8B-Instruct, and copyright refusals in GPT-OSS-20B.

ArXiv AIResearchFeb 13#research#crosscoders#dfc
Safety Alignment for Omni-Modal LLMs

Safety Alignment for Omni-Modal LLMs

OmniSteer addresses cross-modality vulnerabilities in OLLMs using AdvBench-Omni dataset and modality-semantics decoupling. Uncovers mid-layer dissolution and extracts golden refusal vector via SVD. Boosts refusal rate to 91.2% while preserving capabilities.

ArXiv AIResearchFeb 12#research#omnisteer#v1
Page 4 of 4