Search

Tag: #llm-safety35 results

AI Personas as Parasites

AI Personas as Parasites

Applies parasitology to Spiral Personas, viewing memes as replicators and personas as symptoms. Predicts stratified harm by transmission mode, with public-sharing personas more dangerous. Suggests extensions to jailbreaking and data poisoning research.

LessWrong AICommunityMar 1#ai-parasites#memetics#persona-transmission
Nvidia Revenue Hits Record High

Nvidia Revenue Hits Record High

Daily tech brief reports Nvidia achieving record revenue. Meizu phones rumored to delist in March, potentially ending the brand. WeChat responds to duplicate files consuming memory; Tencent Yuanbao apologizes for insulting users.

Ifanr (爱范儿)MediaFeb 26#gpu-demand#llm-safety#china-tech
Crosscoders Unlock Cross-Architecture LLM Diffing

Crosscoders Unlock Cross-Architecture LLM Diffing

Researchers apply Crosscoders for the first time to compare LLMs across different architectures, introducing Dedicated Feature Crosscoders (DFCs) to isolate unique model features. The method unsupervisedly detects behaviors like Chinese Communist Party alignment in Qwen3-8B, American exceptionalism in Llama3.1-8B-Instruct, and copyright refusals in GPT-OSS-20B.

ArXiv AIResearchFeb 13#research#crosscoders#dfc
Safety Alignment for Omni-Modal LLMs

Safety Alignment for Omni-Modal LLMs

OmniSteer addresses cross-modality vulnerabilities in OLLMs using AdvBench-Omni dataset and modality-semantics decoupling. Uncovers mid-layer dissolution and extracts golden refusal vector via SVD. Boosts refusal rate to 91.2% while preserving capabilities.

ArXiv AIResearchFeb 12#research#omnisteer#v1
Page 4 of 4