Search

直接匹配不多,已補上最新動態。

Tag: #crl1 results

CRL Steers SAE Features Token-by-Token

CRL Steers SAE Features Token-by-Token

CRL uses reinforcement learning to select sparse autoencoder (SAE) features for steering language models at each token, revealing which features impact outputs. It includes adaptive masking for diverse features and enables analysis like branch point tracking and layer-wise comparisons. Tested on Gemma-2 2B, it improves benchmarks while providing interpretable logs.

ArXiv AIResearchFeb 12#research#crl#gemma-2