Search

直接匹配不多,已補上最新動態。

Tag: #self-interpretation1 results

Adapters Unlock Reliable Self-Interpretation

Adapters Unlock Reliable Self-Interpretation

Lightweight adapters trained on interpretability artifacts enable reliable self-interpretation in frozen LMs. A simple scalar affine adapter outperforms baselines in feature labeling, topic identification, and implicit reasoning decoding. Gains scale with model size, driven mostly by learned bias.

ArXiv AIResearchFeb 12#research#self-interpretation#v1