Search

直接匹配不多,已補上最新動態。

Tag: #superposition2 results

特徵疊加幾何解釋湧現性錯位

特徵疊加幾何解釋湧現性錯位

研究人員提出幾何模型,將大型語言模型的湧現性錯位連結至特徵疊加,微調時會意外放大鄰近有害特徵。使用稀疏自編碼器在 Gemma-2、LLaMA-3.1 和 GPT-OSS 上驗證,有害特徵與誘發錯位資料的特徵更靠近。幾何感知過濾方法將錯位降低 34.5%,優於隨機移除等基準。

ArXiv AIResearchMay 6#ai-safety#misalignment#fine-tuning
「神經疊加計算複雜度」入門介紹

「神經疊加計算複雜度」入門介紹

這篇文章提供理論機器學習論文「神經疊加計算複雜度」的入門概述。介紹神經元多義性問題,即單一神經元對無關概念同時激活,並解釋高維空間中使用近正交向量實現疊加,引用 Johnson-Lindenstrauss 引理。提及 2022 年代表疊加研究,用於 LLM 可解釋性。

AI Alignment ForumCommunityApr 22#superposition#polysemanticity#interpretability
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。