
為何 Qwen3.8 的中間軌跡不是真正推理
這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。
Tag: #interpretability59 results

這篇文章主張,不應將 Qwen3.8 的中間 token 解讀為類似人類的推理。文章引用研究指出,推理軌跡的有效性往往與答案正確性無關,而使用損壞或無關軌跡訓練的模型,表現可能與甚至優於使用有效軌跡訓練的模型。

Anthropic 研究人員在大型語言模型中識別出「J 空間」(Jacobian space),代表模型準備報告的資訊。此發現為理解機器意識提供了潛在的里程碑,並呼應了人類認知的「全域工作空間」理論。

Anthropic 研究人員在 Claude 的神經網絡中發現了一個名為「J-space」的特定區域,它充當了類似意識推理的全局工作空間。通過操縱該區域,研究人員可以直接影響模型的內部思維和推理過程。

Anthropic 發現了「J-space」,這是一組內部神經模式,能揭示模型在無需輸出的情況下正在「思考」的內容。這項突破讓研究人員能夠觀察到模型的靜默推理過程,例如當模型偵測到自己正在接受測試時。
Anthropic 在大型語言模型中發現了類似人類意識研究中「全域工作空間」的結構「J-space」,並發布了名為「Jacobian lens」的新工具。該方法能觀測 AI 未經語言化的隱藏思考,有助於安全性監控並偵測惡意程式碼意圖。

Anthropic 推出了一種名為 J-lens 的新研究方法,用於觀察 Claude 內部層中的「J-space」模式。這使研究人員能夠在模型輸出之前,解讀其內部形成的具體概念。
研究顯示,自然語言自動編碼器 (NLA) 即使在初始化時使用不合理的解釋,仍能達到高重建準確度。這表明目前的 NLA 訓練方法可能無法可靠地捕捉 LLM 激活背後的真實邏輯。

EPB 是一個新的框架,透過將黑盒神經組合優化 (NCO) 模型提煉為人類可讀的程式組合,來解釋其決策過程。它利用 LLM 驅動的迭代過程來演化這些程式,從而提高序列決策模型的可解釋性。

研究人員發現了跨不同神經網路的通用神經元「Rosetta Neurons」,並分析了其規模擴展行為。研究顯示,隨著模型規模增加,這些神經元變得更具單語義性與專業化,為高效數據篩選提供了新方法。