Search

Tag: #interpretability59 results

艱難 CoT 解釋任務釋出

艱難 CoT 解釋任務釋出

研究人員推出九個目標導向的思考鏈解釋任務,黑盒 LLM 監控在 OOD 表現不佳。他們開源資料集,包含同分布與 OOD 評估,對探針、TF-IDF 及 LLM 監控進行基準測試,非 LLM 方法在 OOD 表現更優。此測試平台用於基準社區進展,超越單純閱讀 CoT。

AI Alignment ForumCommunityMar 26#interpretability#mechinterp#ai-safety
Schmidt Sciences AI 可解釋性 RFP

Schmidt Sciences AI 可解釋性 RFP

Schmidt Sciences 邀請提案參與 AI 可解釋性試點計畫,針對 LLM 的欺騙行為進行偵測與緩解。資助額度達 100 萬美元,專案持續 1-3 年,截止日期為 2026 年 5 月 26 日。強調超越無權重存取基準的工具,應對真實世界風險。

AI Alignment ForumCommunityMar 17#interpretability#ai-safety#deception
LLM 大規模互動識別

LLM 大規模互動識別

柏克萊 AI 研究解決 LLM 解釋性挑戰,來自特徵、資料與內部複雜互動。大規模高效識別關鍵互動,介紹 SPEX 與 ProxySPEX 演算法,使用消融法。借鑒訊號處理與編碼理論,最小化昂貴消融成本。

Berkeley AI ResearchResearchMar 13#interpretability#ablation#spectral-methods
從頭訓練 144M 脈衝神經網路語言模型

從頭訓練 144M 脈衝神經網路語言模型

Nord 是一個 144M 參數脈衝神經網路 (SNN) 語言模型,從頭在 FineWeb-Edu 上訓練,僅花費 A5000 GPU 的 10 美元。達到 97-98% 推理稀疏度,比 GPT-2 Small 更好的主題連貫性,並透過脈衝率提供可視化可解釋性。支援 STDP 在線學習,並採用原創架構。

Reddit r/LocalLLaMACommunityFeb 26#snn#neuromorphic#sparsity
Apple 電路放大提升 LLM 數學推理

Apple 電路放大提升 LLM 數學推理

Apple 推出「建構性電路放大」方法,透過針對 LLM 中的稀疏子網路(稱為電路)來提升數學推理能力。此方法基於既有電路負責特定任務,且微調會強化這些電路的發現。該方法識別關鍵權杖以進行精準、任務導向的更新。

Apple Machine LearningOfficialFeb 25#circuits#math-reasoning#subnetworks
Page 3 of 6