🤖較早收集於 35m

小型 LLM 原始層實證發現

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#semantic-primitives#model-scalinggraph-oriented-generationqwen-2.5gemma-3llama-3.2smollm2ollama

💡小型 LLM 原始層可重現證明 – 輕鬆探測內部結構(24字)

⚡ 30-Second TL;DR

有什麼變化

所有 4 款模型一致 +0.245 激活差距:Qwen 2.5、Gemma 3、LLaMA 3.2、SmolLM2

為什麼重要

揭示小型 LLM 的固有結構隨規模演化,或許解釋突現能力。無需 API 即可進行機械解釋性探測。

下一步行動

使用 GitHub 儲存庫中的 Ollama 在本地重現 18 項實驗。

誰應關注:Researchers & Academics

關鍵要點

  • 所有 4 款模型一致 +0.245 激活差距:Qwen 2.5、Gemma 3、LLaMA 3.2、SmolLM2
  • 11 種預註冊組合預測 Layer 1 概念(例如 WANT + GRIEF → longing)
  • 最小模型差距最大,隨規模縮小,因支架原始在更大模型中強化
  • 完全可透過 Ollama 在本地重現,程式碼/資料於 GitHub
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。