🦙最新收集於 2h

SHADOW-250M 將 LLM 壓縮至 60MB

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#edge-ai#long-context#cpu-inferenceshadow-250mshadow-250mfinewebhugging-facellama.cpp

💡了解 2.5 億參數模型如何以 60MB 部署,並透過磁碟記憶體達到每秒 400 token。

⚡ 30-Second TL;DR

有什麼變化

這款 2.5 億參數模型從零開始訓練,使用 300 億個 FineWeb token。

為什麼重要

SHADOW-250M 展示了極小型、以 CPU 為核心的語言模型與長期外部記憶體的實用方向。由於參數量較小且作者明確指出能力限制,它更適合狹窄的檢索與嵌入式場景,而非廣泛推理或開放領域助理。

下一步行動

複製 SHADOW-250M 的 GitHub 儲存庫,並在自己的邊緣裝置工作負載上測試 CPU 吞吐量、RAM 使用量與封存檢索準確率。

誰應關注:Developers & AI Engineers

關鍵要點

  • 這款 2.5 億參數模型從零開始訓練,使用 300 億個 FineWeb token。
  • 低於 2 bit 的量化將部署大小縮減至 60MB,執行時 RAM 約需 80MB。
  • 模型不需 GPU 或大型框架,即可在一般筆電 CPU 上達到約每秒 400 token。
  • 較舊的上下文會壓縮為 1 bit 並儲存至磁碟,支援從最長 1 億 token 的封存資料中檢索。
  • 在留出的英文網頁文字評測中,模型達到每 token 3.15 nats 與 23.3 perplexity。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 15 個來源。

🔑 增強重點摘要

  • SHADOW-250M 採用創新的詞彙表處理方式,使用固定 512-bit 編碼取代傳統嵌入層,僅佔用 8.4 MB 且無需訓練參數。
  • 該模型採用混合上下文架構,將最近的 2,048 個 token 保留在 fp16 格式,其餘歷史資料則壓縮至 1 bit 並儲存於磁碟。
  • 開發者明確指出該模型設計初衷為「檢索導向」,旨在從大規模封存資料中提取資訊,而非進行複雜的深度推理。
  • SHADOW-250M 與企業資安領域的「影子 AI (Shadow AI)」概念無關,其定位為開源、隱私導向的本地端部署工具。
  • 模型開發過程受限於預算,因此在架構設計上極度強調資源效率,成功在無 GPU 輔助下實現高效能推論。

🛠️ 技術深入

  • 詞彙表架構:使用 131k token 的固定 512-bit 編碼,節省嵌入層空間。
  • 量化技術:採用低於 2 bit 的極致量化,實現 60MB 的部署體積。
  • 記憶體管理:執行時 RAM 需求約 80MB,適合低階硬體。
  • 上下文處理:支援最高 1 億 token 的磁碟封存檢索,透過 1 bit 壓縮技術降低儲存成本。
  • 推論效能:在一般筆電 CPU 上達到 400 token/s 的高吞吐量。

🔮 前景展望AI analysis grounded in cited sources

極致輕量化模型將成為邊緣運算的主流。
SHADOW-250M 證明了在極低記憶體佔用下,仍能維持長上下文檢索能力,為物聯網裝置提供 AI 支援。
磁碟輔助檢索將取代傳統 KV Cache 成為長上下文解決方案。
透過將舊上下文壓縮至 1 bit 儲存於磁碟,可突破 RAM 對上下文長度的物理限制。

時間線

2026-08
SHADOW-250M 模型正式發布並於 Reddit 社群公開。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. reddit.com
  2. youtube.com
  3. reddit.com
  4. reddit.com
  5. replicate.dev
  6. reddit.com
  7. reddit.com
  8. replicate.dev
  9. reddit.com
  10. reddit.com
  11. reddit.com
  12. reddit.com
  13. reddit.com
  14. toriihq.com
  15. infosecurity-magazine.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。