🦙Reddit r/LocalLLaMA•最新收集於 2h
SHADOW-250M 將 LLM 壓縮至 60MB
💡了解 2.5 億參數模型如何以 60MB 部署,並透過磁碟記憶體達到每秒 400 token。
⚡ 30-Second TL;DR
有什麼變化
這款 2.5 億參數模型從零開始訓練,使用 300 億個 FineWeb token。
為什麼重要
SHADOW-250M 展示了極小型、以 CPU 為核心的語言模型與長期外部記憶體的實用方向。由於參數量較小且作者明確指出能力限制,它更適合狹窄的檢索與嵌入式場景,而非廣泛推理或開放領域助理。
下一步行動
複製 SHADOW-250M 的 GitHub 儲存庫,並在自己的邊緣裝置工作負載上測試 CPU 吞吐量、RAM 使用量與封存檢索準確率。
誰應關注:Developers & AI Engineers
關鍵要點
- •這款 2.5 億參數模型從零開始訓練,使用 300 億個 FineWeb token。
- •低於 2 bit 的量化將部署大小縮減至 60MB,執行時 RAM 約需 80MB。
- •模型不需 GPU 或大型框架,即可在一般筆電 CPU 上達到約每秒 400 token。
- •較舊的上下文會壓縮為 1 bit 並儲存至磁碟,支援從最長 1 億 token 的封存資料中檢索。
- •在留出的英文網頁文字評測中,模型達到每 token 3.15 nats 與 23.3 perplexity。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 15 個來源。
🔑 增強重點摘要
- •SHADOW-250M 採用創新的詞彙表處理方式,使用固定 512-bit 編碼取代傳統嵌入層,僅佔用 8.4 MB 且無需訓練參數。
- •該模型採用混合上下文架構,將最近的 2,048 個 token 保留在 fp16 格式,其餘歷史資料則壓縮至 1 bit 並儲存於磁碟。
- •開發者明確指出該模型設計初衷為「檢索導向」,旨在從大規模封存資料中提取資訊,而非進行複雜的深度推理。
- •SHADOW-250M 與企業資安領域的「影子 AI (Shadow AI)」概念無關,其定位為開源、隱私導向的本地端部署工具。
- •模型開發過程受限於預算,因此在架構設計上極度強調資源效率,成功在無 GPU 輔助下實現高效能推論。
🛠️ 技術深入
- 詞彙表架構:使用 131k token 的固定 512-bit 編碼,節省嵌入層空間。
- 量化技術:採用低於 2 bit 的極致量化,實現 60MB 的部署體積。
- 記憶體管理:執行時 RAM 需求約 80MB,適合低階硬體。
- 上下文處理:支援最高 1 億 token 的磁碟封存檢索,透過 1 bit 壓縮技術降低儲存成本。
- 推論效能:在一般筆電 CPU 上達到 400 token/s 的高吞吐量。
🔮 前景展望AI analysis grounded in cited sources
極致輕量化模型將成為邊緣運算的主流。
SHADOW-250M 證明了在極低記憶體佔用下,仍能維持長上下文檢索能力,為物聯網裝置提供 AI 支援。
磁碟輔助檢索將取代傳統 KV Cache 成為長上下文解決方案。
透過將舊上下文壓縮至 1 bit 儲存於磁碟,可突破 RAM 對上下文長度的物理限制。
⏳ 時間線
2026-08
SHADOW-250M 模型正式發布並於 Reddit 社群公開。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

