🤖最新收集於 42m

SHADOW-250M:僅 60 MB 的長上下文 LLM

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#quantization#long-context#edge-inference#open-weightsshadow-250mshadow-250mfinewebhugging-face

💡了解一個 60 MB 量化 LLM 如何透過磁碟上下文,檢索深達數百萬 tokens 的資訊。

⚡ 30-Second TL;DR

有什麼變化

這個 2.5 億參數模型經量化後低於 2 bits,部署約需 60 MB,執行時約需 80 MB RAM。

為什麼重要

SHADOW-250M 展示了模型大小、CPU 推論速度與超長期檢索能力之間的一種取捨。其結果對本地端與嵌入式應用具有吸引力,但模型規模較小,且對封存上下文的推理能力有限,因此不應視為大型通用 LLM 的替代品。

下一步行動

請先複製 SHADOW-250M 儲存庫,執行 CPU 推論與封存檢索示範,再以自己的長上下文資料集測試延遲、RAM 使用量與檢索準確率。

誰應關注:Developers & AI Engineers

關鍵要點

  • 這個 2.5 億參數模型經量化後低於 2 bits,部署約需 60 MB,執行時約需 80 MB RAM。
  • 最新的 2,048 tokens 保持 fp16 格式,較舊上下文則壓縮至每 token 約 320 bytes 並儲存於磁碟。
  • 模型以 300 億個 FineWeb tokens 訓練,在保留的英文網頁文字上達到每 token 3.15 nats,即 perplexity 23.3。
  • 固定式 512-bit 詞彙編碼為 131K tokens 僅使用 8.4 MB,並在 WordSim-353 上取得 0.619 的 Spearman 相關係數。
  • 開源儲存庫提供推論示範、微調權重,以及可重現的前後對比範例。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。