🦙Reddit r/LocalLLaMA•最新收集於 3h
250 美元打造的 Mini Kimi-K3 擊敗 GPT-2

💡一項 250 美元實驗展示 Kimi-K3 式稀疏架構能否超越 GPT-2。
⚡ 30-Second TL;DR
有什麼變化
該複製模型共有 10.2 億參數,每個 token 僅啟用 1.45 億參數。
為什麼重要
這項成果顯示,現代稀疏架構可以在相對可負擔的預算下進行研究與部分重現。不過,該基準測試結果由作者自行回報,並不能證明其整體能力已接近更大型的 Kimi 模型。
下一步行動
先閱讀預訓練教學,並使用公開的 Mini Kimi-K3 設定重現 HellaSwag 評測,再將其改用於自己的語料庫。
誰應關注:Researchers & Academics
關鍵要點
- •該複製模型共有 10.2 億參數,每個 token 僅啟用 1.45 億參數。
- •模型重現了 Kimi-K3 的 Kimi Delta Attention、Gated MLA、Attention Residuals 與 LatentMoE 等元件。
- •模型採用 Kimi-K3 原版的 163,840-token tokenizer,且僅進行下一 token 預測訓練。
- •模型處理了 5,000,003,584 個 token,並回報 HellaSwag 得分為 33.4%。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 24 個來源。
🔑 增強重點摘要
- •原始 Kimi-K3 模型由中國公司月之暗面 (Moonshot AI) 開發,總參數為 2.8 兆,其中每個 token 啟用 1040 億參數。
- •原始 Kimi K3 模型支援高達 1,048,576 個 token 的上下文視窗,顯著超越其前身 Kimi K2.7 Code 的 262,144 個 token。
- •該獨立開發者利用 Modal 平台租用 GPU 進行訓練,以實現 250 美元的低成本。
- •Mini Kimi-K3 模型雖然總參數僅為 Kimi K3 的約兩千分之一,但在 HellaSwag 基準測試中仍展現出競爭力。
- •Kimi Delta Attention 是一種混合線性注意力機制,旨在提高長上下文處理的效率和硬體優化,而 Attention Residuals 則透過學習式注意力機制改進了深度網路中的資訊流和訓練穩定性。
🛠️ 技術深入
- Kimi Delta Attention (KDA):這是一種線性注意力機制,具有細粒度的通道級門控,旨在提高長上下文處理的記憶體管理和硬體效率。它採用 Diagonal-Plus-Low-Rank (DPLR) 過渡矩陣的專門變體,以提高 Tensor Core 的利用率,並允許每個維度獨立決定遺忘速度,實現精細的遺忘機制。
- Gated MLA (多頭潛在注意力):Kimi K2.5(K3 的前身)採用 MLA 來有效處理其 256K token 的上下文視窗。它利用壓縮表示來減少記憶體使用,透過選擇性注意力聚焦於相關 token,並使用分層處理來管理長距離依賴。
- Attention Residuals (AttnRes):此機制將傳統的固定加法殘差連接替換為對先前層輸出的 softmax 注意力。這使得每一層都能夠透過學習到的、依賴於輸入的權重選擇性地聚合早期表示,解決了隱藏狀態不受控制增長和單個層貢獻被稀釋的問題。它透過控制隱藏狀態增長和更均勻地分佈梯度來提高訓練穩定性。
- LatentMoE:這是一種混合專家 (MoE) 設計,利用低維潛在瓶頸來最小化大規模語言模型中的記憶體和通訊開銷。它採用共享門控網路和潛在投影來有效路由 token,從而提高每 FLOP 和每參數的準確性。它將路由負載和專家計算壓縮到一個較小的「潛在」空間中,顯著減少了推斷期間的記憶體移動和通訊開銷。
- 163,840-token tokenizer:這種極大的分詞器表明模型旨在處理極長的上下文,並可能包含廣泛的專用 token,例如用於程式碼或特定領域的 token。原始 Kimi K3 具有 100 萬 token 的上下文視窗,因此大型分詞器對於有效編碼此類長上下文至關重要。
🔮 前景展望AI analysis grounded in cited sources
更低成本的尖端模型開發將加速 AI 創新。
獨立開發者以極低成本複製 Kimi-K3 的核心架構並超越 GPT-2,證明了高效能模型不再是大型機構的專利,將激勵更多個人和小型團隊投入模型開發。
稀疏混合專家 (MoE) 和長上下文注意力機制將成為主流架構。
Mini Kimi-K3 成功複製 Kimi Delta Attention、LatentMoE 等先進元件,並展現其效能優勢,預示這些技術將在未來模型設計中扮演更關鍵的角色。
開源社群將在大型語言模型領域扮演更重要的角色。
該專案在 Reddit r/LocalLLaMA 社群發布,並成功複製複雜模型,顯示開源協作和知識共享能有效降低進入門檻,推動技術普及與進步。
⏳ 時間線
2023-03
月之暗面 (Moonshot AI) 公司成立
2023-10
Kimi 聊天機器人首次發布,支援 128,000 token 上下文
2025-07
月之暗面發布開源 MoE 模型 Kimi K2 (1 兆參數)
2026-01
月之暗面發布 Kimi K2.5,一個多模態 MoE 模型
2026-07
月之暗面發布 Kimi K3,一個 2.8 兆參數的開源多模態模型,支援 100 萬 token 上下文視窗
2026-08
獨立開發者發布 250 美元打造的 Mini Kimi-K3 複製模型
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- firecrawl.dev
- wikipedia.org
- bleap.finance
- wikipedia.org
- huggingface.co
- openlm.ai
- kimi.ai
- reddit.com
- medium.com
- alphaxiv.org
- datacamp.com
- emergentmind.com
- digitalocean.com
- vizuaranewsletter.com
- doubleword.ai
- medium.com
- semianalysis.com
- kimi-k25.com
- huggingface.co
- emergentmind.com
- nvidia.com
- glennklockwood.com
- github.com
- intoai.pub
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。