⚛️較早收集於 2h

Mythos 架構被 22 歲小伙「逆推」開源了!MoE 和注意力借鑑 DeepSeek

Mythos 架構被 22 歲小伙「逆推」開源了!MoE 和注意力借鑑 DeepSeek
PostLinkedIn
⚛️閱讀原文: 量子位

💡開源 Mythos 逆向:MoE+DeepSeek 注意力 – 剖析 Claude 秘密(22字)

⚡ 30-Second TL;DR

有什麼變化

逆向工程 Claude 的 Mythos 架構

為什麼重要

民主化先進 LLM 架構存取,助研究者無需專有限制即可實驗類 Mythos 設計。

下一步行動

從 GitHub 複製 Mythos 儲存庫,使用其 DeepSeek 風格注意力訓練小型 MoE 模型。

誰應關注:Researchers & Academics

關鍵要點

  • 逆向工程 Claude 的 Mythos 架構
  • 22 歲開發者開源
  • 借鑑 DeepSeek 的 MoE 和注意力
  • 整合公開論文與架構推測

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 該開源專案名為 'Mythos-Reversed',開發者透過分析 Claude API 的響應延遲與輸出模式,推斷出其潛在的稀疏激活路徑。
  • 該架構採用了類似 DeepSeek-V3 的 Multi-head Latent Attention (MLA) 機制,旨在降低 KV 快取佔用並提升長文本處理效率。
  • 社群對此專案的安全性提出質疑,認為逆向工程閉源模型架構可能違反 Anthropic 的服務條款,並引發了關於模型權重保護的法律討論。

🛠️ 技術深入

  • 架構核心:採用 MoE (Mixture-of-Experts) 結構,包含 8 個專家模型,其中 2 個為活躍專家。
  • 注意力機制:實作了 MLA (Multi-head Latent Attention) 以壓縮 KV 快取,透過低秩投影減少記憶體頻寬瓶頸。
  • 路由策略:使用基於 Token 級別的負載平衡損失函數,確保專家利用率分佈均勻。
  • 訓練框架:基於 PyTorch 與 FlashAttention-3 進行優化,以適應消費級 GPU 的推論需求。

🔮 前景展望AI analysis grounded in cited sources

閉源模型架構的隱蔽性將大幅下降
逆向工程技術的普及迫使模型開發商必須在架構設計上增加混淆層或採用更嚴格的 API 輸出限制。
開源社群將加速追趕頂尖閉源模型的效能
透過逆向工程獲取的架構洞察,讓開源開發者能更精確地復現頂尖模型的關鍵效能優化技術。

時間線

2026-03
開發者開始對 Claude 的 API 輸出進行統計學分析與架構推測。
2026-04
Mythos-Reversed 專案在 GitHub 正式開源,引發 AI 社群對逆向工程邊界的廣泛討論。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位