🤖最新收集於 31m

Doom 在 210 億參數 Transformer 中運行,完全無需訓練

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡看看編譯器如何將 Doom 渲染器變成無需訓練的標準 Transformer checkpoint。

⚡ 30-Second TL;DR

有什麼變化

自訂編譯器能直接將計算圖轉換為 Transformer 權重,因此不需要訓練。

為什麼重要

此專案展示 Transformer 權重不只能編碼學習到的統計行為,也能表達相當複雜的確定性計算。雖然目前主要是研究性展示,但這種編譯器方法可能啟發程式合成、可微分計算與特殊 Transformer 執行模型的研究。

下一步行動

請 clone Torchwright Doom 儲存庫並載入其 Hugging Face checkpoint,實際評估該編譯器如何將確定性計算圖映射為 Transformer 權重。

誰應關注:Researchers & Academics

關鍵要點

  • 自訂編譯器能直接將計算圖轉換為 Transformer 權重,因此不需要訓練。
  • 模型接收 3,614 個 token 的場景資料提示,並生成 53,747 個 token 的像素繪圖指令。
  • 此 checkpoint 可在不使用 trust_remote_code 的情況下搭配 Hugging Face Transformers,並附有 43 行 Python 主程式。
  • 在 NVIDIA B200 上渲染單一畫面需時超過 40 分鐘,約可達到每天 35 個畫面。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此專案利用了 Transformer 的注意力機制(Attention Mechanism)作為通用計算引擎,證明了權重矩陣可被視為一種唯讀記憶體(ROM)來執行確定性演算法。
  • 該技術的核心在於將 Doom 的軟體渲染器(Software Renderer)轉換為線性代數運算,並將這些運算映射至模型權重,而非透過梯度下降學習。
  • 研究人員指出,這種方法揭示了大型語言模型在處理非語言任務時,其內部表示層(Internal Representation)具有極高的可程式化潛力。
  • 該模型在執行時完全繞過了傳統的 GPU 渲染管線,直接透過 Transformer 的前向傳播(Forward Pass)輸出像素指令,這是一種極端的『以計算換取儲存』範式。
  • 此實驗引發了關於『模型即程式碼』(Model-as-Code)的討論,探討了將複雜邏輯直接編碼進神經網路權重以實現零訓練推論的可行性。

🛠️ 技術深入

  • 核心機制:利用 Transformer 的矩陣乘法(MatMul)層模擬 Doom 渲染器的算術邏輯單元(ALU)。
  • 權重映射:將渲染器的狀態機(State Machine)與幾何變換矩陣直接寫入模型的權重矩陣,實現了確定性的輸出。
  • 記憶體需求:由於模型參數高達 210 億,該權重矩陣佔用了約 40GB 以上的 VRAM,主要用於儲存編譯後的渲染邏輯。
  • 推論過程:模型不進行機率採樣(Sampling),而是使用貪婪解碼(Greedy Decoding)以確保輸出指令的確定性與正確性。
  • 渲染管線:將 Doom 的 BSP(Binary Space Partitioning)樹結構轉換為 Transformer 可處理的序列化數據,並透過注意力頭(Attention Heads)進行空間投影計算。

🔮 前景展望AI analysis grounded in cited sources

神經網路權重將成為一種新型的軟體發布格式。
此實驗證明了複雜演算法可以被編譯進權重,未來可能出現無需訓練、直接由編譯器生成的『權重軟體』。
Transformer 架構將被用於執行非 AI 的通用計算任務。
透過將邏輯編碼進權重,Transformer 可作為一種通用的、可解釋的計算引擎,而不僅限於語言處理。

時間線

2026-07
開發者公開展示將 Doom 渲染邏輯編譯至 Transformer 權重的初步概念驗證。
2026-08
該 210 億參數模型正式發布於 Hugging Face,並在 Reddit r/MachineLearning 引發廣泛討論。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning