
研究人員以 1,500 美元從零訓練出基礎模型
Sapient 的研究人員開發了 HRM-Text,這是一種使用分層遞迴模型 (HRM) 取代標準 Transformer 的高效樣本模型。此方法使組織能夠以遠低於傳統大型語言模型的成本,從零開始預訓練具備推理能力的模型。
Tag: #model-architecture24 results

Sapient 的研究人員開發了 HRM-Text,這是一種使用分層遞迴模型 (HRM) 取代標準 Transformer 的高效樣本模型。此方法使組織能夠以遠低於傳統大型語言模型的成本,從零開始預訓練具備推理能力的模型。

字節跳動研究人員提出了一種挑戰擴散模型與自回歸模型的新視覺生成方法。該模型允許像人類一樣進行迭代修改,模擬繪畫過程。
Guide Labs 開源 Steerling-8B,一個 80 億參數 LLM,具備新型架構。此設計使模型動作易於解釋。此首發推進透明 AI 開發。
這篇技術深度分析探討了 Moonshot AI 的 Kimi K3,這是一款擁有 2.78 兆參數的開源權重模型。內容涵蓋了 Kimi Delta Attention 與 Stable LatentMoE 等架構創新。

本研究提出了「能力收斂假說」(CCH),主張模型能力取決於特定的架構存取結構,而非僅僅是規模擴展。研究指出三種限制效能的「資源牆」,並證明結合壓縮狀態與逐字索引通道的混合架構能有效突破這些限制。

前 OpenAI 技術長 Mira Murati 發布了其創業後的首款 AI 模型,主打高度可客製化與成本效能平衡。該項目旨在縮小新興 AI 實驗室與業界領先者之間的技術差距。

Tesla 正在調整其 FSD 開發策略,將先進的 L4 自動駕駛模型應用於其 L2 消費級駕駛輔助系統。此舉旨在統一 FSD 與即將推出的 Robotaxi 平台之間的模型架構。

研究人員在 Claude 內部發現了一種運作機制類似「類腦空間」的結構。刪除或修改該區域會導致模型性能與推理能力顯著下降。

Wiola 是一種從第一性原理構建的全新小型語言模型 (SLM) 架構,包含螺旋旋轉位置編碼 (SRPE) 和自適應標記合併 (ATM) 等五項創新技術。該模型提供 120M 到 1.5B 參數四種規模,並完全相容於 HuggingFace 生態系統。

minFLUX 是一個輕量級的開源 PyTorch 實作,旨在幫助開發者理解 FLUX.1 與 FLUX.2 模型背後的核心架構與數學原理。它提供了與 HuggingFace diffusers 對應的逐行代碼映射,並包含完整的訓練與推論迴圈。