
250 美元打造的 Mini Kimi-K3 擊敗 GPT-2
一名獨立開發者以約 250 美元,使用 50 億個去污染化 token 預訓練出 10.2 億參數的 Kimi-K3 複製模型。該模型在 HellaSwag 上達到 33.4%,高於 GPT-2 124M 據報的 28%,且完全未經指令微調。
Tag: #pretraining10 results

一名獨立開發者以約 250 美元,使用 50 億個去污染化 token 預訓練出 10.2 億參數的 Kimi-K3 複製模型。該模型在 HellaSwag 上達到 33.4%,高於 GPT-2 124M 據報的 28%,且完全未經指令微調。

Hugging Face 推出 EMO,一種針對專家混合模型 (MoE) 的新型預訓練方法。它實現湧現模組化,讓專家專門化行為在預訓練中自然出現。此進展提升可擴展 AI 架構。

daVinci-LLM 結合產業規模資源與完全開放,探索 LLM 預訓練科學。它釋出從頭訓練的 3B 模型,使用 8T 令牌、Data Darwinism 框架與兩階段自適應課程。超過 200 項消融實驗揭示處理深度為關鍵擴展因素及領域特定策略。

Apple 關於將語言模型從一般預訓練混合數據最佳分割至專門領域的論文,已獲 ICLR 2026 工作坊接受。它批判標準兩階段訓練範式,即全語料庫預訓練後進行專門化。該研究探討多領域持續預訓練,以提升目標任務效能。

長期關注 OpenAI 模型動向的 X 使用者 ChrisGPT 爆料,OpenAI 正在開發一個代號為 Doug 的新大型預訓練模型。據稱 Doug 將是 OpenAI 迄今規模最大的預訓練計畫,且與 GPT-6 分開,但目前沒有官方確認或技術規格。
貼文質疑語言建模本質上是 token 級(預訓練、抽樣)還是序列級(對齊、獎勵)。強調 token 級交叉熵與字串分佈差異,以及近視抽樣。尋求統一視角與原則框架的研究。

這則 Reddit 貼文介紹 Gladstone 等人於 2026 年發表的研究論文《Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation》。根據標題,該研究旨在將預訓練拓展至既有維度之外,並探索端到端生成。
Reddit 貼文質疑幾何深度學習(GDL)能否透過將旋轉與置換等不變性直接嵌入模型架構,減少大量預訓練需求。GDL 結構性強制對稱性,而非從海量資料學習,可能大幅降低資料需求。此討論探討當前預訓練是否源於不良歸納偏誤。
貼文探討儘管有 Kimi 與 DeepSeek 等開源預訓練模型,為何 GPT 與 Claude 等大實驗室模型仍主宰。主張預訓練運算非障礙,RLHF 後訓練才是關鍵差異。小實驗室能否負擔 RLHF 以競爭?
這篇文章提出研究:能否透過數學轉換,將未訓練的 LLM 直接轉換成與訓練完成模型功能等效的模型。若可行,便能省去教師模型生成回應、反向傳播與傳統蒸餾流程,但目前尚未提出具體演算法或實驗結果。