
PFN 推出日本首款全從零打造具長考推理 LLM「PLaMo 3.0 Prime」
Preferred Networks 發布 PLaMo 3.0 Prime β版,這是日本首款完全從零打造的大規模語言模型。它參考 DeepSeek R-1 等手法,支持「長考」推理功能,效能逼近 Qwen3-235B 和 gpt-oss-120b。這是國內不依賴既有模型的 LLM 開發里程碑。
Tag: #from-scratch6 results

Preferred Networks 發布 PLaMo 3.0 Prime β版,這是日本首款完全從零打造的大規模語言模型。它參考 DeepSeek R-1 等手法,支持「長考」推理功能,效能逼近 Qwen3-235B 和 gpt-oss-120b。這是國內不依賴既有模型的 LLM 開發里程碑。
開發者花一年在 PyTorch 從頭實作 GPT-2、Llama 3.2-3B 和 DeepSeek 架構。GitHub 提供開源程式碼;Leanpub 書籍涵蓋解釋、推導與圖表。目標為生產級 LLM 理解。
開發者完成 Dante-2B 第一階段訓練,這是專為義大利文與英文優化的 2.1B 參數 LLM,從頭訓練。客製化 tokenizer 有效處理義大利文形態。第二階段將擴展至 4096 上下文長度。
開發者使用 2× H200 GPU 從頭訓練 2.1B 義大利文/英文 LLM,第一階段 90B 權杖完成。具備專為義大利文優化的自訂 tokenizer 與 LLaMA 風格架構。第二階段將擴展至 4096 上下文。
一位開發者不使用 AI 生成程式碼,從頭實作擴散語言模型,在 MacBook Air M2 上以微型莎士比亞資料集訓練 750 萬參數模型。數小時後產生連貫文字如「To be, fo hend!」。程式碼已在 GitHub 開源。
教學從頭建構 LLM,使用瑪麗·雪萊《科學怪人》文本訓練。包含 Substack 深度指南及 GitHub Kaggle 可執行筆記本。適合動手機器學習學習。