
利用 NVIDIA Blackwell 的 NVFP4 加速 LLM 訓練
NVIDIA 推出了 NVFP4,這是一種專為優化 Blackwell 架構上 frontier LLM 預訓練吞吐量而設計的新數值精度格式。此技術旨在透過解決低位元混合精度訓練的挑戰,進而縮短訓練時間並降低運算成本。
Tag: #llm-training33 results

NVIDIA 推出了 NVFP4,這是一種專為優化 Blackwell 架構上 frontier LLM 預訓練吞吐量而設計的新數值精度格式。此技術旨在透過解決低位元混合精度訓練的挑戰,進而縮短訓練時間並降低運算成本。

本文探討了Alibaba的Qwen模型如何評估並篩選用於訓練的優質數據。文章強調,儘管技術舞台已經更迭,但數據策展的核心原則始終如一。

本研究提出了一種利用基於 George Polya 問題解決策略的多元自生成數據,以提升大型語言模型(LLM)在訓練中期階段效能的方法。研究顯示,透過這些多樣化推理路徑訓練的模型,在後續的強化學習(RL)階段,於數學、程式碼及敘事推理任務中均表現更佳。
OpenSimula 是 Davidson 等人的 Simula 機制設計實驗性開源 Python 實作,已加入 AfterImage 資料集工具。針對 SFT/評估設定中的推理空間控制多樣性,使用 LLM 分類法、抽樣與批評迴圈。提供儲存庫、文件與實驗性 API 免責聲明。

NVIDIA nvCOMP 僅需 30 行 Python 即可壓縮 LLM 訓練檢查點。70B 模型檢查點達 782 GB,每 15-30 分鐘一次,造成高儲存成本。此工具大幅降低費用,同時維持 GPU 使用率焦點。

PyTorch 推出 TorchSpec,這是一款用於大規模訓練推測解碼的新系統,隨著大型語言模型的快速成長而應運而生。邊緣模型如 Kimi K2.5、GLM 5 和 Qwen 3.5 突顯了高效訓練技術的需求。TorchSpec 旨在有效支援這些巨型模型。

ImportAI 第449期報導LLM訓練其他LLM、成功的72B參數分散式訓練執行,以及研究顯示電腦視覺比生成文字更難。同時探討AI是否會引發政治空窗期。

NVIDIA Megatron Core 實作 Falcon-H1 混合架構,以提升大規模大型語言模型訓練。該開源庫提供業界領先的並行處理與 GPU 最佳化效能。開發現以 GitHub 為主於 NVIDIA/Megatron-LM 儲存庫,由社群貢獻推動。

儘管北京積極推動半導體自主化,中國領先的 AI 開發商仍持續使用 Nvidia 晶片訓練大型語言模型。轉換至國產晶片架構的高昂成本與工程複雜度,仍是主要障礙。
一個開發團隊正在尋求微調小型模型(如 Llama、Mistral 或 Gemma)的路線圖。他們正在尋找如何使用自有數據啟動微調流程的指導。