Search

Tag: #llm-reasoning33 results

NVIDIA FP8 高吞吐量強化學習訓練

NVIDIA FP8 高吞吐量強化學習訓練

NVIDIA 實現使用端到端 FP8 精度的高吞吐量強化學習 (RL) 訓練,這對大型語言模型 (LLM) 轉向複雜推理至關重要。像群組相對策略優化 (GRPO) 等演算法透過反饋驅動迭代改進,不同於監督微調。RL 包含兩個高強度階段以提升模型效能。

NVIDIA Developer BlogOfficialApr 20#precision-training#llm-reasoning
Page 2 of 4