
Qwen2.5-0.5B 使用 GRPO 訓練 Reddit 摘要
使用自製 PyTorch GRPO 在 Reddit 貼文摘要任務訓練 Qwen2.5-0.5B-Instruct (bf16),以 length_penalty + quality_reward (ROUGE-L) 達成 64 個 token 展開長度。設定:3 台 Mac Mini 叢集,使用 MLX 訓練及 vLLM 展開。透過 LLM-as-a-Judge (GPT-5) 及 DeepEval 評估忠實度、涵蓋率、簡潔性及清晰度。







