GRPO Trains Qwen for Reddit Summaries on Mac Minis
Trained Qwen2.5-0.5B-Instruct variants on Reddit summarization with length constraints using GRPO on 3x Mac Minis. Quality + length penalty outperformed length-only in LLM-as-a-Judge evals (2.5/4 vs 2.4/4) via DeepEval on faithfulness, coverage, conciseness, clarity. Significant p=0.0042 on ROUGE-L composite score from 200 smoltldr test samples.







