Search

直接匹配不多,已補上最新動態。

Tag: #drpo1 results

Robust Policy Optimization for Recommendations

Robust Policy Optimization for Recommendations

DRPO tackles model collapse in off-policy generative recommendation via optimistic distributionally robust optimization. Proves hard filtering recovers high-quality data from noisy logs. Achieves SOTA on mixed-quality benchmarks.

ArXiv AIResearchFeb 12#research#drpo#v1