Google ❤️ Open Source AI
Selecting Diverse SFT Traces Improves Post-RL Generalization
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses