Multi-module GRPO: Composing Policy Gradients and Prompt Optimization for Language Model Programs Review 2026-05-28 14 분 소요 0. Introduction
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability Review 2026-05-25 14 분 소요 0. Introduction