J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
Published in ACL, 2026
Recommended citation: Austin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty (2025). J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization. ACL 2026.
Paper Link: https://arxiv.org/abs/2505.13346
Abstract
This work develops a group-relative policy-optimization method for training language-model judges.
