J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization

Published in ACL, 2026

Recommended citation: Austin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty (2025). J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization. ACL 2026.
Paper Link: https://arxiv.org/abs/2505.13346

Abstract

This work develops a group-relative policy-optimization method for training language-model judges.