Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains

Published in ICLR, 2026

Recommended citation: Austin Xu, Xuan-Phi Nguyen, Yilun Zhou, Chien-Sheng Wu, Caiming Xiong, Shafiq Joty (2025). Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains. ICLR 2026.
Paper Link: https://arxiv.org/abs/2510.17793

Abstract

This work studies how to scale multi-task generative evaluator training across reasoning-centric domains.