RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
TL;DR AI
2 min readKey summary
Researchers proposed RUBRIC-ARROW, an alternating reward-modeling framework for LLM post-training.
It trains a rubric generator and a rubric-conditioned judge, then uses pairwise preference data in reinforcement learning.
The method replaces tie-prone pointwise scoring with probability-based rubric scoring to better separate answers.
Experiments showed stronger reward-modeling performance and improved downstream post-training results, including GRPO.
