LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
TL;DR AI
2 min readKey summary
Researchers introduced LaRA, a layer-wise method for detecting data contamination in RL-post-trained language models.
LaRA measures perturbation sensitivity, directional collapse, and local rigidity to spot contamination through representation changes, not output signals.
The paper finds contamination creates systematic layer-by-layer deviations and LaRA outperforms prior baselines on RL-trained reasoning models.
The approach could make leakage detection more reliable and strengthen trust in evaluation and generalization claims.
