A controlled counterfactual audit of 80 arXiv manuscripts shows that large language model evaluators systematically inflate ...