Score centering is merged in verl (#8010): an additive correction for training–inference mismatch that kept RL training stable with an fp8 sampler where plain policy gradient collapsed.