A fixed set of labelled cases you score every change against — sometimes with a second model as the judge.