When training smaller models on long-context tasks, combining token-level teacher guidance with task-level verifier rewards—by measuring and distributing their disagreement—works better than either signal alone.
This paper addresses a key problem in training smaller language models for long-context tasks: teacher models give token-level guidance that looks locally correct but misses global evidence or violates task constraints.