A quantization scheme where model weights are compressed to 4-bit precision while intermediate calculations (activations) remain at 16-bit for better accuracy.