What is 'gradient checkpointing' used for in deep learning training?
-
A
Clipping gradients to prevent explosion
-
B
Trading compute for memory by recomputing activations during the backward pass
-
C
Saving model weights at regular intervals
-
D
Monitoring gradient norms for debugging