What is 'ZeRO' (Zero Redundancy Optimizer) and which parallel training problem does it primarily address?
-
A
A loss-scaling algorithm that prevents gradient underflow in FP16 training
-
B
A memory optimization technique that partitions optimizer states, gradients, and parameters across data-parallel ranks
-
C
A communication protocol replacing NCCL for multi-node clusters
-
D
A GPU power management policy that zeros idle GPU clocks