What is 'sparsity' acceleration in TensorRT, and which GPU architecture first introduced hardware support for it?
-
A
Exploiting 2:4 structured sparsity in weight tensors for 2× speedup, first supported on Ampere GPUs
-
B
Removing zero-valued activations dynamically at runtime, introduced on Volta GPUs
-
C
Pruning convolutional filters automatically during TensorRT build, available since Pascal
-
D
Eliminating redundant batch normalization layers, enabled on Turing GPUs