Which serving optimization packs multiple independent requests into a single GPU forward pass without waiting for a full batch to fill?
-
A
Tensor parallelism
-
B
Continuous batching (iteration-level scheduling)
-
C
Quantization-aware training
-
D
Flash Attention