What is the attention mechanism in transformer models computing with its Query, Key, and Value matrices?
-
A
Convolving input features across spatial dimensions using learned filters
-
B
Computing weighted sums of value vectors, where weights derive from query-key dot product similarities
-
C
Applying recurrent state transitions to sequential input tokens
-
D
Normalizing feature distributions across the batch dimension