FFN (Feed-Forward Network) / MLP
The per-token processing sub-layer in a Transformer block; holds much of the model's parameters and knowledge.
The per-token processing sub-layer in a Transformer block; holds much of the model's parameters and knowledge. (M01)