Artificial Intelligence #transformer#feed-forward
Transformer Feed-Forward Block Linearity: Learned, Not Architectural, According to New Research
A new study introduces R^2_lin, a measure of linearity for transformer feed-forward blocks. Across models like GPT-2 and Pythia-160m, R^2_lin varies widely and is not determined by activation function. The findings offer targeted compression signals and reveal pitfalls in training linear baselines.
Jun 20, 2026 1 source