Transformer Activation Graph (8 Layers × 4 Heads)
Selected: L5_H3 (Sycophancy Attention Head)
Feed-Forward Stream
Targeted Attention Head
Ablated / Clamped
Output Unembedding
Intervention: Feat #4 Clamped (-2.50x)
Monosemantic Sparse Autoencoder (SAE) Dictionary
Layer 5 SAE • 16 Features
Detected Monosemantic Features (Superposition Decomposed)
Activation Magnitude
Downstream Next-Token Probabilities
Sycophancy: 0.78 → 0.14