Ω

Neural Architecture Tradeoff Workbench

Karpathy Thought Experiment: Transformer vs SSM (Mamba) vs CNN vs GNN
Task Benchmarks Preset
Model Parameters Live Controls
Dynamic Activation Topology & Attention Map
View:

Primary Bottleneck & Analysis

Transformer context quadratic memory wall vs SSM hidden state loss risk

Scaling Metrics Transformer
Memory Footprint
128 MB
O(N²) quadratic
Compute FLOPs
2.1 GFLOPs
Attention Matrix
Context Capacity
Bounded
KV Cache Limit
Recurrent State
None
Full Sequence
Memory Scaling Curves (MB)
Karpathy Verdict Recommendation
Recommended: Hybrid SSM-Attention

Combine SSM's unbounded context linear $O(N)$ scanning with selective sparse Transformer attention for exact multi-hop recall.