Task Benchmarks
Preset
Model Parameters
Live Controls
Primary Bottleneck & Analysis
Transformer context quadratic memory wall vs SSM hidden state loss risk
Scaling Metrics
Transformer
Memory Footprint
128 MB
O(N²) quadratic
Compute FLOPs
2.1 GFLOPs
Attention Matrix
Context Capacity
Bounded
KV Cache Limit
Recurrent State
None
Full Sequence
Memory Scaling Curves (MB)
Karpathy Verdict Recommendation
Recommended: Hybrid SSM-Attention
Combine SSM's unbounded context linear $O(N)$ scanning with selective sparse Transformer attention for exact multi-hop recall.