Optimal Fit in 8GB VRAM (67.8% utilization)
Model weights, KV cache, and activations fit comfortably inside GPU VRAM without host RAM offloading.
VRAM Allocation Stack Breakdown Total: 5.43 GB / 8.00 GB
Weights 4.58GB
KV 0.50GB
Act 0.35GB
Free 2.57GB
Model Weights 4.58 GB
KV Cache 0.50 GB
Activation Overhead 0.35 GB
Total VRAM Required 5.43 GB
Predicted Speed 38.2 tok/s Memory bandwidth bound
VRAM Utilization 67.9% Target: 8 GB Physical VRAM
KV Memory / Token 128 KB GQA (Grouped Query Attn)
Host Offload Risk 0.00 GB No PCIe bottleneck slowdown
Side-by-Side Micro-Model Efficiency Comparison High utility local models on consumer hardware
Model Name Category Parameters VRAM Footprint Estimated Speed / Latency Consumer Viability
WebGPU Browser Acceleration Diagnostic
Scanning local browser WebGPU device capabilities...