Interactive Compute Pipeline Builder
Accelerated: 4 CUDA-X Nodes
Performance & Speedup Telemetry
FP8 Accelerated
End-to-End Latency
12.4 ms
↓ 86.2% vs CPU
Total Speedup
18.4x
vs Host CPU Baseline
Effective Throughput
842 TFLOPs
85.4% TC Peak
Energy Efficiency
2.41 GFLOP/J
+620% Perf/Watt
Dynamic Roofline Model Visualizer
AI = 142 FLOPs/Byte