Project HydraFusion Orchestration Bench Terminal-Bench 2.1

Task Routing & Policy Config ● Engine Ready
1
Decomposition
Spec analysis, dependency subgraph, intent isolation
Gemini 3.8 Flash
2
Fast Synthesis
Rapid code patch generation & AST transform
Gemini 3.8 Flash
3
Sandboxed Harness
Terminal execution, pytest runner & linter verify
Native Sandbox
4
Diagnosis & Repair
Triggered on test failure: deep causal reasoning
GPT-6 Astra
-- Project HydraFusion Dynamic Multi-Model Execution Trace --
Ready. Select a Terminal-Bench 2.1 scenario and click 'Run Multi-Model Task'.
Benchmark Economics & Quality Balanced Mode
Estimated Task Cost
$0.126 -67.2%
Verified Quality Gain
+4.9% vs Monolith
Effective Token Efficiency
3.1x throughput
Routing Decision Points
4 stages
Token Cost Waterfall vs Monolithic Baseline $0.126 vs $0.384
HydraFusion (Multi-Model) 28,400 tokens ($0.126)
Claude Opus 5 (Monolith Baseline) 89,200 tokens ($0.384)
Stage-by-Stage Telemetry
Stage Model Latency Tokens Cost
1. Plan Gemini 3.8 Flash 420ms 4.2k $0.012
2. Synth Gemini 3.8 Flash 680ms 8.5k $0.024
3. Verify Harness Runner 1100ms 0 $0.000
4. Repair GPT-6 Astra 1450ms 15.7k $0.090
Why HydraFusion Outperforms: Offloading high-frequency planning and code synthesis to lightweight models (Gemini 3.8 Flash) preserves frontier attention budget (GPT-6 Astra / Opus) exclusively for actionable error recovery.
Enjoy this tool? Build your own with Super