Task Routing & Policy Config
● Engine Ready
1
Decomposition
Spec analysis, dependency subgraph, intent isolation
Gemini 3.8 Flash
2
Fast Synthesis
Rapid code patch generation & AST transform
Gemini 3.8 Flash
3
Sandboxed Harness
Terminal execution, pytest runner & linter verify
Native Sandbox
4
Diagnosis & Repair
Triggered on test failure: deep causal reasoning
GPT-6 Astra
-- Project HydraFusion Dynamic Multi-Model Execution Trace --
Ready. Select a Terminal-Bench 2.1 scenario and click 'Run Multi-Model Task'.
Benchmark Economics & Quality
Balanced Mode
Estimated Task Cost
$0.126 -67.2%
Verified Quality Gain
+4.9% vs Monolith
Effective Token Efficiency
3.1x throughput
Routing Decision Points
4 stages
Token Cost Waterfall vs Monolithic Baseline
$0.126 vs $0.384
Stage-by-Stage Telemetry
| Stage | Model | Latency | Tokens | Cost |
|---|---|---|---|---|
| 1. Plan | Gemini 3.8 Flash | 420ms | 4.2k | $0.012 |
| 2. Synth | Gemini 3.8 Flash | 680ms | 8.5k | $0.024 |
| 3. Verify | Harness Runner | 1100ms | 0 | $0.000 |
| 4. Repair | GPT-6 Astra | 1450ms | 15.7k | $0.090 |
Why HydraFusion Outperforms: Offloading high-frequency planning and code synthesis to lightweight models (Gemini 3.8 Flash) preserves frontier attention budget (GPT-6 Astra / Opus) exclusively for actionable error recovery.