GitHub Copilot

Project HydraFusion Orchestrator

Terminal-Bench 2.1
Evaluated on Terminal-Bench 2.1: HydraFusion multi-model routing delivers verified pass rate at estimated task cost vs. monolithic Claude Opus 5 baseline.
Scenario:
Multi-Model Routing DAG Route: Adaptive Dynamic Dispatch
01 TRIAGE Fast
Speculative Triage
Fast Speculative (8B)
450 tok $0.002
02 PLANNER Astra
Agentic Diagnosis
GPT-6 Astra
2,800 tok $0.070
03 VERIFIER Sandbox
Terminal Verification
Deterministic Bash
Cycle 1/2 $0.000
04 ESCALATION Escalate
Frontier Fallback
Claude Opus 5
0 tok (Bypassed) $0.000
Speculative Triage: Parses task description, classifies terminal error bounds, generates high-speed initial hypothesis.
210ms
Live Task Telemetry TB-2.1 Benchmark
EST. COST / TASK
$0.47/task
-66.9% vs Opus 5
VERIFIED PASS RATE
77.3%
+4.9 pp vs Opus 5
CLAUDE OPUS 5 BASELINE
$1.42/task
Single Model Baseline
OPUS 5 BASELINE PASS
72.4%
Zero-routing baseline
Sandbox Verification Loop
Terminal Execution Trace & Sandbox
Terminal-Bench 2.1 Pareto Frontier Cost ($) vs Verified Quality (%)
HydraFusion Route
Opus 5 Monolith
GPT-6 Astra Deep
Fast Speculative
Enjoy this tool? Build your own with Super