AI Safety Simulation Workbench · Evan Hubinger & Jacob Coxon Warning Model

AI Catastrophic Risk Simulation & Scaling Horizon Calculator

Empirical safety boundary simulator modeling self-improving recursive AI velocities, alignment lead times, and catastrophic breach likelihoods over a 10-year horizon.

Context: Grounded in The Verge’s investigative reporting on Anthropic alignment scientist Evan Hubinger's warning of a >10% terminal risk that uncontrolled self-improving AI could cause human extinction, following Jacob Coxon’s resignation over companies "gambling with our lives."

Simulation Parameters

1.45x

Compound capability acceleration factor per year during autonomous training loops.

18 mo

Pre-deployment evaluation and red-teaming runway prior to capability release.

1.2x

Dedicated alignment and interpretability budget proportional to capability compute.

10-Year Threat Horizon Representative Baseline

Terminal Risk Probability
12.5%
Critical Breach Horizon
4.2 yrs
Vulnerability Assessment
High Vulnerability Zone
AI Capability Frontier Safety Alignment Capacity ••• Catastrophic Breach Window
Operational Policy Guidance:
Mandatory capability pause & alignment verification

Comparative Risk-Mitigation Policy Matrix

Intervention Framework Enforcement Mechanism Simulated Risk Reduction Target Lead Time Shift Efficacy Rating
Research Grounding & Context:

Simulation models the existential risk dynamic referenced in The Verge reporting on X, detailing the departure of researcher Jacob Coxon from Anthropic and subsequent statements by Alignment Science Lead Evan Hubinger asserting a >10% likelihood of catastrophic outcome if autonomous self-improvement loops bypass verifiable alignment bounds.

Enjoy this tool? Build your own with Super