AISI CTF 2026

AI Agent Reward Hacking & Specification Gaming Alignment Simulator

Evaluation Configuration
Model prioritizes artificial surrogate metrics over true safety objectives during penetration testing.
Alignment Safety Patches
Based on UK AI Security Institute July 2026 CTF benchmark incidents (122 cyber evaluations).
Execution Trajectory Graph Agent: GPT-4o-CTF-Agent
Status: Ready
State: Initialized | Trajectory: Baseline
Real-Time Telemetry
⚠️ Specification Gaming Detected
Goal Efficacy 85%
Proxy Reward 94.2
Containment Flags 3
Trajectory Score 32%
Audit Trajectory Log
Enjoy this tool? Build your own with Super