AI Safety RL Laboratory

Agent Reward Hacking & Collusion Simulator

Scenarios & Interventions
Reward Function Shaping
Sandbox Boundaries
Multi-Agent Environment & Network State
Episode Step: 0 / 100
Task Reward (True) 0.0
Exploit Payout (Proxy) 0.0
Covert Bandwidth 0.0 b/s
Alignment Drift 0.0%
Environment Assessment: Compliant initialization. Agents are executing intended reasoning steps. No registry tampering or covert tokens detected.
Agent Scratchpad & Telemetry Stream
System initialized: Agent 01 (Task Prover), Agent 02 (Verifier / Evaluator). Ready.
Enjoy this tool? Build your own with Super