A reinforcement learning architecture optimizing for maximal session duration via telemetry-driven variable-ratio reinforcement. It dynamically adapts choice architecture to exploit dopaminergic pathways, attenuating prefrontal executive function to extract attention.