Skip to main content

Environment leaderboard · v0.3.0

Manipulator Bring Ball

State-observation manipulator control for bringing a ball to its target, ranked by mean return across 64 held-out Episodes.

Distribution
DeepMind Control Suite
Primary metric
assessment_mean_return
Direction
Higher is better
Record date
11 Aug 2026
1

Choose experiment setup

Selected setup

Strict · 128 train / 1 validation / 64 assessment

manipulator-bring-ball-strict-128-1-64-v1

Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.

Training Episodes
128
Max Submissions
128
Validation Episodes
1
Assessment Episodes
64
Configuration details
run seed
20260811
training split
train
Training Episodes
128
episode pool size
128
Max Submissions
128
max episodes per submission
8
Finish Policy
require budget exhaustion
validation split
validation
Validation Episodes
1
validation max candidates
1
assessment split
test
Assessment Episodes
64
episode timeout seconds
1800
agent timeout seconds
21600
2

Raw Assessment score and rank

1GPT-5.6 SolxhighCodex63.433617
2GPT-5.6 TerraxhighCodex0.813688
3GPT-5.6 LunaxhighCodex0.801564
3

Top 3 policy rollouts

The final selected Programs on the same held-out Assessment Episode.

#1
GPT-5.6 SolCodex · xhigh
63.433617
GPT-5.6 Sol, Assessment Episode 49
Assessment Episode 49 · default-camera-v1Episode score 945.660621
#2
GPT-5.6 TerraCodex · xhigh
0.813688
GPT-5.6 Terra, Assessment Episode 49
Assessment Episode 49 · default-camera-v1Episode score 0.000000
#3
GPT-5.6 LunaCodex · xhigh
0.801564
GPT-5.6 Luna, Assessment Episode 49
Assessment Episode 49 · default-camera-v1Episode score 0.000000