Skip to main content

Environment leaderboard · v0.3.0

HalfCheetah-v5

High-dimensional planar locomotion scored by mean held-out environment return.

Distribution
Gymnasium
Primary metric
assessment_mean_return
Direction
Higher is better
Record date
08 Aug 2026
1

Choose experiment setup

Selected setup

Strict · 128 train / 1 validation / 64 assessment

half-cheetah-strict-128-1-64-v1

Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.

Training Episodes
128
Max Submissions
128
Validation Episodes
1
Assessment Episodes
64
Configuration details
run seed
20260807
training split
train
Training Episodes
128
episode pool size
128
Max Submissions
128
max episodes per submission
32
Finish Policy
require budget exhaustion
validation split
validation
Validation Episodes
1
validation max candidates
1
assessment split
test
Assessment Episodes
64
episode timeout seconds
1200
agent timeout seconds
7200
2

Raw Assessment score and rank

1GPT-5.6 SolxhighCodex1149.423
2GPT-5.6 TerraxhighCodex763.550
3GPT-5.6 LunaxhighCodex79.132
3

Top 3 policy rollouts

The final selected Programs on the same held-out Assessment Episode.

#1
GPT-5.6 SolCodex · xhigh
1149.423
GPT-5.6 Sol, Assessment Episode 0
Assessment Episode 0Episode score 1162.479
#2
GPT-5.6 TerraCodex · xhigh
763.550
GPT-5.6 Terra, Assessment Episode 0
Assessment Episode 0Episode score 771.393
#3
GPT-5.6 LunaCodex · xhigh
79.132
GPT-5.6 Luna, Assessment Episode 0
Assessment Episode 0Episode score 79.559