Environment leaderboard · v0.3.0
HalfCheetah-v5
High-dimensional planar locomotion scored by mean held-out environment return.
- Distribution
- Gymnasium
- Primary metric
- assessment_mean_return
- Direction
- Higher is better
- Record date
- 08 Aug 2026
Choose experiment setup
⌄
Selected setup
Strict · 128 train / 1 validation / 64 assessment
half-cheetah-strict-128-1-64-v1Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.
- Training Episodes
- 128
- Max Submissions
- 128
- Validation Episodes
- 1
- Assessment Episodes
- 64
Configuration details
- run seed
- 20260807
- training split
- train
- Training Episodes
- 128
- episode pool size
- 128
- Max Submissions
- 128
- max episodes per submission
- 32
- Finish Policy
- require budget exhaustion
- validation split
- validation
- Validation Episodes
- 1
- validation max candidates
- 1
- assessment split
- test
- Assessment Episodes
- 64
- episode timeout seconds
- 1200
- agent timeout seconds
- 7200
Raw Assessment score and rank
1GPT-5.6 SolxhighCodex1149.423
2GPT-5.6 TerraxhighCodex763.550
3GPT-5.6 LunaxhighCodex79.132
Top 3 policy rollouts
The final selected Programs on the same held-out Assessment Episode.


