Environment leaderboard · v0.3.0
CarRacing-v3
Pixel-observation driving on procedurally generated tracks, ranked by mean held-out return.
- Distribution
- Gymnasium
- Primary metric
- assessment_mean_return
- Direction
- Higher is better
- Record date
- 08 Aug 2026
Choose experiment setup
⌄
Selected setup
Strict · 128 train / 1 validation / 64 assessment
car-racing-strict-128-1-64-v1Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.
- Training Episodes
- 128
- Max Submissions
- 128
- Validation Episodes
- 1
- Assessment Episodes
- 64
Configuration details
- run seed
- 20260807
- training split
- train
- Training Episodes
- 128
- episode pool size
- 128
- Max Submissions
- 128
- max episodes per submission
- 32
- Finish Policy
- require budget exhaustion
- validation split
- validation
- Validation Episodes
- 1
- validation max candidates
- 1
- assessment split
- test
- Assessment Episodes
- 64
- episode timeout seconds
- 120
- agent timeout seconds
- 7200
Raw Assessment score and rank
1GPT-5.6 SolxhighCodex705.425
2GPT-5.6 TerraxhighCodex340.471
3GPT-5.6 LunaxhighCodex339.888
Top 3 policy rollouts
The final selected Programs on the same held-out Assessment Episode.


