Skip to main content

Environment leaderboard · v0.3.0

Atari Tetris

Pixel-observation Tetris control in ALE, ranked by mean return across 64 held-out Episodes.

Distribution
ALE
Primary metric
assessment_mean_return
Direction
Higher is better
Record date
11 Aug 2026
1

Choose experiment setup

Selected setup

Strict · 128 train / 1 validation / 64 assessment

tetris-strict-128-1-64-v1

Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.

Training Episodes
128
Max Submissions
128
Validation Episodes
1
Assessment Episodes
64
Configuration details
run seed
20260810
training split
train
Training Episodes
128
episode pool size
128
Max Submissions
128
max episodes per submission
8
Finish Policy
require budget exhaustion
validation split
validation
Validation Episodes
1
validation max candidates
1
assessment split
test
Assessment Episodes
64
episode timeout seconds
1800
agent timeout seconds
21600
2

Raw Assessment score and rank

1GPT-5.6 SolxhighCodex400.375000
2GPT-5.6 TerraxhighCodex3.328125
3GPT-5.6 LunaxhighCodex1.625000
3

Top 3 policy rollouts

The final selected Programs on the same held-out Assessment Episode.

#1
GPT-5.6 SolCodex · xhigh
400.375000
GPT-5.6 Sol, Assessment Episode 0
Assessment Episode 0 · ale-rgb-v1Episode score 522.000000
#2
GPT-5.6 TerraCodex · xhigh
3.328125
GPT-5.6 Terra, Assessment Episode 0
Assessment Episode 0 · ale-rgb-v1Episode score 3.000000
#3
GPT-5.6 LunaCodex · xhigh
1.625000
GPT-5.6 Luna, Assessment Episode 0
Assessment Episode 0 · ale-rgb-v1Episode score 2.000000