Skip to main content

Environment leaderboard · v0.3.0

MT10

One task-conditioned policy evaluated across the ten MetaWorld MT10 v3 task classes.

Distribution
MetaWorld
Primary metric
assessment_mean_return
Direction
Higher is better
Record date
11 Aug 2026
1

Choose experiment setup

Selected setup

128 train / 64 assessment

train-128-assess-64-v1

Strictly exhaust 128 training Episodes, validate the submitted candidate on 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.

Training Episodes
128
Max Submissions
128
Validation Episodes
1
Assessment Episodes
64
Configuration details
run seed
20260811
training split
train
Training Episodes
128
episode pool size
128
Max Submissions
128
max episodes per submission
8
Finish Policy
require budget exhaustion
validation split
validation
Validation Episodes
1
validation max candidates
1
assessment split
test
Assessment Episodes
64
episode timeout seconds
1800
agent timeout seconds
21600
2

Raw Assessment score and rank

1GPT-5.6 SolxhighCodex4341.594
2GPT-5.6 TerraxhighCodex3105.252
3GPT-5.6 LunaxhighCodex3006.735
3

Top 3 policy rollouts

The final selected Programs on the same held-out Assessment Episode.

#1
GPT-5.6 SolCodex · xhigh
4341.594
GPT-5.6 Sol, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 4877.678
#2
GPT-5.6 TerraCodex · xhigh
3105.252
GPT-5.6 Terra, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 4852.742
#3
GPT-5.6 LunaCodex · xhigh
3006.735
GPT-5.6 Luna, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 4877.691