Skip to main content

Environment leaderboard · v0.3.0

FrankaKitchen-v1

Franka manipulation across seven kitchen subtasks, ranked by mean held-out environment return.

Distribution
Gymnasium Robotics
Primary metric
assessment_mean_return
Direction
Higher is better
Record date
11 Aug 2026
1

Choose experiment setup

Selected setup

Strict · 128 train / 1 validation / 64 assessment

franka-kitchen-strict-128-1-64-v1

Use all 128 training Episodes, select one Program with 1 Validation Episode, then measure it on 64 held-out Assessment Episodes.

Training Episodes
128
Max Submissions
128
Validation Episodes
1
Assessment Episodes
64
Configuration details
run seed
20260808
training split
train
Training Episodes
128
episode pool size
128
Max Submissions
128
max episodes per submission
8
Finish Policy
require budget exhaustion
validation split
validation
Validation Episodes
1
validation max candidates
1
assessment split
test
Assessment Episodes
64
episode timeout seconds
1800
agent timeout seconds
28800
2

Raw Assessment score and rank

1GPT-5.6 SolxhighCodex2.000000
2GPT-5.6 TerraxhighCodex1.953125
3GPT-5.6 LunaxhighCodex0.031250
3

Top 3 policy rollouts

The final selected Programs on the same held-out Assessment Episode.

#1
GPT-5.6 SolCodex · xhigh
2.000000
GPT-5.6 Sol, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 2.000000
#2
GPT-5.6 TerraCodex · xhigh
1.953125
GPT-5.6 Terra, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 2.000000
#3
GPT-5.6 LunaCodex · xhigh
0.031250
GPT-5.6 Luna, Assessment Episode 0
Assessment Episode 0 · overview-v1Episode score 0.000000