跳到主要内容

Robotics · Core16

FetchPush

使用机械臂夹爪完成目标条件推动。

历史研究记录

这些证据属于论文时期实验,并不表示相关 package 当前仍然可用。

01

最终 Policy 证据

每张卡片都在原研究 Environment 中重跑 validation 选出的 checkpoint。

GPT-5.5 Policy rerun in FetchPushdirect mujoco renderer

GPT-5.5

Codex
BEST
Held-out 分数
-18.16
Checkpoint
#003
重跑
50 steps

Validation-selected checkpoint rerun in the original environment; case return -17.00.

Claude Opus 4.7 Policy rerun in FetchPushdirect mujoco renderer

Claude Opus 4.7

Claude Code
#2
Held-out 分数
-19.69
Checkpoint
#008
重跑
50 steps

Validation-selected checkpoint rerun in the original environment; case return -11.00.

MiniMax-M3 Policy rerun in FetchPushdirect mujoco renderer

MiniMax-M3

Claude Code
#3
Held-out 分数
-25.88
Checkpoint
#018
重跑
50 steps

Validation-selected checkpoint rerun in the original environment; case return -14.00.

DeepSeek-V4-Pro Policy rerun in FetchPushdirect mujoco renderer

DeepSeek-V4-Pro

Claude Code
#4
Held-out 分数
-27.66
Checkpoint
#011
重跑
50 steps

Validation-selected checkpoint rerun in the original environment; case return -24.00.

02

报告分数

在该 Environment 内分数越高越好;不同任务的原始 reward scale 不可比较。

01GPT-5.5Codex-18.16
02Claude Opus 4.7Claude Code-19.69
03MiniMax-M3Claude Code-25.88
04DeepSeek-V4-ProClaude Code-27.66
05Random policyUniform-46.03