native env renderGPT-5.5
Codex- Held-out 分数
- 95.22
- Checkpoint
- #005
- 重跑
- 88 steps
Validation-selected checkpoint rerun in the original environment; case return 95.69.
Control · Core16
带延迟目标奖励的连续油门控制任务。
这些证据属于论文时期实验,并不表示相关 package 当前仍然可用。
每张卡片都在原研究 Environment 中重跑 validation 选出的 checkpoint。
native env renderValidation-selected checkpoint rerun in the original environment; case return 95.69.
native env renderValidation-selected checkpoint rerun in the original environment; case return 98.89.
native env renderValidation-selected checkpoint rerun in the original environment; case return 91.61.
native env renderValidation-selected checkpoint rerun in the original environment; case return 94.50.
在该 Environment 内分数越高越好;不同任务的原始 reward scale 不可比较。
98.7795.2294.4891.88-33.36