跳到主要内容

论文伴随材料 · v0.1.0

Core16 实验记录

四条 Coding Agent / 模型链路在十六个交互任务上的 held-out return 与最终 Policy 重跑。

历史研究记录

这些证据属于论文时期实验,并不表示相关 package 当前仍然可用。

01

Held-out 分数矩阵

分数只能在同一个 Environment 列内比较;高亮值为列内最大值。

ModelAcrobotContinuousCarBipedalCarRacingReacherHalfCheetahAntPusherDoorKeyKeyCorridorFourRoomsObstructedMazeParkingRoundaboutFetchPushFetchPickAndPlace
GPT-5.5Codex-84.6995.22248.9604.1-3.473601.8989.6-37.110.9860.9180.6640.904-30.249.818-18.16-11.81
Claude Opus 4.7Claude Code-88.5998.77-15.84602.3-3.979452.0990.1-38.520.9830.9300.7010.911-38.189.331-19.69-13.34
MiniMax-M3Claude Code-136.491.88-80.87233.4-5.103606.2983.4-39.250.0000.0000.4030.000-32.719.521-25.88-13.22
DeepSeek-V4-ProClaude Code-91.1694.48-97.4825.20-6.506-0.468898.0-54.180.0000.0000.0790.000-53.3810.20-27.66-20.56
Random policyUniform-499.2-33.36-101.0-29.63-43.77-291.8-34.60-147.50.0000.0000.0420.000-47.457.188-46.03-43.75
02

Agent 链路

列内最佳次数只用于概括矩阵,并不是跨任务聚合分数。

Codex

GPT-5.5

9 / 16列内最佳
Claude Code

Claude Opus 4.7

5 / 16列内最佳
Claude Code

MiniMax-M3

1 / 16列内最佳
Claude Code

DeepSeek-V4-Pro

1 / 16列内最佳

行为证据

检查被选中的 Policies。

档案保留 64 段原环境重跑,每个模型–环境链路各一段。

打开重跑档案阅读论文