Policy 可见契约
Policy.act() 接收一个严格包含四个有限浮点数的有序列表,并返回一个精确整数 Action。
| 索引 | 分量 | 含义 | 范围 |
|---|---|---|---|
0 | cart_position | 小车水平位置 | [-4.8, 4.8] |
1 | cart_velocity | 小车水平速度 | unbounded |
2 | pole_angle | 杆的弧度角 | ≈ [-0.418, 0.418] |
3 | pole_angular_velocity | 杆的角速度 | unbounded |
0向左推动1向右推动严格 Action 处理
非法 Action 不会被截断、修复、转换或替换。
Episode 生命周期
- 派生按 split 隔离的 Environment seed。
- 创建新的 Environment 与 Policy process。
- 只允许状态在同一 Episode 的 act() 调用间保留。
- 在终止、500 步或 Policy failure 时停止。
Reward 与评分
每次合法 Environment step 贡献 +1。Benchmark score 是各 Episode 计分的算术平均值;Policy failure 贡献 0。
安装与评估
uv sync --project environments/gymnasium/classic_control/cartpole --extra dev
uv build environments/gymnasium/classic_control/cartpole