赛事: 昇腾 Model Agent 模型适配大赛(第二季) 引擎: torch_npu + ML-Agents PPO 硬件: Ascend 910B 系列(实测 Ascend910B4) 标签:
npuascendpytorchtransformers
| 属性 | 值 |
|---|---|
| 原始模型 | ppo-Pyramids |
| 架构 | ML-Agents PPO 离散 (172→512×2→5) |
| 任务类型 | 强化学习策略推理 |
| 输入格式 | 172 维 维观测 |
| 输出格式 | 5 离散动作 |
⚠️ 本仓库不包含模型权重(交付件仅
inference.py/readme.md/requirements.txt/assets/),推理前必须先从原始模型仓单独下载权重。
依赖清单(requirements.txt):torch / torch_npu、numpy
代码获取:inference.py 内置 RL checkpoint → PyTorch 网络转换逻辑。
pip install -r requirements.txt -i https://repo.huaweicloud.com/repository/pypi/simple/
git clone https://gitcode.com/hf_mirrors/ppo-Pyramids.git . && git lfs pull
python3 inference.py --model_path . --device npu:0python3 inference.py --model_path . --device npu:0预期输出: 推理完成 → 动作 3, 耗时 155 ms
.
├── inference.py # NPU 推理脚本
├── readme.md # 本文件
├── requirements.txt # 依赖清单
└── assets/ # 截图素材本模型由 昇腾 Model Agent 自动完成 NPU 适配。
ML-Agents PPO 离散 (172→512×2→5) 迁移至昇腾 NPU:读取 RL checkpoint 权重重建 PyTorch 网络,调用 torch_npu 完成设备初始化。