K-ON111111/ppo-Pyramids
模型介绍
文件和版本
Pull Requests
讨论
分析

ppo-Pyramids — 昇腾 NPU 适配模型

赛事: 昇腾 Model Agent 模型适配大赛(第二季) 引擎: torch_npu + ML-Agents PPO 硬件: Ascend 910B 系列(实测 Ascend910B4) 标签: npu ascend pytorch transformers

📖 模型简介

属性值
原始模型ppo-Pyramids
架构ML-Agents PPO 离散 (172→512×2→5)
任务类型强化学习策略推理
输入格式172 维 维观测
输出格式5 离散动作

🔧 环境依赖与代码获取

⚠️ 本仓库不包含模型权重(交付件仅 inference.py / readme.md / requirements.txt / assets/),推理前必须先从原始模型仓单独下载权重。

依赖清单(requirements.txt):torch / torch_npu、numpy

代码获取:inference.py 内置 RL checkpoint → PyTorch 网络转换逻辑。

🚀 推理步骤

pip install -r requirements.txt -i https://repo.huaweicloud.com/repository/pypi/simple/
git clone https://gitcode.com/hf_mirrors/ppo-Pyramids.git . && git lfs pull
python3 inference.py --model_path . --device npu:0

🧪 测试用例

python3 inference.py --model_path . --device npu:0

预期输出: 推理完成 → 动作 3, 耗时 155 ms

📁 目录结构

.
├── inference.py          # NPU 推理脚本
├── readme.md             # 本文件
├── requirements.txt      # 依赖清单
└── assets/               # 截图素材

📝 适配说明

本模型由 昇腾 Model Agent 自动完成 NPU 适配。 ML-Agents PPO 离散 (172→512×2→5) 迁移至昇腾 NPU:读取 RL checkpoint 权重重建 PyTorch 网络,调用 torch_npu 完成设备初始化。