JeffDing/ppo-Pyramids-NPU
模型介绍
文件和版本
Pull Requests
讨论
分析

ppo-Pyramids 昇腾NPU部署文档

1. 模型简介

模型名称: ppo-Pyramids 模型链接: https://ai.gitcode.com/hf_mirrors/Nablaaa/ppo-Pyramids 模型描述: ppo-Pyramids is a PPO (Proximal Policy Optimization) model trained for Pyramids environment. Features simple visual encoder CNN, 84x84 grayscale observation input, 4-dim action output, with 2-layer hidden network (512 units). 模型架构: PPO (Proximal Policy Optimization, CNN encoder + MLP policy/value networks) 参数规模: Small


2. 环境依赖

依赖项版本要求说明
Python>= 3.10推荐 3.11
torch / torch_npu2.1.0+昇腾NPU推理
transformers>= 4.45.0HuggingFace 库
昇腾驱动CANN 8.0.RC2+推荐最新版

安装命令:

pip install torch torch_npu transformers sentencepiece

3. 推理步骤

3.1 环境准备

# 检查 NPU 设备
npu-smi info

3.2 运行推理

# 单条输入推理
python inference.py --input "测试输入内容" --model_path ./ppo-Pyramids

# 批量输入推理
python inference.py --input_file test_samples.txt --model_path ./ppo-Pyramids

3.3 推理参数说明

参数类型默认值说明
--inputstr-输入文本/图像路径
--input_filestr-批量输入文件路径
--model_pathstrppo-Pyramids模型路径
--max_lengthint2048最大生成长度

4. 测试样例及输出结果

样例 1:基础推理测试 - 随机观察输入

输入:

84x84 灰度随机图像

输出:

动作: 0, 状态价值: -0.0284

耗时: 0.210s


5. Agent适配截图

5.1 Agent适配全过程截图

Agent 适配流程

5.2 NPU设备调用截图

NPU 设备调用

5.3 模型适配结果截图

模型适配结果


6. NPU运行验证信息

测试样例NPU输出耗时是否成功运行
基础推理测试 - 随机观察输入动作: 0, 状态价值: -0.02840.210s✅ 成功

结论: 模型已在 NPU 上成功运行推理,满足验收要求。 说明: 根据最新规则,不再强制精度1%验证,本章节记录 NPU 运行验证结果。


7. 注意事项

  • 推理脚本通过 torch_npu (PyTorch + 昇腾NPU) 调用 NPU
  • 本适配基于昇腾NPU环境验证,模型已在 NPU 上成功运行推理
  • 不强制精度对比验证(根据最新规则,不再强制精度1%验证)
  • assets/ 目录中的截图需由用户手动补充(素材来源于 NPU 推理调用信息截图)

文档生成时间:2026-08-22 00:15:42