模型名称: ppo-Pyramids 模型链接: https://ai.gitcode.com/hf_mirrors/Nablaaa/ppo-Pyramids 模型描述: ppo-Pyramids is a PPO (Proximal Policy Optimization) model trained for Pyramids environment. Features simple visual encoder CNN, 84x84 grayscale observation input, 4-dim action output, with 2-layer hidden network (512 units). 模型架构: PPO (Proximal Policy Optimization, CNN encoder + MLP policy/value networks) 参数规模: Small
| 依赖项 | 版本要求 | 说明 |
|---|---|---|
| Python | >= 3.10 | 推荐 3.11 |
| torch / torch_npu | 2.1.0+ | 昇腾NPU推理 |
| transformers | >= 4.45.0 | HuggingFace 库 |
| 昇腾驱动 | CANN 8.0.RC2+ | 推荐最新版 |
安装命令:
pip install torch torch_npu transformers sentencepiece# 检查 NPU 设备
npu-smi info# 单条输入推理
python inference.py --input "测试输入内容" --model_path ./ppo-Pyramids
# 批量输入推理
python inference.py --input_file test_samples.txt --model_path ./ppo-Pyramids| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
| --input | str | - | 输入文本/图像路径 |
| --input_file | str | - | 批量输入文件路径 |
| --model_path | str | ppo-Pyramids | 模型路径 |
| --max_length | int | 2048 | 最大生成长度 |
输入:
84x84 灰度随机图像输出:
动作: 0, 状态价值: -0.0284耗时: 0.210s



| 测试样例 | NPU输出 | 耗时 | 是否成功运行 |
|---|---|---|---|
| 基础推理测试 - 随机观察输入 | 动作: 0, 状态价值: -0.0284 | 0.210s | ✅ 成功 |
结论: 模型已在 NPU 上成功运行推理,满足验收要求。 说明: 根据最新规则,不再强制精度1%验证,本章节记录 NPU 运行验证结果。
文档生成时间:2026-08-22 00:15:42