Chapter 50
OnnxRuntime GenAI Windows GPU 指南
OnnxRuntime GenAI Windows GPU 指南
本指南提供了在 Windows 上使用 GPU 配置和使用 ONNX Runtime (ORT) 的步骤。旨在帮助您利用 GPU 加速您的模型,提高性能和效率。
本文档提供以下指导:
- 环境设置:安装 CUDA、cuDNN 和 ONNX Runtime 等必要依赖的说明。
- 配置:如何配置环境和 ONNX Runtime 以有效利用 GPU 资源。
- 优化建议:关于如何微调 GPU 设置以获得最佳性能的建议。
1. Python 3.10.x /3.11.8
注意 建议使用 miniforge 作为您的 Python 环境
conda create -n pydev python==3.11.8
conda activate pydev提醒 如果您安装过任何关于 Python 的 ONNX 库,请卸载它们
2. 使用 winget 安装 CMake
winget install -e --id Kitware.CMake3. 安装 Visual Studio 2022 - C++ 桌面开发
注意 如果您不想编译可以跳过此步骤

4. 安装 NVIDIA 驱动程序
-
NVIDIA GPU 驱动 https://www.nvidia.com/en-us/drivers/
-
NVIDIA CUDA 12.4 https://developer.nvidia.com/cuda-12-4-0-download-archive
-
NVIDIA CUDNN 9.4 https://developer.nvidia.com/cudnn-downloads
提醒 请使用默认安装流程
5. 设置 NVIDIA 环境
将 NVIDIA CUDNN 9.4 的 lib、bin、include 文件复制到 NVIDIA CUDA 12.4 对应的 lib、bin、include 目录
-
复制 'C:\Program Files\NVIDIA\CUDNN\v9.4\bin\12.6' 目录下的文件到 'C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\bin'
-
复制 'C:\Program Files\NVIDIA\CUDNN\v9.4\include\12.6' 目录下的文件到 'C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\include'
-
复制 'C:\Program Files\NVIDIA\CUDNN\v9.4\lib\12.6' 目录下的文件到 'C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\lib\x64'
6. 下载 Phi-3.5-mini-instruct-onnx
winget install -e --id Git.Git
winget install -e --id GitHub.GitLFS
git lfs install
git clone https://huggingface.co/microsoft/Phi-3.5-mini-instruct-onnx7. 运行 InferencePhi35Instruct.ipynb
打开 Notebook 并执行

8. 编译 ORT GenAI GPU
注意
- 请先卸载所有 onnx、onnxruntime 和 onnxruntime-genai 相关库
pip list 然后卸载所有 onnxruntime 库,即
pip uninstall onnxruntime
pip uninstall onnxruntime-genai
pip uninstall onnxruntume-genai-cuda- 检查 Visual Studio 扩展支持
检查 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\extras 中是否有 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\extras\visual_studio_integration 文件夹。
如果未找到,请检查其他 CUDA 工具包驱动文件夹,并将 visual_studio_integration 文件夹及其内容复制到 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\extras\visual_studio_integration
- 如果您不想编译可跳过此步骤
git clone https://github.com/microsoft/onnxruntime-genai-
解压 onnxruntime-win-x64-gpu-1.19.2.zip 并重命名为 ort,然后将 ort 文件夹复制到 onnxruntime-genai 目录下
-
使用 Windows Terminal,进入 VS 2022 的开发者命令提示符,进入 onnxruntime-genai 目录

- 使用您的 Python 环境编译它
cd onnxruntime-genai
python build.py --use_cuda --cuda_home "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4" --config Release
cd build/Windows/Release/Wheel
pip install .whl免责声明: 本文件由 AI 翻译服务 Co-op Translator 翻译完成。尽管我们力求准确,但请注意,自动翻译可能包含错误或不准确之处。原始语言版文件应视为权威来源。对于重要信息,建议使用专业人工翻译。我们对因使用本翻译而产生的任何误解或误释不承担责任。
