Chapter 59
E2E OpenVino Phi3Vision
本演示展示了如何使用预训练模型,根据图像和文本提示生成 Python 代码。
以下是逐步说明:
-
导入和设置:
- 导入所需的库和模块,包括用于图像处理的
requests、PIL,以及用于模型和处理的transformers。
- 导入所需的库和模块,包括用于图像处理的
-
加载并显示图像:
- 使用
PIL库打开图像文件(demo.png)并显示。
- 使用
-
定义提示:
- 创建一条消息,包含图像和请求生成用于处理图像并使用
plt(matplotlib)保存的 Python 代码。
- 创建一条消息,包含图像和请求生成用于处理图像并使用
-
加载处理器:
- 从指定的
out_dir目录加载预训练模型的AutoProcessor。该处理器将处理文本和图像输入。
- 从指定的
-
创建提示:
- 使用
apply_chat_template方法将消息格式化为适合模型的提示。
- 使用
-
处理输入:
- 将提示和图像处理成模型可理解的张量。
-
设置生成参数:
- 定义模型生成过程的参数,包括最大生成新标记数和是否采样输出。
-
生成代码:
- 模型根据输入和生成参数生成 Python 代码。使用
TextStreamer处理输出,跳过提示和特殊标记。
- 模型根据输入和生成参数生成 Python 代码。使用
-
输出:
- 打印生成的代码,代码应包含用于处理图像并按提示保存的 Python 代码。
本演示说明了如何利用基于 OpenVino 的预训练模型,根据用户输入和图像动态生成代码。
免责声明:
本文件使用 AI 翻译服务 Co-op Translator 进行翻译。虽然我们力求准确,但请注意,自动翻译可能包含错误或不准确之处。原始文件的母语版本应被视为权威来源。对于重要信息,建议采用专业人工翻译。因使用本翻译而产生的任何误解或误释,我们概不负责。
