在英特尔硬件上部署深度学习模型的无代码方法 OpenVINO 深度学习工作台的三部分系列文章 – CPU AI 第三部
作者 Taylor, Mary, 翻译 李翊玮
关于该系列
- 了解如何转换、微调和打包 推理就绪的 TensorFlow 模型,该模型针对英特尔®硬件进行了优化,仅使用 Web 浏览器。每一步都在云中使用 OpenVINO™ 深度学习工作台和 Intel® DevCloud for the Edge 进行。
- 第一部分:我们向您展示英特尔®深度学习推理工具及其工作原理的基础知识。
- 第二部分:我们使用OpenVINO深度学习工作台完成导入,转换和基准测试TensorFlow模型的每个步骤。
- 第三部分(此文):我们向您展示如何使用OpenVINO深度学习工作台,仅使用浏览器即可导出精度级别以提高性能并导出随时可运行的推理包。
第三部分:重新校准精度并打包您的TensorFlow模型,以便使用OpenVINO™深度学习工作台进行部署
在第二部分中,我们向您展示了如何使用 OpenVINO™ 深度学习工作台导入 TensorFlow 模型,将其转换为英特尔® IR,对其进行基准测试,并为优化的推理模型设置性能级别。
在第三部分中,我们将深入探讨一些在工作台中进行分析和优化的高级工具。然后,我们将向您展示如何打包生产就绪推理模型。
注意:如果您尚未注册,请注册DevCloud for the Edge。它是免费的,只需要几分钟。如果您想在注册之前进行探索,请查看我们的第一篇文章。
第一步:将TensorFlow模型校准为INT8
我们在第二部分中选择的处理器,英特尔®至强® 6258R(又名Cascade Lake),具有英特尔®深度学习加速,可加速INT8精度的性能。让我们看看当我们将模型从FP32校准到INT8时性能如何变化。
我们的第一个英特尔®至强 6258R 基准测试的吞吐量为每秒 383.83 帧,延迟为 2.58 毫秒, 大部分 处理(占 99.58%)以 FP32 运行。

在FP32上,我们的第一个基准测试以每秒386.83帧的速度运行,延迟为2.58毫秒。
当我们将同一实验校准为INT8时,我们看到了显着的性能提升。吞吐量几乎翻了一番,达到每秒 765.84 帧,延迟缩短了一半,达到 1.29 毫秒。

在INT8,性能大约翻了一番。
校准不会将每个操作都切换到 INT8。FP32精度仍然在混合中。在校准期间,工作台运行FP32和INT8的多种组合,然后测试和检查吞吐量和速度。这个过程可能需要一段时间,但完成后,您将拥有一个达到最佳平衡的混合模型。

校准混合精度级别,以创造最佳性能。

深度学习工作台可识别推理效率低下的问题,并提出改进建议。
第二步:打包 TensorFlow 模型以进行部署
一旦我们达到了吞吐量和延迟的正确平衡,我们就可以打包模型进行部署。我们 所要 做的就是转到“包”选项卡,然后选择我们的目标硬件以及我们要包含在包中的内容。就是这么简单。

工作台会自动打包优化和校准的模型。
结论 这是我们关于使用
OpenVINO™ 深度学习工作台和面向边缘的英特尔® DevCloud
创建部署就绪推理模型的三部分系列文章的结尾 。现在,您知道了如何优化 TensorFlow 模型并在任何英特尔®架构上运行它,而您所需要的只是一个 Web 浏览器!
了解更多信息:
- 阅读 INT8 校准
- 阅读使用部署包构建应用程序
- 开始使用 OpenVINO 工具包和深度学习工作台
- 探索深度学习工作台文档
- 观看视频 – OpenVINO™ 深度学习工作台简介
- 观看视频 – 深度学习工作台入门
- 观看视频 – 面向边缘的英特尔® DevCloud 上的 OpenVINO™ 深度学习工作平台
欢迎加WeChat 交流

更多推荐



所有评论(0)