推理引擎优化怎么验:算子单测、后端契约与整图回归
推理引擎优化怎么验:算子单测、后端契约与整图回归
先把问题落到具体对象
推理引擎的“能跑”与“算对”是两件事。先固定模型、输入张量、后端和精度,再分层验证图优化、算子实现与完整推理结果。
测试分层怎么做
单元测试对单个 pass 和 kernel 比较 shape、dtype 与数值容差;集成测试验证图划分、内存规划和硬件后端契约;整图回归则用固定模型比较输出、峰值内存与耗时分布。性能数据必须附带编译选项、线程数和硬件信息。
验证顺序
- 用固定张量验证改动过的 pass 或 kernel,断言 shape、dtype 和允许的数值误差。
- 把同一子图交给目标后端,检查图划分、内存布局和不支持算子的回退行为。
- 在固定模型上做整图对照,一次只改变编译选项、精度或线程数中的一个。
- 保存模型版本、输入、硬件和原始输出;发现漂移时先关闭对应优化,再定位到具体 pass。
交付前检查
确认数值漂移能定位到具体 pass 或后端,性能回退能复现;耗时的整图测试放入独立流水线,不阻塞快速单测。
适用边界
数值容差和性能门槛取决于模型、精度与硬件后端。没有同一环境下的基线,本文的分层方法不能替代项目自己的阈值。
