wenet中的模型用的是pytorch中的动态量化,只有部分算子如linear是量化的,其它如 CNN 是未量化的。也就是浮点和定点运算混合的。浮点输入碰到定点的算子时,会调用 Quantize 将输入转换为int8。定点输入碰到浮点算子时,会调用Dequantize转换为浮点。
wenet的模型量化,但是输入还是 float型。 那么是不是可以理解为:推理计算是调用的还是 float的卷积计算,对推理速度是没有提升的。 能否将输入转为 float16,甚至转为 uint8进行
评论 0
文明发言,友善讨论
还没有评论,发表你的看法,来抢沙发~
