Observei uma taxa de transferência de inferência diferente ao executar a mesma arquitetura de modelo com diferentes arquivos de peso. Embora a estrutura do modelo seja idêntica, o desempenho da inferência varia significativamente dependendo da precisão do peso e da representação usada.
Os pesos e precisão do modelo (FP32, FP16, INT8) afetam o desempenho de inferência.
Usar o formato FP32 resultaria na distribuição completa do peso e é conhecido como um ponto flutuante de precisão simples.
Enquanto isso, os formatos FP16 e INT8 são ambos formatos de peso comprimido onde são espremidos para serem menores de tamanho. A compensação para essas compactações é a precisão do modelo, também conhecida como erro de quantização.
Quanto mais bits alocados para representar os dados, maior o alcance que eles poderiam representar e, potencialmente, a melhor precisão do modelo. No entanto, dados maiores exigem maior espaço de memória para seu armazenamento, maior largura de banda de memória necessária para transferi-los, e mais recursos de computação e tempo sendo utilizados.
Os resultados de parâmetro de comparação Distribuição Intel® do kit de ferramentas OpenVINO™ retratam diferenças óbvias em termos de desempenho entre diferentes formatos de peso e precisão.