Ir para o conteúdo principal
Base de conhecimentos do suporte

Por que a aplicação de pesos diferentes a um modelo afeta o desempenho de inferência?

Tipo de conteúdo: Solução de problemas   |   ID do artigo: 000088030   |   Última revisão: 09/03/2026

Descrição

Observei uma taxa de transferência de inferência diferente ao executar a mesma arquitetura de modelo com diferentes arquivos de peso. Embora a estrutura do modelo seja idêntica, o desempenho da inferência varia significativamente dependendo da precisão do peso e da representação usada.

Resolução

Os pesos e precisão do modelo (FP32, FP16, INT8) afetam o desempenho de inferência.

Usar o formato FP32 resultaria na distribuição completa do peso e é conhecido como um ponto flutuante de precisão simples.

Enquanto isso, os formatos FP16 e INT8 são ambos formatos de peso comprimido onde são espremidos para serem menores de tamanho. A compensação para essas compactações é a precisão do modelo, também conhecida como erro de quantização.
Quanto mais bits alocados para representar os dados, maior o alcance que eles poderiam representar e, potencialmente, a melhor precisão do modelo. No entanto, dados maiores exigem maior espaço de memória para seu armazenamento, maior largura de banda de memória necessária para transferi-los, e mais recursos de computação e tempo sendo utilizados.

Os resultados de parâmetro de comparação Distribuição Intel® do kit de ferramentas OpenVINO™ retratam diferenças óbvias em termos de desempenho entre diferentes formatos de peso e precisão.

Produtos relacionados

Este artigo aplica-se a 1 produtos.

Avisos legais

O conteúdo desta página é uma combinação de tradução humana e por computador do conteúdo original em inglês. Este conteúdo é fornecido para sua conveniência e apenas para informação geral, e não deve ser considerado completo ou exato. Se houver alguma contradição entre a versão em inglês desta página e a tradução, a versão em inglês prevalecerá e será a determinante. Exibir a versão em inglês desta página.