Quantification d'un modèle DistilBERT Humor NLP
La quantification est une technique de compression de modèle qui permet de réduire le temps d'inférence. La quantification du type virgule flottante 32 bits (FP32) au type entier 8 bits (INT8) améliore les performances avec seulement une légère baisse de précision. Généralement, la taille du modèle peut être réduite de 4 à 5 fois et le temps d'inférence peut être réduit de plus de 3 fois ( source ).
Nous devons d'abord importer quelques bibliothèques supplémentaires pour la quantification, notamment neural_compressoretoptimum.intel :
Je règle l' torchappareil sur cpu:
Nous pouvons maintenant appliquer la quantification. Consultez les exemples de classification de texte dans le optimum.intel référentiel GitHub pour en savoir plus. Chargeons un modèle précédemment formé :
J'ai configuré le formateur pour utiliser la classe IncTrainerou la classe Intel® Neural Compressor Trainer :
Tout est maintenant en place pour exécuter la quantification. Notez que j'utilise un fichier de configuration appelé quantization.yml téléchargé à partir du référentiel optimum.intel GitHub . Vous pouvez modifier les paramètres de configuration dans ce fichier pour ajuster la façon dont le modèle est quantifié. Ici, j'applique la quantification dynamique post-entraînement, une technique qui ne nécessite pas de réentraînement, mais sacrifie généralement un peu de précision :
Nous pouvons alors continuer et lancer la quantification avec optimizer.fit():
Maintenant que nous avons un modèle optimisé, nous pouvons le comparer au modèle de référence :
Nous pouvons enregistrer le modèle quantifié sur le disque et disposer à la fois du modèle FP32 et du modèle INT8 nouvellement quantifié :
En exécutant l'évaluation avec le modèle FP32, nous obtenons :
Et pour INT8 :
La précision est à peu près la même mais le modèle INT8 est 1,5 fois plus rapide que le modèle FP32. Le code complet peut être trouvé sur GitHub ici .
Vous pouvez installer Intel Neural Compressor de manière autonome ou dans le cadre d' Intel AI Analytics Toolkit . Pour en savoir plus sur les solutions matérielles et logicielles d'intelligence artificielle d'Intel, rendez-vous ici .
![Qu'est-ce qu'une liste liée, de toute façon? [Partie 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































