Quantification
Réduction de la précision numérique des poids d'un modèle (ex. de 16 à 4 bits) pour diminuer son empreinte mémoire et accélérer l'inférence, au prix d'une légère perte de qualité.
Réduction de la précision numérique des poids d'un modèle (ex. de 16 à 4 bits) pour diminuer son empreinte mémoire et accélérer l'inférence, au prix d'une légère perte de qualité.