← Retour au glossaire A-Z
Glossaire IA · P2

Quantization

La quantization, c'est une technique qui compresse un modèle d'IA en réduisant la précision de ses calculs internes, pour qu'il prenne moins de mémoire et tourne plus vite. C'est ce qui rend possible de faire tourner un gros modèle chez toi, sur un ordinateur normal.

Customisation Lecture 4 min Mis à jour le 2026-05-22
— Définition

Quantization, en clair

En clair : on allège le modèle pour qu'il tienne sur du matériel grand public, par exemple un Llama 70B compressé en 4 bits qui tient sur un GPU de gamer.

Vois ça comme un compromis taille-précision, pas comme une dégradation pure : plus tu compresses, plus tu gagnes en légèreté mais tu perds un peu de qualité, et trop agressive elle casse les modèles de raisonnement.

Exemple concret

Llama 70B en 4 bits tient sur un GPU grand public. En 16 bits, il faut un datacenter. La quantization, c'est cette compression.

Pourquoi ça compte

C'est ce qui rend l'IA locale possible. Sans quantization, faire tourner un gros modèle chez soi est impossible.

Tu la vois dans Ollama, LM Studio et les modèles qui tournent localement.

À ne pas confondre

Distillation : La distillation entraîne un petit modèle à imiter un modèle plus puissant.

Modèle IA : Un modèle IA est le moteur qui lit ta demande et produit une réponse.

Erreurs fréquentes

  • Croire qu'une quantization en 4 bits donne la même qualité que 16 bits.
  • Oublier que la quantization plus agressive casse les modèles de raisonnement.
  • Confondre quantization (poids du modèle) et précision de calcul (runtime).

Mini-checklist

  • Je vérifie d'abord si le mot désigne un concept, un outil, un risque ou une métrique.
  • Je le relie à un cas concret : Llama 70B en 4 bits tient sur un GPU grand public. En 16 bits, il faut un datacenter. La quantization, c'est cette compression.
  • Je garde en tête le piège principal : Croire qu'une quantization en 4 bits donne la même qualité que 16 bits.

Questions rapides

C'est quoi Quantization en IA ?

La quantization réduit la précision interne d'un modèle pour gagner en mémoire et en vitesse, ce qui rend l'IA locale possible. On la croise dans Ollama, LM Studio et les modèles qui tournent localement.

Où vais-je croiser Quantization ?

Tu la vois dans Ollama, LM Studio et les modèles qui tournent localement.

Quel mot lire après Quantization ?

Commence par Distillation, Modèle IA, Open source vs open weight.

Tu veux continuer dans l'ordre ?

Reviens au glossaire complet, cherche un mot, puis ouvre seulement les pages qui méritent plus qu'une définition courte.

Ouvrir le glossaire IA