← Retour au glossaire A-Z
Glossaire IA · P1

Prompt caching

Le prompt caching, c'est une technique qui réutilise la partie stable de ton contexte au lieu de la recalculer à chaque appel, pour aller plus vite et payer moins. Tu t'en sers quand un agent renvoie sans cesse les mêmes gros documents ou consignes : sur une boucle, ça peut diviser les coûts par 5 à 10.

Performance Lecture 4 min Mis à jour le 2026-05-22
— Définition

Prompt caching, en clair

En clair : si tu renvoies le même bloc de texte encore et encore, le service le garde en mémoire un court moment et te le facture une fraction du prix la fois d'après.

Vois ça comme une mémoire à court terme côté fournisseur, pas comme un truc magique : le cache a une durée de vie (souvent 5 minutes), il ne marche que sur l'entrée, pas sur la sortie, et la moindre virgule modifiée en début de prompt le casse.

Exemple concret

Mon agent répète le même CLAUDE.md de 4000 tokens à chaque appel. Avec cache, je paie 10% du coût habituel sur la partie cachée.

Pourquoi ça compte

Sur un agent en boucle, le prompt caching divise les coûts par 5 à 10. C'est l'optimisation la plus rentable du marché.

Tu le vois dans OpenAI, Anthropic, Gemini, Claude Code et les agents qui renvoient souvent les mêmes gros documents.

À ne pas confondre

Token : Un token est un petit morceau de texte que l'IA compte pour mesurer ce qu'elle lit, écrit et facture.

Clé API : Une clé API est un mot de passe technique qui autorise un outil à appeler un service d'IA en ton nom.

Erreurs fréquentes

  • Oublier que le cache a une durée de vie (souvent 5 minutes).
  • Casser le cache en modifiant la moindre virgule du début du prompt.
  • Croire que le cache marche aussi sur la sortie (faux, juste sur l'entrée).

Mini-checklist

  • Je vérifie d'abord si le mot désigne un concept, un outil, un risque ou une métrique.
  • Je le relie à un cas concret : Mon agent répète le même CLAUDE.md de 4000 tokens à chaque appel. Avec cache, je paie 10% du coût habituel sur la partie cachée.
  • Je garde en tête le piège principal : Oublier que le cache a une durée de vie (souvent 5 minutes).

Questions rapides

C'est quoi Prompt caching en IA ?

Le prompt caching réutilise la partie stable du contexte (consignes, gros documents) pour aller plus vite et payer moins. Sur un agent en boucle, il peut diviser les coûts par 5 à 10. Disponible chez OpenAI, Anthropic, Gemini et dans Claude Code.

Où vais-je croiser Prompt caching ?

Tu le vois dans OpenAI, Anthropic, Gemini, Claude Code et les agents qui renvoient souvent les mêmes gros documents.

Quel mot lire après Prompt caching ?

Commence par Token, Clé API, Fenêtre de contexte.

Tu veux continuer dans l'ordre ?

Reviens au glossaire complet, cherche un mot, puis ouvre seulement les pages qui méritent plus qu'une définition courte.

Ouvrir le glossaire IA