← Retour au glossaire A-Z
Glossaire IA · P1

Modèle de vision

Un modèle de vision, c'est une IA qui comprend et décrit des images : tu lui envoies une capture d'écran, une photo ou un graphique, et elle te dit ce qu'elle voit ou te l'analyse. Tu la croises pour lire des factures, des écrans, des schémas ou des documents scannés.

Modalité Lecture 4 min Mis à jour le 2026-05-22
— Définition

Modèle de vision, en clair

En clair : c'est l'IA qui sait regarder une image et la commenter, pas seulement lire le texte qu'elle contient.

Vois-la comme un OCR augmenté de raisonnement : elle remplace beaucoup de cas d'OCR classique. Ne la confonds pas avec la génération d'image, qui crée des visuels au lieu de les lire. Faiblesse connue : elle compte mal le nombre précis d'éléments.

Exemple concret

J'envoie une capture d'un dashboard à Claude, je lui demande 'qu'est-ce qui ne va pas dans ce graphe'. Il répond avec analyse.

Pourquoi ça compte

La vision IA remplace 80% des cas d'OCR classique et débloque la lecture de docs visuels (factures, écrans, schémas).

Tu le croises dans l'analyse de captures, photos, graphiques, tableaux et documents scannés.

À ne pas confondre

Multimodal : Un modèle multimodal accepte plusieurs types d'entrées, comme texte, image, audio ou vidéo.

OCR : L'OCR transforme le texte présent dans une image ou un scan en texte lisible par une machine.

Erreurs fréquentes

  • Lui demander de compter précisément des éléments (faiblesse connue).
  • Oublier de redimensionner les images (coût et lenteur).
  • Confondre vision (lire) et génération d'image (créer).

Mini-checklist

  • Je vérifie d'abord si le mot désigne un concept, un outil, un risque ou une métrique.
  • Je le relie à un cas concret : J'envoie une capture d'un dashboard à Claude, je lui demande 'qu'est-ce qui ne va pas dans ce graphe'. Il répond avec analyse.
  • Je garde en tête le piège principal : Lui demander de compter précisément des éléments (faiblesse connue).

Questions rapides

C'est quoi Modèle de vision en IA ?

Un modèle de vision est une IA qui comprend et décrit des images : captures d'écran, photos, graphiques, tableaux, documents scannés. Il fonctionne comme un OCR augmenté de raisonnement, mais ne génère pas d'images.

Où vais-je croiser Modèle de vision ?

Tu le croises dans l'analyse de captures, photos, graphiques, tableaux et documents scannés.

Quel mot lire après Modèle de vision ?

Commence par Multimodal, OCR, Modèle IA.

Tu veux continuer dans l'ordre ?

Reviens au glossaire complet, cherche un mot, puis ouvre seulement les pages qui méritent plus qu'une définition courte.

Ouvrir le glossaire IA