Fenêtre contextuelle : définition complète en IA pour les PME
Fenêtre contextuelle
La fenêtre contextuelle (context window) est la quantité maximale de texte qu'un modèle de langage peut traiter en une seule requête — entrée (prompt + documents injectés) et sortie (réponse) combinées. Elle se mesure en tokens : GPT-4o accepte 128 000 tokens, Claude 200 000, certains modèles open source 4 000 à 32 000. C'est la « mémoire vive » du modèle : tout ce qui dépasse la fenêtre est ignoré.
Ce que ça change pour une PME
La fenêtre contextuelle détermine ce que vous pouvez mettre dans une seule requête :
- un email de 500 mots (environ 700 tokens) + un contexte de 2 000 tokens → largement dans la fenêtre ;
- un contrat de 20 pages (environ 8 000 tokens) + une instruction → possible sur GPT-4o, serré sur un modèle léger ;
- un document de 100 pages (environ 40 000 tokens) → ne tient pas dans un seul appel — il faut un RAG avec découpage.
Les implications pratiques
La fenêtre conditionne l'architecture : pour de gros volumes, le RAG découpe les documents en chunks qui tiennent dans la fenêtre. Pour des conversations longues, la mémoire du modèle se limite à la fenêtre — les échanges anciens « sortent » si on ne les réinjecte pas. En direction IA externalisée, on dimensionne le découpage et la mémoire selon le modèle choisi.
Termes liés
Pour aller plus loin
Envie d'appliquer tout ça à votre PME ?
Audit IA Express offert (45 min) — analyse ciblée, plan d'action concret.