Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Fenêtre de contexte des LLM : pourquoi plus de tokens ne veut pas dire mieux

3 min de lecture · Le Big Data · 28 avr. 2026 · IA générative · Pertinence : élevée
Vérifié par la rédaction de laveille.ai le . Notre méthodologie

D'après Anthropic - Claude Sonnet 4 now supports 1M tokens of context, relayé par Le Big Data

Fenêtre de contexte des LLM : pourquoi plus de tokens ne veut pas dire mieux

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • La fenêtre de contexte est le volume maximal de tokens (unités de texte découpées) qu'un LLM peut traiter en même temps : instructions système, historique, documents et réponse générée doivent tous y tenir.
  • Le calcul d'attention du Transformer coûte en O(n²) : allonger fortement le contexte augmente vite le calcul, la mémoire vive (VRAM) et la latence.
  • Une fenêtre large ne garantit pas une bonne mémoire : l'étude Lost in the Middle (Liu et al., 2023) montre que les modèles retrouvent mal une information logée au centre d'un long contexte.
  • Anthropic a ouvert en bêta publique, le 12 août 2025, une fenêtre de 1 million de tokens pour Claude Sonnet 4, permettant d'ingérer des bases de code de plus de 75 000 lignes.
  • Le RAG (génération augmentée par récupération) et le chunking (découpage en blocs) restent des solutions pour limiter ce qu'on injecte dans le contexte plutôt que de tout y faire tenir.

Pourquoi ça compte

Comprendre les limites de la fenêtre de contexte évite de traiter les LLM comme des mémoires infinies : au-delà d'un certain volume, la fiabilité peut baisser et le coût de calcul grimpe fortement, ce qui pousse les équipes techniques vers des architectures de récupération ciblée (RAG) plutôt que vers le réflexe de tout injecter d'un coup.

Chiffre-clé

Depuis le 12 août 2025, Claude Sonnet 4 d'Anthropic accepte une fenêtre de contexte de 1 million de tokens en bêta publique, selon le blogue officiel d'Anthropic.

Action concrète

Avant de bâtir un pipeline autour d'un LLM, mesurez en tokens - pas en mots - ce que vous injectez réellement (system prompt, historique, documents) et privilégiez le RAG pour ne récupérer que les passages pertinents plutôt que de charger un corpus entier dans le contexte.

Repères datés

Sources originale et média

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !