Votre ChatGPT s’arrête en pleine phrase ? Voici pourquoi.
Vous êtes en train de faire analyser un contrat, et ChatGPT s’arrête net. Vous réessayez, il ne répond plus rien. Puis le message fatal apparaît : « conversation trop longue » ou « limite de tokens atteinte ».
Voici une explication simple de la limite de tokens ChatGPT. Dans ma pratique, je vois des dirigeants perdre des heures sur ce blocage. Ils ne comprennent pas comment fonctionne la mémoire de travail d’un modèle de langage. Une fois que vous la comprenez, vous pouvez travailler sans interruption.
Un token, c’est quoi en pratique ?
Un token est une unité de découpage du texte. Cela peut être un mot entier, une partie de mot, un espace ou une ponctuation.
ChatGPT ne lit pas votre question comme vous l’écrivez. Il la découpe en petits morceaux, puis les analyse. C’est ce qu’on appelle la tokenisation. Elle permet au modèle de traiter votre texte par étapes.
Prenons un exemple : « Bonjour, comment vas-tu aujourd’hui ? » représente environ 8 tokens. Le modèle compte la virgule, les espaces et le point d’interrogation.
Un mot français ne vaut pas toujours un token
Le découpage dépend du modèle et du langage. Un mot court comme « chat » peut représenter un token. Un mot plus long comme « procrastination » peut en représenter trois.
En français, les accents et les espaces augmentent la consommation de tokens. Un même texte en anglais consomme souvent moins de tokens que sa version française. C’est un piège classique quand on colle un acte notarié ou une convention.
La limite de tokens ne concerne pas que la réponse
L’erreur la plus fréquente ? Croire que la limite s’applique uniquement à la réponse de ChatGPT.
En réalité, la limite de tokens couvre l’ensemble de la fenêtre de contexte. Votre message actuel, l’historique de la conversation et la réponse générée sont directement concernés.
Plus votre conversation est longue, plus le modèle consomme de tokens à chaque échange. Avec un historique de vingt messages, vous avez peut-être déjà consommé plus de 2 000 tokens avant même de poser votre question. La place restante pour la réponse diminue d’autant.
Quand l’historique est trop long, ChatGPT oublie le début
Le modèle ne peut traiter qu’un nombre défini de tokens à la fois. Si l’historique dépasse cette capacité, les premiers échanges sont oubliés.
Vous ne perdez pas seulement le fil : le modèle perd des informations importantes. Dans mon métier, cela peut faire perdre une analyse juridique entière.
Combien de tokens ont les modèles ChatGPT ?
Chaque modèle possède sa propre limite. Voici un tableau comparatif pour vous repérer rapidement.
| Modèle | Limite de tokens | Mots approximatifs |
|---|---|---|
| GPT-3.5 Turbo | 4 096 tokens | ~3 000 mots |
| GPT-4 | 8 192 tokens | ~6 000 mots |
| GPT-4o | 4 096 tokens | ~3 000 mots |
| GPT-5 | Variable | Variable |
Ce tableau est une base, pas une vérité éternelle. OpenAI fait évoluer ses modèles. Vérifiez toujours la documentation officielle pour votre abonnement.
En français, 1 000 mots représentent environ 1 300 à 1 500 tokens
Une page Word classique compte environ 500 mots. Vous dépassez donc rapidement les 600 tokens en français.
Si vous collez un document de cinq pages, vous consommez déjà presque toute la fenêtre du modèle GPT-4o. Il ne reste plus de place pour une réponse complète.
Version gratuite vs ChatGPT Plus : deux limites différentes
La limite de tokens ne doit pas être confondue avec la limite de messages. Ce sont deux systèmes de restriction différents.
La version gratuite restreint le nombre de messages sur les modèles récents. Le système compte vos demandes sur une période donnée. En payant, vous accédez à des modèles avec des fenêtres plus grandes et des quotas plus élevés.
Pour un usage professionnel, je recommande souvent de passer en version Plus si vous travaillez sur des documents longs. Mais ce n’est pas un passe-droit universel. Le quota de messages peut également être atteint.
GPT-5 gratuit : quelques messages toutes les 5 heures, puis bascule en mini
En version gratuite, vous avez accès à un nombre limité de messages GPT-5. Une fois le quota atteint, ChatGPT bascule vers une version mini.
Cette version mini est plus rapide, mais moins performante pour les réponses longues. C’est une bascule automatique, souvent vécue comme une dégradation.
Effacer la conversation ne réinitialise pas le quota de messages. Une nouvelle session ne change rien au compteur.
Que faire quand la limite de tokens ChatGPT est atteinte ?
Voici ma checklist quotidienne, celle que j’utilise moi-même avant chaque tâche longue.
- Réduisez votre prompt à l’essentiel.
- Effacez ou archiver l’historique avant une nouvelle demande.
- Découpez une grande tâche en sous-tâches.
- Demandez un plan avant de demander le développement complet.
- Utilisez des puces et des phrases courtes en français.
Avant chaque demande, estimez mentalement le nombre de tokens. Une question courte représente 20 à 30 tokens. Une page de contexte, c’est 500 à 700 tokens.
Une règle simple : si votre demande au départ est trop longue, vous prenez le risque de voir la réponse coupée en plein vol.
Effacer une conversation libère-t-il des tokens ?
Oui, pour la fenêtre de contexte. En supprimant l’historique, vous libérez de la place pour la nouvelle entrée.
Non, pour le quota de messages. Ouvrir une nouvelle conversation ne vous redonne pas des messages gratuits.
Mon conseil : fermez systématiquement les anciennes discussions avant de coller un document long. Vous éviterez l’oubli des premières instructions.
Côté API : la limite de tokens est aussi une facture
Si vous utilisez l’API d’OpenAI, le nombre de tokens a un impact direct sur vos coûts.
La facturation est basée sur le nombre de tokens traités en entrée et en sortie. Peu importe que la réponse soit utilisée ou non : vous payez pour le traitement.
Combien coûte 1 000 tokens ? Cela varie selon le modèle et la période. Ce qui ne change pas : payer pour des tokens non pertinents est inutile.
L’erreur qui coûte cher : payer pour des pages entières alors qu’un résumé suffit
J’ai vu des entreprises envoyer des contrats de 50 pages dans l’API pour une simple question de conformité.
Une meilleure approche consiste à envoyer un extrait pertinent, ou un résumé intermédiaire. Pour réduire votre utilisation des tokens, commencez par poser une question ciblée.
Divisez vos documents, posez une question ciblée, générez par morceaux. Cette méthode réduit la consommation de tokens et améliore la qualité des réponses.
