Qu'est-ce qu'un token ?
Les modèles de langage ne lisent ni lettres ni mots, mais des tokens : des morceaux de texte découpés par un « tokeniseur ». Un token correspond souvent à un mot courant, à un fragment de mot plus long, à un signe de ponctuation ou à une suite d'espaces. Tous les fournisseurs facturent au token, et chaque modèle a une limite de contexte exprimée en tokens. Savoir à peu près combien de tokens contient un prompt est donc la première étape pour estimer un coût ou vérifier qu'un document tient dans la fenêtre de contexte.
Comment fonctionne l'estimation
Chaque fournisseur utilise son propre tokeniseur, et plusieurs ne le publient pas. Plutôt que de charger des mégaoctets de fichiers dans votre navigateur, l'outil combine deux règles empiriques reconnues :
- Environ 4 caractères par token : caractères ÷ 4.
- Environ ¾ de mot par token : mots × 4 ÷ 3.
Ces règles sont calibrées sur l'anglais. Le français, avec ses mots plus longs et ses accents, produit en général 10 à 30 % de tokens en plus pour un même contenu : gardez une marge, surtout pour un budget. Les caractères chinois, japonais et coréens sont comptés à part, à environ un token chacun. Les bornes basse et haute de la fourchette correspondent à chacune des deux règles prises seule.
Exemple chiffré
Un prompt système de 300 mots et environ 1 800 caractères est estimé à (1 800 ÷ 4 + 300 × 4 ÷ 3) ÷ 2 = (450 + 400) ÷ 2 = 425 tokens. Envoyé 10 000 fois par mois avec une réponse de 300 tokens, cela fait 4,25 millions de tokens d'entrée et 3 millions de tokens de sortie. Avec Claude Haiku 4.5 (1 $ / 5 $), le coût est de 4,25 + 15 = 19,25 $ par mois. Avec GPT-5.6 Sol (5 $ / 30 $), il atteint 21,25 + 90 = 111,25 $.
L'exemple montre aussi que la longueur des réponses pèse souvent plus lourd que celle du prompt : raccourcir les réponses est l'une des optimisations les plus rentables. Pour modéliser une application complète (trafic, historique, voix), utilisez le calculateur de coût des API d'IA.
Limites
Il s'agit d'un estimateur, pas d'un tokeniseur. Le code, le JSON, les URL, les nombres et les mises en forme inhabituelles se découpent moins efficacement que de la prose : attendez-vous à des chiffres réels plus élevés. Les familles de modèles peuvent donner des résultats sensiblement différents pour un même texte. Pour une valeur exacte, utilisez le point d'accès de comptage de tokens ou le champ « usage » renvoyé par votre fournisseur. Les applications de chat ajoutent aussi des tokens de mise en forme invisibles, et les images, l'audio et les définitions d'outils sont facturés à part.