Comprendre les coûts de l'utilisation des modèles d'IA.
Les tarifs des API IA changent souvent, et chaque éditeur les présente à sa façon. On les a réunis dans un tableau récapitulatif : prix d'entrée, de sortie et de cache de 20 modèles chez OpenAI, Anthropic, Google, Mistral et Scaleway, relevés le 5 août 2026. Chaque ligne porte un lien vers la grille officielle et une indication du lieu de traitement de vos données.
Tarifs vérifiés le 5 août 2026 sur les pages officielles des éditeurs. Mise à jour mensuelle.
- Un token
- Un token correspond à une suite de caractères : environ quatre en anglais, plutôt trois en français (voir la FAQ). Les fournisseurs facturent au volume de texte, jamais au nombre de requêtes utilisateur : mille questions courtes coûtent moins cher que cent questions accompagnées d'un long document.
- L'entrée
- Tout ce que vous envoyez au modèle : la question, mais aussi les consignes et les documents joints. Elle grossit vite dès qu'on ajoute un historique de conversation ou une pièce jointe.
- La sortie
- Ce que le modèle produit. Elle coûte plus cher que l'entrée sur les 20 modèles du tableau : de 3 à 8 fois plus.
- Le cache d'entrée
- Renvoyez deux fois le même texte, un document ou un historique de conversation, et certains fournisseurs facturent la seconde fois bien moins cher que la première : c'est le cache d'entrée. Utile en particulier sur les conversations à contexte long, où l'historique grossit à chaque tour et se retrouve renvoyé en entier à chaque message. Le tableau l'indique dans la colonne « Entrée en cache », quand le fournisseur le publie.
Le tableau.
| Fournisseur | Modèle | Entrée | Entrée en cache | Sortie | Résidence UE | Grille officielle |
|---|---|---|---|---|---|---|
| OpenAI | gpt-5.6-sol | 5 $ | 0,5 $ | 30 $ | Oui | Vérifier |
| OpenAI | gpt-5.6-terra | 2 $ | 0,2 $ | 12 $ | Oui | Vérifier |
| OpenAI | gpt-5.6-luna | 0,2 $ | 0,02 $ | 1,2 $ | Oui | Vérifier |
| OpenAI | gpt-5-mini | 0,25 $ | 0,025 $ | 2 $ | Oui | Vérifier |
| OpenAI | o3 | 2 $ | 0,5 $ | 8 $ | Oui | Vérifier |
| Anthropic | Claude Opus 5 | 5 $ | 0,5 $ | 25 $ | Non | Vérifier |
| Anthropic | Claude Sonnet 5 Tarif d'introduction jusqu'au 31 août 2026. À partir du 1er septembre 2026 : 3 $ en entrée et 15 $ en sortie. | 2 $ | 0,2 $ | 10 $ | Non | Vérifier |
| Anthropic | Claude Haiku 4.5 | 1 $ | 0,1 $ | 5 $ | Non | Vérifier |
| Gemini 3.6 Flash | 1,5 $ | 0,15 $ | 7,5 $ | Oui | Vérifier | |
| Gemini 3.5 Flash | 1,5 $ | 0,15 $ | 9 $ | Oui | Vérifier | |
| Gemini 3.1 Flash-Lite Tarif texte, image et vidéo. L'audio est facturé au double en entrée. | 0,25 $ | 0,025 $ | 1,5 $ | Oui | Vérifier | |
| Gemini 2.5 Pro Tarif jusqu'à 200 000 tokens en entrée. Au delà : 2,50 $ en entrée et 15 $ en sortie. | 1,25 $ | 0,125 $ | 10 $ | Oui | Vérifier | |
| Mistral | Mistral Medium 3.5 | 1,5 $ | non publié | 7,5 $ | Oui | Vérifier |
| Mistral | Mistral Large 3 | 0,5 $ | non publié | 1,5 $ | Oui | Vérifier |
| Mistral | Mistral Small 4 | 0,15 $ | non publié | 0,6 $ | Oui | Vérifier |
| Mistral | Devstral 2 | 0,4 $ | non publié | 2 $ | Oui | Vérifier |
| Scaleway | mistral-medium-3.5-128b | 1,5 € | non publié | 7,5 € | Oui | Vérifier |
| Scaleway | qwen3.5-397b-a17b | 0,6 € | non publié | 3,6 € | Oui | Vérifier |
| Scaleway | gpt-oss-120b | 0,15 € | non publié | 0,6 € | Oui | Vérifier |
| Scaleway | glm-5.2 | 1,8 € | non publié | 5,5 € | Oui | Vérifier |
La fenêtre de contexte ne figure pas dans ce tableau, parce qu'elle ne se facture pas pareil d'un fournisseur à l'autre. Chez Google, dépasser 200 000 tokens de contexte fait passer à un tarif plus élevé. Chez Anthropic, un contexte long reste facturé au même prix qu'un contexte standard.
Trouvez le modèle le moins cher selon votre usage.
Choisir un modèle dépend de votre usage. Un assistant qui multiplie les allers-retours sur un même contexte profite du cache d'entrée : chez certains fournisseurs, ça peut diviser le prix par dix. À l'inverse, un agent qui produit de longues réponses paie surtout le prix de sortie.
Coût mensuel estimé, du moins cher au plus cher
Ce classement ordonne des prix, pas des aptitudes. Un modèle peut arriver en tête parce qu'il est plus petit, sans pour autant savoir traiter votre tâche.
Converti en euros au taux BCE du 4 août 2026 pour rendre les lignes comparables entre elles. Hors remises négociées, hors traitement par lots, hors coût des outils appelés côté serveur.
Les coûts cachés du prix par token.
Le nombre de requêtes ne bouge pas, la facture si. Trois mécanismes changent ce que vous payez réellement, et aucun n'apparaît dans le prix par million de tokens.
- Les tokens de raisonnement
- Un modèle de raisonnement produit des tokens intermédiaires avant sa réponse. Ils sont facturés au tarif de sortie et n'apparaissent pas dans ce que l'utilisateur lit. Leur volume se règle : Anthropic demande au minimum 1 024 tokens et conseille de partir de 16 000 sur une tâche complexe, OpenAI annonce « de quelques centaines à des dizaines de milliers » selon la difficulté. Sur une réponse de 400 tokens, ce sont donc 3 à 40 fois plus de tokens facturés que ce que l'utilisateur lit.
- Le cache d'entrée
- Une option, disponible seulement chez certains fournisseurs, qui peut diviser par dix le prix de la partie réutilisée d'une longue conversation. Mistral et Scaleway ne la publient pas : chez eux, l'historique de la conversation est facturé au prix d'entrée plein à chaque requête.
- Le traitement par lots
- Un troisième levier joue sur la facture : le traitement par lots, qui offre en général une remise de moitié sur ce qui peut attendre quelques heures plutôt qu'une réponse immédiate.
Ce que le prix affiché ne dit pas
Ces trois mécanismes (tokens de raisonnement, cache d'entrée, traitement par lots) expliquent pourquoi le prix affiché par million de tokens ne dit pas ce que vous paierez réellement. C'est pour ça que le simulateur ci-dessus demande le profil de cache et le budget de raisonnement : sans eux, l'estimation ne correspond à aucun usage réel.
Trois questions, pas une case à cocher.
« Hébergé en Europe » ne veut rien dire tant qu'on n'a pas répondu séparément à trois questions : où tourne l'inférence, où les données sont stockées au repos, et sous quel contrat. La colonne du tableau répond par oui ou par non, et la réponse détaillée est ici, éditeur par éditeur. Lisez surtout le périmètre : chez Google, l'option existe sur un produit dont les tarifs ne sont pas ceux affichés.
- OpenAI : oui
- Résidence Europe (EEE et Suisse) sur le point d'entrée eu.api.openai.com, pour le traitement comme pour le stockage. Elle se configure projet par projet, et suppose deux démarches : signer un avenant sur la durée de conservation des données, et obtenir l'accord d'OpenAI sur ses contrôles anti-abus. Attention si vous utilisez l'API Assistants : les fichiers et threads qu'elle stocke ne sont pas couverts par cette garantie de résidence, même si le reste de votre usage l'est. Documentation de l'éditeur.
- Anthropic : non
- L'API Anthropic ne propose que deux géographies d'inférence, « global » et « us », et le stockage au repos n'est disponible qu'aux États-Unis. Une résidence UE reste possible en passant par Amazon Bedrock ou Google Cloud en régions européennes : ce sont alors le contrat et la grille tarifaire du cloud partenaire qui s'appliquent, pas ceux affichés ici. Documentation de l'éditeur.
- Google : oui
- Gemini Enterprise permet de choisir une multi-région « eu », qui couvre le stockage au repos comme le traitement, avec des régions par pays dont la France pour certains modèles. Attention au périmètre : les tarifs listés ici sont ceux de l'API Gemini pour développeurs, dont la documentation ne décrit aucune option de résidence. Gemini Enterprise est un autre produit, avec sa propre grille. Documentation de l'éditeur.
- Mistral : oui
- Infrastructure européenne, avec un point d'entrée régional api.eu.mistral.ai qui ne sert que les modèles hébergés dans cette région et garantit que les données traitées n'en sortent pas. Un point d'entrée américain existe aussi, mais il faut le choisir explicitement. Documentation de l'éditeur.
- Scaleway : oui
- Modèles servis depuis la région Paris, et tarifs publiés directement en euros, ce qui supprime le risque de change sur la ligne budgétaire. Le catalogue est composé de modèles ouverts : on n'y trouve pas les modèles propriétaires d'OpenAI, d'Anthropic ni de Google. Documentation de l'éditeur.
Reprenez le contrôle sur votre budget IA.
Une facture d'API dit combien vous avez payé. Elle ne dit ni quelle équipe, ni quel projet, ni quel modèle. optidome fait ce rapprochement, que la dépense soit facturée au token, à la licence ou en crédits prépayés.
- Comment lire un prix par million de tokens ?
- Les fournisseurs facturent au token, séparément pour ce que vous envoyez (entrée) et pour ce que le modèle produit (sortie). Un token vaut environ quatre caractères en anglais, plutôt trois pour la langue française. Un prix de 2 $ par million de tokens en entrée revient donc à environ 0,65 $ par million de caractères de texte français, contre 0,50 $ en anglais.
- Pourquoi certains prix sont-ils en dollars et d'autres en euros ?
- Parce que chaque ligne reprend la devise dans laquelle l'éditeur publie son tarif. OpenAI, Anthropic, Google et Mistral publient en dollars, Scaleway en euros. Convertir en dur figerait un taux de change dans la donnée ; la conversion se fait à l'affichage, au taux de référence de la Banque centrale européenne dont la date est indiquée.
- Pourquoi les modèles de raisonnement coûtent-ils plus cher à volume de requêtes égal ?
- Parce qu'ils produisent des tokens intermédiaires, facturés au tarif de sortie mais absents de la réponse affichée. À nombre de requêtes constant et à prix affiché identique, une même tâche peut coûter plusieurs fois plus cher selon le modèle retenu. C'est le poste le plus souvent absent des budgets prévisionnels.
- Que signifie la colonne résidence UE ?
- Elle indique si l'éditeur propose lui-même une option de traitement et de stockage des données en Union européenne. Un « non » signifie que l'option n'existe que par un cloud partenaire, avec un autre contrat et une autre grille tarifaire. Un « oui » ne vaut pas toujours pour le modèle de la ligne : le détail par éditeur, plus haut sur cette page, précise le périmètre exact, parce que le lieu d'inférence, le lieu de stockage au repos et les conditions contractuelles ne se recouvrent pas.
- À quelle fréquence ce comparateur est-il mis à jour ?
- Tous les mois, sur les pages tarifaires officielles. La date de dernière vérification est affichée en haut de page et chaque ligne renvoie vers la grille de son éditeur.
Tarifs relevés le 5 août 2026 sur les pages officielles liées dans le tableau. Les remises négociées, les engagements de volume et le traitement par lots s'en écartent. Ce comparateur donne un ordre de grandeur pour arbitrer, pas un devis.
Budgets de raisonnement : documentation Anthropic sur le raisonnement étendu (minimum de 1 024 tokens, 16 000 conseillés sur une tâche complexe) et documentation OpenAI sur les tokens de raisonnement (facturés au tarif de sortie, « de quelques centaines à des dizaines de milliers »). Aucun des deux ne publie de facteur par modèle.