DonnIA
Toutes les ressources
GuideBonnes pratiques20 min

Réduire sa facture à zéro

Ce qui est réellement gratuit, ce qui est limité, et ce qui coûte quoi qu'on fasse, prix officiels à l'appui.


Le titre est un objectif, pas une promesse. Pour certains usages, la facture descend réellement à zéro et y reste. Pour d'autres, elle ne descendra jamais en dessous de quelques euros par mois, et te faire croire le contraire ne rendrait service à personne.

Ce guide sépare donc trois catégories : ce qui est gratuit et le reste, ce qui est gratuit dans une limite qu'il faut connaître, et ce qui coûte de l'argent quoi qu'on fasse. Les prix cités viennent de la documentation tarifaire officielle d'Anthropic consultée en août 2026 ; les grilles bougent, vérifie avant de bâtir un budget dessus.

Le levier le plus rentable n'est d'ailleurs pas dans les prix. C'est de ne pas envoyer au modèle ce qui n'a pas besoin d'y aller. Un script Python qui filtre en amont coûte zéro et divise la facture par cinq, ce qu'aucune remise ne fera.

La règle qui vaut tous les optimisations

Ce qui entre dans le contexte est payé. Ce qui y reste est repayé à chaque tour. Un fichier de deux mille lignes lu au début d'une session de cinquante échanges a été facturé cinquante fois.

Avant de chercher un modèle moins cher, regarde ce que tu envoies. Dans la plupart des montages, la moitié du volume ne sert à rien.

Le code déterministe est toujours gratuit

Trier, dédoublonner, filtrer, agréger, compter, convertir : ça se fait en code, pas au modèle. Réserve le modèle à ce qui demande du jugement. C'est moins élégant qu'un gros prompt, c'est infiniment moins cher, et c'est plus fiable.

Avant de commencer

  • Un usage identifié, avec un ordre de grandeur de volume
  • De quoi lire ta consommation actuelle, ne serait-ce que la console
  • Une distinction claire entre ce qui est urgent et ce qui ne l'est pas

1Ce qui est réellement gratuit

Le code déterministe. Le point précédent, qui reste le plus rentable.

Les modèles exécutés en local. Des outils comme Ollama ou llama.cpp sont libres et s'installent sans compte ni carte bancaire. Le coût ne disparaît pas : il se déplace vers ton matériel et ton électricité. C'est gratuit au sens comptable si la machine existe déjà et sert à autre chose, et ça ne l'est plus du tout si tu achètes une carte graphique pour l'occasion.

Le crédit d'essai. La documentation d'Anthropic indique que les nouveaux utilisateurs reçoivent « une petite quantité de crédits gratuits pour tester l'API ». Le montant n'est pas précisé publiquement. C'est de quoi valider un prototype, pas de quoi faire tourner un service.

L'outil de récupération de page web. Sur l'API Anthropic, web_fetch n'entraîne aucun coût supplémentaire au-delà des jetons du contenu récupéré. Attention à la nuance : le contenu récupéré, lui, est facturé comme entrée. Une page de documentation de 100 ko, c'est environ 25 000 jetons.

2Ce qui est gratuit dans une limite

L'exécution de code sur l'API. Deux cas. Utilisée avec web_search ou web_fetch (versions _20260209 et ultérieures), elle n'entraîne aucun frais supplémentaire. Utilisée seule, elle est facturée au temps d'exécution, avec 1 550 heures gratuites par mois et par organisation, puis 0,05 USD par heure et par conteneur. Deux détails à connaître : le temps d'exécution est facturé avec un minimum de cinq minutes, et si des fichiers sont joints à la requête, le temps est facturé même si l'outil n'est pas appelé, parce que les fichiers sont préchargés sur le conteneur.

Pour une petite structure, ces 1 550 heures sont largement au-dessus de l'usage réel. C'est un des rares cas où « gratuit » est une description honnête.

La fenêtre de contexte de 1 million de jetons. Sur les modèles 4.6 et ultérieurs, elle est incluse au tarif standard, sans supplément pour contexte long. Ce qui ne veut pas dire qu'elle est gratuite : une requête de 900 000 jetons est facturée au même tarif par jeton qu'une requête de 9 000, donc cent fois plus cher. L'absence de supplément n'est pas une invitation à remplir la fenêtre.

3Ce qui coûte, et combien

Voici les tarifs par million de jetons, entrée et sortie, sur l'API Anthropic.

ModèleEntréeSortie
Claude Haiku 4.51 USD5 USD
Claude Sonnet 52 USD jusqu'au 31 août 2026, puis 3 USD10 USD, puis 15 USD
Claude Opus 55 USD25 USD
Claude Fable 510 USD50 USD

Une hausse programmée

Le tarif d'introduction de Sonnet 5 à 2/10 USD court jusqu'au 31 août 2026. À partir du 1er septembre, c'est 3/15 USD. Si tu construis un budget à partir du tarif actuel, prends le tarif d'après.

Autres postes qui se paient :

  • La recherche web sur l'API : 10 USD pour 1 000 recherches, en plus des jetons du contenu ramené. Chaque recherche compte pour une, quel que soit le nombre de résultats. Une recherche en erreur n'est pas facturée.
  • Le mode rapide sur Opus 5 et Opus 4.8 : 10 USD en entrée, 50 USD en sortie. C'est le tarif d'un modèle bien supérieur pour la même intelligence, en échange de la vitesse.
  • La résidence des données : demander une inférence aux États-Unis avec inference_geo: "us" applique un multiplicateur de 1,1 sur toutes les catégories de jetons.

4Les deux remises documentées

Le traitement par lots. L'API Batch applique 50 % de remise sur l'entrée et sur la sortie. La contrepartie est l'asynchronisme : tu envoies un lot, tu récupères les résultats plus tard. Pour tout ce qui n'est pas interactif, une veille, un rapport nocturne, un traitement de fichiers, c'est la moitié de la facture pour un changement de code modeste.

La mise en cache du prompt. Les multiplicateurs par rapport au tarif d'entrée de base :

OpérationMultiplicateur
Écriture de cache, 5 minutes1,25x
Écriture de cache, 1 heure2x
Lecture de cache0,1x

La lecture coûte donc 10 % du tarif normal. Le seuil de rentabilité est simple : le cache de cinq minutes devient gagnant dès la première relecture, celui d'une heure à partir de la deuxième. Les deux remises se cumulent.

Un cache qui ne se déclenche pas coûte plus cher

Le cache fonctionne par correspondance de préfixe : un seul octet qui change au début du prompt invalide tout ce qui suit. Une date insérée dans le prompt système, un identifiant de session, un JSON sérialisé sans tri des clés, et tu paies le supplément d'écriture à chaque requête sans jamais lire. Vérifie dans la réponse que cache_read_input_tokens n'est pas à zéro.

5Se méfier de ce qui est annoncé gratuit ailleurs

Plusieurs fournisseurs proposent des paliers gratuits, et certains sont généreux. Trois questions à poser avant de bâtir dessus.

Qu'est-ce qui est réellement inclus ? Un palier gratuit est presque toujours borné : nombre de requêtes par minute, par jour, taille de contexte, modèles accessibles. La limite qui te bloquera n'est pas toujours celle qui est mise en avant.

Que devient ta donnée ? Sur plusieurs offres gratuites, la contrepartie est l'utilisation des échanges pour entraîner les modèles. Si tu traites des données client, ça peut suffire à disqualifier l'offre indépendamment de son prix.

Combien de temps l'offre tient-elle ? Un palier gratuit n'est pas un engagement contractuel. Il change, se réduit, disparaît.

Ce guide ne liste pas les paliers gratuits tiers

Les conditions de ces offres changent trop vite pour qu'une liste écrite reste juste. Va lire la page tarifaire du fournisseur au moment où tu décides, et note la date. C'est le seul conseil que je peux donner sans risquer de te faire construire sur une information périmée.

L'arbitrage honnête

Pour un usage personnel et non urgent, zéro est atteignable : un modèle local sur une machine que tu as déjà, du code déterministe pour tout le reste. Tu paies en temps de configuration et en qualité de sortie.

Pour un usage professionnel, la question n'est pas « comment ne rien payer » mais « combien vaut une heure de mon temps ». Un rapport hebdomadaire qui coûte quarante centimes de jetons et t'économise une heure et demie n'a aucun intérêt à être optimisé. Passe le temps ailleurs.

Le bon réflexe reste de mesurer avant de décider. Un mois de facture réelle t'apprendra plus que n'importe quel tableau de tarifs, et t'évitera d'optimiser un poste qui pèse trois pour cent du total.

Quelques prompts pour aller plus loin

ObjectifPrompt à adapter
Trouver ce qui peut sortir du modèleVoici mon script : [CODE]. Quelles etapes envoyees au modele pourraient etre faites en code deterministe sans perte de qualite ? Reecris-en une.
Estimer avant de lancerVoici un exemple de requete et de reponse typiques, et je prevois [N] appels par mois. Estime le cout mensuel aux tarifs suivants : [TARIFS]. Donne le calcul, pas seulement le total.
Diagnostiquer un cache inefficaceVoici le code qui construit mon prompt. Liste tout ce qui peut varier d'une requete a l'autre avant le point de cache, et propose un reordonnancement.
Choisir le bon modèle par tâcheVoici 6 taches de mon systeme, avec un exemple pour chacune. Pour chacune, dis si un modele rapide et peu couteux suffit, et ce qui te ferait changer d'avis.
Repérer les candidats au traitement par lotsVoici la liste des appels au modele dans mon application, avec leur contexte d'usage. Lesquels peuvent passer en asynchrone sans degrader l'experience ?

Tu as d’autres ressources comme ça ?

Ce que tu viens de lire est entièrement gratuit. Une nouvelle ressource part chaque semaine dans la newsletter : guides, modèles à copier et liens triés, sans compte à créer.

Cette page est en accès libre, n’hésite pas à la partager.