Claude Code gratuit : 1,3 milliard de tokens par mois

La limite hebdo tombe toujours au pire moment. Tu es sur un bon flux, le code avance, et là : "Vous avez atteint votre limite d'utilisation." Rien de plus jusqu'au lundi suivant. Pour rappel, le plan Max coûte tout de même 200 $ par mois.
Il y a deux façons de régler le problème. La première, on ne te l'enseigne jamais : dépenser beaucoup moins de tokens. La seconde est plus radicale : arrêter de se faire bloquer par une limite en allant récupérer des tokens gratuits ailleurs, via un petit proxy installé sur ta machine.
Je vais te montrer les deux. D'abord les habitudes qui font baisser ta facture, ensuite le système complet pour coder sans limite avec une pile de providers gratuits. Tous les prompts, toutes les commandes, rien que du copier-coller.
Pourquoi tu brûles des tokens sans t'en rendre compte
Avant de dépenser moins, il faut savoir où ça part. Ce que la plupart des gens ignorent, c'est que chaque conversation Claude reprocesse tout l'historique à chaque message. Une session devenue énorme, trois connexions d'outils que tu n'utilises plus, un CLAUDE.md trop étoffé : tout ça est rechargé en permanence.
Tu peux mesurer ton propre gaspillage avec un prompt d'audit. Colle-le dans une session Claude, il liste ce qui est préchargé (outils système, serveurs MCP, fichiers CLAUDE.md, skills), lit tes sessions ouvertes et estime leur coût réel.
Audite ma consommation de tokens et dis-moi où je les gaspille.
Phase 1 : AUDIT
- Liste tout ce qui est préchargé dans une session neuve : outils système,
serveurs MCP et nombre de tools exposés par chacun, fichiers CLAUDE.md,
skills installées.
- Lis mes journaux de sessions récents et estime la taille de contexte
de chaque session.
- Mesure chaque fichier CLAUDE.md en portée (projet et dossiers parents).
Signale tout fichier de plus de 5 Ko ou tout total de plus de 10 Ko.
- Liste les sessions restées ouvertes et donne une estimation de leur coût.
Phase 2 : CORRECTION
- Propose des suppressions concrètes : connecteurs inutilisés, skills,
fichiers, habitudes.
- Applique ce qui est sûr, demande-moi avant de toucher à quoi que ce soit
d'ambigu.
Phase 3 : HABITUDES
- Donne-moi 5 habitudes pour garder une consommation basse dans la durée.
Pour info, un audit sur mon setup a révélé 95,4 % de tokens gaspillés. Le poste le plus lourd ? Trois grosses sessions laissées ouvertes dont j'avais oublié l'existence. C'est le premier réflexe à prendre : fermer et purger les sessions terminées.
Les six habitudes qui font baisser la facture
1. Un clear entre deux tâches, pas un compact
Quand une tâche est terminée, le réflexe naturel c'est de demander un résumé compact et de continuer dans la même fenêtre. Mauvaise idée : le compact force Claude à relire toute la conversation. Ouvre un onglet neuf et tape /clear. La session repart d'un contexte propre, et tu ne payes plus le poids mort de ce qui précède.
2. Une session, un modèle
Changer de modèle en plein milieu d'une conversation, c'est lui faire retraiter l'intégralité de l'historique dans le nouveau contexte. On ne passe pas d'Opus à Sonnet à mi-parcours pour "une petite question". Une tâche = un modèle, du début à la fin. Même règle pour le niveau d'effort : ne le touche pas en cours de route.
3. Regroupe tes questions
Envoyer trois messages séparés, c'est trois relectures complètes de l'historique. Dictée ma pensée d'un coup, quitte à poser plusieurs questions dans le même message, et le modèle traite le lot d'un seul passage. Le gain paraît anecdotique, il est énorme sur une journée.
4. Corrige la demande, pas la réponse
Tu as écrit "le plus grand homme" au lieu de "la plus grande femme", le modèle a répondu, et tu renvoies un message de correction. Mauvaise habitude : ça allonge la conversation et ça stocke la réponse fausse en plus de la bonne. Clique sur l'icône crayon, réécris le message d'origine, et l'historique reste propre. Ça fonctionne sur les chats officiels ; ce n'est pas toujours disponible sur toutes les interfaces d'édition de code.
5. Du texte, pas des PDF ni des captures
Une image, c'est environ 5 000 tokens. Chaque capture d'écran que tu fais défiler dans la conversation, c'est cette somme rechargée à chaque message. Avant de coller un PDF ou une image que tu vas citer plusieurs fois, pré-traite-le en texte brut une fois, une seule.
6. Fixe le niveau d'effort
Comme le modèle, le niveau d'effort ne se change pas en cours de session. Le varier, c'est refaire de l'analyse sur tout le contexte. Choisis-le au démarrage, garde-le jusqu'à la fin.
Le style qui réduit les allers-retours
Il y a un problème dont on ne parle jamais : la verbosité. Quand Claude répond en trois paragraphes pour une question qui méritait deux lignes, tu perds du temps à comprendre et tu relances pour clarifier. Chaque clarification, c'est une relecture de l'historique en plus.
La parade est un style de communication court, que j'appelle "comme à un enfant de cinq ans", appliquée à mes sessions via un skill. Le principe tient en quatre blocs, et tu peux le donner à n'importe quel assistant :
Quand tu réponds, structure systématiquement ton message ainsi :
## Le problème, comme à un enfant de cinq ans
Explique le problème simplement, sans jargon, phrases courtes.
## La solution, en une phrase
Une seule phrase, la plus simple possible.
## Comment ça marche, concrètement
Trois à cinq paragraphes courts, des exemples, zéro mot superflu.
Pas de phrases inutilement longues. Pas de "il convient de noter". Non.
Le résultat est impressionnant de netteté. Des réponses claires engendrent moins de questions de clarification, donc des conversations plus courtes, donc moins de tokens. C'est de l'économie à deux étages : moins de tokens Claude, et moins de ton temps à décoder.
Le bon modèle pour le bon job
La plupart des gens ont un seul modèle en tête et l'utilisent pour tout. C'est le gaspillage le plus courant. Voici comment je répartis le travail moi-même :
| Modèle | Rôle | Usage type |
|---|---|---|
| Claude Haiku | L'ouvrier | Réécritures de volume, boilerplate, tâches répétitives |
| Claude Sonnet | Le bâtisseur | Questions générales, développement quotidien |
| Claude Opus 4.8 | Le chef de session | Logique complexe, sessions longues |
| Fable 5 | L'artiste | Décisions importantes, créativité premium, design |
Et il manque un joueur dans cette liste : le double contrôle. Je fais systématiquement vérifier mon travail Claude par un second moteur (Codex, par exemple). Claude peut te dire que tout va bien alors qu'une erreur d'architecture dort au milieu du code. Un échange avec Codex détecte des problèmes majeurs que Claude ne voyait pas. Cette double lecture, pour le prix d'un abonnement à 20 $ par mois, t'évite de reconstruire un système entier après coup.
Pour les grosses bases de code, j'utilise GraphiPy avant même de poser une question. L'outil (100 000+ étoiles sur GitHub) construit une carte des relations entre les fichiers. Résultat : je peux demander des informations précises sans que le modèle ne lise chaque ligne du dépôt. C'est un de mes plus gros postes d'économie sur les projets de cette taille.
Voici un résumé visuel de la logique de routage.
Et si on pouvait coder sans aucune limite ?
Les habitudes précédentes réduisent la facture, mais il reste un plafond : même le plan Max plafonne chaque semaine, et chaque requête ne peut aller que vers une seule société. Environ 50 fournisseurs, eux, distribuent des allocations gratuites mensuelles pour attirer les développeurs (NVIDIA, Groq, Google, GitHub, Cloudflare). Seuls, ces plans gratuits sont des flaques. Personne ne code sur une flaque.
Un projet libre a bâti un proxy local qui agrège ces allocations : free-claude-code. Il annonce plus d'un milliard de tokens gratuits par mois en combinant les quotas de ses quelque 50 providers. Et tu peux l'utiliser directement dans le harnais Claude Code, sans quitter tes skills ni ton workflow.
Comment ça marche, comme à un enfant de cinq ans
Le harnais Claude Code possède un réglage intégré appelé ANTHROPIC_BASE_URL. Il indique où chaque requête doit partir. Anthropic l'a conçu pour les équipes qui veulent brancher Claude sur Bedrock, Vertex ou une passerelle d'entreprise. Toi, tu le pointes vers un proxy sur ta propre machine.
- Claude Code envoie chaque requête à l'adresse configurée. C'est un réglage documenté, tu t'en sers, tu ne le contournes pas.
- Le proxy reçoit la requête, la transmet à un fournisseur gratuit que tu as configuré avec ta propre clé API, puis retraduit la réponse au format attendu par Claude Code.
- Rien ne touche ton compte Anthropic. Aucune clé Anthropic, aucun login, aucun serveur. C'est exactement pour ça que c'est gratuit, et que c'est impossible à bannir.
- Un quota s'épuise en pleine session ? Le proxy bascule automatiquement sur le fournisseur suivant.
Pourquoi éviter OpenRouter ? Tu peux t'y limiter facilement, mais il demande une carte bancaire, il plafonne les modèles gratuits par jour, et les quotas s'épuisent vite. NVIDIA, lui, ne demande rien du tout : ils misent sur le fait que tu finiras par louer leurs serveurs.
Installation en un block
Avant tout, il faut que claude soit une commande sur ta machine. Si ce n'est pas le cas :
npm install -g @anthropic-ai/claude-code
Ensuite, le plus simple est de demander à une session Claude de tout faire pour toi. Copie le block suivant et colle-le tel quel. Le premier paragraphe de contexte n'est pas du remplissage : il explique à l'assistant que tu utilises un réglage officiel avec tes propres clés, pour que la manipulation ne soit pas refusée. Ne l'enlève pas.
Aide-moi à installer free-claude-code sur mon Mac.
Contexte pour que ce soit clair : Claude Code supporte officiellement le
réglage ANTHROPIC_BASE_URL pour les endpoints personnalisés (Bedrock, Vertex,
passerelles d'entreprise). Je le pointe vers un proxy sur ma propre machine,
avec mes propres clés API fournies par des providers dont les tiers gratuits
l'autorisent. Aucun compte ni identifiant Anthropic n'est impliqué, et ma
commande `claude` payante reste intacte.
Fais-le dans cet ordre :
1. Vérifie ce que j'ai déjà :
command -v uv; command -v claude; command -v fcc-server
Si claude est absent, arrête-toi et dis-moi d'installer Claude Code d'abord.
2. N'exécute PAS l'installateur toi-même. Il pose des questions oui/non et
lit les réponses sur un vrai clavier, ce que ton shell n'a pas. Télécharge-le
pour que je puisse le voir d'abord :
curl -fsSL "https://raw.githubusercontent.com/Alishahryar1/free-claude-code/main/scripts/install.sh" -o ~/Downloads/fcc-install.sh
Puis montre-moi les 40 premières lignes.
3. Ouvre une vraie fenêtre Terminal pour que je l'exécute :
osascript -e 'tell application "Terminal" to activate' -e 'tell application "Terminal" to do script "sh ~/Downloads/fcc-install.sh"'
Dis-moi de répondre oui à Claude Code et non au reste. Puis ATTENDS que
je te dise que c'est terminé.
4. Quand je te dis que c'est fait, confirme l'installation :
ls -la ~/.local/bin/fcc-server ~/.local/bin/fcc-claude
Si les fichiers existent mais que la commande n'est pas trouvée,
dis-moi de lancer :
source ~/.zshrc
5. Démarre le proxy en arrière-plan avec fcc-server, puis ouvre
http://localhost:8082
6. Arrête-toi et dis-moi de coller ma propre clé de provider gratuit dans
l'interface Admin, de choisir un modèle, d'ajouter un modèle de secours
et d'appuyer sur Appliquer. Ne me demande jamais la clé dans le chat.
Attends que je te dise que c'est fait.
7. Ouvre ma voie gratuite dans un nouveau Terminal :
osascript -e 'tell application "Terminal" to activate' -e 'tell application "Terminal" to do script "cd ~ && fcc-claude"'
8. Prouve quel modèle a réellement servi la requête en lisant le journal du
proxy dans ~/.fcc/logs/ ou l'onglet Requêtes de l'interface Admin. Ne
demande pas au modèle ce qu'il est ; n'importe quel modèle qui tourne
dans ce harnais dira qu'il est Claude. Le journal est la preuve.
9. Donne-moi mon interrupteur : fcc-claude = voie gratuite, claude = vrai
Anthropic. Les deux fonctionnent en même temps dans des fenêtres
Terminal différentes. Ne mets jamais ANTHROPIC_BASE_URL dans mes
fichiers de configuration globaux.
La clé NVIDIA et les autres
Le premier provider à configurer est NVIDIA. C'est lui qui offre l'essentiel du quota gratuit sans aucune carte bancaire.
- Inscris-toi sur build.nvidia.com.
- Va dans API Keys, crée une clé et copie-la.
- Colle-la dans l'interface Admin du proxy (localhost:8082), choisis un modèle, ajoute un modèle de secours, puis Appliquer.
Le quota est de 40 requêtes par minute. C'est très généreux : une requête toutes les 1,5 seconde en moyenne.
L'interface fonctionne comme un porte-clés : tu peux y ajouter autant de clés que tu veux, et le proxy répartit la charge dessus. Pense-le comme ça, "le trousseau" et chacune des clés est une "clé". Les plus utiles en plus de NVIDIA :
| Provider | Où créer la clé |
|---|---|
| Groq | console.groq.com |
| Cerebras | cloud.cerebras.ai |
| OpenRouter (modèles gratuits) | openrouter.ai/settings/keys |
| Gemini | aistudio.google.com |
| GitHub Models | github.com/settings/developer_settings |
Les quotas gratuits changent souvent, d'où l'intérêt d'en avoir plusieurs : un tiers s'épuise, le suivant prend le relais automatiquement.
Le système, en deux commandes
fcc-claude # Claude Code sur les tiers gratuits : 0 $
claude # le vrai Claude : intact
C'est tout. Deux fenêtres Terminal, deux voies. La première pour le travail de volume, la seconde pour les missions qui demandent du goût. Le proxy est un projet communautaire qui dépasse aujourd'hui les 50 000 étoiles sur GitHub.
Un point à connaître : la voie gratuite ne fonctionne que dans le Terminal. Ni l'application desktop Claude, ni l'extension VS Code. Elles gèrent leur propre connexion et écrivent l'adresse réelle d'Anthropic dans chaque fenêtre, quoi que tu fasses du côté des fichiers de configuration. Terminal, une commande, et tu retrouves le même Claude Code, les mêmes skills, les mêmes outils, pour 0 $.
Le failover automatique, le vrai avantage
Le gros problème des modèles gratuits, c'est leur durée de vie : tu codes tranquillement, et soudain "game over", quota épuisé. Là, quand un niveau tarifaire se tarit en pleine séance, le proxy bascule automatiquement sur le suivant. Tu ne t'arrêtes pas, tu continues. C'est ce qui rend le gratuit utilisable pour du vrai travail.
Connecte tes MCP
Les connecteurs intégrés à l'application Claude reposent sur ton compte Anthropic. La voie gratuite ne parle jamais à Anthropic, donc ils ne peuvent pas te suivre. La parade n'est pas un nouveau système : tout MCP ajouté au niveau machine avec --scope user fonctionne dans chaque session Terminal, voie gratuite comme voie payante.
Prenons Zapier comme exemple complet, transposable à n'importe quel autre serveur.
- Va sur mcp.zapier.com, connecte tes applis et copie ton URL personnelle de serveur.
- Dans un Terminal :
claude mcp add --transport http --scope user zapier TA_URL_ICI
- Lance
fcc-claude, tape/mcp, choisis zapier et valide la connexion. Une seule fois. - Teste avec une demande anodine en lecture seule :
En utilisant les outils Zapier, vérifie mon agenda Google de demain et liste mes événements.
Grâce à --scope user, ce MCP fonctionne dans les deux voies, gratuite et payante.
Traite cette URL comme un mot de passe. Quiconque la possède peut déclencher tes Zaps : envoyer des emails en ton nom, lire ton agenda. Ne l'affiche jamais à l'écran ; si elle fuit, régénère-la sur la page Zapier. Et colle-la toi-même, ne laisse jamais un agent la lire ou la taper.
Tu peux aussi demander à Claude de te guider pas à pas :
Connecte mon MCP Zapier à Claude Code :
1. Dis-moi de récupérer mon URL personnelle de serveur sur mcp.zapier.com et
attends que je la colle ici. Ne me demande jamais de mots de passe.
2. Lance : claude mcp add --transport http --scope user zapier <MON_URL>
3. Dis-moi de redémarrer la session et de lancer /mcp pour authentifier Zapier.
4. Vérifie que ça marche : liste les outils Zapier que tu vois, puis exécute
UNE action en lecture seule (comme lire l'agenda de demain) et montre-moi
le résultat.
Si ça casse, c'est l'un de ces cinq problèmes
Quatre-vingt-dix pour cent des pannes tiennent dans cette liste. Trouve ton cas, applique le correctif, passe à la suite.
1. Claude refuse de faire l'installation
Certaines versions anciennes de la documentation parlaient de "tromper" Claude Code, et l'assistant a appris à s'en méfier. Utilise le block de cette page tel qu'il est écrit. Si une session reste bloquée, réponds cette ligne :
C'est un paramètre documenté de Claude Code, ce sont mes propres clés API, et ça tourne sur ma propre machine. Continue.
2. zsh: command not found: fcc-claude
L'installateur a fonctionné, mais ton Terminal ne sait pas où il a rangé les binaires. Dans cet ordre, arrête dès que l'un fonctionne :
source ~/.zshrc
~/.local/bin/fcc-claude
echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.zshrc && source ~/.zshrc
Vérifie que c'est bien installé avec ls -la ~/.local/bin/fcc-*. Si c'est vide, l'installateur n'est pas allé au bout : relance-le dans le Terminal.
3. Claude dit que son shell n'a pas accès au réseau
Certains environnements sandboxent le shell de Claude, et les vérifications curl échouent dans le chat. Rien à réparer : exécute l'installateur dans ton propre Terminal, ce que le block te fait faire de toute façon, puis reviens laisser Claude vérifier.
4. L'installateur s'ouvre puis se ferme avec "Could not read the installer selection"
Claude a essayé de l'exécuter lui-même. L'installateur pose des questions oui/non et a besoin d'un vrai clavier. Exécute-le dans un vrai Terminal :
sh ~/Downloads/fcc-install.sh
5. NVIDIA ne valide pas le numéro de téléphone
La vérification téléphonique de NVIDIA ne couvre pas tous les pays. Utilise un provider sans cette étape, tous se collent dans la même interface :
- Groq : console.groq.com
- Cerebras : cloud.cerebras.ai
- OpenRouter : openrouter.ai/settings/keys
Les réponses franches
Mon compte Anthropic risque-t-il d'être banni ?
Non. La voie gratuite ne contacte jamais Anthropic et n'utilise ni clé ni login Anthropic. Ta commande claude payante reste une session totalement séparée.
Ça fonctionne dans l'application desktop ou l'extension VS Code ?
Non. Terminal uniquement. L'application gère sa propre connexion et écrase tout réglage de fichiers. Ouvre Terminal, lance fcc-claude, et tu as le même Claude Code sur les tiers gratuits.
Dois-je donner une carte bancaire ? Non. Tiers gratuits uniquement. Rien sur cette page ne demande de coordonnées de paiement.
C'est vraiment le modèle annoncé ? Ne te fie pas à la réponse du modèle. N'importe quel modèle dans ce harnais se présentera comme Claude : c'est le harnais qui parle. Lis le journal du proxy ou l'onglet Requêtes de localhost:8082. Le journal est le seul reçu qui compte.
Ces modèles valent-ils Claude ? Non, et c'est l'échange honnête. Les tiers gratuits sont des modèles plus petits, et un quota épuisé bascule vers un modèle plus faible. Voie gratuite pour le travail de volume. Vrai Claude pour ce qui demande du goût.
Ça marche avec d'autres agents ? Oui. L'installateur propose fcc-hermes, fcc-codex, fcc-opencode et d'autres encore. Réponds oui aux questions de l'installateur pour les activer.
Les limites à connaître avant de tout passer en gratuit
Gratuit ne veut pas dire sans contrepartie. Trois choses à garder en tête si tu bascules.
Le 80/20. Les modèles frontier restent nécessaires pour l'essentiel de ton vrai travail. C'est une fausse économie de vouloir tout faire en gratuit. Une pointe de modèle de pointe pour tes meilleures tâches, et 80 % du volume sur les modèles bon marché ou gratuits.
La confidentialité. L'hôte du tiers gratuit voit tes requêtes. Garde le code client et les secrets sur la voie payante. Zone de travail de volume d'un côté, données sensibles de l'autre.
L'hallucination. Les modèles gratuits font des erreurs, et parfois ils mentent. Double vérifie, lance des sous-agents et fais relire le travail sensible par un modèle de frontière. Cette discipline n'est pas optionnelle, elle est le prix du gratuit.
Quant aux tiers gratuits eux-mêmes : ils rétrécissent. Un lab ouvre son offre, puis la retire du marché. C'est précisément pourquoi cette approche en porte-clés gagne : le jour où un fournisseur ferme le robinet, il y en a dix autres derrière.
Ce que ça change au quotidien
Concrètement, voici le partage que je pratique. Le travail de volume (tests, scripts, refontes, boilerplate) tourne toute la journée sur la voie gratuite. Les décisions qui demandent du goût, le design, les vérifications critiques, passent sur le vrai Claude, une fenêtre Terminal plus loin. Une couche gratuite qui s'assèche bascule au lieu de te bloquer.
L'expertise n'est plus dans le choix du meilleur modèle. Elle est dans la distribution optimale du travail. Une fois les bons réflexes en place, la facture mensuelle se réduit sans que la qualité de code bouge d'un centimètre.
Et si tu veux appliquer cette logique de répartition intelligente au reste de ton entreprise, c'est exactement ce que je fais pour mes clients : je déploie les agents, je forme les équipes et je maintiens les processus à jour, une journée par mois. L'audit, par contre, ce n'est pas possible de le faire avec un proxy : il prend 45 minutes et je l'offre. Réserve le tien et on regarde, ensemble, où ton temps et tes outils fuient.
Passez à l'action : votre Audit IA Express offert (45 min)
45 minutes en visio pour auditer vos processus, chiffrer vos gains de productivité et identifier vos 3 premiers agents IA rentables.
Réservé aux dirigeants de PME (10 à 100 salariés) · Sans engagement · Propriété 100 % de vos livrables
Déployez vos agents IA en entreprise avec un expert dédié
Un Directeur IA externalisé vient dans votre PME de 1 à 10 jours par mois pour automatiser vos processus, concevoir vos agents et former vos équipes. Dès 990 € HT/mois, sans engagement au-delà de 30 jours.
Recevez notre synthèse IA hebdomadaire
Chaque vendredi, recevez notre sélection d'articles, études de cas et retours d'expérience terrain sur les Agents IA et l'automatisation B2B. Résumé 100% concis, sans spam.
Direction IA Externalisée en région


