Caveman est un utilitaire d’Agentic Coding qui s’attaque à la consommation de tokens en sortie de Claude Code. Là où RTK réduit les tokens qui entrent dans le contexte, Caveman agit sur le versant opposé : les tokens que le modèle produit dans sa réponse.
Le constat de départ
Claude Code peut se montrer très verbeux dans l’expression de ses réponses. Cette verbosité a un coût direct, puisque les tokens en sortie sont généralement les plus chers dans la facturation d’un LLM.
Comment Caveman fonctionne
La solution retenue par Caveman est simple : rappeler à Claude Code de s’exprimer de façon terne et simpliste, presque comme un homme des cavernes — d’où son nom. Le style de réponse est délibérément appauvri pour ne garder que l’essentiel.
Un point important pour la qualité du résultat : cette réduction ne touche pas le raisonnement interne du modèle (le thinking), seulement l’output visible par l’utilisateur. Le modèle continue de réfléchir normalement, seule la formulation de sa réponse finale est comprimée.
Ce qu’on observe à l’usage
Dans l’ensemble, Caveman se montre plutôt efficace pour réduire la production de tokens. On observe cependant quelques pertes de qualité ponctuelles, notamment quand on demande à Claude de produire un contenu textuel travaillé — de la documentation ou une présentation HTML, par exemple. Ce n’est pas systématique, mais Caveman peut dans ces cas-là dégrader la qualité du texte produit, puisque l’exigence de concision entre en tension avec un contenu qui a justement besoin de développement.
Vous souhaitez approfondir ce sujet ?
Voir les formations