Retour au blog
AI Tools 11 min read 20 juillet 2026

Caveman : faire dire plus aux agents IA avec moins de tokens

Guide pratique de JuliusBrussee/caveman, le skill MIT qui compresse les reponses des coding agents, preserve code et commandes, prend en charge plus de 30 agents, mesure les gains et reduit les fichiers memoire.

#Caveman#Coding Agents#Optimisation des tokens#Claude Code#Codex#Gemini CLI#Agent Skills#Prompt Engineering#Outils developpeur#Open Source
Neel Shah
Neel Shah Tech Lead · Ingénieur senior en données · Ottawa

Les coding agents utilisent parfois plus de mots pour expliquer une correction que pour l’implementer. Introductions polies, conclusions repetees et narration pedagogique consomment tokens et attention lorsqu’un utilisateur veut une commande, un patch ou un diagnostic direct.

JuliusBrussee/caveman est un skill et plugin MIT qui modifie le style de sortie : fragments courts, moins de remplissage, meme contenu technique. Il prend en charge Claude Code, Codex, Gemini CLI, Cursor, Windsurf, Cline, Copilot et plus de 30 environnements.

La formule du projet est « gros cerveau, petite bouche ». C’est aussi la bonne lecture technique. Caveman ne compresse ni le raisonnement interne ni le contexte d’entree. Il contraint la reponse finale et demande de conserver exactement code, commandes, chemins, URLs et erreurs.


Interactif : choisir la taille de la bouche de l'agent
La reponse raccourcit; code et sens technique doivent rester.
Prompttache + contexte
Raisonnementnon compresse
Politique reponseretirer le remplissage
Encapsulez l'objet dans useMemo. Nouvelle reference a chaque rendu.
Nouvelle ref a chaque rendu. Utilisez useMemo.
Nouvelle ref/rendu. useMemo.
Codeobjectif byte-identique
+
Commandesinchangees
+
Erreursinchangees
65%moyenne output du projet
0%reduction input/raisonnement
30+environnements agents
6 niveauxnormal a wenyan
Lite garde des phrases completes en retirant le remplissage social et les repetitions.
Full, par defaut, favorise fragments et causes directes avec assez de contexte pour agir.
Ultra minimise agressivement. Utile pour les routines connues; risque pour nuance, apprentissage ou communication.

Ce que Caveman modifie vraiment

Caveman installe un skill base sur un prompt ou une regle equivalente. Il demande au modele de :

  • commencer par la reponse sans preambule
  • utiliser des fragments lorsque la grammaire n’ajoute rien
  • eviter de repeter probleme et conclusion
  • conserver code, commandes, erreurs, URLs et chemins
  • garder la langue de l’utilisateur
  • regler la compression avec lite, full, ultra et wenyan

L’interface compte six niveaux avec le comportement normal et un mode supplementaire. wenyan emploie volontairement le chinois classique; les autres gardent la langue du prompt.

C’est un controle de style, pas une compression semantique interne. L’agent recoit le meme contexte et effectue son travail normal. Seule la sortie visible est contrainte.

Une installation, plusieurs agents

L’installateur detecte les outils et place l’integration adaptee :

curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

Windows utilise PowerShell. Node.js 18+ est requis; installation ciblee, dry-run, rerun et desinstallation sont documentes dans INSTALL.md.

L’integration varie : plugin et hook pour Claude Code, extension Gemini CLI, registry de skills ou fichiers de regles pour Codex, Cursor, Windsurf et autres. Une equipe doit inspecter ce qui est installe, les chemins modifies et la distribution des mises a jour avant un deploiement large.

Des commandes au-dela des reponses courtes

Caveman propose plusieurs outils :

  • /caveman [niveau] change le style de session
  • /caveman-commit cree des Conventional Commits compacts
  • /caveman-review produit des remarques de revue par ligne
  • /caveman-stats estime les tokens economises
  • /caveman-compress <fichier> reduit instructions et memoires persistantes
  • caveman-shrink compresse les descriptions d’outils MCP
  • cavecrew-* fournit des sous-agents concis

La compression de memoire cible les tokens d’entree. Un CLAUDE.md plus court est recharge a chaque session. Le risque persiste aussi : supprimer une contrainte affecte toutes les sessions futures. Relisez le diff et gardez l’original versionne.

Lire correctement le chiffre de 65%

Le projet annonce 65% de reduction des tokens de sortie en moyenne sur dix prompts avec les compteurs de l’API Claude. La plage publiee va de 22 a 87%, avec une moyenne passant de 1 214 a 294 tokens.

Cela ne signifie pas 65% de tokens totaux ou de cout en moins. La note « honest numbers » precise :

  1. Les tokens d’entree et de raisonnement ne diminuent pas.
  2. Le skill ajoute environ 1 a 1,5k tokens d’entree par tour.
  3. Un workload deja concis peut devenir net-negatif.

Prompts, versions de modele, verbosite par defaut, mix de taches et notation influencent les resultats. Reproduisez le benchmark puis comparez exactitude, temps de revue, questions suivantes, total de tokens, latence et cout.

Quand la brievete perd de l’information

Les reponses courtes excellent lorsque l’audience connait le domaine. Elles deviennent dangereuses lorsque incertitude, compromis, conformite, migration ou apprentissage comptent.

Un agent peut conserver chaque byte de code tout en supprimant une alerte importante autour. « Meme reponse » est donc un objectif, pas une garantie de longueur. Demandez : hypotheses et incertitudes restent-elles? Un nouveau membre peut-il agir? Les etapes destructives et risques sont-ils visibles? Les references restent-elles exactes? Faut-il davantage de tours?

Utilisez lite pour travail inconnu, onboarding et architecture. Reservez ultra aux routines partagees et facilement verifiables.

Confidentialite et securite

Selon le projet, Caveman n’utilise ni backend, compte, analytics ni telemetrie. Apres installation, skill et hooks sont locaux; les stats lisent des logs existants. Le reseau intervient lors de l’installation via GitHub et les registries des agents.

Un skill influence chaque reponse et appartient donc a la supply chain. Epinglez ou relisez les versions, inspectez les scripts, verifiez les modifications, limitez la portee et testez les mises a jour. Le style ne doit jamais affaiblir des exigences superieures de securite ou d’exactitude.

Workflow d’adoption pratique

Commencez avec un agent et une semaine de taches :

  1. Mesurez output, input, raisonnement, latence et tours suivants.
  2. Activez lite et comparez exactitude et lisibilite.
  3. Essayez full pour debug, revue et implementation.
  4. Compressez moins architecture, incident, juridique et securite.
  5. Relisez /caveman-compress avant commit.
  6. Mesurez la session totale, pas seulement l’output.
  7. Documentez le retour rapide en mode normal.

L’objectif n’est pas le minimum de mots, mais la plus petite reponse conservant tout ce qui permet l’action correcte suivante.

Conclusion

Caveman transforme un meme en experience d’interface utile. Les coding agents n’ont pas toujours besoin de narrer leur competence. Une contrainte claire rend le travail plus rapide a lire et peut reduire les tokens de sortie.

Sa limite est tout aussi importante : la sortie n’est qu’une partie du budget et la brievete peut cacher le contexte. Caveman fonctionne comme couche de communication configurable, mesuree par le succes de la tache et non par la seule petitesse des chiffres.

Ressources

Questions fréquentes

De quoi parle Caveman : faire dire plus aux agents IA avec moins de tokens ?

Guide pratique de JuliusBrussee/caveman, le skill MIT qui compresse les reponses des coding agents, preserve code et commandes, prend en charge plus de 30 agents, mesure les gains et reduit les fichiers memoire.

À qui s’adresse cet article ?

Cet article s’adresse aux ingénieurs, responsables techniques et équipes data travaillant sur Caveman, Coding Agents, Optimisation des tokens.

Comment utiliser cet article ?

Utilisez-le comme référence pratique pour les décisions AI Tools, les arbitrages d’architecture et les workflows de production.

Article complet

Lire la version anglaise integrale

La version anglaise contient tout le detail de l’analyse, y compris les explications techniques, les exemples et les points de comparaison.

Ouvrir l’article anglais
Autres articles

Parcourir les autres resumes et articles du blog.

Projets

Voir les outils, datasets et bibliotheques publies.

Contact

Discuter d’un projet de donnees, d’IA ou d’architecture.