Les coding agents utilisent parfois plus de mots pour expliquer une correction que pour l’implementer. Introductions polies, conclusions repetees et narration pedagogique consomment tokens et attention lorsqu’un utilisateur veut une commande, un patch ou un diagnostic direct.
JuliusBrussee/caveman est un skill et plugin MIT qui modifie le style de sortie : fragments courts, moins de remplissage, meme contenu technique. Il prend en charge Claude Code, Codex, Gemini CLI, Cursor, Windsurf, Cline, Copilot et plus de 30 environnements.
La formule du projet est « gros cerveau, petite bouche ». C’est aussi la bonne lecture technique. Caveman ne compresse ni le raisonnement interne ni le contexte d’entree. Il contraint la reponse finale et demande de conserver exactement code, commandes, chemins, URLs et erreurs.
useMemo. Nouvelle reference a chaque rendu.useMemo.useMemo.Ce que Caveman modifie vraiment
Caveman installe un skill base sur un prompt ou une regle equivalente. Il demande au modele de :
- commencer par la reponse sans preambule
- utiliser des fragments lorsque la grammaire n’ajoute rien
- eviter de repeter probleme et conclusion
- conserver code, commandes, erreurs, URLs et chemins
- garder la langue de l’utilisateur
- regler la compression avec
lite,full,ultraetwenyan
L’interface compte six niveaux avec le comportement normal et un mode supplementaire. wenyan emploie volontairement le chinois classique; les autres gardent la langue du prompt.
C’est un controle de style, pas une compression semantique interne. L’agent recoit le meme contexte et effectue son travail normal. Seule la sortie visible est contrainte.
Une installation, plusieurs agents
L’installateur detecte les outils et place l’integration adaptee :
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
Windows utilise PowerShell. Node.js 18+ est requis; installation ciblee, dry-run, rerun et desinstallation sont documentes dans INSTALL.md.
L’integration varie : plugin et hook pour Claude Code, extension Gemini CLI, registry de skills ou fichiers de regles pour Codex, Cursor, Windsurf et autres. Une equipe doit inspecter ce qui est installe, les chemins modifies et la distribution des mises a jour avant un deploiement large.
Des commandes au-dela des reponses courtes
Caveman propose plusieurs outils :
/caveman [niveau]change le style de session/caveman-commitcree des Conventional Commits compacts/caveman-reviewproduit des remarques de revue par ligne/caveman-statsestime les tokens economises/caveman-compress <fichier>reduit instructions et memoires persistantescaveman-shrinkcompresse les descriptions d’outils MCPcavecrew-*fournit des sous-agents concis
La compression de memoire cible les tokens d’entree. Un CLAUDE.md plus court est recharge a chaque session. Le risque persiste aussi : supprimer une contrainte affecte toutes les sessions futures. Relisez le diff et gardez l’original versionne.
Lire correctement le chiffre de 65%
Le projet annonce 65% de reduction des tokens de sortie en moyenne sur dix prompts avec les compteurs de l’API Claude. La plage publiee va de 22 a 87%, avec une moyenne passant de 1 214 a 294 tokens.
Cela ne signifie pas 65% de tokens totaux ou de cout en moins. La note « honest numbers » precise :
- Les tokens d’entree et de raisonnement ne diminuent pas.
- Le skill ajoute environ 1 a 1,5k tokens d’entree par tour.
- Un workload deja concis peut devenir net-negatif.
Prompts, versions de modele, verbosite par defaut, mix de taches et notation influencent les resultats. Reproduisez le benchmark puis comparez exactitude, temps de revue, questions suivantes, total de tokens, latence et cout.
Quand la brievete perd de l’information
Les reponses courtes excellent lorsque l’audience connait le domaine. Elles deviennent dangereuses lorsque incertitude, compromis, conformite, migration ou apprentissage comptent.
Un agent peut conserver chaque byte de code tout en supprimant une alerte importante autour. « Meme reponse » est donc un objectif, pas une garantie de longueur. Demandez : hypotheses et incertitudes restent-elles? Un nouveau membre peut-il agir? Les etapes destructives et risques sont-ils visibles? Les references restent-elles exactes? Faut-il davantage de tours?
Utilisez lite pour travail inconnu, onboarding et architecture. Reservez ultra aux routines partagees et facilement verifiables.
Confidentialite et securite
Selon le projet, Caveman n’utilise ni backend, compte, analytics ni telemetrie. Apres installation, skill et hooks sont locaux; les stats lisent des logs existants. Le reseau intervient lors de l’installation via GitHub et les registries des agents.
Un skill influence chaque reponse et appartient donc a la supply chain. Epinglez ou relisez les versions, inspectez les scripts, verifiez les modifications, limitez la portee et testez les mises a jour. Le style ne doit jamais affaiblir des exigences superieures de securite ou d’exactitude.
Workflow d’adoption pratique
Commencez avec un agent et une semaine de taches :
- Mesurez output, input, raisonnement, latence et tours suivants.
- Activez
liteet comparez exactitude et lisibilite. - Essayez
fullpour debug, revue et implementation. - Compressez moins architecture, incident, juridique et securite.
- Relisez
/caveman-compressavant commit. - Mesurez la session totale, pas seulement l’output.
- Documentez le retour rapide en mode normal.
L’objectif n’est pas le minimum de mots, mais la plus petite reponse conservant tout ce qui permet l’action correcte suivante.
Conclusion
Caveman transforme un meme en experience d’interface utile. Les coding agents n’ont pas toujours besoin de narrer leur competence. Une contrainte claire rend le travail plus rapide a lire et peut reduire les tokens de sortie.
Sa limite est tout aussi importante : la sortie n’est qu’une partie du budget et la brievete peut cacher le contexte. Caveman fonctionne comme couche de communication configurable, mesuree par le succes de la tache et non par la seule petitesse des chiffres.