Réduisez le coût de vos applications d'IA sans changer de fournisseur ni dégrader la qualité.
Savings analyse chaque requête, évite les exécutions inutiles, élimine le contexte redondant et choisit l'option la plus économique qui respecte encore votre contrat de qualité. Chaque chiffre publié est mesuré contre le compteur du fournisseur lui-même.
Installation en cinq lignes. La licence s'active depuis votre tableau de bord.
S'installe devant ces fournisseurs
gpt-4o-miniAnthropicGeminirésolveurs · singleflight · avoided_calls
outils élagués · récupération · contexte redondant · eliminated_tokens
encodage plus léger · seulement si c'est rentable · compressed_tokens
L'exécution la moins chère gagne
OpenAI gpt-4o-mini
≥ 20,0 % de facture en moins, vérifié à 95 % · face à une intégration non optimisée, sans streaming
Le second contrôle
Face à une intégration déjà optimisée à la main
Ici, chaque scénario s'exécute aussi contre une intégration qu'un intégrateur diligent aurait déjà réglée : le cache natif du fournisseur configuré sur le préfixe stable, et seulement les outils dont la tâche a vraiment besoin, choisis un à un. Tout le reste — contrat, plafond, température et graine — est identique.
23,2 %
Face à une intégration non optimisée
Presque tout le monde se compare à une intégration naïve, et face à elle n'importe qui a l'air bon.
22,9 %
Face à une intégration déjà optimisée à la main
Ce second comparatif est le seul qui mesure le mérite propre de la couche : ce qu'il reste à économiser une fois les fruits mûrs cueillis.
Nous annonçons toujours le plus petit des deux chiffres, et les deux sortent du même artefact public : promettre au-delà du second contrôle reviendrait à vous vendre comme notre mérite ce que vous aviez déjà.
mesuré sur gpt-4o-mini · plancher à 95 % · d1c8233 · 2026-09-12 · 193
Évite l'appel entièrement
résolveurs · singleflight
avoided_calls
Retire ce qu'il était inutile d'envoyer
outils élagués · récupération · contexte redondant
eliminated_tokens
Comprime ce qui reste
encodage plus léger · seulement si c'est rentable
compressed_tokens
Chaque étape s'inscrit dans UN registre comptable distinct : ces chiffres ne s'additionnent donc pas. Une étape dont le registre ne dépasse pas zéro n'apparaît pas ici. Un pourcentage sans son modèle à côté ne veut rien dire : le même levier peut faire économiser sur un modèle et coûter sur un autre.
Comment les économies sont mesurées — et chaque essai, publié un par un.
Les deux bras sont mesurés avec le compteur du fournisseur lui-même — sans référence modélisée. Pour chaque scénario, le banc envoie au même modèle la requête non optimisée et la requête BV-SALA, chiffre les deux à partir de la consommation de tokens déclarée par le fournisseur et agrège les scénarios par un bootstrap stratifié, poids un par scénario : le chiffre affiché ne dépend donc pas du nombre de répétitions échues à chaque cas. L'agrégat groupé reste dans l'artefact sous le nom aggregatePooled, étiqueté pour ce qu'il est : ce n'est pas le chiffre affiché. Nous publions le plancher de l'intervalle de confiance à 95 %, jamais l'estimation ponctuelle.
- Même modèle, deux bras : la requête naïve contre la requête BV-SALA.
- Coût chiffré avec le tokenizer du fournisseur lui-même — pas de référence modélisée.
- Nous publions le plancher de l'intervalle de confiance à 95 %, jamais l'estimation flatteuse.
- Deux bras de contrôle : face à une intégration non optimisée et face à la même intégration déjà optimisée à la main. Seul le second chiffre revient au mérite de la couche.
- Les registres qui ne dépassent pas zéro sont publiés quand même, avec leur étiquette.
Télécharger les essais bruts (CSV) d1c8233 · 2026-09-12 · 193 · gpt-4o-mini
Vérifiez-le avec vos propres chiffres, avant d'installer quoi que ce soit
Le vérificateur exécute le vrai optimiseur dans votre navigateur : vous choisissez un exemple ou collez vos données, indiquez votre usage de l'API et voyez l'économie projetée, calculée exactement comme le sera plus tard votre reçu. Rien de ce que vous collez ne quitte la page.
Le vérificateur vit à l'intérieur du produit, dans votre tableau de bord Savings — ce n'est pas une calculatrice marketing à part.
Conçu pour les développeurs
Moins de maux de tête avec la facture. Sans changer de fournisseur.
Trois faits sur le paquet. Aucun n'est une promesse.
Installation en cinq lignes
npm install @bivelio/savings-layerSDK sous licence pour Node.js ; la licence s'active depuis votre tableau de bord. Fonctionne avec tout endpoint compatible avec l'API OpenAI et avec l'adaptateur natif Anthropic.
npmjs.com/package/@bivelio/savings-layer ↗- 01
Zéro dépendance à l'exécution
Un seul bundle ESM. Rien ne s'installe à côté de votre code que nous n'ayons écrit ; le tokenizer exact est un peer optionnel.
- 02
Un SavingsReport par appel
Des registres jamais additionnés, le coût avec sa base — mesuré ou estimé — et des traces par étape. C'est exactement ce que lit votre tableau de bord.
- 03
Votre trafic reste direct
Le SDK encapsule l'appel dans votre processus. Vos prompts ne passent jamais par BiVelio : nous ne recevons que des comptages et des coûts.
Trois couloirs qui ne s'additionnent jamais — et un seul est facturé
Chaque reçu sépare l'économie selon ce qu'on peut en prouver, car toutes les preuves ne se valent pas. Additionner les trois donnerait un nombre plus gros et moins sûr : c'est pourquoi on ne les additionne jamais.
Mesuré
Le fournisseur a déclaré les mêmes tokens et un autre tarif a été payé : c'est une soustraction entre deux prix publics, et vous pouvez la rapprocher de la console de votre fournisseur, ligne à ligne.
mesuré · facturéDu fournisseur
Son propre compteur dit combien de tokens il a effacés. Le comptage est le sien, pas le nôtre ; ce qu'il vaut en argent dépend du prix auquel ces tokens auraient été payés, et cette part est notre estimation. On le montre, on ne le facture pas.
estimé · non facturéHypothétique
Ce qu'une politique aurait économisé si elle avait été appliquée. Cela vient d'une simulation du tour : personne n'a rien exécuté. Cela peut sortir négatif, et on le montre quand même. Ce n'est jamais facturé.
simulé · non facturéSeul le couloir mesuré est facturé. L'estimé et l'hypothétique n'entrent jamais dans votre facture, même s'ils sortent plus gros — et si un chiffre ne peut pas être rapproché de la facture de votre fournisseur, c'est écrit sur la ligne même où il apparaît.
bvsala · terminaux de code
Claude Code avec une clé d'API ? Voyez la dépense réelle, token par token.
Une seule commande place un compteur local devant votre terminal. Aucun code à toucher, rien à configurer — et vos prompts ne quittent jamais votre machine : seuls les comptages et le coût arrivent au tableau de bord.
Une commande, zéro configuration
bvsala claude
bvsala doctorElle fonctionne avec Claude Code, Codex CLI, Goose et Qwen Code — et bvsala doctor imprime la configuration exacte des autres.
- La passerelle démarre sur un port éphémère, lance votre terminal en le pointant vers elle et s'éteint à la sortie.
- Votre dépense apparaît dans le tableau de bord token par token, comptée avec le compteur de votre propre fournisseur.
- bvsala doctor ne vérifie que l'existence : son rapport montre des chemins, jamais le contenu de vos fichiers de configuration.
Aujourd'hui la passerelle mesure ; l'optimisation automatique n'y est pas encore.
savings-mode · skill gratuit
Le skill qui étire vos plafonds d'abonnement
Pas de facture ne veut pas dire pas de douleur : la fenêtre de cinq heures et le plafond hebdomadaire. savings-mode est un skill d'instructions pures — sans proxy, votre trafic intact — qui coupe les deux masses qui brûlent vraiment le plafond : la sortie du modèle et les résultats d'outils.
Claude Code
Une seule commande : il s'installe dans ~/.claude/skills et s'active tout seul quand la conversation parle de limites ou d'économiser des tokens.
~/.claude/skillsCodex
N'a pas de skills, donc la même discipline voyage comme bloc balisé dans votre AGENTS.md : toujours active, et désactivée en supprimant le bloc. Votre AGENTS.md hors des balises n'est jamais touché.
AGENTS.mdClaude.ai
Le skill voyage en zip : vous activez « Code execution and file creation » dans les réglages, vous le téléversez dans Customize → Skills, et il apparaît avec son propre interrupteur, privé sur votre compte. Le téléchargement demande votre compte Savings, qui est gratuit ; le skill lui-même n'embarque aucune télémétrie.
savings-mode.zip
L'effet du skill lui-même sera publié une fois mesuré en A/B — jamais avant.
Il est gratuit ; ce que l'on paie avec Savings, c'est savoir combien il vous économise.
Le modèle commercial
Comment se calcule ce que vous nous payez
Un abonnement par siège, et une commission qui sort de l'économie mesurée — jamais de votre poche.
90 %
Vous gardez toujours 90 % ou plus de chaque euro économisé.
La commission n'existe que si votre économie mesurée existe, et aucune tranche ne dépasse le taux maximal.
Seulement sur l'économie mesurée
Ensuite, commission uniquement sur l'économie mesurée : celle que vous pouvez rapprocher de la facture de votre fournisseur, ligne à ligne. L'estimé est montré, jamais facturé.
Par tranches marginales
Par tranches marginales, chacune à son taux et dès le premier euro mesuré : plus vous économisez, plus notre pourcentage baisse.
Sans engagement
Un mois sans économie ? Ce mois-là, pas de commission. Sans engagement — et votre première facture variable ne contient que des chiffres déjà vus sur votre relevé.
Ce qu'est un siège
Un siège est une machine ou une identité de service active, pas une personne, et il n'est facturé que s'il a été actif trois jours ou plus dans le mois. La CI et les exécuteurs éphémères ne comptent pas.
Votre premier mois est un mois de calibrage
Il n'y a ni offre gratuite ni essai : ce que vous pouvez vérifier avant de payer, ce sont les mesures publiques du produit. Votre premier mois est un mois de calibrage, et il est payant : vous ne payez que le siège, nous mesurons tout votre trafic et nous ne prenons aucune commission — à la clôture, vous verrez le relevé exact de ce que cela aurait coûté.
- 1
Connectez
Savings se place devant vos appels aux modèles et commence à compter avec le compteur de votre propre fournisseur.
- 2
Calibrez
Le premier mois, vous ne payez que le siège : nous mesurons tout votre trafic réel et ne prenons aucune commission.
- 3
Décidez
À la clôture, vous recevez le relevé exact de ce que cela aurait coûté. Ensuite, la commission sort de l'économie mesurée, jamais de votre poche.
Les taux exacts vivent dans la tarification du produit et ne sont pas recopiés ici, pour que personne ne lise sur cette page un chiffre déjà périmé.
bivelio-savings-layer · apps/web/lib/billing/tarifa.ts · caa7310 · 2026-09-12
Questions fréquentes sur Savings
Comment BV-SALA mesure et réduit votre facture de LLM.
Réduit-il vraiment ma facture de LLM ?
Oui, et nous ne vous demandons pas de nous croire sur parole : chaque chiffre de la page est mesuré face au compteur du fournisseur lui-même, avec son intervalle de confiance à côté. Nous rapportons le plancher à 95 % — l'économie prudente —, jamais l'estimation flatteuse.
Comment l'économie est-elle mesurée ?
Avec un banc A/B : pour chaque scénario, la requête non optimisée et la requête BV-SALA partent vers le même modèle, les deux sont chiffrées au compteur du fournisseur, et nous publions la borne inférieure de l'intervalle de confiance à 95 %. Il y a deux bras de contrôle — une intégration non optimisée et la même intégration déjà optimisée à la main — et les scénarios sont agrégés par un bootstrap stratifié, poids un par scénario. Sans référence modélisée ni hypothèses.
Est-ce que cela dégrade la qualité des réponses ?
Non. BV-SALA choisit, pour chaque requête, l'exécution la moins chère qui respecte encore votre contrat de qualité. Si réduire le coût compromettait la qualité que vous avez fixée, il ne le fait pas : l'économie ne se fait jamais au détriment du résultat.
Avec quels fournisseurs cela fonctionne-t-il ?
Deux choses à ne pas confondre. Compatibilité : il se place devant votre fournisseur et fonctionne avec tout endpoint compatible avec l'API OpenAI, plus l'adaptateur natif Anthropic. Mesure : aujourd'hui il n'existe qu'un seul chiffre publié, celui d'OpenAI gpt-4o-mini, mesuré au compteur du fournisseur lui-même. Qu'une marque soit compatible ne veut pas dire qu'elle soit mesurée ; quand nous en mesurerons une autre, nous publierons son chiffre avec son modèle à côté.
Comment cela s'installe-t-il ?
En cinq lignes. C'est un SDK sous licence pour Node.js (@bivelio/savings-layer) ; la licence s'active depuis votre tableau de bord et fonctionne devant votre intégration actuelle sans avoir à la réécrire.
Combien ça coûte ?
Une redevance par siège plus une commission par paliers sur l'économie mesurée, dès le premier euro. Un siège est une machine ou une identité de service active, pas une personne. Ni offre gratuite ni essai : votre premier mois est un mois de calibrage — vous ne payez que le siège et nous ne prenons aucune commission. Et un mois sans économie est un mois sans commission.
Réserver un appel de 15 min
Nous vous disons ce que vous économiseriez avec votre trafic, sans rien installer.