Reduce el coste de tus aplicaciones de IA sin cambiar de proveedor ni degradar la calidad.
Savings analiza cada petición, evita ejecuciones innecesarias, elimina contexto redundante y selecciona la opción más económica que sigue cumpliendo tu contrato de calidad. Cada cifra publicada está medida contra el contador del propio proveedor.
Instalación en cinco líneas. La licencia se activa desde tu panel.
Se instala delante de estos proveedores
gpt-4o-miniAnthropicGeminiresolutores · singleflight · avoided_calls
herramientas podadas · recuperación · contexto redundante · eliminated_tokens
codificación más ligera · solo si sale a cuenta · compressed_tokens
Gana la ejecución más barata
OpenAI gpt-4o-mini
≥ 20,0 % menos factura, verificado al 95 % · frente a una integración sin optimizar, sin streaming
El segundo control
Frente a una integración que ya estaba optimizada a mano
Aquí cada escenario se ejecuta también contra una integración que un integrador diligente ya habría afinado: la caché nativa del proveedor configurada sobre el prefijo estable, y solo las herramientas que la tarea necesita de verdad, elegidas una a una. Todo lo demás —contrato, tope, temperatura y semilla— es idéntico.
23,2 %
Frente a una integración sin optimizar
Casi todo el mundo se compara con una integración ingenua, y frente a esa cualquiera sale bien.
22,9 %
Frente a una integración ya optimizada a mano
Esa segunda comparación es la única que mide mérito de la capa: lo que queda por ahorrar cuando ya no hay fruta madura.
Anunciamos siempre la menor de las dos cifras, y las dos salen del mismo artefacto público: prometer por encima del segundo control sería venderte como mérito nuestro lo que tú ya tenías.
medido en gpt-4o-mini · suelo del 95 % · d1c8233 · 2026-09-12 · 193
Evita la llamada por completo
resolutores · singleflight
avoided_calls
Quita lo que no hacía falta enviar
herramientas podadas · recuperación · contexto redundante
eliminated_tokens
Comprime lo que queda
codificación más ligera · solo si sale a cuenta
compressed_tokens
Cada paso cae en UN libro contable distinto, así que estas cifras no se suman entre sí. Un paso cuyo libro no despeja el cero no aparece aquí. Un porcentaje sin su modelo al lado no significa nada: la misma palanca puede ahorrar en un modelo y costar en otro.
Cómo se miden los ahorros — y los ensayos, publicados uno por uno.
Los dos brazos se miden con el contador del propio proveedor — sin línea base modelada. Para cada escenario, el banco envía al mismo modelo la petición sin optimizar y la petición de BV-SALA, cotiza ambas con el uso de tokens que declara el proveedor y agrega los escenarios con un bootstrap estratificado, con peso uno por escenario: así el titular no depende de cuántas repeticiones tocaron a cada caso. El agregado agrupado sigue en el artefacto como aggregatePooled, marcado como lo que es: no es el titular. Se publica el suelo del intervalo de confianza del 95 %, nunca la estimación puntual.
- Mismo modelo, dos brazos: la petición ingenua frente a la petición BV-SALA.
- Coste cotizado con el tokenizador del propio proveedor — sin línea base modelada.
- Se publica el suelo del intervalo de confianza del 95 %, nunca la estimación halagadora.
- Dos brazos de control: frente a una integración sin optimizar y frente a la misma integración ya optimizada a mano. Solo la segunda cifra es mérito de la capa.
- Los libros que no despejan el cero se publican igual, con su etiqueta.
Descargar los ensayos crudos (CSV) d1c8233 · 2026-09-12 · 193 · gpt-4o-mini
Compruébalo con tus propios datos, antes de instalar nada
El verificador corre el optimizador real en tu navegador: eliges un ejemplo o pegas tus propios datos, dices cuánto usas la API y ves el ahorro proyectado con el mismo cálculo que después firma tu recibo. Nada de lo que pegues sale de la página.
El verificador vive dentro del producto, en tu panel de Savings — no es una calculadora de marketing aparte.
Hecho para desarrolladores
Menos dolores de cabeza con la factura. Sin cambiar de proveedor.
Tres hechos sobre el paquete. Ninguno es una promesa.
Instalación en cinco líneas
npm install @bivelio/savings-layerSDK con licencia para Node.js; la licencia se activa desde tu panel. Funciona con cualquier endpoint compatible con la API de OpenAI y con el adaptador nativo de Anthropic.
npmjs.com/package/@bivelio/savings-layer ↗- 01
Cero dependencias de runtime
Un solo bundle ESM. Nada se instala junto a tu código que no hayamos escrito nosotros; el tokenizador exacto es un peer opcional.
- 02
Un SavingsReport por llamada
Libros contables que nunca se suman, el coste con su base —medido o estimado— y trazas por etapa. Es lo mismo que lee tu panel.
- 03
Tu tráfico sigue yendo directo
El SDK envuelve la llamada dentro de tu proceso. Tus prompts no pasan por BiVelio: a nosotros solo llegan recuentos y coste.
Tres carriles que no se suman — y solo se factura uno
Cada recibo separa el ahorro según lo que se puede probar de él, porque no toda prueba vale lo mismo. Sumar los tres daría un número más grande y menos cierto: por eso no se suman nunca.
Medido
El proveedor declaró los mismos tokens y se pagó otra tarifa: es una resta entre dos precios públicos y la puedes contrastar con la consola de tu proveedor, línea a línea.
medido · se facturaDel proveedor
Su propio contador dice cuántos tokens borró. El conteo es suyo, no nuestro; lo que valen en dinero depende del precio al que se habrían pagado, y esa parte es una estimación nuestra. Se enseña, no se cobra.
estimado · no se facturaHipotético
Lo que una política habría ahorrado si se hubiera aplicado. Sale de simular el turno: nadie ejecutó nada. Puede salir negativo, y se enseña igual. Jamás se cobra.
simulado · no se facturaSolo se factura el carril medido. Lo estimado y lo hipotético no entran en tu factura aunque salgan más grandes — y si una cifra no se puede contrastar con la factura de tu proveedor, lo dice en la misma línea en la que aparece.
bvsala · terminales de código
¿Claude Code con API key? Mira su gasto real, token a token.
Un solo comando pone un medidor local delante de tu terminal. Sin tocar código y sin configurar nada — y tus prompts jamás salen de tu máquina: al panel solo llegan conteos y coste.
Un comando, cero configuración
bvsala claude
bvsala doctorFunciona con Claude Code, Codex CLI, Goose y Qwen Code — y bvsala doctor imprime la configuración exacta del resto.
- El gateway se levanta en un puerto efímero, lanza tu terminal apuntándole y se apaga al salir.
- Tu gasto aparece en el panel token a token, contado con el contador de tu propio proveedor.
- bvsala doctor solo comprueba existencia: su informe enseña rutas, jamás el contenido de tus ficheros de configuración.
Hoy el gateway mide; la optimización automática ahí todavía no está.
savings-mode · skill gratuito
El skill que estira tus topes de suscripción
Sin factura también hay dolor: la ventana de cinco horas y el tope semanal. savings-mode es un skill de instrucciones puras —sin proxy, sin tocar tu tráfico— que recorta las dos masas que de verdad queman tope: la salida del modelo y los resultados de herramientas.
Claude Code
Un solo comando: se instala en ~/.claude/skills y se activa solo cuando la conversación habla de límites o de ahorrar tokens.
~/.claude/skillsCodex
No tiene skills, así que la misma disciplina viaja como bloque marcado dentro de tu AGENTS.md: siempre activa, y se apaga borrando el bloque. Tu AGENTS.md fuera de las marcas no se toca jamás.
AGENTS.mdClaude.ai
El skill viaja como zip: activas «Code execution and file creation» en los ajustes, lo subes en Customize → Skills y aparece con su propio interruptor, privado en tu cuenta. La descarga pide tu cuenta de Savings, que es gratuita; el skill en sí no lleva telemetría ninguna.
savings-mode.zip
El efecto del propio skill se publicará cuando esté medido en A/B — nunca antes.
Es gratis; lo que se paga con Savings es saber cuánto te ahorra.
El modelo comercial
Cómo se calcula lo que nos pagas
Una cuota por asiento, y una comisión que sale del ahorro medido — nunca de tu bolsillo.
90 %
Siempre te quedas con el 90 % o más de cada euro ahorrado.
La comisión solo existe cuando existe tu ahorro medido, y ningún tramo supera el tipo máximo.
Solo sobre el ahorro medido
Después, comisión solo sobre el ahorro medido: el que puedes contrastar con la factura de tu proveedor, línea a línea. Lo estimado se enseña, pero no se factura nunca.
Por tramos marginales
Por tramos marginales, cada tramo a su tipo y desde el primer euro medido: cuanto más ahorras, menor es el porcentaje que nos llevamos.
Sin permanencia
¿Un mes sin ahorro? Ese mes no hay comisión. Sin permanencia — y tu primera factura variable solo contiene números que ya viste en tu extracto.
Qué es un asiento
Un asiento es una máquina o identidad de servicio activa, no una persona, y solo se factura si ha estado activa tres o más días en el mes. La CI y los ejecutores efímeros no cuentan.
Tu primer mes es de calibración
No hay plan gratuito ni prueba: lo que puedes comprobar antes de pagar son las mediciones públicas del producto. Tu primer mes es de calibración y es de pago: pagas solo el asiento, medimos todo tu tráfico y no cobramos comisión — al cierre verás el extracto exacto de lo que habría costado.
- 1
Conecta
Savings se sitúa delante de tus llamadas a modelos y empieza a contar con el contador de tu propio proveedor.
- 2
Calibra
Durante el primer mes pagas solo el asiento: medimos todo tu tráfico real y no cobramos comisión.
- 3
Decide
Al cierre recibes el extracto exacto de lo que habría costado. A partir de ahí, la comisión sale del ahorro medido, nunca de tu bolsillo.
Los tipos exactos viven en la tarifa del producto y no se copian aquí, para que nadie lea en esta página una cifra que ya ha cambiado.
bivelio-savings-layer · apps/web/lib/billing/tarifa.ts · caa7310 · 2026-09-12
Preguntas frecuentes sobre Savings
Cómo BV-SALA mide y recorta tu factura de LLM.
¿De verdad reduce mi factura de LLM?
Sí, y no te pedimos que lo creas: cada cifra de la página está medida contra el contador del propio proveedor, con su intervalo de confianza al lado. Reportamos el suelo del 95 % —el ahorro conservador—, nunca la estimación halagadora.
¿Cómo se mide el ahorro?
Con un banco A/B: para cada escenario se envía al mismo modelo la petición sin optimizar y la de BV-SALA, se cotizan ambas con el contador del propio proveedor y se informa el límite inferior del intervalo de confianza del 95 %. Hay dos brazos de control —una integración sin optimizar y la misma integración ya optimizada a mano— y los escenarios se agregan con un bootstrap estratificado, con peso uno por escenario. Sin línea base modelada ni supuestos.
¿Empeora la calidad de las respuestas?
No. BV-SALA elige, en cada petición, la ejecución más barata que aún cumple tu contrato de calidad. Si abaratar comprometiera la calidad que has fijado, no lo hace: el ahorro nunca sale a costa del resultado.
¿Con qué proveedores funciona?
Hay que separar dos cosas. Compatibilidad: se sitúa delante de tu proveedor y funciona con cualquier endpoint compatible con la API de OpenAI, más el adaptador nativo de Anthropic. Medición: hoy solo hay una cifra publicada, la de OpenAI gpt-4o-mini, medida contra el contador del propio proveedor. Que una marca sea compatible no significa que esté medida; cuando midamos otra, publicaremos su cifra con su modelo al lado.
¿Cómo se instala?
En cinco líneas. Es un SDK con licencia para Node.js (@bivelio/savings-layer); la licencia se activa desde tu panel y funciona delante de tu integración actual sin reescribirla.
¿Cuánto cuesta?
Una cuota por asiento más una comisión por tramos sobre el ahorro medido, desde el primer euro. Un asiento es una máquina o identidad de servicio activa, no una persona. No hay plan gratuito ni prueba: tu primer mes es de calibración — pagas solo el asiento y no cobramos comisión. Y si un mes no ahorras, ese mes no pagas comisión.
Reserva una llamada de 15 min
Te decimos qué ahorrarías con tu tráfico, sin instalar nada.