BiVelio entra en el NVIDIA Inception ProgramNVIDIA Inception Program
Capa de coste para LLM · SDK con licencia

Reduce el coste de tus aplicaciones de IA sin cambiar de proveedor ni degradar la calidad.

Savings analiza cada petición, evita ejecuciones innecesarias, elimina contexto redundante y selecciona la opción más económica que sigue cumpliendo tu contrato de calidad. Cada cifra publicada está medida contra el contador del propio proveedor.

Instalación en cinco líneas. La licencia se activa desde tu panel.

Se instala delante de estos proveedores

OpenAIgpt-4o-miniAnthropicGemini
BV-SALAmedido en gpt-4o-mini · suelo del 95 %
tráfico entrantechat · gpt-4o-mini
01Evita la llamada por completo22,0 %

resolutores · singleflight · avoided_calls

02Quita lo que no hacía falta enviar43,2 %

herramientas podadas · recuperación · contexto redundante · eliminated_tokens

03Comprime lo que queda20,1 %

codificación más ligera · solo si sale a cuenta · compressed_tokens

Llamadas analizadas: Flujo ilustrativo. Los porcentajes que aparecen salen del extracto medido en gpt-4o-mini, no del dibujo.

Gana la ejecución más barata

medido en gpt-4o-mini · suelo del 95 %

OpenAI gpt-4o-mini

≥ 20,0 % menos factura, verificado al 95 % · frente a una integración sin optimizar, sin streaming

El segundo control

Frente a una integración que ya estaba optimizada a mano

Aquí cada escenario se ejecuta también contra una integración que un integrador diligente ya habría afinado: la caché nativa del proveedor configurada sobre el prefijo estable, y solo las herramientas que la tarea necesita de verdad, elegidas una a una. Todo lo demás —contrato, tope, temperatura y semilla— es idéntico.

B0

23,2 %

Frente a una integración sin optimizar

Casi todo el mundo se compara con una integración ingenua, y frente a esa cualquiera sale bien.

B1mérito de la capa

22,9 %

Frente a una integración ya optimizada a mano

Esa segunda comparación es la única que mide mérito de la capa: lo que queda por ahorrar cuando ya no hay fruta madura.

Anunciamos siempre la menor de las dos cifras, y las dos salen del mismo artefacto público: prometer por encima del segundo control sería venderte como mérito nuestro lo que tú ya tenías.

medido en gpt-4o-mini · suelo del 95 % · d1c8233 · 2026-09-12 · 193

0122,0 %

Evita la llamada por completo

resolutores · singleflight

avoided_calls

0243,2 %

Quita lo que no hacía falta enviar

herramientas podadas · recuperación · contexto redundante

eliminated_tokens

0320,1 %

Comprime lo que queda

codificación más ligera · solo si sale a cuenta

compressed_tokens

Cada paso cae en UN libro contable distinto, así que estas cifras no se suman entre sí. Un paso cuyo libro no despeja el cero no aparece aquí. Un porcentaje sin su modelo al lado no significa nada: la misma palanca puede ahorrar en un modelo y costar en otro.

Cómo se miden los ahorros — y los ensayos, publicados uno por uno.

Los dos brazos se miden con el contador del propio proveedor — sin línea base modelada. Para cada escenario, el banco envía al mismo modelo la petición sin optimizar y la petición de BV-SALA, cotiza ambas con el uso de tokens que declara el proveedor y agrega los escenarios con un bootstrap estratificado, con peso uno por escenario: así el titular no depende de cuántas repeticiones tocaron a cada caso. El agregado agrupado sigue en el artefacto como aggregatePooled, marcado como lo que es: no es el titular. Se publica el suelo del intervalo de confianza del 95 %, nunca la estimación puntual.

  • Mismo modelo, dos brazos: la petición ingenua frente a la petición BV-SALA.
  • Coste cotizado con el tokenizador del propio proveedor — sin línea base modelada.
  • Se publica el suelo del intervalo de confianza del 95 %, nunca la estimación halagadora.
  • Dos brazos de control: frente a una integración sin optimizar y frente a la misma integración ya optimizada a mano. Solo la segunda cifra es mérito de la capa.
  • Los libros que no despejan el cero se publican igual, con su etiqueta.

Descargar los ensayos crudos (CSV) d1c8233 · 2026-09-12 · 193 · gpt-4o-mini

Compruébalo con tus propios datos, antes de instalar nada

El verificador corre el optimizador real en tu navegador: eliges un ejemplo o pegas tus propios datos, dices cuánto usas la API y ves el ahorro proyectado con el mismo cálculo que después firma tu recibo. Nada de lo que pegues sale de la página.

El verificador vive dentro del producto, en tu panel de Savings — no es una calculadora de marketing aparte.

Hecho para desarrolladores

Menos dolores de cabeza con la factura. Sin cambiar de proveedor.

Tres hechos sobre el paquete. Ninguno es una promesa.

Instalación en cinco líneas

npm install @bivelio/savings-layer

SDK con licencia para Node.js; la licencia se activa desde tu panel. Funciona con cualquier endpoint compatible con la API de OpenAI y con el adaptador nativo de Anthropic.

npmjs.com/package/@bivelio/savings-layer ↗
  1. 01

    Cero dependencias de runtime

    Un solo bundle ESM. Nada se instala junto a tu código que no hayamos escrito nosotros; el tokenizador exacto es un peer opcional.

  2. 02

    Un SavingsReport por llamada

    Libros contables que nunca se suman, el coste con su base —medido o estimado— y trazas por etapa. Es lo mismo que lee tu panel.

  3. 03

    Tu tráfico sigue yendo directo

    El SDK envuelve la llamada dentro de tu proceso. Tus prompts no pasan por BiVelio: a nosotros solo llegan recuentos y coste.

Tres carriles que no se suman — y solo se factura uno

Cada recibo separa el ahorro según lo que se puede probar de él, porque no toda prueba vale lo mismo. Sumar los tres daría un número más grande y menos cierto: por eso no se suman nunca.

Medido

El proveedor declaró los mismos tokens y se pagó otra tarifa: es una resta entre dos precios públicos y la puedes contrastar con la consola de tu proveedor, línea a línea.

medido · se factura

Del proveedor

Su propio contador dice cuántos tokens borró. El conteo es suyo, no nuestro; lo que valen en dinero depende del precio al que se habrían pagado, y esa parte es una estimación nuestra. Se enseña, no se cobra.

estimado · no se factura

Hipotético

Lo que una política habría ahorrado si se hubiera aplicado. Sale de simular el turno: nadie ejecutó nada. Puede salir negativo, y se enseña igual. Jamás se cobra.

simulado · no se factura

Solo se factura el carril medido. Lo estimado y lo hipotético no entran en tu factura aunque salgan más grandes — y si una cifra no se puede contrastar con la factura de tu proveedor, lo dice en la misma línea en la que aparece.

bvsala · terminales de código

¿Claude Code con API key? Mira su gasto real, token a token.

Un solo comando pone un medidor local delante de tu terminal. Sin tocar código y sin configurar nada — y tus prompts jamás salen de tu máquina: al panel solo llegan conteos y coste.

Un comando, cero configuración

bvsala claude
bvsala doctor

Funciona con Claude Code, Codex CLI, Goose y Qwen Code — y bvsala doctor imprime la configuración exacta del resto.

Claude CodeCodex CLIGooseQwen Code
  • El gateway se levanta en un puerto efímero, lanza tu terminal apuntándole y se apaga al salir.
  • Tu gasto aparece en el panel token a token, contado con el contador de tu propio proveedor.
  • bvsala doctor solo comprueba existencia: su informe enseña rutas, jamás el contenido de tus ficheros de configuración.

Hoy el gateway mide; la optimización automática ahí todavía no está.

savings-mode · skill gratuito

El skill que estira tus topes de suscripción

Sin factura también hay dolor: la ventana de cinco horas y el tope semanal. savings-mode es un skill de instrucciones puras —sin proxy, sin tocar tu tráfico— que recorta las dos masas que de verdad queman tope: la salida del modelo y los resultados de herramientas.

  1. Claude Code

    Un solo comando: se instala en ~/.claude/skills y se activa solo cuando la conversación habla de límites o de ahorrar tokens.

    ~/.claude/skills
  2. Codex

    No tiene skills, así que la misma disciplina viaja como bloque marcado dentro de tu AGENTS.md: siempre activa, y se apaga borrando el bloque. Tu AGENTS.md fuera de las marcas no se toca jamás.

    AGENTS.md
  3. Claude.ai

    El skill viaja como zip: activas «Code execution and file creation» en los ajustes, lo subes en Customize → Skills y aparece con su propio interruptor, privado en tu cuenta. La descarga pide tu cuenta de Savings, que es gratuita; el skill en sí no lleva telemetría ninguna.

    savings-mode.zip

El efecto del propio skill se publicará cuando esté medido en A/B — nunca antes.

Es gratis; lo que se paga con Savings es saber cuánto te ahorra.

El modelo comercial

Cómo se calcula lo que nos pagas

Una cuota por asiento, y una comisión que sale del ahorro medido — nunca de tu bolsillo.

90 %

Siempre te quedas con el 90 % o más de cada euro ahorrado.

La comisión solo existe cuando existe tu ahorro medido, y ningún tramo supera el tipo máximo.

Solo sobre el ahorro medido

Después, comisión solo sobre el ahorro medido: el que puedes contrastar con la factura de tu proveedor, línea a línea. Lo estimado se enseña, pero no se factura nunca.

Por tramos marginales

Por tramos marginales, cada tramo a su tipo y desde el primer euro medido: cuanto más ahorras, menor es el porcentaje que nos llevamos.

Sin permanencia

¿Un mes sin ahorro? Ese mes no hay comisión. Sin permanencia — y tu primera factura variable solo contiene números que ya viste en tu extracto.

Qué es un asiento

Un asiento es una máquina o identidad de servicio activa, no una persona, y solo se factura si ha estado activa tres o más días en el mes. La CI y los ejecutores efímeros no cuentan.

Tu primer mes es de calibración

No hay plan gratuito ni prueba: lo que puedes comprobar antes de pagar son las mediciones públicas del producto. Tu primer mes es de calibración y es de pago: pagas solo el asiento, medimos todo tu tráfico y no cobramos comisión — al cierre verás el extracto exacto de lo que habría costado.

  1. 1

    Conecta

    Savings se sitúa delante de tus llamadas a modelos y empieza a contar con el contador de tu propio proveedor.

  2. 2

    Calibra

    Durante el primer mes pagas solo el asiento: medimos todo tu tráfico real y no cobramos comisión.

  3. 3

    Decide

    Al cierre recibes el extracto exacto de lo que habría costado. A partir de ahí, la comisión sale del ahorro medido, nunca de tu bolsillo.

Los tipos exactos viven en la tarifa del producto y no se copian aquí, para que nadie lea en esta página una cifra que ya ha cambiado.

bivelio-savings-layer · apps/web/lib/billing/tarifa.ts · caa7310 · 2026-09-12

Preguntas frecuentes sobre Savings

Cómo BV-SALA mide y recorta tu factura de LLM.

¿De verdad reduce mi factura de LLM?

Sí, y no te pedimos que lo creas: cada cifra de la página está medida contra el contador del propio proveedor, con su intervalo de confianza al lado. Reportamos el suelo del 95 % —el ahorro conservador—, nunca la estimación halagadora.

¿Cómo se mide el ahorro?

Con un banco A/B: para cada escenario se envía al mismo modelo la petición sin optimizar y la de BV-SALA, se cotizan ambas con el contador del propio proveedor y se informa el límite inferior del intervalo de confianza del 95 %. Hay dos brazos de control —una integración sin optimizar y la misma integración ya optimizada a mano— y los escenarios se agregan con un bootstrap estratificado, con peso uno por escenario. Sin línea base modelada ni supuestos.

¿Empeora la calidad de las respuestas?

No. BV-SALA elige, en cada petición, la ejecución más barata que aún cumple tu contrato de calidad. Si abaratar comprometiera la calidad que has fijado, no lo hace: el ahorro nunca sale a costa del resultado.

¿Con qué proveedores funciona?

Hay que separar dos cosas. Compatibilidad: se sitúa delante de tu proveedor y funciona con cualquier endpoint compatible con la API de OpenAI, más el adaptador nativo de Anthropic. Medición: hoy solo hay una cifra publicada, la de OpenAI gpt-4o-mini, medida contra el contador del propio proveedor. Que una marca sea compatible no significa que esté medida; cuando midamos otra, publicaremos su cifra con su modelo al lado.

¿Cómo se instala?

En cinco líneas. Es un SDK con licencia para Node.js (@bivelio/savings-layer); la licencia se activa desde tu panel y funciona delante de tu integración actual sin reescribirla.

¿Cuánto cuesta?

Una cuota por asiento más una comisión por tramos sobre el ahorro medido, desde el primer euro. Un asiento es una máquina o identidad de servicio activa, no una persona. No hay plan gratuito ni prueba: tu primer mes es de calibración — pagas solo el asiento y no cobramos comisión. Y si un mes no ahorras, ese mes no pagas comisión.

Reserva una llamada de 15 min

Te decimos qué ahorrarías con tu tráfico, sin instalar nada.