Reduz o custo das tuas aplicações de IA sem mudar de fornecedor nem degradar a qualidade.
O Savings analisa cada pedido, evita execuções desnecessárias, elimina contexto redundante e escolhe a opção mais económica que continua a cumprir o teu contrato de qualidade. Cada número publicado é medido contra o contador do próprio fornecedor.
Instalação em cinco linhas. A licença ativa-se a partir do seu painel.
Medido contra fornecedor real
resolvedores · cache exata · singleflight
ferramentas podadas · recuperação · contexto redundante
codificação mais leve · só se compensar
Comece só a medir
Introduzir uma camada nova em produção mete respeito. Por isso o Savings arranca em modo só-medição.
- 1
Ligue
O Savings coloca-se à frente das suas chamadas a modelos, sem modificar nenhuma.
- 2
Meça
Durante um período inicial só observa: tráfego real, custo real, qualidade real.
- 3
Decida
Recebe o relatório de quanto pouparia e decide se ativa a otimização. Até lá, nada muda.
Ganha a execução mais barata
OpenAI gpt-4o-mini
≥ 23,1 % menos fatura, verificado a 95 %
Anthropic claude-sonnet-4-5
78 % menos custo com cache de prefixo
Evita a chamada por completo
resolvedores · cache exata · singleflight
Retira o que não era preciso enviar
ferramentas podadas · recuperação · contexto redundante
Comprime o que resta
codificação mais leve · só se compensar
Cada passo cai num livro-razão distinto, pelo que estes números não se somam entre si. Um passo cujo livro não sai do zero não aparece aqui.
Como se medem as poupanças — reproduzível
Ambos os braços são medidos com o tokenizador do próprio fornecedor — sem linha de base modelada. O benchmark A/B envia, para cada cenário, um pedido ingénuo e o pedido do BV-SALA ao mesmo modelo, calcula o preço de ambos a partir do uso de tokens reportado pelo fornecedor e apresenta o limite inferior do intervalo de confiança de 95 % — nunca a estimativa pontual mais lisonjeira.
Instalação em cinco linhas
npm install @bivelio/savings-layerSDK com licença para Node.js; a licença ativa-se a partir do seu painel. Funciona com OpenAI, Anthropic e Google.
npmjs.com/package/@bivelio/savings-layer ↗Agenda uma chamada de 15 min
Dizemos-lhe quanto pouparia com o seu tráfego, sem instalar nada.
Perguntas frequentes sobre o Savings
Como o BV-SALA mede e reduz a tua fatura de LLM.
Reduz mesmo a minha fatura de LLM?
Sim, e não te pedimos que acredites: cada número da página está medido contra o contador do próprio fornecedor, com o seu intervalo de confiança ao lado. Reportamos o piso dos 95 % —a poupança conservadora—, nunca a estimativa lisonjeira.
Como se mede a poupança?
Com um benchmark A/B: para cada cenário envia-se ao mesmo modelo um pedido ingénuo e o do BV-SALA, cotam-se ambos com o tokenizador do próprio fornecedor e reporta-se o limite inferior do intervalo de confiança de 95 %. Sem linha de base modelada nem pressupostos.
Piora a qualidade das respostas?
Não. O BV-SALA escolhe, em cada pedido, a execução mais barata que ainda cumpre o teu contrato de qualidade. Se baratear comprometesse a qualidade que definiste, não o faz: a poupança nunca sai à custa do resultado.
Com que fornecedores funciona?
Coloca-se à frente do teu fornecedor e mede contra o contador dele. Hoje cobre OpenAI, Anthropic e Google, com a mesma metodologia de medição para todos.
Como se instala?
Em cinco linhas. É um SDK licenciado para Node.js (@bivelio/savings-layer); a licença ativa-se a partir do teu painel e funciona à frente da tua integração atual sem a reescrever.
Quanto custa?
A licença ativa-se a partir do teu painel; consulta os preços no próprio produto. A poupança medida foi pensada para superar folgadamente o custo da camada.