Novo: Intake — do documento ao dado verificado, com evidência
Camada de custo para LLM · SDK com licença

Reduz o custo das tuas aplicações de IA sem mudar de fornecedor nem degradar a qualidade.

O Savings analisa cada pedido, evita execuções desnecessárias, elimina contexto redundante e escolhe a opção mais económica que continua a cumprir o teu contrato de qualidade. Cada número publicado é medido contra o contador do próprio fornecedor.

Instalação em cinco linhas. A licença ativa-se a partir do seu painel.

Medido contra fornecedor real

OpenAIAnthropicGemini
BV-SALAmedido · piso dos 95 %
01Evita a chamada por completo17.9%

resolvedores · cache exata · singleflight

02Retira o que não era preciso enviar38.6%

ferramentas podadas · recuperação · contexto redundante

03Comprime o que resta45.1%

codificação mais leve · só se compensar

Comece só a medir

Introduzir uma camada nova em produção mete respeito. Por isso o Savings arranca em modo só-medição.

  1. 1

    Ligue

    O Savings coloca-se à frente das suas chamadas a modelos, sem modificar nenhuma.

  2. 2

    Meça

    Durante um período inicial só observa: tráfego real, custo real, qualidade real.

  3. 3

    Decida

    Recebe o relatório de quanto pouparia e decide se ativa a otimização. Até lá, nada muda.

Ganha a execução mais barata

medido · piso dos 95 %

OpenAI gpt-4o-mini

≥ 23,1 % menos fatura, verificado a 95 %

Anthropic claude-sonnet-4-5

78 % menos custo com cache de prefixo

0117.9%

Evita a chamada por completo

resolvedores · cache exata · singleflight

0238.6%

Retira o que não era preciso enviar

ferramentas podadas · recuperação · contexto redundante

0345.1%

Comprime o que resta

codificação mais leve · só se compensar

Cada passo cai num livro-razão distinto, pelo que estes números não se somam entre si. Um passo cujo livro não sai do zero não aparece aqui.

Como se medem as poupanças — reproduzível

Ambos os braços são medidos com o tokenizador do próprio fornecedor — sem linha de base modelada. O benchmark A/B envia, para cada cenário, um pedido ingénuo e o pedido do BV-SALA ao mesmo modelo, calcula o preço de ambos a partir do uso de tokens reportado pelo fornecedor e apresenta o limite inferior do intervalo de confiança de 95 % — nunca a estimativa pontual mais lisonjeira.

Instalação em cinco linhas

npm install @bivelio/savings-layer

SDK com licença para Node.js; a licença ativa-se a partir do seu painel. Funciona com OpenAI, Anthropic e Google.

npmjs.com/package/@bivelio/savings-layer ↗

Agenda uma chamada de 15 min

Dizemos-lhe quanto pouparia com o seu tráfego, sem instalar nada.

Perguntas frequentes sobre o Savings

Como o BV-SALA mede e reduz a tua fatura de LLM.

Reduz mesmo a minha fatura de LLM?

Sim, e não te pedimos que acredites: cada número da página está medido contra o contador do próprio fornecedor, com o seu intervalo de confiança ao lado. Reportamos o piso dos 95 % —a poupança conservadora—, nunca a estimativa lisonjeira.

Como se mede a poupança?

Com um benchmark A/B: para cada cenário envia-se ao mesmo modelo um pedido ingénuo e o do BV-SALA, cotam-se ambos com o tokenizador do próprio fornecedor e reporta-se o limite inferior do intervalo de confiança de 95 %. Sem linha de base modelada nem pressupostos.

Piora a qualidade das respostas?

Não. O BV-SALA escolhe, em cada pedido, a execução mais barata que ainda cumpre o teu contrato de qualidade. Se baratear comprometesse a qualidade que definiste, não o faz: a poupança nunca sai à custa do resultado.

Com que fornecedores funciona?

Coloca-se à frente do teu fornecedor e mede contra o contador dele. Hoje cobre OpenAI, Anthropic e Google, com a mesma metodologia de medição para todos.

Como se instala?

Em cinco linhas. É um SDK licenciado para Node.js (@bivelio/savings-layer); a licença ativa-se a partir do teu painel e funciona à frente da tua integração atual sem a reescrever.

Quanto custa?

A licença ativa-se a partir do teu painel; consulta os preços no próprio produto. A poupança medida foi pensada para superar folgadamente o custo da camada.