Cada área abriu a sua
Marketing tem uma assinatura, o dev tem uma chave de API, alguém pagou outra no cartão. Ninguém consegue dizer quanto a empresa gasta com IA no mês.
Uma chave, o catálogo inteiro de modelos. Cada pedido é avaliado antes de sair: dá para responder do cache, num modelo gratuito ou na assinatura que a empresa já paga? A API cara é o último recurso, e o painel mostra quanto isso deixou de sair do caixa.
"Resuma este e-mail em três linhas."
Exemplo de encaminhamento. No seu painel o valor é o real, somado por período, e a camada local não aparece porque é hardware do dono do appliance, não do cliente.
A conta da IA não estoura por causa de um pedido caro; estoura porque mil pedidos baratos foram para o modelo mais caro que estava configurado. O Roteador avalia cada um antes de sair e usa a camada mais barata que dá conta.
Marketing tem uma assinatura, o dev tem uma chave de API, alguém pagou outra no cartão. Ninguém consegue dizer quanto a empresa gasta com IA no mês.
A chave configurada é a que atende tudo. Resumir um e-mail e montar uma estratégia saem pelo mesmo lugar, e pelo mesmo preço.
Uma chave, um fornecedor, um ponto de falha. A instabilidade dele vira o seu problema, e não existe plano B configurado.
Cada chamada que passa pela porta fica registrada: quem pediu, qual camada resolveu, quanto custou e quanto teria custado. É o que transforma "gastamos muito com IA" numa frase com número atrás.

Quanto a empresa deixou de gastar porque o pedido foi resolvido numa camada mais barata. É a métrica que justifica o módulo sozinha.
Se um provedor cai, o tráfego desvia para o próximo sem ninguém acordar. Você não herda o downtime de fornecedor nenhum.
O catálogo inteiro atrás de uma chave só, com o mesmo formato de chamada. Trocar de modelo deixa de ser projeto de migração.
Quem consumiu o quê, por área e por projeto, com teto por chave, para ninguém esvaziar o saldo sem querer.
A decisão é feita antes da chamada sair, e a ordem nunca muda: começa pelo que é grátis e só desce para o pago quando as opções de cima não dão conta.
Pedido idêntico com resposta guardada volta do cache. Custa zero e chega instantâneo: é a camada que mais economiza em operação repetitiva.
Boa parte do trabalho de rotina não precisa do modelo de ponta: resumir, classificar, extrair. Se um gratuito entrega, é ele que responde.
A empresa já tem contas de IA. Elas entram no pool e são usadas até o limite antes de qualquer centavo novo ser gasto.
Quando a tarefa realmente exige o modelo caro, ele é chamado, e o painel registra que ali o gasto foi necessário, não descuido.
Chave direta funciona, gateway de terceiro funciona, e ter um dev cuidando disso funciona. O ponto é quanto cada um custa quando o volume cresce.
Uma chave da Rovemark substitui as chaves dos provedores. Você define o teto de gasto dela na hora de criar.
O gateway aceita o formato que o seu código já usa. Na prática é mudar a URL base e a chave: o resto do código fica igual.
A partir da primeira chamada o painel mostra qual camada resolveu cada pedido e quanto deixou de sair.
Passa a ter um número para "quanto gastamos com IA", e um teto por chave, para o gasto não depender de bom senso.
Para de manter integração por provedor e de acordar quando um deles cai. Um endpoint, e o desvio é automático.
Não escolhe modelo, não pensa em preço, não pede chave para ninguém. Pede o que precisa e recebe.
Gasto e custo evitado por área, projeto e período.
Uma por pessoa ou por projeto, revogável, com limite próprio.
Qual camada resolveu, quanto custou, quanto teria custado.
Quando uma chave passa do teto ou um provedor começa a falhar, o aviso chega onde o time já está.
O Roteador não põe margem por chamada: o crédito consumido é o custo do modelo que respondeu. Quando quem responde é o cache, o gratuito ou a sua própria assinatura, não há crédito nenhum.
O plano gratuito já liga o Roteador com os modelos sem custo por chamada. Dá para atravessar a operação inteira de rotina sem gastar crédito e ver, no painel, quanto isso teria custado por fora.
Ver todos os planosNão. O gateway aceita o formato que a maioria das bibliotecas já usa, então na prática você troca a URL base e a chave. O que estava chamando um provedor direto passa a chamar a porta, e o roteamento acontece do outro lado.
A escolha é por capacidade, não por sorteio: cada tipo de tarefa tem um piso de qualidade, e um modelo só entra se dá conta daquele piso. Você também pode fixar um modelo específico para uma rota quando quiser: a economia é o padrão, não uma obrigação.
É justamente o ponto. As contas que a empresa já paga entram no pool e são usadas até o limite antes de qualquer gasto novo: muita gente descobre aqui que estava pagando duas vezes pela mesma capacidade.
Ela degrada limpo: devolve uma resposta explícita de indisponibilidade em vez de travar, e o seu código trata como trataria a queda de qualquer provedor. Nada fica pendurado esperando.
O que fica guardado é seu, cifrado com a sua chave, e existe para o cache e para o histórico que você mesmo consulta. Sai inteiro no dia que você quiser e não vira treino de modelo de ninguém.
Todo pedido de todos os módulos sai por aqui, por isso a economia do Roteador aparece na conta do sistema inteiro, não só de quem chama a API na mão.

Cada um resolve uma frente, e todos escrevem na mesma memória. Veja os outros e como eles se encaixam neste.