Pular para conteúdo principal

Roteamento de LLM: o que fazer quando o preço do token muda

Rafael Torres
Rafael Torres11 de setembro de 20265 min. de leitura
Roteamento de LLM: o que fazer quando o preço do token muda

Quando o preço do token muda, o custo de uma rota fixa de LLM muda junto, sem aviso. O procedimento: re-ler a tabela de preços com data de leitura, recalcular o custo da rota fixa com o perfil de consumo real, comparar com a alternativa roteada e fixar a cadência de re-avaliação.

O aviso vem dos dados. Entre as leituras de 17 de agosto e 7 de setembro de 2026 na Artificial Analysis, o GPT-5.6 Sol, modelo topo de linha, cortou o preço de input em 20% e o de output em 33%. No mesmo intervalo de 21 dias, o DeepSeek V4 Flash 0731, categoria econômica, subiu 214% no input e 371% no output. Mesma janela, direções opostas.

A premissa que quebra é operacional: a tabela de preços de modelos de IA deixou de ser insumo anual e virou insumo que se move no mês. Este guia executa a re-decisão em cinco passos, com esses dois modelos como exemplo corrido, e mostra onde o middleware do stack de IA em escala absorve o movimento sem renegociar contrato e sem reintegrar código.

O roteiro completo:

  1. Fixar o perfil de consumo por modelo, separando input e output.
  2. Ler a tabela de preços com data de leitura anotada.
  3. Recalcular o custo da rota fixa com o perfil real.
  4. Comparar rota fixa contra rota roteada.
  5. Fixar a cadência de re-avaliação e a regra de re-decisão.

O que você precisa antes de redecidir a rota

A redecisão de rota é uma conta com três insumos. Sem perfil de consumo, porcentagem é abstrato. Sem data de leitura, comparação entre tabelas é inválida. Sem a política de rota atual, não existe linha de base para medir o efeito da mudança. Nada disso exige ferramenta nova, e nenhum passo depende do fornecedor do modelo.

Três itens, nesta ordem:

  1. Perfil de consumo por modelo. Milhões de tokens de input e de output por mês, separados por modelo, lidos do rastro de chamadas ou da fatura. Um total agregado serve para contabilidade, não para decisão de rota.
  2. Tabela de preços com data de leitura. Preço de input e de output por milhão de tokens, o tier contratado, a fonte e o dia da leitura anotados junto ao número, porque preço sem data não é dado, é memória.
  3. Política de rota atual. Qual modelo atende qual carga hoje e sob qual regra, para que a comparação do Passo 4 tenha linha de base.

Passo 1: Fixar o perfil de consumo por modelo

O perfil de consumo converte porcentagem em dinheiro: milhões de tokens de input e output por modelo, por mês, lidos do rastro de chamadas. Com ele, a re-precificação do modelo topo vira US$400 por mês na rota, US$300 do output e US$100 do input, e a do modelo econômico vira US$61,20, US$31,20 do output e US$30 do input, no exemplo do Passo 3. Sem perfil, porcentagem é ruído.

O perfil mora no rastro de auditoria das chamadas do gateway, nos relatórios de consumo do provedor ou na planilha do time de dados. A separação entre input e output é invariável, porque os dois têm preços diferentes e, nesta janela, movimentos diferentes: o output carregou o corte de 33% do modelo topo e a alta de 371% do modelo econômico, entre as leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis.

A composição da carga também entra. Extração de dados estruturados e sumarização de documentos são cargas de input pesado. Geração de relatórios e de código é output pesado. Duas cargas com o mesmo total de tokens pagam contas diferentes, e o perfil é o que mostra qual conta é a sua.

Passo 2: Ler a tabela de preços com data de leitura

A tabela de preços de modelos de IA é um documento que se move, então a leitura vale pelo dia em que foi feita. Anote preço de input e de output por milhão de tokens, o tier contratado, a fonte e a data. Duas leituras separadas por 21 dias foram suficientes para mover os dois modelos em direções opostas.

As duas leituras deste guia:

ModeloInput / output na leitura de 2026-08-17Input / output na leitura de 2026-09-07Delta de inputDelta de output
GPT-5.6 SolUS$5,00 / US$30,00US$4,00 / US$20,00-20%-33%
DeepSeek V4 Flash 0731US$0,14 / US$0,28US$0,44 / US$1,32+214%+371%

Valores por milhão de tokens, no tier máximo listado em cada data. Fonte: Artificial Analysis, leituras de 2026-08-17 e 2026-09-07.

A leitura corrente é que preço de modelo de IA só desce. Esta janela é a refutação com dois números datados: o modelo topo cortou preço enquanto o modelo econômico subia, dentro de 21 dias.

Tendência de fundo não é operação.

A mesma janela trouxe um segundo movimento, de placar e não de preço: a Artificial Analysis re-baseou o Intelligence Index para a versão 4.2 em 4 de setembro de 2026. Score e preço são leituras separadas; a re-decisão por score está no artigo sobre o re-base do placar de inteligência, e este guia fica na tabela de preços.

Em produção, a leitura datada é o insumo que alimenta a política de roteamento; o pilar do model router mostra como a camada transforma leitura em regra.

Passo 3: Recalcular o custo por token da rota fixa

O recálculo multiplica o perfil de consumo pelos preços datados, duas vezes: uma com a tabela antiga, outra com a tabela nova. A diferença é o quanto a rota fixa mudou de custo sem nenhuma decisão sua. O exemplo abaixo usa o perfil ilustrativo de 100 milhões de tokens de input e 30 milhões de output por mês.

GPT-5.6 Sol, tabela de 2026-08-17: 100 milhões de input × US$5,00 = US$500; 30 milhões de output × US$30,00 = US$900. Total: US$1.400 por mês.

GPT-5.6 Sol, tabela de 2026-09-07: input a US$4,00 e output a US$20,00 fecham a mesma rota em US$1.000 por mês: US$400 a menos, uma queda de 28,6% na fatura, percentual que não está na tabela: é o efeito combinado do corte de 20% no input com o de 33% no output.

DeepSeek V4 Flash 0731, tabela de 2026-08-17: 100 milhões de input × US$0,14 = US$14; 30 milhões de output × US$0,28 = US$8,40. Total: US$22,40.

DeepSeek V4 Flash 0731, tabela de 2026-09-07: input a US$0,44 e output a US$1,32 fecham a mesma rota em US$83,60 por mês: US$61,20 a mais, um aumento de 273% na fatura.

Rota fixa (100M input + 30M output por mês)Custo com tabela de 2026-08-17Custo com tabela de 2026-09-07Delta mensal
GPT-5.6 SolUS$1.400,00US$1.000,00-US$400,00 (-28,6%)
DeepSeek V4 Flash 0731US$22,40US$83,60+US$61,20 (+273%)

Fonte dos preços: Artificial Analysis, leituras de 2026-08-17 e 2026-09-07. Perfil: ilustrativo.

Rota fixa re-precificada

A conta expõe o erro que este guia combate. A re-precificação do modelo topo vira US$400 por mês na rota, US$300 do output e US$100 do input, e a do modelo econômico vira US$61,20, US$31,20 do output e US$30 do input: a porcentagem maior pertence à conta menor. A queda secular do preço do token segue real e de longo prazo, mas dentro de três semanas a direção que importa é a do seu perfil, e ela não segue a tendência de mercado.

Passo 4: Comparar a rota fixa com a rota roteada

A comparação transforma o recálculo em decisão. A rota fixa custa o que a tabela nova diz, e o custo vence a cada mudança de preço. A rota roteada terceiriza a re-decisão para uma camada que reavalia modelos por preço e desempenho em tempo real. O que sobra para você é governança, não a leitura da tabela.

CritérioRota fixaRota roteada
Quem lê a tabela de preçosO seu time, a cada mudançaA camada de roteamento, continuamente
Intervalo até o ajuste de custoDias a semanas, o ciclo humano de re-decisãoO tempo de uma reavaliação de modelo
Failover quando um modelo caiManual, com reintegraçãoAutomático, com fallback configurável
Troca de modeloReintegração no códigoTroca de variável de endpoint, sem reintegração
Governança de gastoFatura e planilhaTeto por chave, agente ou projeto, consumo em tempo real

A tabela compara categorias, e vale uma leitura honesta dela. A rota roteada não decide sozinha qual tarefa tolera o modelo econômico: a política é sua, com regras por chave e tetos de gasto. A camada executa. Onde a qualidade exige o modelo topo, a regra fixa esse caminho e o roteamento respeita a regra, porque o default por custo é a decisão errada justamente onde latência ou qualidade são restrições duras. A política de roteamento em produção existe para marcar esses caminhos antes que o custo os decida.

A escolha de rota parece decisão de engenharia e é tomada como tal, no código; no fim do mês ela aparece na fatura como decisão de margem.

O Nexforce Router é essa camada: um gateway de LLM com mais de 300 modelos atrás de uma única API compatível com OpenAI, roteamento inteligente por custo, desempenho, latência e contexto, ranking de modelos em tempo real por preço e desempenho, failover automático com fallback configurável e troca de modelo sem reintegração. A Nexforce declara economia de até 50% no custo por token, número declarado pela própria empresa como teto de posicionamento, não como resultado verificado: a conta da sua rota, feita no Passo 3, é que decide.

Antes de mover a rota, o mesmo prompt roda em paralelo nos modelos candidatos, e a decisão sai de resultado medido, e não de chute. O argumento econômico estático do roteamento já foi defendido no artigo sobre o custo dos modelos de IA; a comparação acima adiciona o tempo: a rota fixa re-precifica quando a tabela muda, e a roteada re-decide. A régua do benchmark de LLMs para CFOs, custo antes de score, se aplica linha a linha: a tabela de preços é a matéria-prima dela.

Passo 5: Fixar a cadência e a regra de re-decisão

Cadência é o que impede a rota fixa de vencer em silêncio de novo. Fixe três coisas: a frequência de leitura da tabela, o limiar de variação que obriga recálculo e a regra que decide entre manter a rota fixa e migrar para a rota roteada. Uma janela de 21 dias bastou para mover preços em 33% e 371%.

Frequência: leitura datada da tabela de preços uma vez por mês, com o histórico guardado, porque comparar a tabela de hoje com a de seis meses atrás sem as intermediárias esconde o momento em que a rota venceu.

Limiar: 10% de variação no custo mensal da rota fixa obriga recálculo. Abaixo disso, ruído. A mudança de preço de modelo de IA é recorrente, e o gatilho é o custo mensal, e não a porcentagem da tabela: a janela deste guia mostrou 371% custando menos, em dólares, do que 28,6%.

Regra: caminho com exigência firme de qualidade ou latência fica em rota fixa monitorada; volume sem política de qualidade migra para a rota roteada. Nenhuma das três exige renegociar contrato nem reintegrar código. Com a camada de roteamento em escala no lugar, a re-decisão vira política no gateway, e a tabela de preços volta a ser insumo, e não evento.

Fluxo de re-decisão de rota

Como confirmar que a decisão valeu

Verificação é comparar o custo efetivo por token antes e depois, no mesmo perfil de consumo, com o rastro de cada chamada. Sem rastro por chamada, a comparação é opinião. Com rastro, o custo por token efetivo da rota aparece no mês seguinte, e a decisão de rota vira número auditável.

O Nexforce Router entrega o rastro que a verificação pede: cada chamada auditável, observabilidade central com logs, métricas e dashboards, e analytics de economia e desempenho por modelo. Três números fecham a verificação. O custo por token efetivo do mês, dividindo a fatura pelo total de tokens servidos. A fatia de chamadas que caiu no fallback, que revela quantas vezes o modelo principal da rota ficou indisponível e quantas vezes o fallback segurou a operação sem que ninguém abrisse chamado. O consumo contra o teto de gasto, que mostra se a governança segurou o mês.

O número final é um só.

Cinco falhas comuns na re-decisão de rota

As falhas abaixo são as cinco que a janela de agosto e setembro de 2026 expõe com mais força. Cada uma tem correção de uma linha, e todas compartilham a mesma raiz: decidir rota com o dado errado, porcentagem sem perfil ou leitura sem data.

Ler porcentagem sem perfil de consumo. A re-precificação do GPT-5.6 Sol vira US$400 por mês no perfil do Passo 3, US$300 do output e US$100 do input, e a do DeepSeek V4 Flash 0731 vira US$61,20, US$31,20 do output e US$30 do input. A porcentagem sem perfil inverte a prioridade da fila. Correção: nenhum número de tabela entra em decisão sem passar pelo perfil real.

Comparar leituras sem data. Sem data de leitura, a comparação entre duas tabelas não compara nada: cada número vale pelo dia em que foi lido, e o dia sumiu. Correção: fonte e data anotados junto a cada preço, como nas leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis.

Olhar só a linha de input. No modelo topo, output é a linha cara da fatura; no modelo econômico desta janela, o input passa a liderar a conta. Os dois movimentos desta janela eram maiores no output, -33% e +371% contra -20% e +214% no input, e quem leu só a primeira linha subestimou a conta. Correção: input e output no recálculo, sempre.

Trocar de modelo por preço e perder a tarefa. O modelo econômico subiu 371% e continua barato em valor absoluto; a pergunta de rota nunca é qual modelo custa menos por token, é qual cumpre a tarefa pelo menor custo por resultado. Correção: comparar dentro da mesma qualidade de entrega, com o mesmo prompt rodado em paralelo antes de migrar.

Tratar re-base de índice como mudança de preço. O Intelligence Index v4.2, re-baseado em 4 de setembro de 2026, mudou o placar de score, não a tabela de preços. Quem confunde as duas leituras redecide rota por um movimento que não tocou o custo. Correção: placar e preço em leituras separadas, cada uma com a sua data.

Perguntas frequentes sobre preço do token e roteamento de LLM

Por que o preço dos modelos de IA muda?

Reprecificação competitiva entre fornecedores, custo de computação que se move e reestruturação de tiers e de contextos longos são os motores mais comuns. Nenhuma tabela vem com aviso prévio: as duas leituras desta janela, de 2026-08-17 e 2026-09-07 na Artificial Analysis, capturaram um corte de até 33% e uma alta de até 371% sem nota explicativa registrada nas páginas de preço consultadas. O preço é decisão do fornecedor, e a defesa é cadência de leitura, não adivinhação.

Quanto muda o custo quando o preço do token muda?

Depende do perfil de consumo, e a resposta para cada caso: no perfil ilustrativo de 100 milhões de input e 30 milhões de output por mês, o corte no modelo topo vale US$400 por mês e a alta no modelo econômico vale US$61,20. Um perfil três vezes maior multiplica os dois valores por três. Porcentagem sem perfil não responde. Nunca.

Vale a pena manter uma rota fixa em um modelo?

Depende do caminho, e a resposta para cada caso: caminho com exigência firme de qualidade ou latência fica em rota fixa, monitorada com a cadência do Passo 5, porque previsibilidade de comportamento vale mais que a diferença de custo. Volume sem política de qualidade migra para a rota roteada, que absorve a mudança de preço sem re-trabalho.

O que é roteamento de LLM?

É a camada que escolhe o modelo de cada chamada por custo, desempenho, latência e contexto, mantendo o ranking de modelos atualizado e o failover pronto. O model router como middleware é o pilar que detalha a arquitetura completa, e a decisão de rota passa a ser política nele, e não evento no seu calendário.

Referências e Leitura Complementar

Levar para a próxima leitura da tabela de preços

A tabela de preços de modelos de IA vai continuar mudando, nos dois sentidos, sem aviso. O que fica: perfil de consumo fixado, leitura datada, recálculo da rota fixa, comparação com a rota roteada e cadência de re-avaliação. O roteamento executa a re-decisão em política; a decisão de manter, migrar ou monitorar continua sendo sua.

Dois números datados abrem e fecham este artigo: na mesma janela de três semanas, entre as leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis, o modelo topo ficou US$400 por mês mais barato no perfil trabalhado, e o modelo econômico ficou US$61,20 mais caro. A rota fixa que não reavalia paga os dois, e a que reavalia transforma a tabela de preços em insumo. A referência da arquitetura está no guia de referência do model router, e a camada que executa a re-avaliação está descrita na página do Nexforce Router.

A tabela de preços muda de novo. Essa parte não depende de você. Chegar à próxima mudança com perfil de consumo, data de leitura e cadência depende, e é aí que a decisão vence a surpresa.

Nexforce

Economize até 50% de créditoscom uma única API inteligente

Conecte sua operação ao nosso AI Router e otimize o consumo de múltiplos LLMs

Teste Grátis

Artigos relacionados