Roteamento de LLM: o que fazer quando o preço do token muda

Quando o preço do token muda, o custo de uma rota fixa de LLM muda junto, sem aviso. O procedimento: re-ler a tabela de preços com data de leitura, recalcular o custo da rota fixa com o perfil de consumo real, comparar com a alternativa roteada e fixar a cadência de re-avaliação.
O aviso vem dos dados. Entre as leituras de 17 de agosto e 7 de setembro de 2026 na Artificial Analysis, o GPT-5.6 Sol, modelo topo de linha, cortou o preço de input em 20% e o de output em 33%. No mesmo intervalo de 21 dias, o DeepSeek V4 Flash 0731, categoria econômica, subiu 214% no input e 371% no output. Mesma janela, direções opostas.
A premissa que quebra é operacional: a tabela de preços de modelos de IA deixou de ser insumo anual e virou insumo que se move no mês. Este guia executa a re-decisão em cinco passos, com esses dois modelos como exemplo corrido, e mostra onde o middleware do stack de IA em escala absorve o movimento sem renegociar contrato e sem reintegrar código.
O roteiro completo:
- Fixar o perfil de consumo por modelo, separando input e output.
- Ler a tabela de preços com data de leitura anotada.
- Recalcular o custo da rota fixa com o perfil real.
- Comparar rota fixa contra rota roteada.
- Fixar a cadência de re-avaliação e a regra de re-decisão.
O que você precisa antes de redecidir a rota
A redecisão de rota é uma conta com três insumos. Sem perfil de consumo, porcentagem é abstrato. Sem data de leitura, comparação entre tabelas é inválida. Sem a política de rota atual, não existe linha de base para medir o efeito da mudança. Nada disso exige ferramenta nova, e nenhum passo depende do fornecedor do modelo.
Três itens, nesta ordem:
- Perfil de consumo por modelo. Milhões de tokens de input e de output por mês, separados por modelo, lidos do rastro de chamadas ou da fatura. Um total agregado serve para contabilidade, não para decisão de rota.
- Tabela de preços com data de leitura. Preço de input e de output por milhão de tokens, o tier contratado, a fonte e o dia da leitura anotados junto ao número, porque preço sem data não é dado, é memória.
- Política de rota atual. Qual modelo atende qual carga hoje e sob qual regra, para que a comparação do Passo 4 tenha linha de base.
Passo 1: Fixar o perfil de consumo por modelo
O perfil de consumo converte porcentagem em dinheiro: milhões de tokens de input e output por modelo, por mês, lidos do rastro de chamadas. Com ele, a re-precificação do modelo topo vira US$400 por mês na rota, US$300 do output e US$100 do input, e a do modelo econômico vira US$61,20, US$31,20 do output e US$30 do input, no exemplo do Passo 3. Sem perfil, porcentagem é ruído.
O perfil mora no rastro de auditoria das chamadas do gateway, nos relatórios de consumo do provedor ou na planilha do time de dados. A separação entre input e output é invariável, porque os dois têm preços diferentes e, nesta janela, movimentos diferentes: o output carregou o corte de 33% do modelo topo e a alta de 371% do modelo econômico, entre as leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis.
A composição da carga também entra. Extração de dados estruturados e sumarização de documentos são cargas de input pesado. Geração de relatórios e de código é output pesado. Duas cargas com o mesmo total de tokens pagam contas diferentes, e o perfil é o que mostra qual conta é a sua.
Passo 2: Ler a tabela de preços com data de leitura
A tabela de preços de modelos de IA é um documento que se move, então a leitura vale pelo dia em que foi feita. Anote preço de input e de output por milhão de tokens, o tier contratado, a fonte e a data. Duas leituras separadas por 21 dias foram suficientes para mover os dois modelos em direções opostas.
As duas leituras deste guia:
| Modelo | Input / output na leitura de 2026-08-17 | Input / output na leitura de 2026-09-07 | Delta de input | Delta de output |
|---|---|---|---|---|
| GPT-5.6 Sol | US$5,00 / US$30,00 | US$4,00 / US$20,00 | -20% | -33% |
| DeepSeek V4 Flash 0731 | US$0,14 / US$0,28 | US$0,44 / US$1,32 | +214% | +371% |
Valores por milhão de tokens, no tier máximo listado em cada data. Fonte: Artificial Analysis, leituras de 2026-08-17 e 2026-09-07.
A leitura corrente é que preço de modelo de IA só desce. Esta janela é a refutação com dois números datados: o modelo topo cortou preço enquanto o modelo econômico subia, dentro de 21 dias.
Tendência de fundo não é operação.
A mesma janela trouxe um segundo movimento, de placar e não de preço: a Artificial Analysis re-baseou o Intelligence Index para a versão 4.2 em 4 de setembro de 2026. Score e preço são leituras separadas; a re-decisão por score está no artigo sobre o re-base do placar de inteligência, e este guia fica na tabela de preços.
Em produção, a leitura datada é o insumo que alimenta a política de roteamento; o pilar do model router mostra como a camada transforma leitura em regra.
Passo 3: Recalcular o custo por token da rota fixa
O recálculo multiplica o perfil de consumo pelos preços datados, duas vezes: uma com a tabela antiga, outra com a tabela nova. A diferença é o quanto a rota fixa mudou de custo sem nenhuma decisão sua. O exemplo abaixo usa o perfil ilustrativo de 100 milhões de tokens de input e 30 milhões de output por mês.
GPT-5.6 Sol, tabela de 2026-08-17: 100 milhões de input × US$5,00 = US$500; 30 milhões de output × US$30,00 = US$900. Total: US$1.400 por mês.
GPT-5.6 Sol, tabela de 2026-09-07: input a US$4,00 e output a US$20,00 fecham a mesma rota em US$1.000 por mês: US$400 a menos, uma queda de 28,6% na fatura, percentual que não está na tabela: é o efeito combinado do corte de 20% no input com o de 33% no output.
DeepSeek V4 Flash 0731, tabela de 2026-08-17: 100 milhões de input × US$0,14 = US$14; 30 milhões de output × US$0,28 = US$8,40. Total: US$22,40.
DeepSeek V4 Flash 0731, tabela de 2026-09-07: input a US$0,44 e output a US$1,32 fecham a mesma rota em US$83,60 por mês: US$61,20 a mais, um aumento de 273% na fatura.
| Rota fixa (100M input + 30M output por mês) | Custo com tabela de 2026-08-17 | Custo com tabela de 2026-09-07 | Delta mensal |
|---|---|---|---|
| GPT-5.6 Sol | US$1.400,00 | US$1.000,00 | -US$400,00 (-28,6%) |
| DeepSeek V4 Flash 0731 | US$22,40 | US$83,60 | +US$61,20 (+273%) |
Fonte dos preços: Artificial Analysis, leituras de 2026-08-17 e 2026-09-07. Perfil: ilustrativo.
A conta expõe o erro que este guia combate. A re-precificação do modelo topo vira US$400 por mês na rota, US$300 do output e US$100 do input, e a do modelo econômico vira US$61,20, US$31,20 do output e US$30 do input: a porcentagem maior pertence à conta menor. A queda secular do preço do token segue real e de longo prazo, mas dentro de três semanas a direção que importa é a do seu perfil, e ela não segue a tendência de mercado.
Passo 4: Comparar a rota fixa com a rota roteada
A comparação transforma o recálculo em decisão. A rota fixa custa o que a tabela nova diz, e o custo vence a cada mudança de preço. A rota roteada terceiriza a re-decisão para uma camada que reavalia modelos por preço e desempenho em tempo real. O que sobra para você é governança, não a leitura da tabela.
| Critério | Rota fixa | Rota roteada |
|---|---|---|
| Quem lê a tabela de preços | O seu time, a cada mudança | A camada de roteamento, continuamente |
| Intervalo até o ajuste de custo | Dias a semanas, o ciclo humano de re-decisão | O tempo de uma reavaliação de modelo |
| Failover quando um modelo cai | Manual, com reintegração | Automático, com fallback configurável |
| Troca de modelo | Reintegração no código | Troca de variável de endpoint, sem reintegração |
| Governança de gasto | Fatura e planilha | Teto por chave, agente ou projeto, consumo em tempo real |
A tabela compara categorias, e vale uma leitura honesta dela. A rota roteada não decide sozinha qual tarefa tolera o modelo econômico: a política é sua, com regras por chave e tetos de gasto. A camada executa. Onde a qualidade exige o modelo topo, a regra fixa esse caminho e o roteamento respeita a regra, porque o default por custo é a decisão errada justamente onde latência ou qualidade são restrições duras. A política de roteamento em produção existe para marcar esses caminhos antes que o custo os decida.
A escolha de rota parece decisão de engenharia e é tomada como tal, no código; no fim do mês ela aparece na fatura como decisão de margem.
O Nexforce Router é essa camada: um gateway de LLM com mais de 300 modelos atrás de uma única API compatível com OpenAI, roteamento inteligente por custo, desempenho, latência e contexto, ranking de modelos em tempo real por preço e desempenho, failover automático com fallback configurável e troca de modelo sem reintegração. A Nexforce declara economia de até 50% no custo por token, número declarado pela própria empresa como teto de posicionamento, não como resultado verificado: a conta da sua rota, feita no Passo 3, é que decide.
Antes de mover a rota, o mesmo prompt roda em paralelo nos modelos candidatos, e a decisão sai de resultado medido, e não de chute. O argumento econômico estático do roteamento já foi defendido no artigo sobre o custo dos modelos de IA; a comparação acima adiciona o tempo: a rota fixa re-precifica quando a tabela muda, e a roteada re-decide. A régua do benchmark de LLMs para CFOs, custo antes de score, se aplica linha a linha: a tabela de preços é a matéria-prima dela.
Passo 5: Fixar a cadência e a regra de re-decisão
Cadência é o que impede a rota fixa de vencer em silêncio de novo. Fixe três coisas: a frequência de leitura da tabela, o limiar de variação que obriga recálculo e a regra que decide entre manter a rota fixa e migrar para a rota roteada. Uma janela de 21 dias bastou para mover preços em 33% e 371%.
Frequência: leitura datada da tabela de preços uma vez por mês, com o histórico guardado, porque comparar a tabela de hoje com a de seis meses atrás sem as intermediárias esconde o momento em que a rota venceu.
Limiar: 10% de variação no custo mensal da rota fixa obriga recálculo. Abaixo disso, ruído. A mudança de preço de modelo de IA é recorrente, e o gatilho é o custo mensal, e não a porcentagem da tabela: a janela deste guia mostrou 371% custando menos, em dólares, do que 28,6%.
Regra: caminho com exigência firme de qualidade ou latência fica em rota fixa monitorada; volume sem política de qualidade migra para a rota roteada. Nenhuma das três exige renegociar contrato nem reintegrar código. Com a camada de roteamento em escala no lugar, a re-decisão vira política no gateway, e a tabela de preços volta a ser insumo, e não evento.
Como confirmar que a decisão valeu
Verificação é comparar o custo efetivo por token antes e depois, no mesmo perfil de consumo, com o rastro de cada chamada. Sem rastro por chamada, a comparação é opinião. Com rastro, o custo por token efetivo da rota aparece no mês seguinte, e a decisão de rota vira número auditável.
O Nexforce Router entrega o rastro que a verificação pede: cada chamada auditável, observabilidade central com logs, métricas e dashboards, e analytics de economia e desempenho por modelo. Três números fecham a verificação. O custo por token efetivo do mês, dividindo a fatura pelo total de tokens servidos. A fatia de chamadas que caiu no fallback, que revela quantas vezes o modelo principal da rota ficou indisponível e quantas vezes o fallback segurou a operação sem que ninguém abrisse chamado. O consumo contra o teto de gasto, que mostra se a governança segurou o mês.
O número final é um só.
Cinco falhas comuns na re-decisão de rota
As falhas abaixo são as cinco que a janela de agosto e setembro de 2026 expõe com mais força. Cada uma tem correção de uma linha, e todas compartilham a mesma raiz: decidir rota com o dado errado, porcentagem sem perfil ou leitura sem data.
Ler porcentagem sem perfil de consumo. A re-precificação do GPT-5.6 Sol vira US$400 por mês no perfil do Passo 3, US$300 do output e US$100 do input, e a do DeepSeek V4 Flash 0731 vira US$61,20, US$31,20 do output e US$30 do input. A porcentagem sem perfil inverte a prioridade da fila. Correção: nenhum número de tabela entra em decisão sem passar pelo perfil real.
Comparar leituras sem data. Sem data de leitura, a comparação entre duas tabelas não compara nada: cada número vale pelo dia em que foi lido, e o dia sumiu. Correção: fonte e data anotados junto a cada preço, como nas leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis.
Olhar só a linha de input. No modelo topo, output é a linha cara da fatura; no modelo econômico desta janela, o input passa a liderar a conta. Os dois movimentos desta janela eram maiores no output, -33% e +371% contra -20% e +214% no input, e quem leu só a primeira linha subestimou a conta. Correção: input e output no recálculo, sempre.
Trocar de modelo por preço e perder a tarefa. O modelo econômico subiu 371% e continua barato em valor absoluto; a pergunta de rota nunca é qual modelo custa menos por token, é qual cumpre a tarefa pelo menor custo por resultado. Correção: comparar dentro da mesma qualidade de entrega, com o mesmo prompt rodado em paralelo antes de migrar.
Tratar re-base de índice como mudança de preço. O Intelligence Index v4.2, re-baseado em 4 de setembro de 2026, mudou o placar de score, não a tabela de preços. Quem confunde as duas leituras redecide rota por um movimento que não tocou o custo. Correção: placar e preço em leituras separadas, cada uma com a sua data.
Perguntas frequentes sobre preço do token e roteamento de LLM
Por que o preço dos modelos de IA muda?
Reprecificação competitiva entre fornecedores, custo de computação que se move e reestruturação de tiers e de contextos longos são os motores mais comuns. Nenhuma tabela vem com aviso prévio: as duas leituras desta janela, de 2026-08-17 e 2026-09-07 na Artificial Analysis, capturaram um corte de até 33% e uma alta de até 371% sem nota explicativa registrada nas páginas de preço consultadas. O preço é decisão do fornecedor, e a defesa é cadência de leitura, não adivinhação.
Quanto muda o custo quando o preço do token muda?
Depende do perfil de consumo, e a resposta para cada caso: no perfil ilustrativo de 100 milhões de input e 30 milhões de output por mês, o corte no modelo topo vale US$400 por mês e a alta no modelo econômico vale US$61,20. Um perfil três vezes maior multiplica os dois valores por três. Porcentagem sem perfil não responde. Nunca.
Vale a pena manter uma rota fixa em um modelo?
Depende do caminho, e a resposta para cada caso: caminho com exigência firme de qualidade ou latência fica em rota fixa, monitorada com a cadência do Passo 5, porque previsibilidade de comportamento vale mais que a diferença de custo. Volume sem política de qualidade migra para a rota roteada, que absorve a mudança de preço sem re-trabalho.
O que é roteamento de LLM?
É a camada que escolhe o modelo de cada chamada por custo, desempenho, latência e contexto, mantendo o ranking de modelos atualizado e o failover pronto. O model router como middleware é o pilar que detalha a arquitetura completa, e a decisão de rota passa a ser política nele, e não evento no seu calendário.
Referências e Leitura Complementar
- Artificial Analysis. Página do modelo GPT-5.6 Sol, com os preços de input e de output por milhão de tokens usados em todas as contas deste guia, nas leituras de 2026-08-17 e 2026-09-07: https://artificialanalysis.ai/models/gpt-5-6-sol
- Artificial Analysis. Intelligence Index v4.2, re-base do placar de inteligência anunciado em 2026-09-04: https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
- Artificial Analysis. Portal de modelos e preços por milhão de tokens, leituras de 2026-08-17 e 2026-09-07, modelo DeepSeek V4 Flash 0731: https://artificialanalysis.ai
Levar para a próxima leitura da tabela de preços
A tabela de preços de modelos de IA vai continuar mudando, nos dois sentidos, sem aviso. O que fica: perfil de consumo fixado, leitura datada, recálculo da rota fixa, comparação com a rota roteada e cadência de re-avaliação. O roteamento executa a re-decisão em política; a decisão de manter, migrar ou monitorar continua sendo sua.
Dois números datados abrem e fecham este artigo: na mesma janela de três semanas, entre as leituras de 2026-08-17 e 2026-09-07 da Artificial Analysis, o modelo topo ficou US$400 por mês mais barato no perfil trabalhado, e o modelo econômico ficou US$61,20 mais caro. A rota fixa que não reavalia paga os dois, e a que reavalia transforma a tabela de preços em insumo. A referência da arquitetura está no guia de referência do model router, e a camada que executa a re-avaliação está descrita na página do Nexforce Router.
A tabela de preços muda de novo. Essa parte não depende de você. Chegar à próxima mudança com perfil de consumo, data de leitura e cadência depende, e é aí que a decisão vence a surpresa.

Economize até 50% de créditoscom uma única API inteligente
Conecte sua operação ao nosso AI Router e otimize o consumo de múltiplos LLMs
Teste GrátisArtigos relacionados

Execução durável para agentes de IA: o motor vive no código
Agentes de IA de longa duração falham no meio do caminho, e a diferença entre refazer e retomar decide o custo e a confiança. A execução durável escrita no próprio código, com checkpoint por etapa, vence o motor de orquestração dedicado na maioria das cargas de agentes B2B.
Read more
MCP gateway: a camada de controle para o tráfego de ferramentas dos agentes de IA
Como o protocolo MCP transforma a integração de agentes de IA e por que a governança do tráfego de ferramentas exige um gateway centralizado para segurança, auditoria e controle de custos.
Read more
Ranking de modelos de IA resetou: o que muda na escolha
O re-base do principal índice de inteligência reescalonou todos os placares publicados de uma vez e provou que versões do índice não são comparáveis. O texto traduz o reset em um procedimento de redecisão de rota sob incerteza de placar, com re-teste com tráfego próprio, política de rota, fallback e teto de gasto, e aterrissa no Nexforce Router.
Read more