← Todos os artigos

Inteligência artificial · caderno de investigação

De 20 configurações para 4: um roteador de GPT enxuto

Uma análise de vinte combinações de Luna, Terra, Sol e Astra para construir um roteador simples que escala apenas quando a tarefa exige.

Por Gabriel Vidoretto8 min de leitura
  • Roteamento de IA
  • Modelos de linguagem
  • Custos
  • Benchmarks
De 20 configurações para 4: um roteador de GPT enxuto
Neste artigo

Vinte combinações de modelo e nível de raciocínio parecem oferecer liberdade de escolha. Quando coloco qualidade e custo por tarefa no mesmo mapa, encontro uma escada bem mais simples: quatro configurações cobrem os principais degraus sem transformar o roteador em um catálogo de exceções.

Sol high custa US$ 0,81 por tarefa no recorte analisado. Astra low custa US$ 0,82. Por um centavo a mais, o score exibido no Intelligence Index da Artificial Analysis passa de 42 para 46. Esse centavo resume o problema de escolher modelos apenas pelo nome ou pelo preço de cada token.

A pergunta que realmente ajuda a projetar um sistema é: qual é o próximo ganho de qualidade que vale pagar para esta tarefa?

Comparei 20 combinações entre GPT-5.6 Luna, Terra, Sol e GPT-6 Astra, cada uma com cinco níveis de raciocínio. Minha proposta para um roteador enxuto é Luna high → Luna max → Astra low → Astra xhigh. Sol medium pode entrar se os testes do seu produto mostrarem que ele resolve uma faixa intermediária real.

Escada de quatro níveis: Luna high, Luna max, Astra low e Astra xhigh, partindo de vinte combinações.
De vinte opções para quatro papéis claros no roteador.Ampliar imagem ↗

A escolha real é modelo mais nível de raciocínio

Cada família oferece configurações como low, medium, high, xhigh e max. O nível de raciocínio, ou effort, controla quanto trabalho o modelo pode dedicar antes de responder. Subir de nível costuma consumir mais tokens, aumentar o tempo e elevar o custo. A qualidade também pode melhorar, mas nem sempre na mesma proporção.

Por isso, perguntar “qual GPT devo usar?” ainda deixa uma decisão importante de fora. Para encaminhar uma tarefa, a unidade prática é família + effort. Classificar um ticket simples, extrair campos de um documento e investigar uma falha complexa não precisam começar no mesmo degrau.

Preço por token não é custo por tarefa

A tarifa por milhão de tokens informa quanto cada unidade custa. Ela não diz quantos tokens serão gastos até a resposta. Um modelo barato por token pode raciocinar por mais tempo e terminar com uma tarefa cara. Dois efforts da mesma família podem ter a mesma tarifa e custos finais muito diferentes.

Usei o Cost per Intelligence Index Task da Artificial Analysis. A métrica pondera o custo de entrada, cache, raciocínio e resposta nas tarefas do índice. Ela é mais útil para comparar configurações do que a tarifa isolada, embora não seja uma previsão da sua fatura.

Comparação visual entre preço por token e custo de uma tarefa completa, incluindo o raciocínio gerado.
O custo relevante para roteamento é o da tarefa resolvida.Ampliar imagem ↗

Primeiro corte: a fronteira de Pareto

Uma configuração é dominada quando outra custa menos ou igual e entrega score maior ou igual, com vantagem real em pelo menos uma dessas medidas. Nesse par de critérios, não existe motivo para escolhê-la. A fronteira de Pareto reúne as alternativas que sobrevivem a essa comparação.

Veja Sol xhigh: score 44 por US$ 1,18. Astra low aparece com score 46 por US$ 0,82. Nos números exibidos, Astra low é melhor nas duas dimensões.

Gráfico de Pareto mostrando Astra low com score maior e custo menor que Sol xhigh.
Quando uma alternativa melhora qualidade e custo, a outra é dominada nesse recorte.Ampliar imagem ↗

Mas sobreviver à fronteira matemática não significa merecer uma regra no sistema. Uma configuração pode acrescentar um ponto de score, custar bem mais e exigir outro conjunto de testes, monitoramento e decisões. Fiz, portanto, dois cortes: eliminei os pontos dominados e depois retirei degraus que pouco acrescentavam à operação.

No mapa completo, Luna ocupa a zona econômica, Astra concentra os scores mais altos, e Terra e Sol disputam o meio. O intervalo vai de cerca de US$ 0,01 a US$ 3,26 por tarefa; a escala logarítmica mantém as vinte opções legíveis.

Mapa das vinte configurações de Luna, Terra, Sol e Astra em custo por tarefa e score de inteligência.
O mapa completo revela faixas econômicas, intermediárias e premium.Ampliar imagem ↗

Luna: dois degraus econômicos que têm funções diferentes

No recorte, Luna high entrega score 32 por US$ 0,04. É um bom ponto inicial para volume alto, classificação, extração e tarefas com critérios claros. Luna max sobe para 38 por US$ 0,18 e atende casos que precisam de mais raciocínio sem entrar na faixa premium.

Luna xhigh, com 35 por US$ 0,09, também é eficiente. Não saiu da seleção por ser ruim: high e max simplesmente formam uma escada mais fácil de explicar e operar. Os níveis low e medium podem ser úteis quando volumes enormes tornam cada fração de centavo relevante; para um roteador generalista, high oferece um início mais capaz.

Luna high e Luna max apresentados como as duas etapas econômicas do roteador.
Luna high começa barato; Luna max amplia a capacidade antes de subir de família.Ampliar imagem ↗

Terra: redundante no critério analisado

Terra perde espaço quando comparado com todas as famílias, e não apenas com seus próprios efforts. Três exemplos deixam a diferença visível:

Configuração TerraScore · custo por tarefaAlternativa no recorteScore · custo por tarefa
Terra medium30 · US$ 0,18Luna max38 · US$ 0,18
Terra xhigh38 · US$ 0,63Luna max38 · US$ 0,18
Terra max42 · US$ 1,40Astra low46 · US$ 0,82

A análise comparativa da Artificial Analysis chega à mesma leitura: Luna e Sol ficam à frente de Terra na relação entre inteligência e custo. Assim, Terra não abre uma região atraente nessas duas métricas.

Isso não prova que Terra seja inútil. Compatibilidade, disponibilidade, latência ou desempenho no seu domínio podem justificar sua presença. Se houver esse motivo, ele precisa ser medido separadamente.

Comparação de esforços de Terra com alternativas de Luna e Astra que custam menos ou entregam score maior.
Terra não abre um novo degrau no mapa de custo e score analisado.Ampliar imagem ↗

Sol: um centavo muda o meio da escada

Sol compete melhor que Terra, mas Astra comprime seu espaço. Sol high marca 42 por US$ 0,81; Astra low, 46 por US$ 0,82. Sol high não é estritamente dominado, pois custa um centavo a menos. Operacionalmente, esse centavo dificilmente paga uma regra adicional no roteador.

Nos níveis superiores, a comparação é mais clara:

SolScore · custoAstraScore · custo
Sol xhigh44 · US$ 1,18Astra low46 · US$ 0,82
Sol max47 · US$ 1,99Astra medium50 · US$ 1,54
Comparação entre Sol high e Astra low: diferença de um centavo no custo por tarefa e quatro pontos no score.
Astra low torna Sol high difícil de justificar como degrau próprio.Ampliar imagem ↗

O melhor argumento para manter Sol é medium: score 39 por US$ 0,50. Ele fica entre Luna max (38 por US$ 0,18) e Astra low (46 por US$ 0,82). A transição pode ser útil se Luna max falhar em tarefas que ainda não exigem Astra low. Nos dados do índice, porém, o ganho sobre Luna max é de apenas um ponto por quase 2,8 vezes o custo.

Minha regra seria incluir Sol medium apenas depois de medir esse ganho em casos reais. Sem essa evidência, ele é um degrau opcional.

Sol medium posicionado como possível degrau intermediário entre Luna max e Astra low.
Sol medium precisa provar seu valor nas tarefas do produto.Ampliar imagem ↗

Astra: entrada premium e teto prático

Astra low chega a score 46 por US$ 0,82 e se torna a entrada natural para trabalho importante, difícil ou com maior custo de erro. Astra xhigh aparece com 53 por US$ 2,31: é o teto prático da minha seleção, quando qualidade vale mais que custo.

Astra max também mostra 53, mas por US$ 3,26. Não dá para concluir que xhigh é igual e apenas mais barato: o score público é arredondado, e a Artificial Analysis afirma que todos os efforts do Astra permanecem na fronteira. Medium e high também são válidos ali. Eu os retiro da escada principal para simplificar a operação, não por inferioridade matemática.

Max deve virar padrão somente se testes próprios identificarem um ganho que compense o prêmio. O mesmo raciocínio vale para adicionar qualquer outro degrau.

Astra low como entrada premium e Astra xhigh como teto prático, com observação sobre o score arredondado de max.
Astra xhigh é o teto operacional escolhido; max pede validação própria.Ampliar imagem ↗

O roteador final cabe em quatro regras

NívelScore no recorteCusto por tarefaPapel no sistema
Luna high32US$ 0,04Volume, classificação, extração e tarefas claras
Luna max38US$ 0,18Mais raciocínio ainda na faixa econômica
Astra low46US$ 0,82Casos difíceis ou com maior custo de erro
Astra xhigh53US$ 2,31Exceções críticas em que qualidade é prioridade
Arquitetura do roteador minimalista com quatro configurações e papéis definidos.
Quatro configurações cobrem os principais degraus do recorte.Ampliar imagem ↗

O sistema não precisa adivinhar perfeitamente a dificuldade antes de executar. Pode começar no menor nível compatível, validar formato e critérios de qualidade, subir quando a resposta falhar e registrar quais tipos de tarefa exigiram escalada.

Num ticket de suporte, por exemplo, Luna high pode tentar classificar e extrair dados; Luna max entra se houver mais regras e ambiguidade; Astra low analisa um caso difícil; xhigh fica para a exceção crítica. Se uma etapa resolve o caso, o fluxo termina ali.

Fluxo de um ticket que começa em Luna high e escala para Luna max, Astra low e Astra xhigh somente quando necessário.
A escalada acontece quando a etapa anterior não atende aos critérios definidos.Ampliar imagem ↗

O benchmark mostra o mapa; seus dados escolhem a rota

O Intelligence Index combina avaliações de conhecimento, automação, terminal, código, documentos profissionais e contexto longo. É mais informativo do que um teste isolado, mas não responde sozinho qual configuração respeita melhor o seu formato, usa ferramentas com mais sucesso, entende seu domínio, entrega latência aceitável e mantém estabilidade.

O próprio Astra ilustra essa nuance: mesmo avançando no índice agregado, a avaliação publicada aponta áreas em que a comparação com Sol é menos favorável. Score maior não significa melhor em todas as tarefas.

Use o benchmark para reduzir de vinte candidatos a quatro. Depois, rode seus casos reais e registre qualidade, custo, latência, taxa de erro e taxa de escalada. A seleção final pode terminar com três níveis ou cinco. O ganho já aparece quando cada opção tem um papel claro e medido.

Dados para conferir

GV

Sobre o autor

Gabriel Vidoretto

Desenvolvedor full-stack e explorador de tecnologia. Escrevo para organizar perguntas, voltar às fontes e compartilhar o que encontro no percurso.

Continuar a conversa ↗