Haiku 5.5: preço por token não é custo por tarefa concluída
O Haiku 5.5 reduz a tarifa inicial, mas contexto, tokenizer e esforço de raciocínio exigem medir o custo real antes de trocar o modelo.
Simon Willison analisou o Claude Haiku 5.5, com tarifa de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída na faixa de contexto de até 100 mil tokens.[8] Acima desse limite, os valores informados são US$ 0,50 e US$ 2,50.[8] A novidade interessa a automações frequentes, mas comparar apenas a primeira linha da tabela esconde parte da conta.
O que muda para quem desenvolve
O tokenizer mudou: no teste do autor, o mesmo prompt longo usou aproximadamente 1,25 vez o número de tokens do Haiku anterior.[8] O novo modelo também não permite desligar o raciocínio e usa esforço médio por padrão.[8] Minha análise é que uma migração precisa considerar a unidade realmente cobrada e o comportamento configurado, não somente preservar o texto do prompt.
Nos testes de geração de SVG relatados, esforço baixo levou sete segundos; esforço máximo levou cinco minutos e nove segundos.[8] Esses exemplos não são uma distribuição de latência para todas as tarefas. Servem para mostrar por que o nível de raciocínio deve entrar no experimento, em vez de ser tratado como um detalhe invisível.
A comparação apresentada com GPT-6 Luna também muda em contexto longo: o limite de aumento tarifário informado para esse modelo é 272 mil tokens.[8] Isso não estabelece um vencedor universal. O tamanho das entradas reais e a taxa de respostas aceitas precisam participar da escolha.
Como aplicar
Separe uma amostra representativa de tarefas curtas, documentos maiores e casos difíceis. Defina o que conta como resposta aceita antes de executar a comparação. Para extração, por exemplo, estabeleça campos obrigatórios e tratamento de informação ausente.
Execute o modelo atual e o candidato com as mesmas entradas, mas conte tokens com as ferramentas correspondentes a cada um. Registre esforço de raciocínio, volume de saída, latência, tentativas adicionais e resultado validado. Não considere uma resposta barata que precisou ser refeita como equivalente a uma resposta correta na primeira tentativa.
A medida proposta é custo total da amostra dividido pelas tarefas aceitas, acompanhado da distribuição de latência e dos erros. Isso permite decidir por classe de tarefa: um modelo pode servir para classificação curta e não atender ao prazo de um fluxo interativo mais difícil.
Para experimentos financiados por assinatura, o artigo informa créditos mensais de API de US$ 100 no Max 5x, US$ 200 no Max 20x e até US$ 500 compartilhados no Team.[8] Eles não acumulam, e é possível desativar recarga automática.[8] Confira elegibilidade e cobrança antes de contar com esse saldo.
Cuidados e limites
Os resultados de qualidade mencionados incluem benchmarks reportados pela Anthropic e testes pontuais do autor, não uma avaliação independente universal.[8] Não prometa a mesma qualidade em português, em documentos internos ou em qualquer domínio sem testar.
Minha recomendação é evitar uma troca global motivada pela tarifa nominal. Mantenha comparação reproduzível, limite de gasto e possibilidade de retornar ao modelo anterior. A economia útil é a da tarefa concluída, não a da resposta que parece barata no orçamento.
Fonte
[8] Fonte: Simon Willison