Blog Techify

Claude Haiku 5.5: preços, benchmarks e quando usar

Claude Haiku 5.5 reduz o custo de tarefas delimitadas, mas exige atenção às faixas de contexto, ao tokenizer e à metodologia dos benchmarks antes da adoção

Por Publicado em Atualizado em ⏱ 9 min de leitura

Principais conclusões

  • Delegue ao Haiku 5.5 tarefas delimitadas e verificáveis, como extração e classificação, mantendo planejamento complexo e decisões sensíveis sob supervisão humana ou modelos mais capazes.
  • Controle prompts abaixo de 100 mil tokens quando possível, pois ultrapassar essa fronteira altera as tarifas de entrada e saída, mesmo com contexto disponível de 1M.
  • Recalcule custos com o tokenizer novo e contabilize thinking, tentativas e revisão: a simulação de US$ 35 compara quotas de tokens, não garante economia em produção.
  • Interprete benchmarks conforme esforço e metodologia: os 72,4% do OSWorld representam pontuação parcial, enquanto o critério estrito do Haiku 5.5 registra apenas 37,1% naquele recorte.
  • Estruture com a Techify uma avaliação por processo, combinando critérios de aceitação, limites de dados pessoais, permissões de ferramentas e custo por resultado efetivamente aprovado.

O Claude Haiku 5.5 chega com contexto de 1 milhão de tokens, mas a tarifa muda quando o prompt ultrapassa 100 mil tokens. Este guia separa capacidade, preço e evidência para decidir onde o modelo merece entrar na operação.

O lançamento importa pelo trabalho que permite delegar

Anunciado em 7 de outubro de 2026, o Haiku 5.5 mira classificação, extração, roteamento e tarefas de subagentes. Aceita texto e imagens e produz texto, com disponibilidade anunciada na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry. Região, cota e compatibilidade precisam ser verificadas no provedor escolhido.

A tese editorial da Techify é simples: Haiku deve ser a camada econômica de trabalho delimitado, não o substituto automático do arquiteto Sonnet ou Opus. A decisão útil não é trocar todos os modelos; é identificar tarefas cujo resultado pode ser conferido por regras, exemplos rotulados ou revisão humana.

1. Contexto grande não autoriza enviar tudo

O Haiku 5.5 oferece janela de contexto de 1M tokens e saída máxima síncrona de 128 mil tokens. Saídas de até 300 mil tokens pertencem à Message Batches API com o beta output-300k-2026-03-24; não são o limite normal de uma chamada interativa.

O divisor operacional está abaixo da capacidade máxima: 100 mil tokens separam duas faixas de preço. Caber no contexto não significa custar pouco, responder no prazo ou selecionar corretamente um detalhe perdido no histórico. Um atendimento com catálogo, políticas e todas as conversas acumuladas precisa de gestão de contexto, não apenas de uma janela maior.

Para uma PME, mantenha instruções estáveis, recupere apenas os documentos relevantes e registre o tamanho do prompt antes de chamar o modelo. O planejamento começa pelas decisões de adoção de Claude em PMEs: dados autorizados, dono do processo e consequência de um erro vêm antes da escolha da versão.

2. Preços: duas faixas, cache e processamento em lote

A API cobra o Haiku 5.5 por milhão de tokens em dólares, com preços distintos para prompts de até 100 mil tokens e acima disso. A faixa do prompt também altera o preço de saída; portanto, não orce respostas longas usando automaticamente a tarifa menor.

Modalidade, US$/milhãoPrompt ≤100 milPrompt >100 mil
Entrada normal0,100,50
Saída normal0,502,50
Leitura de cache0,010,05
Escrita de cache, 5 minutos0,1250,625
Escrita de cache, 1 hora0,201,00
Entrada Batch0,050,25
Saída Batch0,251,25

Cache reduz o custo de reutilizar conteúdo elegível, mas sua escrita também é cobrada. Batch favorece processamento assíncrono, como classificar documentos fora do horário de atendimento; não oferece a mesma experiência de uma resposta imediata. Não some descontos sem conferir as regras de cobrança da combinação usada.

Há uma atualização importante na família: o anúncio de 7 de outubro informa leitura de cache do Sonnet 5.5 a US$ 0,10 por milhão. A tabela principal de preços coletada ainda exibia US$ 0,20, enquanto a seção de caching já explicitava US$ 0,10. Adotamos a atualização do anúncio, sem modelar cache Sonnet nesta comparação; a divergência documental exige atenção na integração.

3. A economia precisa sobreviver à mudança de tokenizer

Uma simulação de 100 mil tarefas, cada uma com 2 mil tokens de entrada e 300 de saída, custa US$ 35 no Haiku 5.5 de contexto curto. O cálculo em Python usa 200 milhões de tokens de entrada e 30 milhões de saída, sem cache, ferramentas ou thinking adicional; cada chamada permanece abaixo de 100 mil tokens.

Modelo/modalidadeCusto da quota simulada
Haiku 5.5 normalUS$ 35,00
Haiku 5.5 BatchUS$ 17,50
Haiku 4.5 normalUS$ 350,00
Sonnet 5.5 normalUS$ 700,00

Essa tabela compara quotas de tokens, não necessariamente o mesmo texto. A documentação estima aproximadamente 30% mais tokens para um texto equivalente no novo tokenizer frente ao Haiku 4.5. Aplicando, como hipótese, esse aumento a entrada e saída, o Haiku 5.5 passaria a US$ 45,50: economia calculada de 87% contra US$ 350, desde que esforço e faixa permaneçam equivalentes.

Não é medição de produção nem promessa de redução na fatura. A Techify recomenda medir custo por resultado aceito, incluindo tentativas, escalonamento e revisão, em vez de só preço por token. As práticas para economizar tokens no Claude continuam relevantes mesmo quando a tarifa unitária cai.

4. Benchmarks fortes não equivalem à configuração padrão

Os números de lançamento mostram avanço frente ao Haiku 4.5, mas não descrevem indistintamente a configuração padrão. O Haiku 5.5 usa esforço medium por padrão; vários resultados destacados usam max. A tabela abaixo reproduz o quadro do anúncio Haiku, sem misturar snapshots anteriores de Sonnet.

AvaliaçãoHaiku 5.5Haiku 4.5Sonnet 5.5GPT-6 Luna
GDPval-AA 2.1, Elo162073518401437
AA-Briefcase 1.1, Elo157861418241336
OSWorld 2.1 offline, parcial72,4%15,7%83,9%48,9%
Terminal-Bench 4.039,2%0%70,6%16,4%
FrontierCode 1.1 Main46,4% maxNão informado52,1% xhigh42,4%

GDPval-AA envolve 220 tarefas de 44 ocupações em nove setores, julgadas por comparação cega entre pares, com Elo ancorado no DeepSeek V4.1 Flash em 1600. A Anthropic declara execução independente pela Artificial Analysis; nossa consulta ao leaderboard não encontrou a nova linha Haiku, e a ficha recuperada retornou 404. São resultados reportados pela Anthropic com execução independente declarada, não confirmação independente obtida pela Techify.

Em medium, o GDPval cai para 1277, usando aproximadamente um décimo dos tokens de saída do esforço máximo; no Briefcase, são 1372 contra 1578, com menos de um quarto da saída. Esses recortes mostram uma escolha entre custo e desempenho, não uma falha automática do padrão. A diferença Sonnet 1839 no leaderboard versus 1840 no anúncio também não deve ser vendida como mudança substantiva de capacidade.

5. Automação de computador e código exige ler a metodologia

Os 72,4% do OSWorld são pontuação parcial no subconjunto offline, não taxa de conclusão integral. A avaliação usa 82 tarefas, cinco tentativas, esforço máximo e limite de 500 ações. No critério estrito, o Haiku registra 37,1% e o Sonnet 48,8%; o resultado parcial do Sonnet é 83,9%.

Terminal-Bench 4.0 tem 66 tarefas: Haiku foi avaliado em dez execuções por tarefa, totalizando 660, contra cinco e 330 para Sonnet. Os erros padrão reportados são 1,9 e 2,5 pontos percentuais. Haiku rodou com esforço máximo, sem internet nem modelo de fallback; Sonnet teve fallback. A diferença de configuração impede tratar a tabela como experimento perfeitamente controlado.

FrontierCode Main reúne as 100 tarefas mais difíceis de um conjunto ampliado de 150, com cinco execuções e avaliação conduzida pela Cognition segundo o relatório oficial. Haiku max alcança 46,4%; Sonnet xhigh, 52,1%. Para engenharia, prefira tarefas pequenas com testes, como discutimos em Claude Code e a importância do sistema além do modelo, a delegar uma mudança arquitetural inteira por causa de um ranking.

6. Como comparar Anthropic, Google, OpenAI e DeepSeek

A comparação de fornecedores começa por tarifas equivalentes e pela mesma tarefa, não por nomes de famílias. Os valores abaixo são entrada/saída normal por milhão de tokens em dólares, conforme as páginas oficiais já coletadas; preços de parceiros, ferramentas e condições comerciais podem mudar o custo final.

AlternativaEntrada / saídaCondição relevante
Haiku 5.50,10 / 0,50; 0,50 / 2,50Até 100 mil / acima de 100 mil tokens
Haiku 4.51,00 / 5,00Tokenizer anterior
Sonnet 5.52,00 / 10,00Planejamento e código mais exigentes
Opus 5.54,00 / 20,00Tarifa normal, não Fast Mode
Gemini 3.8 Flash0,75 / 3,75Promoção até 31/12/2026
DeepSeek V4.1 Flash0,15 / 0,60; 0,30 / 1,20Fora de pico / pico
GPT-6 LunaNão disponível nesta apuraçãoComparação de desempenho apenas

Gemini 3.8 Flash passa a US$ 1,50/7,50 em 1º de janeiro de 2027, conforme a política coletada. DeepSeek tem leitura de cache de US$ 0,003 fora do pico e US$ 0,006 no pico; o pico anunciado ocorre de 01h–04h e 06h–10h UTC nos dias úteis, com exceção dos feriados chineses. Não transforme tarifa condicionada em preço universal.

O Haiku é anunciado como o mais rápido da linha em velocidade padrão, mas Opus Fast Mode pode ser mais rápido. Não dispomos de medição própria de tokens por segundo. Para escolher, rode seu conjunto de português, documentos e ferramentas com limites equivalentes: preço baixo não resolve diferenças de integração, disponibilidade regional ou precisão.

7. A aplicação mais defensável na PME brasileira

Haiku faz mais sentido quando recebe uma tarefa delimitada e devolve uma saída verificável: classificar solicitações, extrair campos de pedidos ou resumir uma interação para um operador. Não deve decidir sozinho um reembolso controverso nem alterar registros financeiros apenas porque consegue usar ferramentas.

A Techify recomenda separar executor e supervisor: Haiku prepara dados; validações determinísticas conferem formato, valores permitidos e consistência; casos ambíguos seguem para revisão ou modelo mais capaz. Um harness com loop de avaliação torna esse desenho observável, em vez de depender de um prompt que promete acertar tudo.

Comece em modo sombra, sem efeitos sobre clientes, e compare com decisões já revisadas. Registre aceitação, retrabalho, latência e custo total; defina o limite de qualidade antes de observar os resultados. Para LGPD, minimize dados pessoais, restrinja ferramentas por função e exija confirmação humana em ações de escrita com impacto financeiro ou contratual.

8. Migrar exige mais que trocar o identificador

A migração usa claude-haiku-5-5 na Claude API, com thinking adaptativo e esforço padrão medium. Remova temperature, top_p e top_k do cliente; o orçamento manual budget_tokens e o prefill final de assistant são rejeitados. Reconte prompts no modelo novo.

Leia os blocos de content por type, não presumindo que o primeiro seja texto. Thinking consome orçamento de saída; trate truncamento e stop_reason: refusal explicitamente, pois Haiku não tem fallback de servidor. Recusa deve gerar tratamento seguro, não repetição cega para contornar salvaguardas.

Preserve blocos de thinking sem alterações, mantenha a conversa append-only e respeite o vínculo com a conta produtora. Priority Tier não é suportado: planeje capacidade separadamente. Essas mudanças precisam de testes de contrato e reversão, mesmo que uma chamada simples funcione na primeira tentativa.

Antes de ativar a migração em produção, revise contagem de tokens e tratamento de respostas: o tokenizer e os parâmetros aceitos mudaram, independentemente da queda de preço anunciada.

Para definir quando escalar uma tarefa além do Haiku, compare as capacidades de Sonnet 5.5 e Opus 5.5, em vez de escolher apenas pela tarifa. O comparativo entre Opus, Sonnet e Haiku 5.5 reúne os critérios de custo e desempenho para desenhar esse encaminhamento.

Conclusão

Haiku 5.5 amplia o espaço para delegar trabalho repetitivo a baixo custo, mas o resultado depende de contexto controlado, esforço calibrado e validação. A arquitetura mais prudente economiza na execução delimitada e preserva supervisão onde o erro custa mais que os tokens.

Escolha um processo, estabeleça critérios de aceitação e só aumente o volume após uma avaliação com dados autorizados. Para estruturar essa decisão técnica e operacional, converse com a Techify.

#anthropic #lancamento #benchmark #api #agentes-de-ia

Sobre o autor

Editor — Techify

Rob é editor da Techify e escreve sobre IA aplicada, automação e engenharia de sistemas para empresas que querem escalar.

  • Focado em automação com IA aplicada

Perguntas frequentes

Quanto custa o Claude Haiku 5.5 na API?
O Haiku 5.5 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 de saída para prompts de até 100 mil tokens. Acima desse limite, as tarifas são US$ 0,50 e US$ 2,50, respectivamente. Cache tem cobranças próprias de escrita e leitura, e Batch reduz entrada e saída pela metade. Esses valores são em dólares e não incluem ferramentas, custos de infraestrutura, tributos ou condições comerciais específicas de provedores parceiros.
Claude Haiku 5.5 substitui Sonnet e Opus?
Não automaticamente. Haiku 5.5 é uma opção econômica para tarefas delimitadas, como classificação, extração e roteamento, desde que a saída possa ser verificada. Sonnet e Opus continuam alternativas para etapas mais exigentes de planejamento e execução. A recomendação editorial da Techify é separar executor, validação e supervisão. Compare custo por resultado aceito no seu processo, incluindo retrabalho e escalonamento, em vez de supor que uma tarifa menor torna a substituição universalmente vantajosa.
O resultado de 72,4% no OSWorld significa sucesso completo?
Não. Os 72,4% reportados para Haiku 5.5 representam pontuação parcial no subconjunto offline do OSWorld 2.1. O critério estrito de conclusão registra 37,1%. A metodologia usa 82 tarefas, cinco tentativas e limite de 500 ações, com esforço máximo. Isso não descreve a configuração padrão medium nem garante desempenho igual no computador da sua empresa. Outros benchmarks também têm diferenças de ferramentas e fallback que precisam ser consideradas antes de comparar modelos.
Qual é o limite de contexto e saída do Haiku 5.5?
A janela de contexto anunciada é de 1 milhão de tokens, e o limite máximo de saída na API síncrona é de 128 mil tokens. Até 300 mil tokens de saída estão disponíveis apenas na Message Batches API com o beta output-300k-2026-03-24. Capacidade de contexto não é promessa de custo baixo: prompts acima de 100 mil tokens entram em outra faixa de cobrança. Verifique também cotas, região e compatibilidade da plataforma onde pretende utilizar o modelo.
O que muda ao migrar do Haiku 4.5 para o 5.5?
Além do identificador claude-haiku-5-5, é necessário recontar tokens, pois o mesmo texto pode gerar aproximadamente 30% mais tokens no tokenizer novo. Use thinking adaptativo em vez de budget_tokens manual e remova os parâmetros de amostragem do cliente. Não envie prefill final de assistant. Selecione blocos de resposta por tipo, trate truncamento e refusal e preserve o histórico de thinking conforme as regras da conta. Priority Tier não é suportado; teste capacidade e reversão antes da ativação.