Claude Haiku 5.5: preços, benchmarks e quando usar
Claude Haiku 5.5 reduz o custo de tarefas delimitadas, mas exige atenção às faixas de contexto, ao tokenizer e à metodologia dos benchmarks antes da adoção
Principais conclusões
- Delegue ao Haiku 5.5 tarefas delimitadas e verificáveis, como extração e classificação, mantendo planejamento complexo e decisões sensíveis sob supervisão humana ou modelos mais capazes.
- Controle prompts abaixo de 100 mil tokens quando possível, pois ultrapassar essa fronteira altera as tarifas de entrada e saída, mesmo com contexto disponível de 1M.
- Recalcule custos com o tokenizer novo e contabilize thinking, tentativas e revisão: a simulação de US$ 35 compara quotas de tokens, não garante economia em produção.
- Interprete benchmarks conforme esforço e metodologia: os 72,4% do OSWorld representam pontuação parcial, enquanto o critério estrito do Haiku 5.5 registra apenas 37,1% naquele recorte.
- Estruture com a Techify uma avaliação por processo, combinando critérios de aceitação, limites de dados pessoais, permissões de ferramentas e custo por resultado efetivamente aprovado.
O Claude Haiku 5.5 chega com contexto de 1 milhão de tokens, mas a tarifa muda quando o prompt ultrapassa 100 mil tokens. Este guia separa capacidade, preço e evidência para decidir onde o modelo merece entrar na operação.
O lançamento importa pelo trabalho que permite delegar
Anunciado em 7 de outubro de 2026, o Haiku 5.5 mira classificação, extração, roteamento e tarefas de subagentes. Aceita texto e imagens e produz texto, com disponibilidade anunciada na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry. Região, cota e compatibilidade precisam ser verificadas no provedor escolhido.
A tese editorial da Techify é simples: Haiku deve ser a camada econômica de trabalho delimitado, não o substituto automático do arquiteto Sonnet ou Opus. A decisão útil não é trocar todos os modelos; é identificar tarefas cujo resultado pode ser conferido por regras, exemplos rotulados ou revisão humana.
1. Contexto grande não autoriza enviar tudo
O Haiku 5.5 oferece janela de contexto de 1M tokens e saída máxima síncrona de 128 mil tokens. Saídas de até 300 mil tokens pertencem à Message Batches API com o beta output-300k-2026-03-24; não são o limite normal de uma chamada interativa.
O divisor operacional está abaixo da capacidade máxima: 100 mil tokens separam duas faixas de preço. Caber no contexto não significa custar pouco, responder no prazo ou selecionar corretamente um detalhe perdido no histórico. Um atendimento com catálogo, políticas e todas as conversas acumuladas precisa de gestão de contexto, não apenas de uma janela maior.
Para uma PME, mantenha instruções estáveis, recupere apenas os documentos relevantes e registre o tamanho do prompt antes de chamar o modelo. O planejamento começa pelas decisões de adoção de Claude em PMEs: dados autorizados, dono do processo e consequência de um erro vêm antes da escolha da versão.
2. Preços: duas faixas, cache e processamento em lote
A API cobra o Haiku 5.5 por milhão de tokens em dólares, com preços distintos para prompts de até 100 mil tokens e acima disso. A faixa do prompt também altera o preço de saída; portanto, não orce respostas longas usando automaticamente a tarifa menor.
| Modalidade, US$/milhão | Prompt ≤100 mil | Prompt >100 mil |
|---|---|---|
| Entrada normal | 0,10 | 0,50 |
| Saída normal | 0,50 | 2,50 |
| Leitura de cache | 0,01 | 0,05 |
| Escrita de cache, 5 minutos | 0,125 | 0,625 |
| Escrita de cache, 1 hora | 0,20 | 1,00 |
| Entrada Batch | 0,05 | 0,25 |
| Saída Batch | 0,25 | 1,25 |
Cache reduz o custo de reutilizar conteúdo elegível, mas sua escrita também é cobrada. Batch favorece processamento assíncrono, como classificar documentos fora do horário de atendimento; não oferece a mesma experiência de uma resposta imediata. Não some descontos sem conferir as regras de cobrança da combinação usada.
Há uma atualização importante na família: o anúncio de 7 de outubro informa leitura de cache do Sonnet 5.5 a US$ 0,10 por milhão. A tabela principal de preços coletada ainda exibia US$ 0,20, enquanto a seção de caching já explicitava US$ 0,10. Adotamos a atualização do anúncio, sem modelar cache Sonnet nesta comparação; a divergência documental exige atenção na integração.
3. A economia precisa sobreviver à mudança de tokenizer
Uma simulação de 100 mil tarefas, cada uma com 2 mil tokens de entrada e 300 de saída, custa US$ 35 no Haiku 5.5 de contexto curto. O cálculo em Python usa 200 milhões de tokens de entrada e 30 milhões de saída, sem cache, ferramentas ou thinking adicional; cada chamada permanece abaixo de 100 mil tokens.
| Modelo/modalidade | Custo da quota simulada |
|---|---|
| Haiku 5.5 normal | US$ 35,00 |
| Haiku 5.5 Batch | US$ 17,50 |
| Haiku 4.5 normal | US$ 350,00 |
| Sonnet 5.5 normal | US$ 700,00 |
Essa tabela compara quotas de tokens, não necessariamente o mesmo texto. A documentação estima aproximadamente 30% mais tokens para um texto equivalente no novo tokenizer frente ao Haiku 4.5. Aplicando, como hipótese, esse aumento a entrada e saída, o Haiku 5.5 passaria a US$ 45,50: economia calculada de 87% contra US$ 350, desde que esforço e faixa permaneçam equivalentes.
Não é medição de produção nem promessa de redução na fatura. A Techify recomenda medir custo por resultado aceito, incluindo tentativas, escalonamento e revisão, em vez de só preço por token. As práticas para economizar tokens no Claude continuam relevantes mesmo quando a tarifa unitária cai.
4. Benchmarks fortes não equivalem à configuração padrão
Os números de lançamento mostram avanço frente ao Haiku 4.5, mas não descrevem indistintamente a configuração padrão. O Haiku 5.5 usa esforço medium por padrão; vários resultados destacados usam max. A tabela abaixo reproduz o quadro do anúncio Haiku, sem misturar snapshots anteriores de Sonnet.
| Avaliação | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 | GPT-6 Luna |
|---|---|---|---|---|
| GDPval-AA 2.1, Elo | 1620 | 735 | 1840 | 1437 |
| AA-Briefcase 1.1, Elo | 1578 | 614 | 1824 | 1336 |
| OSWorld 2.1 offline, parcial | 72,4% | 15,7% | 83,9% | 48,9% |
| Terminal-Bench 4.0 | 39,2% | 0% | 70,6% | 16,4% |
| FrontierCode 1.1 Main | 46,4% max | Não informado | 52,1% xhigh | 42,4% |
GDPval-AA envolve 220 tarefas de 44 ocupações em nove setores, julgadas por comparação cega entre pares, com Elo ancorado no DeepSeek V4.1 Flash em 1600. A Anthropic declara execução independente pela Artificial Analysis; nossa consulta ao leaderboard não encontrou a nova linha Haiku, e a ficha recuperada retornou 404. São resultados reportados pela Anthropic com execução independente declarada, não confirmação independente obtida pela Techify.
Em medium, o GDPval cai para 1277, usando aproximadamente um décimo dos tokens de saída do esforço máximo; no Briefcase, são 1372 contra 1578, com menos de um quarto da saída. Esses recortes mostram uma escolha entre custo e desempenho, não uma falha automática do padrão. A diferença Sonnet 1839 no leaderboard versus 1840 no anúncio também não deve ser vendida como mudança substantiva de capacidade.
5. Automação de computador e código exige ler a metodologia
Os 72,4% do OSWorld são pontuação parcial no subconjunto offline, não taxa de conclusão integral. A avaliação usa 82 tarefas, cinco tentativas, esforço máximo e limite de 500 ações. No critério estrito, o Haiku registra 37,1% e o Sonnet 48,8%; o resultado parcial do Sonnet é 83,9%.
Terminal-Bench 4.0 tem 66 tarefas: Haiku foi avaliado em dez execuções por tarefa, totalizando 660, contra cinco e 330 para Sonnet. Os erros padrão reportados são 1,9 e 2,5 pontos percentuais. Haiku rodou com esforço máximo, sem internet nem modelo de fallback; Sonnet teve fallback. A diferença de configuração impede tratar a tabela como experimento perfeitamente controlado.
FrontierCode Main reúne as 100 tarefas mais difíceis de um conjunto ampliado de 150, com cinco execuções e avaliação conduzida pela Cognition segundo o relatório oficial. Haiku max alcança 46,4%; Sonnet xhigh, 52,1%. Para engenharia, prefira tarefas pequenas com testes, como discutimos em Claude Code e a importância do sistema além do modelo, a delegar uma mudança arquitetural inteira por causa de um ranking.
6. Como comparar Anthropic, Google, OpenAI e DeepSeek
A comparação de fornecedores começa por tarifas equivalentes e pela mesma tarefa, não por nomes de famílias. Os valores abaixo são entrada/saída normal por milhão de tokens em dólares, conforme as páginas oficiais já coletadas; preços de parceiros, ferramentas e condições comerciais podem mudar o custo final.
| Alternativa | Entrada / saída | Condição relevante |
|---|---|---|
| Haiku 5.5 | 0,10 / 0,50; 0,50 / 2,50 | Até 100 mil / acima de 100 mil tokens |
| Haiku 4.5 | 1,00 / 5,00 | Tokenizer anterior |
| Sonnet 5.5 | 2,00 / 10,00 | Planejamento e código mais exigentes |
| Opus 5.5 | 4,00 / 20,00 | Tarifa normal, não Fast Mode |
| Gemini 3.8 Flash | 0,75 / 3,75 | Promoção até 31/12/2026 |
| DeepSeek V4.1 Flash | 0,15 / 0,60; 0,30 / 1,20 | Fora de pico / pico |
| GPT-6 Luna | Não disponível nesta apuração | Comparação de desempenho apenas |
Gemini 3.8 Flash passa a US$ 1,50/7,50 em 1º de janeiro de 2027, conforme a política coletada. DeepSeek tem leitura de cache de US$ 0,003 fora do pico e US$ 0,006 no pico; o pico anunciado ocorre de 01h–04h e 06h–10h UTC nos dias úteis, com exceção dos feriados chineses. Não transforme tarifa condicionada em preço universal.
O Haiku é anunciado como o mais rápido da linha em velocidade padrão, mas Opus Fast Mode pode ser mais rápido. Não dispomos de medição própria de tokens por segundo. Para escolher, rode seu conjunto de português, documentos e ferramentas com limites equivalentes: preço baixo não resolve diferenças de integração, disponibilidade regional ou precisão.
7. A aplicação mais defensável na PME brasileira
Haiku faz mais sentido quando recebe uma tarefa delimitada e devolve uma saída verificável: classificar solicitações, extrair campos de pedidos ou resumir uma interação para um operador. Não deve decidir sozinho um reembolso controverso nem alterar registros financeiros apenas porque consegue usar ferramentas.
A Techify recomenda separar executor e supervisor: Haiku prepara dados; validações determinísticas conferem formato, valores permitidos e consistência; casos ambíguos seguem para revisão ou modelo mais capaz. Um harness com loop de avaliação torna esse desenho observável, em vez de depender de um prompt que promete acertar tudo.
Comece em modo sombra, sem efeitos sobre clientes, e compare com decisões já revisadas. Registre aceitação, retrabalho, latência e custo total; defina o limite de qualidade antes de observar os resultados. Para LGPD, minimize dados pessoais, restrinja ferramentas por função e exija confirmação humana em ações de escrita com impacto financeiro ou contratual.
8. Migrar exige mais que trocar o identificador
A migração usa claude-haiku-5-5 na Claude API, com thinking adaptativo e esforço padrão medium. Remova temperature, top_p e top_k do cliente; o orçamento manual budget_tokens e o prefill final de assistant são rejeitados. Reconte prompts no modelo novo.
Leia os blocos de content por type, não presumindo que o primeiro seja texto. Thinking consome orçamento de saída; trate truncamento e stop_reason: refusal explicitamente, pois Haiku não tem fallback de servidor. Recusa deve gerar tratamento seguro, não repetição cega para contornar salvaguardas.
Preserve blocos de thinking sem alterações, mantenha a conversa append-only e respeite o vínculo com a conta produtora. Priority Tier não é suportado: planeje capacidade separadamente. Essas mudanças precisam de testes de contrato e reversão, mesmo que uma chamada simples funcione na primeira tentativa.
Antes de ativar a migração em produção, revise contagem de tokens e tratamento de respostas: o tokenizer e os parâmetros aceitos mudaram, independentemente da queda de preço anunciada.
Para definir quando escalar uma tarefa além do Haiku, compare as capacidades de Sonnet 5.5 e Opus 5.5, em vez de escolher apenas pela tarifa. O comparativo entre Opus, Sonnet e Haiku 5.5 reúne os critérios de custo e desempenho para desenhar esse encaminhamento.
Conclusão
Haiku 5.5 amplia o espaço para delegar trabalho repetitivo a baixo custo, mas o resultado depende de contexto controlado, esforço calibrado e validação. A arquitetura mais prudente economiza na execução delimitada e preserva supervisão onde o erro custa mais que os tokens.
Escolha um processo, estabeleça critérios de aceitação e só aumente o volume após uma avaliação com dados autorizados. Para estruturar essa decisão técnica e operacional, converse com a Techify.
Sobre o autor
Editor — Techify
Rob é editor da Techify e escreve sobre IA aplicada, automação e engenharia de sistemas para empresas que querem escalar.
- Focado em automação com IA aplicada