Claude Sonnet 5.5: preços, benchmarks e limites
Claude Sonnet 5.5 combina execução delimitada, preços e benchmarks com ressalvas; entenda custos, migração e critérios para PMEs e planeje sua adoção.
Principais conclusões
- Defina o Sonnet 5.5 como executor de tarefas delimitadas, com critérios de aceite claros, e reserve julgamento aberto para rotas avaliadas separadamente, sem escolher por um único benchmark.
- Use a tarifa anunciada em 7 de outubro de US$ 0,10 por milhão de tokens para leitura de cache do Sonnet 5.5, incluindo escrita inicial, raciocínio, novas tentativas e revisão humana no orçamento.
- Interprete cada benchmark pelo protocolo, esforço e unidade utilizados, distinguindo avaliações independentes reportadas pela Anthropic de scores internos e evitando transferir resultados entre versões diferentes.
- Avalie 30 tarefas representativas antes de escalar, mantendo ferramentas e contexto comparáveis e registrando conclusão, aderência ao escopo, consumo, fallback e minutos necessários de revisão.
- Converse com a Techify para planejar uma adoção baseada em escopo e custo por tarefa aceita, sem presumir que esforço máximo produz resultados melhores.
A Anthropic anunciou o Claude Sonnet 5.5 em 28 de setembro de 2026, com preços de US$ 2 por milhão de tokens de entrada e US$ 10 de saída. Entenda por que seu melhor papel pode ser executar escopos delimitados, não assumir qualquer decisão.
Um executor melhor não precisa pensar sempre mais
O lançamento promete geração mais de 30% mais rápida e custo por tarefa até 30% menor que o Sonnet 5. São alegações da Anthropic, não testes realizados pela Techify, nem redução equivalente na tabela por token. A diferença importa: consumir menos tokens para concluir uma tarefa não significa pagar menos por cada token.
A tese editorial é simples: Sonnet deve executar trabalho com limites verificáveis; julgamento aberto merece outra rota. Aumentar esforço indiscriminadamente pode ampliar escopo, latência e revisão. Como discutimos em por que o modelo não é o diferencial do Claude Code, instruções, ferramentas e critérios de encerramento fazem parte do resultado.
1. Capacidade técnica não significa memória perfeita
O identificador da API é claude-sonnet-5-5. O modelo aceita texto e imagem como entrada e produz texto. Está disponível nos aplicativos Claude, Claude Code, Claude Platform, AWS, Google Cloud e Azure. Essa disponibilidade não torna preços, limites e condições contratuais idênticos em todos os canais.
A especificação informa 1 milhão de tokens de contexto e até 128 mil de saída. Contexto amplo permite fornecer mais material, mas não garante retenção perfeita ou atenção uniforme. O corte de conhecimento é junho de 2026; fatos posteriores precisam ser fornecidos ou recuperados por ferramentas.
Em Batch, a beta output-300k-2026-03-24 permite até 300 mil tokens de saída, sem transformar esse teto em padrão. Para uma PME, documentos extensos devem vir acompanhados de objetivos, referências e critérios de aceite. A saída máxima é capacidade disponível, não uma meta de consumo.
2. Preços precisam carregar suas condições
O Sonnet custa US$ 2 de entrada e US$ 10 de saída por milhão de tokens. Escrita de cache custa US$ 2,50 para cinco minutos ou US$ 4 para uma hora. Em 7 de outubro, o anúncio do Haiku 5.5 reduziu a leitura de cache do Sonnet 5.5 de US$ 0,20 para US$ 0,10 por milhão de tokens.
A página original do lançamento e a tabela principal de pricing ainda mostram US$ 0,20, mas o anúncio de 7 de outubro e a seção de prompt caching da documentação confirmam US$ 0,10. Esta análise usa a tarifa atual anunciada, sem confundir o preço histórico com o vigente; confirme sua modalidade no Console. O mínimo de cache é 512 tokens. Batch oferece processamento assíncrono com desconto de 50%, mas não substitui uma interação que exige resposta imediata.
| Modelo ou modalidade | Entrada | Saída | Condição relevante |
|---|---|---|---|
| Sonnet 5.5 | 2 | 10 | Cache read atualizado: 0,10 |
| Sonnet 5.5 Batch | 1 | 5 | Assíncrono |
| Opus 5.5 | 4 | 20 | Dobro por token, não necessariamente por tarefa |
| GPT 6.1 Sol | 2 / 4 | 10 / 15 | Contexto curto / longo; limiar não identificado; cache 0,10 / 0,20 |
| Gemini 3.6 Flash | 0,75 | 3,75 | Promoção até 31/12/2026 |
| Gemini 3.6 Flash em 2027 | 1,50 | 7,50 | A partir de 01/01/2027 |
| Gemini 3.5 Flash | 1,50 | 9 | Standard |
| DeepSeek V4.1 Flash | 0,15 / 0,30 | 0,60 / 1,20 | Cache miss; fora de pico / pico; com visão |
| DeepSeek V4 Pro | 0,66 / 1,32 | 1,98 / 3,96 | Cache miss; fora de pico / pico; sem visão |
No Gemini 3.6 Flash, cache custa US$ 0,075, mais US$ 0,50 por milhão de tokens por hora de armazenamento; busca tem custos adicionais. No DeepSeek Flash, cache hit custa US$ 0,003/0,006, fora de pico/pico. Pico: 01–04 e 06–10 UTC, segunda a sexta, exceto feriados chineses. Nada disso estabelece equivalência de capacidade nem se generaliza ao Gemini 4.
3. Uma conta hipotética revela o custo escondido
Considere uma tarefa hipotética com 20 mil tokens de entrada e quatro mil de saída, sem cache. O Sonnet custa US$ 0,08, o Opus US$ 0,16 e o Sonnet Batch US$ 0,04. Não são resultados de produção: são multiplicações das tarifas pelo consumo proposto, úteis para construir uma primeira referência.
Com 18 mil tokens lidos do cache, dois mil novos e quatro mil de saída, o Sonnet chega a US$ 0,0458 por tarefa hipotética, usando leitura a US$ 0,10. A conta exclui a escrita inicial. Os quatro mil tokens precisam incluir raciocínio cobrado; se representarem apenas a resposta visível, o orçamento fica incompleto.
Dez mil tarefas idênticas sem cache custariam US$ 800 no Sonnet contra US$ 1.600 no Opus. Ferramentas, retries, infraestrutura, revisão humana, impostos e câmbio estão excluídos. Para reduzir desperdício, combine esse orçamento com práticas para economizar tokens no Claude, sem confundir economia com uso ilimitado.
4. Benchmarks exigem leitura do experimento
Os números abaixo foram divulgados pela Anthropic, não medidos pela Techify. Terminal-Bench 4.0 avaliou 66 tarefas com cinco tentativas cada, totalizando 330 por modelo. Usou Claude Code --bare, sem internet, recursos pré-cacheados e safeguards ativos. Sonnet rodou em Max; Opus em Xhigh, sua melhor configuração reportada.
O fallback afetou 1,5% das tentativas do Sonnet. O erro padrão informado é ±2,5 pontos para Sonnet e ±2,6 para Opus, assumindo tentativas independentes. O resultado favorece Sonnet nesse desenho, mas não estabelece superioridade universal. Também não deve ser confundido com Terminal-Bench 2.
| Avaliação | Sonnet 5.5 | Comparadores | Unidade ou ressalva |
|---|---|---|---|
| Terminal-Bench 4.0 | 70,6% | Sonnet 5: 10,3%; Opus 5.5: 66,4% | Configurações de esforço diferentes |
| FrontierCode 1.1 Main | Xhigh: 52,1%; Max: 46,2% | Sonnet 5: 42,4%; Opus 5.5: 54,4%; GPT 6 Sol: 49,3% | Ambientes diferentes entre fornecedores |
| GDPval-AA v2.1 | 1844 Elo | Opus: 1846; Sonnet 5: 1449 | AA independente, reportado pela Anthropic |
| AA-Briefcase v1.1 | 1811 | Opus: 1822 | Projetos longos |
| OSWorld 2.1 | Parcial: 80,1%; strict: 43,5% | Opus: 81,8% / 48,7% | Parcial não significa conclusão integral |
FrontierCode inclui 150 tarefas reais de PR da Cognition, exigindo código mergeável, testes ocultos e qualidade dentro do escopo. A Cognition executou Claude no Claude Code e GPT no Codex CLI. Esses ambientes diferentes limitam a comparação. O GPT 6 Sol avaliado não é o GPT 6.1 Sol da tabela de preços: transferir seu score seria incorreto.
5. Mais esforço pode produzir menos trabalho aceito
No FrontierCode, Sonnet marcou 52,1% em Xhigh e 46,2% em Max. A diferença sustenta uma cautela operacional: esforço máximo pode extrapolar escopo ou terminar em timeout. Não prova que pensar menos sempre seja melhor; mostra que a configuração deve ser escolhida pelo trabalho aceito, não pela intensidade nominal do raciocínio.
GDPval-AA avaliou 220 tarefas de 44 ocupações em nove indústrias, com shell, web e comparação cega par a par. AA-Briefcase usa projetos longos, rubricas e julgadores. São avaliações independentes da Artificial Analysis reportadas na publicação Anthropic, distintas dos scores internos. A página direta da AA trouxe metodologia, mas números indisponíveis publicamente: não confirma uma leaderboard nem um Intelligence Index. Um bug pré-release de structured outputs foi corrigido, com possível subestimação; resultados GPT 6 Sol também têm ressalva de bug visual.
No OSWorld 2.1, houve 108 tarefas Ubuntu, cinco execuções, até 500 ações, resolução 1080p, Max e checkpoints. Os 80,1% parciais não significam 80% de automações completas; strict ficou em 43,5%. Elo tampouco é porcentagem. A aplicação prática é separar progresso intermediário de conclusão verificável, especialmente quando uma automação pode deixar trabalho para revisão humana.
6. Migrar exige revisar o contrato da integração
Adaptive thinking é padrão; o esforço anunciado é High na API e Medium nos apps e Claude Code. O modo between_tools desliga o raciocínio inicial e aceita low, medium e high, não xhigh ou max. No Sonnet 5.5, thinking: {"type": "disabled"} retorna 400; use between_tools para desativar apenas o raciocínio inicial. max_tokens inclui raciocínio, cobrado como saída, não apenas texto visível.
tool_choice com any ou tool não é suportado: use auto. Strict tools podem ser usadas quando necessário, mas não garantem que uma ferramenta será sempre chamada. Valores não padrão de temperature, top_p e top_k retornam 400. A migração precisa retirar pressupostos antigos antes de atribuir falhas ao modelo.
Faça parsing de content por type, preserve thinking e signature e mantenha o histórico append-only. Safeguards de cibersegurança podem acionar fallback para Sonnet 5; registre o modelo efetivo. O desenho explicado em harness e loop para tornar a IA mais útil ajuda a tratar execução, histórico e ferramentas como um sistema.
7. Proponha 30 tarefas antes de escalar
A Techify propõe começar a avaliação de uma PME com 30 tarefas representativas, não testes já efetuados: dez de extração e classificação, dez de alterações delimitadas em código ou documentos e dez de fluxos com ferramentas. Use exemplos representativos e dados autorizados. Antes de executar, escreva o resultado esperado, as restrições e as condições de reprovação.
Execute o mesmo conjunto em configurações comparáveis, incluindo esforço Medium e High quando disponíveis. Max deve entrar somente com justificativa e suporte da configuração. Registre conclusão, aderência ao escopo, tokens de entrada, saída e thinking, tempo, retries, fallback e minutos de revisão. Mantenha ferramentas e contexto equivalentes e documente exceções.
Compare custo por tarefa aceita, não apenas por tentativa. Encaminhe julgamento aberto ao Opus como hipótese de roteamento; reserve Flash barato para triagem somente após medir qualidade. Trinta tarefas oferecem um ponto de partida, não comprovação estatística universal. Complemente o desenho com decisões antes de adotar Claude em PMEs.
8. Defina limites e critérios de encerramento
Limites da API dependem da conta e da plataforma. Estar disponível em vários provedores não equivale a capacidade ilimitada nem acesso uniforme às mesmas condições. Separe o orçamento de experimentação do orçamento recorrente e defina o que ocorre quando uma execução atinge o teto de tokens ou falha.
Uma tarefa encerrada por teto de tokens ou timeout não equivale a trabalho concluído. Defina quais testes, campos obrigatórios ou documentos entregues comprovam o aceite e separe interrupções de falhas do modelo. Para documentos longos, selecione o contexto relevante antes de aumentar a janela; mais material não significa melhor execução.
Registre versão solicitada, modelo efetivo, configuração e resultado aceito. Uma resposta aparentemente barata pode custar mais depois de raciocínio, fallback, novas tentativas e correção humana. O controle editorial deve permitir identificar extrapolação de escopo e distinguir saída útil de saída longa, sem premiar volume como produtividade.
A promoção do Gemini 3.6 Flash termina em 31 de dezembro de 2026; projeções que atravessam essa data precisam considerar a tarifa anunciada para 2027.
Usar Sonnet como padrão não elimina as outras faixas: Opus 5.5 pode atender trabalhos mais complexos, enquanto Haiku 5.5 merece avaliação em rotinas curtas de alto volume. O comparativo entre Opus, Sonnet e Haiku 5.5 permite comparar essas escolhas pelo mesmo conjunto de critérios.
Conclusão: escolha o executor pelo escopo
Sonnet 5.5 combina preço intermediário, contexto amplo e resultados fortes em avaliações específicas. Nenhuma dessas características elimina a necessidade de definir trabalho aceito. A escolha defensável começa pelo escopo, ajusta esforço ao problema e incorpora revisão, ferramentas e eventuais fallbacks ao custo total.
A recomendação editorial da Techify é adotar Sonnet como executor delimitado, testar alternativas por função e evitar coroar um vencedor por um benchmark. Use as 30 tarefas propostas para orientar uma avaliação própria. Converse com a Techify para planejar a adoção de IA na sua PME.
Sobre o autor
Editor — Techify
Rob é editor da Techify e escreve sobre IA aplicada, automação e engenharia de sistemas para empresas que querem escalar.
- Focado em automação com IA aplicada