Blog Techify

Claude Sonnet 5.5: preços, benchmarks e limites

Claude Sonnet 5.5 combina execução delimitada, preços e benchmarks com ressalvas; entenda custos, migração e critérios para PMEs e planeje sua adoção.

Por Publicado em Atualizado em ⏱ 10 min de leitura

Principais conclusões

  • Defina o Sonnet 5.5 como executor de tarefas delimitadas, com critérios de aceite claros, e reserve julgamento aberto para rotas avaliadas separadamente, sem escolher por um único benchmark.
  • Use a tarifa anunciada em 7 de outubro de US$ 0,10 por milhão de tokens para leitura de cache do Sonnet 5.5, incluindo escrita inicial, raciocínio, novas tentativas e revisão humana no orçamento.
  • Interprete cada benchmark pelo protocolo, esforço e unidade utilizados, distinguindo avaliações independentes reportadas pela Anthropic de scores internos e evitando transferir resultados entre versões diferentes.
  • Avalie 30 tarefas representativas antes de escalar, mantendo ferramentas e contexto comparáveis e registrando conclusão, aderência ao escopo, consumo, fallback e minutos necessários de revisão.
  • Converse com a Techify para planejar uma adoção baseada em escopo e custo por tarefa aceita, sem presumir que esforço máximo produz resultados melhores.

A Anthropic anunciou o Claude Sonnet 5.5 em 28 de setembro de 2026, com preços de US$ 2 por milhão de tokens de entrada e US$ 10 de saída. Entenda por que seu melhor papel pode ser executar escopos delimitados, não assumir qualquer decisão.

Um executor melhor não precisa pensar sempre mais

O lançamento promete geração mais de 30% mais rápida e custo por tarefa até 30% menor que o Sonnet 5. São alegações da Anthropic, não testes realizados pela Techify, nem redução equivalente na tabela por token. A diferença importa: consumir menos tokens para concluir uma tarefa não significa pagar menos por cada token.

A tese editorial é simples: Sonnet deve executar trabalho com limites verificáveis; julgamento aberto merece outra rota. Aumentar esforço indiscriminadamente pode ampliar escopo, latência e revisão. Como discutimos em por que o modelo não é o diferencial do Claude Code, instruções, ferramentas e critérios de encerramento fazem parte do resultado.

1. Capacidade técnica não significa memória perfeita

O identificador da API é claude-sonnet-5-5. O modelo aceita texto e imagem como entrada e produz texto. Está disponível nos aplicativos Claude, Claude Code, Claude Platform, AWS, Google Cloud e Azure. Essa disponibilidade não torna preços, limites e condições contratuais idênticos em todos os canais.

A especificação informa 1 milhão de tokens de contexto e até 128 mil de saída. Contexto amplo permite fornecer mais material, mas não garante retenção perfeita ou atenção uniforme. O corte de conhecimento é junho de 2026; fatos posteriores precisam ser fornecidos ou recuperados por ferramentas.

Em Batch, a beta output-300k-2026-03-24 permite até 300 mil tokens de saída, sem transformar esse teto em padrão. Para uma PME, documentos extensos devem vir acompanhados de objetivos, referências e critérios de aceite. A saída máxima é capacidade disponível, não uma meta de consumo.

2. Preços precisam carregar suas condições

O Sonnet custa US$ 2 de entrada e US$ 10 de saída por milhão de tokens. Escrita de cache custa US$ 2,50 para cinco minutos ou US$ 4 para uma hora. Em 7 de outubro, o anúncio do Haiku 5.5 reduziu a leitura de cache do Sonnet 5.5 de US$ 0,20 para US$ 0,10 por milhão de tokens.

A página original do lançamento e a tabela principal de pricing ainda mostram US$ 0,20, mas o anúncio de 7 de outubro e a seção de prompt caching da documentação confirmam US$ 0,10. Esta análise usa a tarifa atual anunciada, sem confundir o preço histórico com o vigente; confirme sua modalidade no Console. O mínimo de cache é 512 tokens. Batch oferece processamento assíncrono com desconto de 50%, mas não substitui uma interação que exige resposta imediata.

Preços em USD por 1 milhão de tokens, apurados em 7 de outubro de 2026
Modelo ou modalidadeEntradaSaídaCondição relevante
Sonnet 5.5210Cache read atualizado: 0,10
Sonnet 5.5 Batch15Assíncrono
Opus 5.5420Dobro por token, não necessariamente por tarefa
GPT 6.1 Sol2 / 410 / 15Contexto curto / longo; limiar não identificado; cache 0,10 / 0,20
Gemini 3.6 Flash0,753,75Promoção até 31/12/2026
Gemini 3.6 Flash em 20271,507,50A partir de 01/01/2027
Gemini 3.5 Flash1,509Standard
DeepSeek V4.1 Flash0,15 / 0,300,60 / 1,20Cache miss; fora de pico / pico; com visão
DeepSeek V4 Pro0,66 / 1,321,98 / 3,96Cache miss; fora de pico / pico; sem visão

No Gemini 3.6 Flash, cache custa US$ 0,075, mais US$ 0,50 por milhão de tokens por hora de armazenamento; busca tem custos adicionais. No DeepSeek Flash, cache hit custa US$ 0,003/0,006, fora de pico/pico. Pico: 01–04 e 06–10 UTC, segunda a sexta, exceto feriados chineses. Nada disso estabelece equivalência de capacidade nem se generaliza ao Gemini 4.

3. Uma conta hipotética revela o custo escondido

Considere uma tarefa hipotética com 20 mil tokens de entrada e quatro mil de saída, sem cache. O Sonnet custa US$ 0,08, o Opus US$ 0,16 e o Sonnet Batch US$ 0,04. Não são resultados de produção: são multiplicações das tarifas pelo consumo proposto, úteis para construir uma primeira referência.

Com 18 mil tokens lidos do cache, dois mil novos e quatro mil de saída, o Sonnet chega a US$ 0,0458 por tarefa hipotética, usando leitura a US$ 0,10. A conta exclui a escrita inicial. Os quatro mil tokens precisam incluir raciocínio cobrado; se representarem apenas a resposta visível, o orçamento fica incompleto.

Dez mil tarefas idênticas sem cache custariam US$ 800 no Sonnet contra US$ 1.600 no Opus. Ferramentas, retries, infraestrutura, revisão humana, impostos e câmbio estão excluídos. Para reduzir desperdício, combine esse orçamento com práticas para economizar tokens no Claude, sem confundir economia com uso ilimitado.

4. Benchmarks exigem leitura do experimento

Os números abaixo foram divulgados pela Anthropic, não medidos pela Techify. Terminal-Bench 4.0 avaliou 66 tarefas com cinco tentativas cada, totalizando 330 por modelo. Usou Claude Code --bare, sem internet, recursos pré-cacheados e safeguards ativos. Sonnet rodou em Max; Opus em Xhigh, sua melhor configuração reportada.

O fallback afetou 1,5% das tentativas do Sonnet. O erro padrão informado é ±2,5 pontos para Sonnet e ±2,6 para Opus, assumindo tentativas independentes. O resultado favorece Sonnet nesse desenho, mas não estabelece superioridade universal. Também não deve ser confundido com Terminal-Bench 2.

Resultados reportados, com unidades e protocolos distintos
AvaliaçãoSonnet 5.5ComparadoresUnidade ou ressalva
Terminal-Bench 4.070,6%Sonnet 5: 10,3%; Opus 5.5: 66,4%Configurações de esforço diferentes
FrontierCode 1.1 MainXhigh: 52,1%; Max: 46,2%Sonnet 5: 42,4%; Opus 5.5: 54,4%; GPT 6 Sol: 49,3%Ambientes diferentes entre fornecedores
GDPval-AA v2.11844 EloOpus: 1846; Sonnet 5: 1449AA independente, reportado pela Anthropic
AA-Briefcase v1.11811Opus: 1822Projetos longos
OSWorld 2.1Parcial: 80,1%; strict: 43,5%Opus: 81,8% / 48,7%Parcial não significa conclusão integral

FrontierCode inclui 150 tarefas reais de PR da Cognition, exigindo código mergeável, testes ocultos e qualidade dentro do escopo. A Cognition executou Claude no Claude Code e GPT no Codex CLI. Esses ambientes diferentes limitam a comparação. O GPT 6 Sol avaliado não é o GPT 6.1 Sol da tabela de preços: transferir seu score seria incorreto.

5. Mais esforço pode produzir menos trabalho aceito

No FrontierCode, Sonnet marcou 52,1% em Xhigh e 46,2% em Max. A diferença sustenta uma cautela operacional: esforço máximo pode extrapolar escopo ou terminar em timeout. Não prova que pensar menos sempre seja melhor; mostra que a configuração deve ser escolhida pelo trabalho aceito, não pela intensidade nominal do raciocínio.

GDPval-AA avaliou 220 tarefas de 44 ocupações em nove indústrias, com shell, web e comparação cega par a par. AA-Briefcase usa projetos longos, rubricas e julgadores. São avaliações independentes da Artificial Analysis reportadas na publicação Anthropic, distintas dos scores internos. A página direta da AA trouxe metodologia, mas números indisponíveis publicamente: não confirma uma leaderboard nem um Intelligence Index. Um bug pré-release de structured outputs foi corrigido, com possível subestimação; resultados GPT 6 Sol também têm ressalva de bug visual.

No OSWorld 2.1, houve 108 tarefas Ubuntu, cinco execuções, até 500 ações, resolução 1080p, Max e checkpoints. Os 80,1% parciais não significam 80% de automações completas; strict ficou em 43,5%. Elo tampouco é porcentagem. A aplicação prática é separar progresso intermediário de conclusão verificável, especialmente quando uma automação pode deixar trabalho para revisão humana.

6. Migrar exige revisar o contrato da integração

Adaptive thinking é padrão; o esforço anunciado é High na API e Medium nos apps e Claude Code. O modo between_tools desliga o raciocínio inicial e aceita low, medium e high, não xhigh ou max. No Sonnet 5.5, thinking: {"type": "disabled"} retorna 400; use between_tools para desativar apenas o raciocínio inicial. max_tokens inclui raciocínio, cobrado como saída, não apenas texto visível.

tool_choice com any ou tool não é suportado: use auto. Strict tools podem ser usadas quando necessário, mas não garantem que uma ferramenta será sempre chamada. Valores não padrão de temperature, top_p e top_k retornam 400. A migração precisa retirar pressupostos antigos antes de atribuir falhas ao modelo.

Faça parsing de content por type, preserve thinking e signature e mantenha o histórico append-only. Safeguards de cibersegurança podem acionar fallback para Sonnet 5; registre o modelo efetivo. O desenho explicado em harness e loop para tornar a IA mais útil ajuda a tratar execução, histórico e ferramentas como um sistema.

7. Proponha 30 tarefas antes de escalar

A Techify propõe começar a avaliação de uma PME com 30 tarefas representativas, não testes já efetuados: dez de extração e classificação, dez de alterações delimitadas em código ou documentos e dez de fluxos com ferramentas. Use exemplos representativos e dados autorizados. Antes de executar, escreva o resultado esperado, as restrições e as condições de reprovação.

Execute o mesmo conjunto em configurações comparáveis, incluindo esforço Medium e High quando disponíveis. Max deve entrar somente com justificativa e suporte da configuração. Registre conclusão, aderência ao escopo, tokens de entrada, saída e thinking, tempo, retries, fallback e minutos de revisão. Mantenha ferramentas e contexto equivalentes e documente exceções.

Compare custo por tarefa aceita, não apenas por tentativa. Encaminhe julgamento aberto ao Opus como hipótese de roteamento; reserve Flash barato para triagem somente após medir qualidade. Trinta tarefas oferecem um ponto de partida, não comprovação estatística universal. Complemente o desenho com decisões antes de adotar Claude em PMEs.

8. Defina limites e critérios de encerramento

Limites da API dependem da conta e da plataforma. Estar disponível em vários provedores não equivale a capacidade ilimitada nem acesso uniforme às mesmas condições. Separe o orçamento de experimentação do orçamento recorrente e defina o que ocorre quando uma execução atinge o teto de tokens ou falha.

Uma tarefa encerrada por teto de tokens ou timeout não equivale a trabalho concluído. Defina quais testes, campos obrigatórios ou documentos entregues comprovam o aceite e separe interrupções de falhas do modelo. Para documentos longos, selecione o contexto relevante antes de aumentar a janela; mais material não significa melhor execução.

Registre versão solicitada, modelo efetivo, configuração e resultado aceito. Uma resposta aparentemente barata pode custar mais depois de raciocínio, fallback, novas tentativas e correção humana. O controle editorial deve permitir identificar extrapolação de escopo e distinguir saída útil de saída longa, sem premiar volume como produtividade.

A promoção do Gemini 3.6 Flash termina em 31 de dezembro de 2026; projeções que atravessam essa data precisam considerar a tarifa anunciada para 2027.

Usar Sonnet como padrão não elimina as outras faixas: Opus 5.5 pode atender trabalhos mais complexos, enquanto Haiku 5.5 merece avaliação em rotinas curtas de alto volume. O comparativo entre Opus, Sonnet e Haiku 5.5 permite comparar essas escolhas pelo mesmo conjunto de critérios.

Conclusão: escolha o executor pelo escopo

Sonnet 5.5 combina preço intermediário, contexto amplo e resultados fortes em avaliações específicas. Nenhuma dessas características elimina a necessidade de definir trabalho aceito. A escolha defensável começa pelo escopo, ajusta esforço ao problema e incorpora revisão, ferramentas e eventuais fallbacks ao custo total.

A recomendação editorial da Techify é adotar Sonnet como executor delimitado, testar alternativas por função e evitar coroar um vencedor por um benchmark. Use as 30 tarefas propostas para orientar uma avaliação própria. Converse com a Techify para planejar a adoção de IA na sua PME.

#anthropic #claude-code #benchmark #comparativo #api #agentes-de-ia

Sobre o autor

Editor — Techify

Rob é editor da Techify e escreve sobre IA aplicada, automação e engenharia de sistemas para empresas que querem escalar.

  • Focado em automação com IA aplicada

Perguntas frequentes

Quanto custa o Claude Sonnet 5.5 na API?
O preço é US$ 2 por milhão de tokens de entrada e US$ 10 de saída. Batch assíncrono custa US$ 1 e US$ 5. A escrita de cache custa US$ 2,50 para cinco minutos ou US$ 4 para uma hora. Em 7 de outubro, a Anthropic anunciou a redução da leitura de cache de US$ 0,20 para US$ 0,10 por milhão de tokens. A página original e parte da tabela ainda exibem a tarifa anterior; o anúncio do Haiku 5.5 e a seção de prompt caching confirmam a atualização. Confirme as condições da sua plataforma e inclua ferramentas, raciocínio e revisão no custo total.
Claude Sonnet 5.5 é melhor que Opus 5.5 nos benchmarks?
Não existe uma conclusão universal. No Terminal-Bench 4.0 reportado pela Anthropic, Sonnet marcou 70,6% e Opus 66,4%, usando esforços diferentes e um ambiente específico. No FrontierCode 1.1 Main, Sonnet em Xhigh chegou a 52,1%, contra 54,4% do Opus. Avaliações profissionais e de interface também usam critérios distintos. A decisão deve considerar tarefa, configuração e custo de revisão. Um resultado superior em um benchmark não demonstra vantagem em todas as atividades da empresa.
Vale a pena usar esforço Max no Claude Sonnet 5.5?
Não como regra geral. No FrontierCode 1.1 Main divulgado, Sonnet 5.5 atingiu 52,1% em Xhigh e 46,2% em Max. Esforço elevado pode extrapolar escopo ou contribuir para timeouts. O padrão anunciado é High na API e Medium nos aplicativos e Claude Code. Compare configurações em tarefas com critérios de aceite previamente definidos e registre tokens de raciocínio, tempo e revisão. O objetivo é melhorar o trabalho aceito, não maximizar a quantidade de pensamento produzida.
Como migrar uma integração para Claude Sonnet 5.5?
Revise parâmetros e tratamento de respostas antes da troca. Use tool_choice auto, pois any e tool não são suportados, e não presuma que strict tools garantam uma chamada. Valores não padrão de temperature, top_p e top_k retornam 400. Faça parsing de content por type, preserve thinking e signature e mantenha histórico append-only. between_tools aceita low, medium e high, não xhigh ou max. Registre o modelo efetivo, porque safeguards podem acionar fallback para Sonnet 5.
Como uma PME pode avaliar Claude Sonnet 5.5 sem depender de rankings?
Comece com 30 tarefas propostas: dez de extração e classificação, dez de alterações delimitadas e dez de fluxos com ferramentas. Defina resultado esperado e reprovação antes de executar. Compare configurações com contexto e ferramentas equivalentes, registrando conclusão, escopo, tokens, raciocínio, retries, fallback e revisão humana. Esse conjunto é um ponto de partida, não uma validação universal. A Techify recomenda decidir pelo custo por tarefa aceita e usar modelos baratos para triagem somente depois de medir sua qualidade.