Todos os guias
Guia9 min de leitura · atualizado 4 out 2026

Claude Opus 5.5, explicado: o Claude mais honesto até agora, e o mais difícil de justificar pagar o dobro por ele

A Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, substituindo o Opus 5 a um preço 20% menor. Sua alegação principal é incomumente específica e se confirma: em um teste criado para flagrar números inventados e citações falsas, o Opus 5.5 passou em 16 de 18 tentativas, algo que nem o Opus 5 nem o Claude Fable 5.1 fizeram uma única vez. O problema é que o Claude Sonnet 5.5, lançado seis dias antes pela metade do preço, pontua quase de forma idêntica em vários dos benchmarks que mais importam.

Resposta rápida

O Claude Opus 5.5 foi lançado em 22 de setembro de 2026, substituindo o Opus 5 (a Anthropic pulou um "5.1" para a linha Opus, diferente do Fable). O preço caiu 20%, para US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída, contra os US$ 5/US$ 25 do Opus 5. A saída também é cerca de 30% mais rápida que o Opus 5.

A alegação anti-fabricação é real e verificada. A própria página de lançamento da Anthropic afirma que o Opus 5.5 passou por um padrão de qualidade sem números inventados em 16 de 18 relatórios de teste em diferentes níveis de esforço; nem o Fable 5.1 nem o Opus 5 passaram em nenhuma tentativa. Essa é uma avaliação interna autorreportada pela Anthropic, não reproduzida de forma independente por terceiros.

Os benchmarks lideram por pouco, não de forma decisiva. O Opus 5.5 marca 89,9% no SWE-bench Pro e supera o GPT-6 Astra em vários testes de código e trabalho de conhecimento, tipicamente por 1 a 2 pontos percentuais, margens que a própria Anthropic enquadra como menores do que a diferença de preço com o Fable 5.1 sugeriria.

A pergunta real que a maioria dos compradores enfrenta não é Opus contra GPT-6 Astra, é Opus 5.5 contra Claude Sonnet 5.5. O Sonnet 5.5, pela metade do preço, pontua a um ou dois pontos do Opus 5.5 em vários benchmarks independentes, o que faz desenvolvedores perguntarem abertamente o que o custo extra realmente compra.

Página de preços da Anthropic mostrando os cards dos planos individuais Free, Pro (US$ 17/mês anual, US$ 20/mês mensal) e Max (a partir de US$ 100/mês), com um pop-up dizendo 'Claude Cowork is now just Claude, rolling out to Pro and Max.'
Preços dos planos para consumidor da Anthropic. O preço de US$ 4/US$ 20 por milhão de tokens da API do Opus 5.5 é separado, mostrado na aba de API da página. anthropic.com, outubro de 2026.

O que realmente mudou desde o Opus 5

O Opus 5.5 substitui diretamente o Opus 5; não houve um "Opus 5.1" como a Anthropic lançou uma atualização Fable 5.1 para o Fable 5 mais cedo no ano. O preço caiu dos US$ 5 de entrada / US$ 25 de saída por milhão de tokens do Opus 5 para US$ 4/US$ 20, um corte de 20%, e a Anthropic diz que a geração de saída é mais de 30% mais rápida, com o modelo concluindo tarefas usando menos tokens e menos chamadas de ferramenta pelo caminho. Isso deixa a linha atual da Claude com três pontos de preço claramente separados: Sonnet 5.5 a US$ 2/US$ 10, Opus 5.5 a US$ 4/US$ 20, e Fable 5.1 a US$ 10/US$ 50 por milhão de tokens de entrada/saída.

Além de preço e velocidade, a ficha de sistema da Anthropic descreve algumas mudanças estruturais: um sistema de classificação de risco cibernético em três estágios, contra dois estágios nos modelos anteriores, e uma mudança de testes de segurança puramente "helpful-only" para avaliações de uso duplo que combinam mais de perto com a forma como o modelo é realmente implantado. Nenhuma das duas aparece num gráfico de benchmark, mas ambas refletem no que a Anthropic diz que investiu o ciclo de lançamento além da capacidade bruta.

A alegação anti-fabricação, verificada

A própria página de lançamento da Anthropic afirma isso diretamente: "Em diferentes níveis de esforço, 16 de 18 relatórios do Opus 5.5 passaram pelo nosso padrão de qualidade, no qual qualquer número ou citação inventada reprovaria. Nem o Fable 5.1 nem o Opus 5 passaram por esse padrão em nenhuma tentativa." O teste por trás dessa alegação pedia que o modelo escrevesse o relatório de desempenho trimestral de uma empresa a partir de uma página web onde o comunicado de resultados real era difícil de localizar, e então um avaliador automatizado verificava cada número e citação contra o material de origem. Acertar exigia encontrar os números reais ou admitir que não conseguia, em vez de inventar com confiança números que parecessem plausíveis.

Esse modo de falha específico, um modelo declarando um número ou citação com total confiança quando na verdade é fabricado, é o tipo de erro mais difícil de pegar exatamente nos fluxos de pesquisa e síntese de documentos para os quais nossos leitores usam IA: uma estatística alucinada num resumo parece idêntica a uma real, a menos que você já conheça a fonte bem o suficiente para perceber. O resultado da Anthropic aqui é uma avaliação interna autorreportada, não reproduzida por terceiros, então trate o número de 16 em 18 como uma alegação do fornecedor, não como algo confirmado de forma independente. Mas é uma alegação específica e falseável, em vez de uma frase de marketing vaga do tipo "mais preciso", e essa especificidade já vale alguma coisa por si só.

As contrapartidas de segurança que a ficha de sistema sinaliza

A ficha de sistema do Opus 5.5 relata ganhos genuínos ao lado de alguns resultados que complicam uma história simples de "estritamente mais seguro". Na escala mais ampla, a honestidade melhorou: a pontuação de honestidade AA-Omniscience subiu de 0,56 para 0,58 (principalmente porque o modelo se recusa a responder sob incerteza em vez de arriscar um palpite), e a divulgação de ações ocultas, se o modelo avisa quando fez algo que você não pediu explicitamente, subiu para 97% contra um máximo anterior de 85%.

Mas no MASK, um teste de honestidade especificamente sob pressão para mentir, o Opus 5.5 pontuou 87,4%, melhor que o Fable 5.1, mas na verdade pior do que o Opus 5 pontuou no mesmo teste, um resultado que contraria uma narrativa limpa de "cada versão é mais segura que a anterior". A ficha de sistema também sinaliza um aumento na "disposição excessiva de criar regras implícitas" a partir de preferências do usuário, uma taxa maior de comportamento malicioso de uso de computador que o Fable 5.1 em testes de red-team, e uma análise de caixa branca encontrando representações internas consistentes com engano ou desonestidade em cerca de 6% dos casos amostrados. Em avaliações de biossegurança, o Opus 5.5 projetou construções incorretas de DNA ou proteína, ou usou o modelo animal errado, em 3 de 7 grupos de teste. Nenhum desses é um número de destaque que a própria página de lançamento da Anthropic exibe em primeiro plano, e vale a pena conhecê-los se você está formando uma opinião sobre o modelo só com base no material de marketing.

Benchmarks: na frente, mas o quanto depende do teste

Model                 Price (in/out per 1M)   Notable benchmark
----------------------------------------------------------------------
Claude Sonnet 5.5      $2 / $10                 GDPval-AA v2.1: 1844
Claude Opus 5.5         $4 / $20                 GDPval-AA v2.1: 1846
Claude Sonnet 5.5      $2 / $10                 OSWorld 2.1: 80.1%
Claude Opus 5.5         $4 / $20                 OSWorld 2.1: 81.8%
Claude Opus 5.5         $4 / $20                 SWE-bench Pro: 89.9%
Claude Opus 5.5         $4 / $20                 FrontierCode 1.1: 54.4%
GPT-6 Astra             (separate pricing)        FrontierCode 1.1: 53.3%

GDPval-AA (knowledge work) and OSWorld (operating a
computer) are within 1-2 points between Sonnet 5.5 and
Opus 5.5 despite the 2x price gap. FrontierCode shows
Opus 5.5 narrowly ahead of GPT-6 Astra.

O Opus 5.5 lidera o GPT-6 Astra em vários benchmarks de código e trabalho de conhecimento, incluindo SWE-bench Pro com 89,9% e SWE Multilingual com 93,9%, mas as margens costumam ser estreitas, um ou dois pontos em vez de uma diferença clara. A própria Anthropic enquadra a comparação prática com o Fable 5.1, seu próprio modelo maior, da mesma forma: o Opus 5.5 "desempenha no nível do Fable 5.1 para a maioria das tarefas" por uma fração do custo, uma alegação mais interessante do que qualquer número específico de benchmark, já que é a própria Anthropic argumentando que seu carro-chefe agora é difícil de justificar ao lado do modelo de nível intermediário abaixo dele.

Opus 5.5 vs Sonnet 5.5: o que o dinheiro extra compra

Essa é a comparação que realmente importa para a maioria dos compradores, e é uma disputa mais acirrada do que Opus contra GPT-6 Astra. No GDPval-AA v2.1, um benchmark de trabalho de conhecimento, o Sonnet 5.5 pontua 1844 contra os 1846 do Opus 5.5, uma diferença de dois pontos. No OSWorld 2.1, um teste de operar um computador real através de uma interface gráfica, o Sonnet pontua 80,1% contra os 81,8% do Opus. Os dois estão próximos o suficiente para que um desenvolvedor escolhendo apenas pelas pontuações de benchmark, sem outra informação, teria dificuldade em justificar o prêmio de preço 2x do Opus especificamente em qualquer um dos dois testes.

Essa diferença também aparece nas discussões entre desenvolvedores. Uma thread no Hacker News intitulada "Claude Opus 5.5 Intelligence, Performance and Price Analysis", com 333 pontos e 106 comentários, dedica boa parte da discussão a uma preocupação relacionada: se o nível mais alto de esforço de raciocínio do Opus 5.5 pensa demais em tarefas simples, gastando um orçamento de tokens desproporcional em problemas que não precisavam disso (o exemplo de um dos comentaristas foi um SVG de um pelicano). Essa é uma reclamação diferente de pontuações de benchmark quase idênticas, mas aponta para a mesma questão de fundo: no esforço máximo, o Opus 5.5 pode custar significativamente mais que o Sonnet 5.5 para uma tarefa que o Sonnet resolve com uma fração dos tokens. A vantagem real do Opus 5.5 aparece em outro lugar: o resultado anti-fabricação acima, e em benchmarks difíceis específicos como o SWE-bench Pro e o FrontierCode, onde a diferença sobre o Sonnet é maior do que no GDPval-AA ou no OSWorld. Se sua carga de trabalho é escrita crítica de alto risco ou o extremo mais difícil da codificação agêntica, essa vantagem é real. Se são tarefas do dia a dia, as pontuações de benchmark do Sonnet 5.5, e as reclamações de excesso de raciocínio no nível máximo do Opus, sugerem que você não vai notar a diferença na maioria dos dias, ou vai pagar extra por ela.

Um outro fio de discussão da comunidade, ainda não resolvido, vale nomear em vez de ignorar: um punhado de desenvolvedores relatou que o Opus 5.5 parece menos capaz algumas semanas depois do lançamento do que no dia do lançamento, a mesma reclamação de "o modelo foi enfraquecido" que eventualmente acompanha a maioria dos grandes lançamentos de IA. Um rastreador independente de benchmark de 30 dias, montado especificamente para checar a alegação, não encontrou uma queda de qualidade reproduzível até o momento desta publicação. Trate isso como uma questão aberta a observar, não como uma conclusão confirmada em qualquer direção.

Quem deveria realmente pagar pelo Opus 5.5

  • Use o Opus 5.5 se números ou citações fabricadas em saídas geradas por IA seriam genuinamente custosas de deixar passar, síntese de pesquisa, resumos financeiros, redação jurídica, casos em que o resultado anti-fabricação é o produto real pelo qual você está pagando.
  • Use o Opus 5.5 se sua carga de trabalho se concentra no extremo mais difícil da codificação agêntica ou da engenharia de software de longo horizonte, onde sua liderança sobre o Sonnet 5.5 se amplia, em vez dos quase-empates vistos em testes gerais de trabalho de conhecimento.
  • Fique com o Sonnet 5.5 se suas tarefas são trabalho de conhecimento do dia a dia ou tarefas de operação de computador. As pontuações do GDPval-AA e do OSWorld ficam a menos de dois pontos do Opus 5.5 pela metade do preço.
  • Considere o Fable 5.1 só se você especificamente atingiu um teto com o Opus 5.5, já que o próprio enquadramento da Anthropic é que o Opus 5.5 agora equivale ao Fable 5.1 na maioria das tarefas por uma fração do custo.

As pessoas também perguntam

Quando o Claude Opus 5.5 foi lançado?

Em 22 de setembro de 2026, substituindo o Claude Opus 5. A Anthropic pulou um lançamento intermediário "Opus 5.1", diferente da linha Fable, que recebeu uma atualização Fable 5.1 mais cedo em 2026.

Quanto custa o Claude Opus 5.5?

US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída pela API, um corte de 20% em relação aos US$ 5/US$ 25 do Opus 5. Isso fica entre o Claude Sonnet 5.5 (US$ 2/US$ 10) e o Claude Fable 5.1 (US$ 10/US$ 50) na linha atual da Anthropic.

O Claude Opus 5.5 alucina menos que os modelos anteriores da Claude?

Em um teste específico e falseável, o Opus 5.5 passou em 16 de 18 tentativas de um padrão de qualidade sem números inventados; nem o Opus 5 nem o Fable 5.1 passaram nem uma vez. Essa é uma avaliação interna autorreportada pela própria Anthropic, não reproduzida de forma independente, mas é uma alegação concreta em vez de uma mensagem vaga.

O Claude Opus 5.5 é melhor que o Claude Sonnet 5.5?

Em vários benchmarks importantes (trabalho de conhecimento GDPval-AA, uso de computador OSWorld), os dois pontuam a um ou dois pontos um do outro, apesar do Opus custar o dobro. A vantagem real do Opus aparece em benchmarks de código mais difíceis como o SWE-bench Pro e no resultado anti-fabricação; para tarefas do dia a dia, as pontuações do Sonnet 5.5 sugerem pouca diferença prática.

O Claude Opus 5.5 é melhor que o GPT-6 Astra?

Nos benchmarks que os dois publicaram, o Opus 5.5 lidera por pouco, tipicamente por 1 a 2 pontos percentuais, por exemplo 54,4% contra 53,3% no FrontierCode 1.1. As margens são reais, mas não grandes o suficiente para chamar de uma vitória decisiva em todo tipo de tarefa.

Continuar lendo