/
Por que o Claude Opus 4.8 é o modelo de programação mais confiável da Anthropic
Last Updated:
2026-06-08

Por que o Claude Opus 4.8 é o modelo de programação mais confiável da Anthropic

A Anthropic lançou o Claude Opus 4.8 em 28 de maio de 2026, chamando-o de "uma melhoria modesta, mas tangível, em relação ao seu antecessor". Para contextualizar, o novo Opus chegou apenas 41 dias depois da geração anterior, com a qual alguns usuários não ficaram muito satisfeitos. Mas ele também traz alguns recursos novos bastante poderosos — e vamos explicar todos eles em detalhes neste artigo.

Converse com o Opus 4.8 na Overchat AI seguindo este link.

TLDR

  • Quando foi lançado? O Opus 4.8 foi lançado em 28 de maio de 2026, apenas 41 dias depois do Opus 4.7.
  • Qual é o ponto principal deste lançamento? No geral, desempenho mais estável e melhor capacidade de programação. O Opus 4.8 tem cerca de quatro vezes menos chance que o 4.7 de entregar código com bugs não sinalizados, e suas pontuações gerais de alinhamento estão próximas das do Claude Mythos, o modelo ainda restrito que a Anthropic considera o seu mais capaz.
  • Qual é a melhoria mais importante? O novo modelo apresenta avanços na programação, o que é confirmado pela pontuação superior no SWE-Bench Pro — 69,2% contra 64,3% do 4.7.
  • O que há de novo? Entre os novos recursos estão os Dynamic Workflows (o modelo cria centenas de subagentes paralelos dentro do Claude Code), o Fast Mode (que oferece saída 2,5x mais rápida do que os modos rápidos anteriores do Claude, sendo 3x mais barato) e as atualizações de mensagem de sistema em tempo real, que não quebram mais o cache de prompt.
  • Quanto custa usar o modelo via API? O preço permanece inalterado, em US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída.

O que é o Claude Opus 4.8?

O Claude Opus 4.8 é o modelo principal da Anthropic e uma evolução direta do Opus 4.7.

Ele chegou logo após o Opus 4.7, que havia sido criticado por gerar comentários excessivamente verbosos no código produzido e por uma tendência a pensar demais em tarefas simples.

A Cognition, equipe por trás do agente de programação Devin, afirmou explicitamente no anúncio de lançamento da Anthropic que o Opus 4.8 "corrige os problemas de verbosidade nos comentários e de chamada de ferramentas que observamos no Opus 4.7".

O modelo também mostra melhorias difíceis de captar com benchmarks tradicionais, sobretudo em alinhamento.

O que é alinhamento? É o grau em que uma IA se comporta de acordo com as intenções humanas, segue instruções de forma confiável e responde com segurança em situações complexas.

Segundo os pesquisadores de alinhamento da Anthropic, o Opus 4.8 tem desempenho quase tão bom nessas áreas quanto o Claude Mythos Preview, o modelo interno mais avançado da empresa.

Vale lembrar que o Mythos Preview ainda está disponível apenas para um pequeno grupo de parceiros, porque a Anthropic acredita que suas capacidades poderiam representar riscos de cibersegurança caso o acesso fosse aberto ao público em geral.

O que mudou em relação ao Opus 4.7

Se você já usa o Opus 4.7, veja o que esperar do novo modelo, tanto em termos de recursos visíveis quanto das melhorias nos bastidores.

  • Menos bugs. O Opus 4.8 tem cerca de quatro vezes menos chance de deixar um bug no código gerado.
  • O esforço padrão caiu de xhigh para high. Em tarefas de programação, o padrão high usa aproximadamente o mesmo volume de tokens que o Opus 4.7, mas produz resultados melhores.
  • Dynamic Workflows no Claude Code. O Claude agora pode criar centenas de subagentes em paralelo.
  • Fast Mode. Um novo nível que roda 2,5x mais rápido que o padrão, a US$ 10/US$ 50 por milhão de tokens, o que é três vezes mais barato que o modo rápido equivalente do Opus 4.7.
  • Atualizações de mensagem de sistema em tempo real. A Messages API agora permite atualizar as instruções do Claude no meio de uma tarefa sem quebrar o cache de prompt, o que é útil para ajustar permissões ou contexto enquanto um agente está em execução.
  • Limite menor para prompts cacheáveis. Prompts com apenas 1.024 tokens já podem ser cacheados, contra os 2.048 anteriores.
  • Correções de verbosidade e de chamada de ferramentas. Você vai notar que o modelo tem muito menos chance de ficar preso em longos ciclos de raciocínio autocontraditórios, em que revisa o próprio plano repetidamente ("para corrigir Y, preciso fazer X... na verdade, deveria fazer N... espera, isso também não está certo"). Ele também decide melhor quando as ferramentas são realmente necessárias e tem menos tendência a chamá-las com parâmetros incorretos.

Recursos do Claude Opus 4.8

Vamos falar com mais detalhes sobre os novos recursos adicionados neste lançamento:

Dynamic Workflows

Dentro do Claude Code, o Opus 4.8 agora pode delegar tarefas grandes a centenas de subagentes rodando em paralelo, de forma semelhante ao recurso Agent Swarm apresentado no Kimi K2.5/2.6.

Segundo a Anthropic, isso possibilita fluxos de trabalho que antes eram difíceis de automatizar, incluindo migrações que abrangem toda a base de código. Um exemplo que eles destacam é a atualização de uma base de código com várias centenas de milhares de linhas, do planejamento inicial até um pull request pronto para merge, usando a suíte de testes existente como principal medida de sucesso.

Esse recurso está disponível nos planos Enterprise, Team e Max do Claude Code. Tenha em mente que rodar centenas de agentes simultaneamente pode consumir tokens e limites de uso muito rapidamente, especialmente em projetos grandes ou complexos.

Fast Mode

Este é um novo nível que:

  • Roda a 2,5x a velocidade de saída padrão.
  • Custa mais por token — US$ 10 de entrada e US$ 50 de saída por milhão.
  • É cerca de três vezes mais barato que o modo rápido equivalente em modelos Claude anteriores.

É útil para cargas de trabalho de alto volume em que a velocidade importa mais do que o custo por token.

Atualizações de mensagem de sistema em tempo real

Uma mudança pequena, mas prática, na Messages API. 

  • Antes, editar a mensagem de sistema dentro de uma conversa ativa quebrava o cache de prompt, o que tornava os ajustes no meio da tarefa caros.
  • Com o Opus 4.8, você agora pode atualizar permissões, orçamentos de tokens e contexto enquanto a sessão está em andamento, sem pagar o custo total de recache.

Janela de contexto de 1 milhão de tokens

Inalterada em relação ao Opus 4.7. Alguns pontos a observar aqui:

  • O contexto completo de 1M está disponível na Claude API, no Amazon Bedrock e no Vertex AI.
  • O Microsoft Foundry expõe 200K.
  • A saída máxima é de 128K tokens.

Honestidade e Alinhamento

O Opus 4.8 tem cerca de quatro vezes menos chance que o Opus 4.7 de entregar um bug silenciosamente. Em vez disso, se o modelo comete um erro ou gera código com um bug, o Claude vai avisar que não tem certeza se o código funciona.

Nessas situações, o Opus 4.7 era mais propenso a entregar código falho, mas relatá-lo como funcional. 

Segundo, a equipe de alinhamento da Anthropic atribui ao Opus 4.8 uma pontuação de desalinhamento de 1,9, abaixo dos 2,5 do Opus 4.7. Isso também está próximo do Claude Mythos Preview, que pontua em torno de 1,7 (pontuações menores são melhores).

Eles definem esses números com base em cerca de 2.600 sessões de investigação simuladas por modelo, nas quais medem o engano, a colaboração com usos indevidos e a desconsideração da intenção do usuário. A avaliação completa ocupa 244 páginas no System Card do Opus 4.8. Em resumo: este é o Claude mais confiável que a Anthropic já disponibilizou por meio de sua API pública.

Benchmarks do Claude Opus 4.8

O Opus 4.8 apresenta seus maiores avanços em programação, raciocínio matemático e uso agêntico do computador. Aqui está a tabela completa de benchmarks mostrando seu desempenho nas principais avaliações:

Categoria Benchmark Pontuação
Programação SWE-Bench Verified 88,6%
Programação SWE-Bench Pro 69,2%
Programação SWE-Bench Multilingual 84,4%
Programação Terminal-Bench 2.1 74,6%
Raciocínio GPQA Diamond 93,6%
Raciocínio Humanity's Last Exam (sem ferramentas) 49,8%
Raciocínio Humanity's Last Exam (com ferramentas) 57,9%
Matemática USAMO 2026 96,7%
Uso de agente e ferramentas OSWorld-Verified 83,4%
Uso de agente e ferramentas Online-Mind2Web 84%
Uso de agente e ferramentas MCP-Atlas 82,2
Uso de agente e ferramentas GDPval-AA (Elo) 1890
Contexto longo GraphWalks BFS 1M 68,1

Opus 4.8 vs Opus 4.7

O Opus 4.7 foi lançado seis semanas antes e era o modelo principal da Anthropic até a chegada do Opus 4.8. Ele introduziu o sistema de esforço em múltiplos níveis, uma janela de contexto de 1M e as melhorias agênticas sobre as quais o Opus 4.8 agora se apoia. As críticas chegaram rápido: comentários de código verbosos, chamadas de ferramentas atrapalhadas e uma tendência a gastar tokens demais em tarefas que deveriam ser rápidas.

Benchmark Opus 4.8 Opus 4.7
SWE-Bench Verified 88,6% 87,6%
SWE-Bench Pro 69,2% 64,3%
Terminal-Bench 2.1 74,6% 66,1%
GPQA Diamond 93,6% 94,2%
Humanity's Last Exam (sem ferramentas) 49,8% 46,9%
USAMO 2026 96,7% 69,3%
GDPval-AA (Elo) 1890 1753
Entrada / Saída por 1M US$ 5,00 / US$ 25,00 US$ 5,00 / US$ 25,00

O salto de +4,9 no SWE-Bench Pro é o sinal prático de programação — esse é o benchmark de código mais difícil e menos saturado, e uma diferença de 5 pontos significa que o Opus 4.8 resolve tarefas reais de programação que o Opus 4.7 não conseguia. O salto de +27 no USAMO 2026, a Olimpíada de Matemática dos EUA, é o maior ganho em matemática em um único ciclo na linha Opus e sinaliza uma mudança qualitativa na profundidade do raciocínio matemático. O GPQA está estável — ambos os modelos ficam acima da linha de saturação de 93%, onde as perguntas restantes estão no limite da capacidade de especialistas humanos.

Opus 4.8 vs GPT-5.5

O GPT-5.5 é o modelo de ponta atual da OpenAI e ocupa o topo do Artificial Analysis Intelligence Index, com 60,2. É o modelo mais forte em programação no estilo terminal (em que os comandos rodam ao vivo em um shell) e um dos modelos principais mais baratos em tokens de saída.

Benchmark Opus 4.8 GPT-5.5
SWE-Bench Verified 88,6% 88,7%
SWE-Bench Pro 69,2% 58,6%
Terminal-Bench 2.1 74,6% 78,2%
GPQA Diamond 93,6% 93,6%
Humanity's Last Exam (sem ferramentas) 49,8% 41,4%
OSWorld-Verified 83,4% 78,7%
GDPval-AA (Elo) 1890 1769
Entrada / Saída por 1M US$ 5,00 / US$ 25,00 US$ 5,00 / US$ 15,00

O padrão é dividido. O GPT-5.5 ainda vence o Terminal-Bench por uma margem clara de 3,6 pontos, o que importa para trabalhos pesados de linha de comando — rodar shells, gerenciadores de pacotes, ferramentas de sistema. O Opus 4.8 vence por margens maiores no SWE-Bench Pro (uma vantagem de 10 pontos, o que significa que resolve issues reais do GitHub a uma taxa substancialmente maior), no Humanity's Last Exam (o teste de raciocínio mais difícil em uso atualmente), no uso agêntico do computador e no GDPval — a métrica da Artificial Analysis para tarefas de valor econômico real, em que uma vantagem de 121 pontos Elo se traduz em uma taxa de vitória direta de cerca de dois terços. O GPT-5.5 é 40% mais barato na saída. Para a maioria dos trabalhos de conhecimento e engenharia estruturada, o Opus 4.8 lidera. Para fluxos de trabalho via CLI com uso intenso de terminal ou para saída sensível a custo, o GPT-5.5 ainda tem seus argumentos.

Opus 4.8 vs Gemini 3.5 Flash

O Gemini 3.5 Flash é o modelo intermediário do Google, lançado em 19 de maio de 2026. Ele é posicionado como "inteligência de fronteira com a latência do Flash" — cerca de 4x mais rápido que o Opus e um terço do preço, mas troca capacidade bruta por velocidade. Sua multimodalidade nativa (texto, imagem, áudio, vídeo, PDF) está em outro patamar em comparação a qualquer modelo da linha Opus.

Benchmark Opus 4.8 Gemini 3.5 Flash
SWE-Bench Pro 69,2% 55,1%
MCP Atlas 82,2 83,6%
Humanity's Last Exam (sem ferramentas) 49,8% 40,2%
Velocidade de saída (tokens/seg) ~50 ~278–289
Entrada / Saída por 1M US$ 5,00 / US$ 25,00 US$ 1,50 / US$ 9,00

Esses modelos atendem a casos de uso genuinamente diferentes. O Opus 4.8 lidera em todos os benchmarks de raciocínio, programação e conhecimento desse conjunto — e por margens grandes o suficiente para que, em trabalhos difíceis, seja a única escolha sensata. Mas o Gemini 3.5 Flash mantém uma pequena vantagem no uso de ferramentas MCP, roda cerca de 4x mais rápido e custa cerca de um terço do preço. Para trabalhos de alto volume em que a vazão importa mais do que a qualidade máxima — redação de rascunhos, resumos, cadeias simples de uso de ferramentas — o Gemini Flash muitas vezes entrega mais valor por dólar. Para trabalhos multimodais, é a melhor escolha em qualquer caso.

Preços do Claude Opus 4.8

O preço padrão é inalterado em relação ao Opus 4.7. Veja o preço por 1M de tokens:

  • Entrada (padrão): US$ 5,00 por 1 milhão de tokens
  • Entrada (leitura de cache): US$ 0,50 por 1 milhão de tokens
  • Saída (padrão): US$ 25,00 por 1 milhão de tokens
  • Entrada (fast mode): US$ 10,00 por 1 milhão de tokens
  • Saída (fast mode): US$ 50,00 por 1 milhão de tokens

Se você quiser pular totalmente os preços da API, pode conversar com o Claude Opus 4.8 na Overchat AI como parte de uma única assinatura que também inclui GPT-5.5, Gemini 3.5 Flash, Kimi K2.6, Qwen 3.7 Max e muito mais.

Limitações do Claude Opus 4.8

O GPT-5.5 ainda é melhor para trabalho de terminal. No Terminal-Bench, o GPT-5.5 pontua 78,2 contra os 74,6 do Opus 4.8. Se você passa a maior parte do tempo na linha de comando, o GPT-5.5 ainda leva vantagem.

O GPQA Diamond está um pouco pior do que antes. O Opus 4.8 pontua 93,6, abaixo dos 94,2 do Opus 4.7. A diferença é pequena, mas o desempenho de fato caiu.

A saída custa mais do que a do GPT-5.5. O Opus 4.8 custa US$ 25 por milhão de tokens de saída, enquanto o GPT-5.5 custa US$ 15. Se suas aplicações geram muito texto, esse preço mais alto pode pesar rapidamente.

A Anthropic está lançando novos modelos muito rapidamente. O Opus 4.8 chegou apenas 41 dias depois do Opus 4.7. Se sua equipe migrou recentemente para o 4.7, talvez você não esteja ansioso para trocar de novo tão cedo, ainda mais porque os prompts podem precisar de ajustes entre as versões.

Quando você deve usar o Claude Opus 4.8?

Escolha o Opus 4.8 se:

  • Você escreve muito código. Ele tem desempenho especialmente bom em grandes tarefas de programação, como refatorações de múltiplos arquivos, correção de bugs e migrações de base de código.
  • Você usa o Claude Code. O novo recurso Dynamic Workflows e o uso aprimorado de ferramentas fazem do Opus 4.8 uma evolução e tanto para tarefas de programação baseadas em agentes.
  • Você precisa de respostas confiáveis. O Opus 4.8 tem menos chance de inventar fatos, deixar passar problemas óbvios ou dar a resposta errada com confiança. Se a precisão importa mais que a velocidade, esse é um dos seus maiores pontos fortes.
  • Você lida com problemas difíceis de matemática ou ciência. O Opus 4.8 mostra alguns de seus maiores ganhos em raciocínio matemático e científico.

Escolha outro modelo se:

  • A maior parte do seu trabalho acontece no terminal. O GPT-5.5 ainda tem melhor desempenho em tarefas focadas em terminal e fluxos de trabalho de linha de comando.
  • Você precisa de entrada de áudio ou vídeo. O Opus 4.8 consegue entender mídia, mas não tão bem quanto algo como o Gemini 3.5 Flash.
  • Você precisa de pesos abertos. Modelos como o Kimi K2.6 são mais adequados para auto-hospedagem, personalização e fine-tuning.
  • O custo é uma grande preocupação. O Opus 4.8 é mais caro que o GPT-5.5 e o Gemini 3.5 Flash, especialmente se você gera grandes volumes de saída.

Perguntas frequentes

Quando o Claude Opus 4.8 foi lançado?

O Claude Opus 4.8 foi lançado em 28 de maio de 2026, apenas 41 dias depois do Opus 4.7. Ele já está disponível na Overchat AI, no Claude.ai, no Claude Code, na Claude API, no Amazon Bedrock e no Vertex AI.

Quanto custa o Claude Opus 4.8?

O preço é inalterado em relação ao Opus 4.7:

  • Entrada: US$ 5 por milhão de tokens
  • Entrada em cache: US$ 0,50 por milhão de tokens
  • Saída: US$ 25 por milhão de tokens

A Anthropic também introduziu o Fast Mode, que roda a cerca de 2,5× a velocidade normal. Ele custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. O Fast Mode está atualmente em preview.

O Opus 4.8 é melhor que o Opus 4.7?

Para a maioria das tarefas do mundo real, sim.

Ele pontua mais alto em programação, matemática e tarefas baseadas em agentes. Alguns benchmarks ficaram estáveis ou caíram um pouco, mas esses testes já estão perto do limite para os melhores modelos atuais.

A melhoria mais significativa é a confiabilidade. O Opus 4.8 produz muito menos erros de programação não sinalizados e tem desempenho melhor nos testes de alinhamento da Anthropic.

Como o Claude Opus 4.8 se compara ao GPT-5.5?

O Opus 4.8 tem melhor desempenho em programação, raciocínio e tarefas baseadas em agentes. Ele também pontua mais alto em benchmarks como o SWE-Bench Pro e o Humanity's Last Exam.

O GPT-5.5 ainda tem melhor desempenho em tarefas focadas em terminal e fluxos de trabalho de linha de comando. Ele também é mais barato, custando cerca de 40% menos em tokens de saída.

Em resumo:

  • Escolha o Opus 4.8 para programação, raciocínio e fluxos de trabalho com agentes.
  • Escolha o GPT-5.5 para trabalho de terminal e custos de saída mais baixos.

O que são os Dynamic Workflows?

Dynamic Workflows é um novo recurso do Claude Code. Ele permite que o Opus 4.8 divida tarefas grandes em partes menores e as execute em centenas de subagentes ao mesmo tempo.

A Anthropic afirma que isso pode ser usado para tarefas como grandes migrações de base de código, em que o modelo atualiza um projeto, roda testes e prepara as mudanças para revisão.

O recurso está atualmente disponível nos planos Enterprise, Team e Max do Claude Code.

Posso usar o Claude Opus 4.8 para trabalhos que não sejam de programação?

Sim. O Opus 4.8 também é forte em matemática, pesquisa, tarefas de contexto longo e fluxos de trabalho com agentes baseados na web. Seus resultados de benchmark nessas áreas estão entre os melhores disponíveis atualmente.

Conclusão

Com o Claude Opus 4.8, a Anthropic corrigiu muitas das preocupações com verbosidade e uso de ferramentas que os usuários levantaram em relação ao Opus 4.7. O modelo também produz código com muito menos bugs não sinalizados e é, de modo geral, mais confiável. Ao mesmo tempo, a equipe de alinhamento da Anthropic diz que o Opus 4.8 tem desempenho próximo ao do Claude Mythos Preview, o modelo interno mais avançado da empresa. Esse é um dos resultados de alinhamento mais fortes que a empresa já relatou para um modelo público. Para testar o Opus 4.8 nos seus próprios fluxos de trabalho hoje, acesse a Overchat AI e comece a conversar com o Claude Opus 4.8.