Resumo rápido
- O Claude Opus 4.6 é o modelo mais avançado da Anthropic (lançado em 5 de fevereiro de 2026) e estabelece novos recordes no Terminal-Bench 2.0 (65,4%) e no Humanity's Last Exam (53,1%).
- O grande destaque é a janela de contexto de 1 milhão de tokens em beta — um salto de 5x em relação aos 200 mil do Opus 4.5, colocando-o no mesmo nível do Gemini 3 Pro.
- O Raciocínio Adaptativo substitui o antigo botão de raciocínio — agora o Claude decide sozinho quando raciocinar e quando responder direto, embora os primeiros testes mostrem que ele às vezes exagera na cautela.
- O recurso Equipes de Agentes (em prévia) permite que várias instâncias do Claude trabalhem em paralelo em diferentes partes de um projeto — útil para fluxos de trabalho corporativos.
- A Compactação de Contexto resume o contexto automaticamente no servidor quando ele está perto do limite, para que tarefas longas não travem.
- A saída máxima dobrou para 128 mil tokens, e os primeiros usuários relatam grandes ganhos em documentos jurídicos, qualidade da escrita e menos frases previsíveis.
- Em comparação com o Opus 4.5: melhora em quase todos os benchmarks e fica praticamente empatado no SWE-Bench Verified (80,8% contra 80,9%).
- Em comparação com o GPT-5.2: o Opus 4.6 vence em quase tudo, embora o GPT-5.2 seja mais barato na saída (US$ 15/M contra US$ 25/M).
- Em comparação com o Gemini 3 Pro: o Gemini lidera em raciocínio e janela de contexto, mas o Opus 4.6 ainda é o melhor em programação.
- Os preços continuam idênticos aos do Opus 4.5, apesar dos ganhos de desempenho — uma boa surpresa, dada a tendência recente de modelos mais potentes ficarem mais caros. Ainda assim, é o modelo mais caro da lista.
Introdução
Sem mais delongas, vamos lá. O Opus 4.6 é o novo padrão-ouro entre os modelos de programação. No Terminal-Bench 2.0, ele ocupa o primeiro lugar com 65,4%, e no Humanity's Last Exam atinge 53,1%.
Os modelos de programação da Anthropic costumam ser considerados os melhores do mundo, e este não é exceção. Ele estabelece um novo padrão mesmo quando usado sem a janela de contexto de 1M, que no momento está em beta e disponível apenas para usuários da API.
O que é o Claude Opus 4.6?
O Claude Opus 4.6 é o modelo de IA mais avançado da Anthropic, lançado em 5 de fevereiro de 2026 como uma atualização do Opus 4.5 (que estreou em novembro de 2025).
O grande destaque é a janela de contexto de um milhão de tokens (em beta). Isso representa um aumento de cinco vezes em relação ao limite de 200 mil do Opus 4.5, colocando-o no mesmo nível do Gemini 3 Pro, do Google. Antes, muitos usuários já notavam que os modelos Claude se destacam em design e em programação de front-end. No entanto, a janela de contexto limitada fazia com que eles perdessem o contexto com mais facilidade. Isso logo será coisa do passado com o lançamento da janela de 1M.
Principais recursos do Claude Opus 4.6
Uma janela de contexto ampliada não é o único recurso novo deste modelo; há outras melhorias também. A maioria delas só faz diferença em casos de uso corporativos, mas algumas são fundamentais para o funcionamento do modelo. Você com certeza vai notá-las ao conversar com o modelo, então vamos detalhá-las.
Raciocínio Adaptativo — substitui o antigo botão de liga/desliga. Assim como no ChatGPT, agora o Claude responde na hora em tarefas simples ou ativa o raciocínio em tarefas complexas. Nos testes, achei isso meio inconstante — às vezes ele ativa o raciocínio para coisas que eu consideraria bem simples.
Equipes de Agentes — um recurso poderoso para usuários corporativos e avançados — várias instâncias do Claude podem trabalhar em paralelo em diferentes partes de um projeto. No momento, em prévia.
Compactação de Contexto — é um recurso de resumo que roda no servidor. Quando o contexto está prestes a atingir o limite, o Claude reorganiza as informações que ele guarda para deixá-las menores, de modo que as tarefas em andamento não parem.
Saída máxima de 128K — a quantidade de texto que o modelo consegue gerar foi dobrada.
No Reddit, as primeiras avaliações dizem que o Opus 4.6 é impressionante quando o assunto é trabalhar com e criar documentos jurídicos. Sua capacidade de escrita também melhorou, já que ele adiciona menos frases previsíveis e usa um vocabulário mais amplo.
Em resumo, é uma grande vitória em todas as categorias.
Benchmarks do Claude Opus 4.6
O desempenho em benchmarks dá uma ideia aproximada de onde o Opus 4.6 está, mas as melhorias na prática — melhor planejamento, autocorreção, foco sustentado — são o que os desenvolvedores estão relatando.
Programação:
| Benchmark |
Pontuação do Opus 4.6 |
| Terminal-Bench 2.0 |
65.4% |
| SWE-Bench Verified |
80.8% |
| OSWorld (Computer Use) |
72.7% |
| τ2-Bench Retail |
91.9% |
| MCP Atlas |
59.5% |
Raciocínio e conhecimento:
| Benchmark |
Claude Opus 4.6 |
| HLE (with tools) |
53.1% |
| HLE (without tools) |
40.0% |
| GDPval-AA |
1606 Elo |
| BrowseComp |
84.0% |
| ARC AGI 2 |
68.8% |
| BigLaw Bench |
90.2% |
| Finance Agent |
60.7% |
Retenção de contexto longo (quanto maior, melhor):
| Benchmark |
Pontuação do Opus 4.6 |
Pontuação do Sonnet 4.5 |
| MRCR v2 (1M, 8-needle) |
76% |
18.5% |
| MRCR v2 (256K, 8-needle) |
93% |
10.8% |
Claude Opus 4.6 vs outros modelos de IA
Vamos ver como o novo modelo se compara a outros modelos de ponta — tanto da Anthropic quanto da concorrência.
Claude Opus 4.6 vs Opus 4.5
O Opus 4.6 melhora em relação ao Opus 4.5 em todos os benchmarks, exceto no SWE-Bench Verified, onde os dois ficam praticamente empatados (80,8% contra 80,9%).
| Benchmark |
Opus 4.6 |
Opus 4.5 |
Melhoria |
| Terminal-Bench 2.0 |
65.4% |
59.8% |
+5.6pp |
| OSWorld |
72.7% |
66.3% |
+6.4pp |
| ARC AGI 2 |
68.8% |
37.6% |
+31.2pp |
| GDPval-AA |
1606 Elo |
~1416 Elo |
+190 Elo |
| Context Window |
1M (beta) |
200K |
5x increase |
Claude Opus 4.6 vs GPT-5.2
Em comparação com o Chat GPT-5.2, o Opus 4.6 vence em praticamente tudo, embora valha mencionar que o GPT-5.2 cobra menos pelos tokens de saída — US$ 15/M contra US$ 25/M.
| Benchmark |
Opus 4.6 |
GPT-5.2 |
Vencedor |
| Terminal-Bench 2.0 |
65.4% |
64.7% |
Opus 4.6 |
| GDPval-AA |
1606 Elo |
~1462 Elo |
Opus 4.6 |
| HLE (with tools) |
53.1% |
~42% |
Opus 4.6 |
| BrowseComp |
84.0% |
Menor |
Opus 4.6 |
| SWE-Bench Verified |
80.8% |
80.0% |
Opus 4.6 |
| MCP Atlas |
59.5% |
60.6% |
GPT-5.2 |
Claude Opus 4.6 vs Gemini 3 Pro
O Gemini 3 Pro é o primeiro modelo que supera o Opus 4.6 de formas relevantes: especificamente, no raciocínio e em uma janela de contexto maior. Mas é um programador de IA menos poderoso.
| Benchmark |
Opus 4.6 |
Gemini 3 Pro |
Vencedor |
| Terminal-Bench 2.0 |
65.4% |
56.2% |
Opus 4.6 |
| OSWorld |
72.7% |
Menor |
Opus 4.6 |
| GPQA Diamond |
~85% |
91.9% |
Gemini 3 Pro |
| Context Window |
1M (beta) |
2M |
Gemini 3 Pro |
Preços do Claude Opus 4.6
A Anthropic manteve os preços idênticos aos do Opus 4.5, o que é ótimo, dados os ganhos de desempenho — e um pouco surpreendente. Recentemente, vimos os preços subirem quando modelos mais potentes eram lançados, mas, felizmente, não é o caso aqui.
Aqui está tudo o que você precisa saber sobre o custo de usar o Opus 4.6, começando pelos preços da API, que são os seguintes:
| Tipo de token |
Preço por 1M de tokens |
| Entrada (padrão) |
$5.00 |
| Entrada (leitura de cache) |
$0.50 |
| Saída |
$25.00 |
A seguir, veja como ficam os preços de contexto longo — eles passam a valer acima de 200 mil tokens:
| Tipo de token |
Preço por 1M de tokens |
| Entrada |
$10.00 |
| Saída |
$37.50 |
Para dar um pouco de contexto, o Opus 4.6 é o modelo mais caro desta lista. Veja como ele se compara em preço com os concorrentes:
| Modelo |
Entrada / 1M |
Saída / 1M |
| Claude Opus 4.6 |
$5.00 |
$25.00 |
| GPT-5.2 |
~$5.00 |
$15.00 |
| Gemini 3 Pro |
$2.00 |
$12.00 |
Se você quiser conversar com o Claude Opus 4.6 sem se preocupar com esses preços de API, basta acessar o Overchat AI e começar a conversar com o modelo como parte de uma única assinatura, que também inclui o GPT 5.2, o Kimi K2, todos os modelos Gemini mais recentes e muito mais.
Conclusão
O Claude Opus 4.6 é o modelo mais forte da Anthropic até hoje. A janela de contexto de 1M, a compactação automática do contexto, o raciocínio adaptativo — esses recursos podem não ser revolucionários isoladamente, mas se somam, resultando em um modelo com o qual é mais agradável trabalhar, que erra menos nas tarefas e funciona de forma ainda mais consistente do que seu antecessor, que já era muito consistente.
Se você quer testá-lo por conta própria, comece a conversar com o Claude Opus 4.6 no Overchat AI hoje mesmo.