/
Rival do ChatGPT? Testei o Claude Sonnet 4 e o Opus 4
Last Updated:
2026-09-08

Rival do ChatGPT? Testei o Claude Sonnet 4 e o Opus 4

A Anthropic lançou o Claude Sonnet 4 e o Opus 4. Se você anda usando GPT e Gemini e deixando o Claude de lado, acho que chegou a hora de dar uma chance a ele.

Eu estava ansioso para testar o desempenho desses modelos, e fazia tempo que eu não me divertia tanto avaliando IAs novas.

Quer o resumo da ópera? O Sonnet 4 é uma evolução robusta que custa o mesmo de antes, enquanto o Opus 4 é a aposta da Anthropic na ideia de "e se a gente criasse uma IA capaz de tocar um projeto inteiro do começo ao fim".

Visão geral dos modelos mais recentes da Anthropic

Veja com o que estamos lidando:

Característica Sonnet 4 Opus 4
Janela de contexto 200K tokens 200K tokens
Tokens de saída 64K tokens 32K tokens
Preço da API (por M de tokens) US$ 3 / US$ 15 US$ 15 / US$ 75
Uso indicado Geral, alto volume Tarefas complexas e aprofundadas
Pontos fortes Velocidade, custo-benefício Raciocínio profundo, código complexo

O número que mais salta aos olhos aqui é o 72,5% do Opus 4 no SWE-bench Verified. Para efeito de comparação, o GPT-4.1 chega a cerca de 54,6% no mesmo teste.

Os dois modelos mantêm a janela de contexto de 200K dos antecessores. E é justamente aqui que o Claude ainda fica para trás em relação à concorrência. O Gemini oferece 1 milhão de tokens, e o GPT-4.1 também. Na prática, durante meus testes não encontrei muitas situações em que 200K não fosse suficiente. Mesmo assim,  se você trabalha com textos ou bases de código muito grandes, pode esbarrar em algumas limitações.

Preços do Claude 4

No que diz respeito ao preço da API, o Sonnet 4 mantém o mesmo patamar do 3.7. O Opus 4, a US$ 15/US$ 75 por milhão de tokens, é caro. Ainda assim, sai mais barato que o preço de entrada do GPT-4, que fica em US$ 30 por milhão.

Quanto ao uso gratuito/pago na própria plataforma do Claude, o Sonnet 4 está disponível nos planos gratuito e premium, enquanto o Opus 4 fica restrito ao plano Pro.

Os custos são os seguintes:

Claude 4 pricing

O preço mensal de US$ 17 do plano Pro vale para a cobrança anual e resulta em um pagamento único de US$ 200. Na cobrança mensal, o valor é de US$ 20 por mês.

O Max é uma alternativa interessante ao plano Pro do ChatGPT. Sim, a nomenclatura das IAs já está confusa a essa altura. O plano mais barato do ChatGPT se chama Plus. O Max custa US$ 100, enquanto o do ChatGPT custa US$ 200. Esse recurso é voltado principalmente a desenvolvedores e a usuários que precisam de saídas maiores.

Por exemplo, se você usar o Sonnet para escrever um artigo, o Max pode entregar quatro capítulos, enquanto o Pro entregaria apenas dois. A mesma lógica vale para programação, caso você precise que ele escreva um componente complexo ou uma classe muito grande.

Benchmarks do Claude 4

Antes de partir para os testes práticos, vamos dar uma olhada nos benchmarks. Porque 72,7% no SWE-bench é um número impressionante, mas o que isso significa no trabalho de verdade?

Claude 4 benchmarks

Se você está se perguntando o que tirar desses números além de comparar os modelos entre si, aqui vai uma explicação simples:

SWE-bench Verified testa se uma IA consegue resolver issues do GitHub de projetos open-source populares. O Opus 4 corrigiu mais ou menos 3 de cada 4 problemas reais de programação. O GPT-4.1 mal passou da metade.

Terminal-bench mede se a IA consegue escrever código de forma iterativa até que ele funcione. 43,2% pode parecer baixo, mas este é um benchmark brutalmente difícil.

TAU-bench (agente que usa ferramentas) simula fluxos de trabalho reais de empresas. O Opus 4 cravou 81,4%, o que significa que ele provavelmente daria conta da maioria dos cenários de atendimento ao cliente. Mas ignore este benchmark, a menos que você pretenda integrar o Sonnet ou o Opus a um aplicativo.

MMLU (Massive Multitask Language Understanding) abrange 57 áreas, das exatas às humanas, em nível universitário. Os dois modelos Claude 4 marcam algo perto dos 90% aqui, à altura do GPT-4, e isso está acima da maioria dos estudantes.

AIME testa problemas avançados de competições de matemática do ensino médio. O Opus 4 provavelmente passaria no MIT.

Minha metodologia de testes

Testei os dois modelos pela interface de chat do Claude.ai ao longo da última semana, focando em tarefas do mundo real.

Meus critérios de avaliação:

  • Qualidade de prompt e resposta: o quanto eles entendem o que estou realmente pedindo?
  • Raciocínio e resolução de problemas: o quão bem conseguem percorrer problemas de várias etapas?
  • Lidar com instruções de múltiplas etapas: dê uma tarefa complexa, com várias partes. Ele lembra de todas?
  • Usabilidade em tempo real: com que rapidez ele responde?

Interação como chatbot de uso geral

Testando como esses modelos lidam com conversas comuns.

Claude Sonnet 4

Comecei com uma conversa sobre planejar uma conferência de tecnologia. Pedi ao Sonnet 4 que ajudasse a esboçar o evento, sugerisse palestrantes a partir dos temas e montasse uma divisão de orçamento.

A primeira coisa que notei é que o Sonnet criou um artifact na hora — útil se eu quiser exportar o resultado com facilidade ou editá-lo:

Claude 4 sonnet test

O modelo manteve o contexto sem dificuldade ao longo de 8 a 10 turnos. Aliás, o artifact chegou a 3088 palavras quando terminamos — um documento e tanto.

Claude 4 sonnet test

Um detalhe interessante: quando pedi para encaixar o plano em um orçamento de US$ 50 mil, ele sugeriu opções diferentes:

Claude 4 sonnet test

E quando pedi para encontrar locais adequados em San Francisco, o Claude pesquisou na internet e me deu uma lista que levava o meu orçamento em conta:

Claude Opus 4

Mesmo cenário de planejamento de conferência, agora com o Opus 4. 

A primeira coisa que notei — ele não criou um artifact, preferindo responder no próprio chat. As respostas em si — bem mais curtas. Mas isso é ruim? Nem tanto, já que as respostas eram informativas:

Claude Opus 4

Quando mencionei a restrição de orçamento, o Opus não se limitou a detalhar a divisão dos custos: ele também sugeriu estratégias para economizar:

Claude Opus 4 test

E quando pedi para sugerir locais, ele montou uma lista em níveis, o que me ajudaria a escolher os espaços mais promissores para pesquisar por conta própria e entrar em contato:

Claude Opus 4 test

Conclusões

A diferença é sutil, mas bem perceptível. À primeira vista, os dois modelos fizeram a mesma coisa (até as sugestões eram parecidas).

No entanto, o Sonnet 4 exagerou na quantidade de informação — quem tem tempo de ler 25.000 caracteres? O Opus 4 foi menos prolixo e conseguiu entregar o mesmo valor usando menos palavras — cerca de 2000, incluindo as minhas mensagens.

Programação

Para este desafio, testei tarefas cotidianas de depuração e melhoria de código.

Claude Sonnet 4

Escrevi um script em Python que mescla arquivos CSV. Mas tem só um problema — ele descarta colunas duplicadas de propósito.

Usei um prompt propositalmente vago: "Este script não funciona. Você consegue consertar?" Vamos ver o que acontece.

Claude Sonnet 4 coding test

O Sonnet 4 identificou o problema corretamente, criou um artifact, e o código rodou de primeira. Ele também explicou o que estava errado, embora de um jeito bem difícil de entender.

Claude Opus 4

Passei o mesmo script com bug para o Opus 4. Sem surpresas aqui — o Opus não teve nenhuma dificuldade para encontrar e corrigir o erro.

Claude Opus 4 coding test

O interessante é que o código resultante é praticamente igual. Mas há uma diferença importante — e ela não está no código.

Conclusões

Os dois modelos adotaram a mesma abordagem (usando pd.concat()) e a implementaram de forma parecida. 

Mas uma área em que o Opus, na minha opinião, supera o Sonnet é a qualidade das explicações. As explicações do Sonnet eram muito técnicas e, sinceramente, quase impossíveis de entender. O Opus, por outro lado, explicou as coisas como faria um bom professor — usando uma linguagem simples e envolvente.

Os dois modelos são eficientes para programar, mas, se você é iniciante aprendendo a programar, talvez goste bem mais de usar o Opus do que o Sonnet.

Escrita criativa

Hora de ver qual modelo é o melhor escritor de IA. Para este teste, pedi:

"Crie um rap de punchlines no estilo do Big L, com referências ao Harlem. Faça soar fluido e natural, como um freestyle."

Como os modelos se saíram? 

Claude Sonnet 4

Para efeito de comparação, aqui vai um trecho do famoso hit do Big L, Put it On:

"...Aiyyo, you betta flee hobbes, or get your head flown three blocks

L keep rapper's hearts pumpin' like Reeboks

And every year I gain clout and my name sprouts

Some brothers'd still be large if the crack never came out

I got the wild style, always been a foul child

My guns go poom-poom, and yo' guns go pow-pow

I'm known to have a hottie open, I keep the shottie smokin'

Front and get half the bones in your body broken"

O Sonnet 4 consegue replicar esse estilo? Foi isto que ele produziu:

Não sei você, mas acho que isso foi um erro evidente — abusou de clichês ("bars", "spit fire") e soa repetitivo no ritmo.

Claude Opus 4

Dei o mesmo prompt ao Opus 4 e, na minha opinião, a diferença é bem nítida:

Claude Opus 4 writing sample

Isso ainda soa mais como Epic Rap Battles of History do que Big L, mas há muito mais punchlines criativas. "I'm complex as the apartments where my mama lives, G" pelo menos me arrancou uma risada.

Resumo dos pontos fortes e fracos

Veja como o Sonnet 4 e o Opus 4 se saíram, na minha opinião. Pontos fortes:

  • Respostas muito rápidas (em geral, 2 a 5 segundos)
  • Bom programador de IA (o Sonnet 4 não é bom em explicar código)
  • US$ 3/US$ 15 por milhão de tokens, mais barato que a maioria dos concorrentes

Pontos fracos:

  • De vez em quando, prolixo demais
  • O contexto de 200K não é o melhor do mercado, já que tanto o ChatGPT quanto o Gemini oferecem modelos com janelas de contexto de 1M.
  • O Sonnet 4 é bastante fraco em escrita criativa (sem fine-tuning), enquanto o Opus 4 é mais ou menos.

Não me entenda mal, o Sonnet 4 e o Opus 4 são uma evolução enorme em relação ao Claude 3.7. E olha, para um modelo que está por trás do plano gratuito do Claude, o Sonnet 4 é impressionantíssimo.

Para 90% do que as pessoas de fato fazem com IA — rascunhar e-mails, corrigir um código aqui e ali, resumir documentos — ele é um assistente de IA muito poderoso.