/
Qwen 3.7 Max e Plus: os novos melhores modelos de IA da China?
Last Updated:
2026-06-08

Qwen 3.7 Max e Plus: os novos melhores modelos de IA da China?

O Qwen 3.7 Max é o modelo mais poderoso da Alibaba. Mas como ele se compara aos outros modelos de ponta de 2026? Vale a pena escolhê-lo no lugar do Claude Opus 4.8, do GPT 5.5 ou do Gemini 3.5 Flash? 

Neste artigo, vamos detalhar o novo lançamento e ver como o Qwen 3.7 Max se compara aos demais modelos, para ajudar você a decidir quando usá-lo e obter o melhor resultado.

O Qwen 3.7 Max já está disponível no Overchat AI, então você pode começar a conversar com ele hoje mesmo.

TLDR

  • O Qwen 3.7 é o principal modelo de IA de raciocínio proprietário da Alibaba.
  • Ele foi lançado em 20 de maio de 2026, no Alibaba Cloud Summit.
  • Com esse lançamento, a Alibaba ampliou a janela de contexto de 256K tokens no Qwen 3.6 Max para 1M de tokens no Qwen 3.7 Max, colocando-o no mesmo patamar do Claude Opus 4.8 e de outros modelos de ponta atuais.
  • A Alibaba afirma que o modelo consegue manter mais de 35 horas de execução contínua, trabalhando em uma única tarefa por mais de um dia inteiro.
  • A API custa US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída.
  • Uma limitação importante a se considerar é que o modelo Max é apenas de texto; já o Qwen 3.7 Plus é multimodal e consegue entender imagens.
  • Os usuários vão gostar de saber que o Qwen 3.7 Max é compatível com a API da Anthropic, o que permite usá-lo com o Claude Code de imediato.

O que é o Qwen 3.7 Max?

O Qwen 3.7 Max é o modelo principal da Alibaba. Trata-se de um modelo de raciocínio proprietário, de pesos fechados, construído sobre a série Qwen 3.6.

O Qwen 3.7 Max é um modelo de raciocínio, ou seja, ele gera uma cadeia interna de pensamento antes de produzir a resposta final.

Essa abordagem de raciocínio prolongado é padrão entre os modelos de ponta, mas a Alibaba a otimizou para operação contínua. Como resultado, o Qwen 3.6 consegue trabalhar de forma independente por mais de 35 horas sem interrupção. Isso vale para tarefas de agente, claro, e não para responder a uma pergunta simples.

Na prática, o Qwen 3.7 se destaca em programação e tem uma recuperação de contexto longo bastante precisa. O mais notável é que ele resolve tarefas complexas com facilidade. Por exemplo, a Alibaba confirmou que ele consegue trabalhar com mais de 1.000 ferramentas em uma única execução de prompt.

Junto com o Qwen 3.7 Max, a Alibaba também apresentou uma prévia do Qwen 3.7 Plus — um modelo irmão multimodal que vamos abordar mais adiante.

Recursos do Qwen 3.7

Agora que já temos uma noção geral do modelo, vamos olhar mais de perto alguns dos seus recursos mais importantes.

Janela de contexto de 1M de tokens

A janela de contexto do Qwen 3.7 Max aumentou cerca de 4 vezes, chegando a 1 milhão de tokens, ante 256K do Qwen 3.6 Max. É o mesmo tamanho da janela de contexto do Claude Opus 4.8 e, na prática, isso significa que o modelo raramente esbarra em problemas de contexto limitado, mesmo em tarefas muito longas que se estendem por várias horas. Vale destacar também que o modelo suporta uma saída máxima de 65.536 tokens por resposta.

Trabalho de agente de longo prazo

A Alibaba afirma que o modelo consegue trabalhar de forma independente por mais de 35 horas seguidas, gerenciando mais de 1.000 chamadas de ferramentas sem perder desempenho. Isso é impressionante, já que o desempenho da maioria dos modelos tende a cair quanto mais tempo eles passam trabalhando em uma tarefa. Na prática, isso se traduz em uma execução muito mais rápida e em um consumo de tokens reduzido. Em um teste interno, a Alibaba mediu uma melhora de velocidade de cerca de 10 vezes em relação à versão anterior.

Compatibilidade nativa com a API da Anthropic

Se você usa o Claude Code, vai gostar de saber que o Qwen 3.7 Max oferece suporte nativo à API da Anthropic, o que significa que dá para usá-lo com o Claude Code de imediato. A Alibaba também afirma que ele funciona muito bem com o OpenClaw.

Cache de prompts

O Qwen 3.7 Max oferece suporte a cache de prompts, um mecanismo em que o modelo consegue lembrar — ou armazenar em cache — prompts que são reutilizados várias vezes, e isso reduz drasticamente o custo de uso. Os tokens de entrada em cache custam US$ 0,25 por milhão, o que representa um desconto de 90% em relação à tarifa padrão de US$ 2,50 para entrada. 

Qwen 3.7 Plus

Junto com o Max, a Alibaba também lançou o Qwen 3.7 Plus, que traz a capacidade de entender imagens. O Plus ficou em #16 no mundo na categoria Visão do LM Arena, então não é o melhor da classe, mas é bom.

Benchmarks do Qwen 3.7

Nesta seção, vamos examinar os benchmarks especificamente da versão Qwen 3.7 Max, já que é essa a versão disponível no Overchat AI. Também vamos explicar o que cada benchmark significa e como interpretá-lo. 

Para começar, o Qwen 3.7 Max registra uma pontuação de 56,6 no benchmark Artificial Analysis Intelligence Index v4.0 (que mede o desempenho geral), e essa é a melhor colocação de um modelo chinês na época do lançamento.

Você pode ver a tabela completa de benchmarks abaixo e, mais adiante, vamos comparar esses números com os de outros modelos da mesma categoria de peso.

Categoria Benchmark Pontuação
Programação SWE-Bench Verified 80.4%
Programação SWE-Bench Pro 60.6%
Programação Terminal-Bench 2.0 69.7%
Programação LiveCodeBench 91.6%
Raciocínio GPQA Diamond 92.4%
Raciocínio HMMT 2026 Feb 97.1%
Raciocínio Humanity's Last Exam (no tools) 41.4%
Raciocínio Apex 44.5
Agente e uso de ferramentas MCP-Atlas 76.4%
Agente e uso de ferramentas MCP-Mark 60.8%
Agente e uso de ferramentas BFCL-V4 75.0%
Agente e uso de ferramentas Kernel Bench L3 (median speedup) 1.98x
Contexto longo MRCR-v2 @ 128k 90.4%

Qwen 3.7 Max vs Claude Opus 4.8

O Claude Opus 4.8 é o modelo principal da Anthropic e é amplamente considerado um dos melhores modelos de programação — será que o novo modelo de IA chinês consegue superá-lo? 

Benchmark Qwen 3.7 Max Claude Opus 4.8
SWE-Bench Verified 80.4% 88.6%
SWE-Bench Pro 60.6% 69.2%
GPQA Diamond 92.4% 93.6%
AA Intelligence Index 56.6 61.4
Input / Output per 1M $2.50 / $7.50 $5.00 / $25.00

Como você pode ver, o Opus 4.8 supera o Qwen 3.7 Max em todos os benchmarks de programação e raciocínio deste conjunto. Porém, é importante lembrar que o Qwen 3.7 Max é muito mais barato tanto na entrada quanto na saída, e a diferença de desempenho não é nem de longe tão grande quanto a diferença de custo.

Qwen 3.7 Max vs GPT-5.5

O GPT-5.5 é atualmente um dos melhores modelos de programação. Mas há um teste em que o Qwen 3.7 Max supera o GPT 5.5.

Benchmark Qwen 3.7 Max GPT-5.5
SWE-Bench Verified 80.4% 88.7%
SWE-Bench Pro 60.6% 58.6%
GPQA Diamond 92.4% 93.6%
Terminal-Bench 2.0 69.7% 82.7%
AA Intelligence Index 56.6 60.2
Input / Output per 1M $2.50 / $7.50 $5.00 / $30.00

Esse teste é o SWE-Bench Pro, e isso é interessante porque se trata de um benchmark de programação composto por um conjunto selecionado de tarefas de código realistas. Isso indica um excelente desempenho no mundo real.

Qwen 3.7 Max vs DeepSeek V4 Pro

O DeepSeek V4 Pro é outro modelo de IA chinês. À primeira vista, ele tem algumas semelhanças com outros modelos, por exemplo: ambos são modelos de raciocínio com contexto de 1M. Mas veja como eles se comparam:

Benchmark Qwen 3.7 Max DeepSeek V4 Pro
SWE-Bench Verified 80.4% 80.6%
SWE-Bench Pro 60.6% 55.4%
GPQA Diamond 92.4% 88.8%
LiveCodeBench 91.6% 93.5%
Input / Output per 1M $2.50 / $7.50 $0.435 / $0.87

Para colocar os números acima em perspectiva, tenha em mente que o DeepSeek V4 Pro é cerca de seis vezes mais barato.

Os dois modelos praticamente empatam no benchmark de programação SWE-Bench Verified, mas o Qwen 3.7 Max abre uma vantagem clara no SWE-Bench Pro (ou seja, tem melhor desempenho em questões de código mais difíceis) e no GPQA Diamond. Este último envolve o modelo resolver problemas selecionados a dedo por pesquisadores de nível de doutorado em biologia, física e química. Esses problemas são feitos de propósito para que o modelo não consiga simplesmente pesquisar a resposta no Google, mas tenha que resolvê-los.

Qwen 3.7 Max vs Kimi K2.6

O Kimi K2.6 é outro modelo de IA da China, especificamente da Moonshot AI. Ele é reconhecido pela escrita criativa de alta qualidade e pelas habilidades de design de front-end, além da capacidade de implantar vários subagentes em tarefas complexas por meio dos Agent Swarms. Mas como ele se compara ao Qwen 3.7?

Benchmark Qwen 3.7 Max Kimi K2.6
SWE-Bench Verified 80.4% 80.2%
SWE-Bench Pro 60.6% 58.6%
GPQA Diamond 92.4% 90.5%
LiveCodeBench 91.6% 89.6%
Terminal-Bench 2.0 69.7% 66.7%
Input / Output per 1M $2.50 / $7.50 $0.95 / $4.00

O Qwen 3.7 Max vence em todos os benchmarks deste conjunto, mas por muito pouco — com diferença de até 3 pontos na maioria deles.

O Kimi K2.6 também custa cerca de um terço do preço e é de pesos abertos. A maior diferença aparece nas tarefas de raciocínio mais difíceis, em que o Qwen 3.7 Max sai na frente.

Qwen 3.7 Max vs Gemini 3.5 Flash

O Gemini 3.5 Flash é o novo modelo do Google, e é muito interessante porque o Google o projetou para ser, ao mesmo tempo, rápido, barato e extremamente poderoso. Ele atinge um desempenho de nível flagship a uma velocidade 4 vezes maior e até supera o Gemini 3.1 Pro na maioria dos benchmarks.

Benchmark Qwen 3.7 Max Gemini 3.5 Flash
SWE-Bench Pro 60.6% 55.1%
AA Intelligence Index 56.6 55
Humanity's Last Exam (no tools) 40.2% 41.4%
Input / Output per 1M $2.50 / $7.50 $1.50 / $9.00

O Gemini 3.5 Flash é o único modelo desta lista com preço próximo ao do Qwen 3.7 Max. O Qwen 3.7 Max lidera no SWE-Bench Pro e no Intelligence Index, mas o Gemini 3.5 Flash roda cerca de 4 vezes mais rápido em tokens de saída por segundo e já vem com suporte multimodal nativo.

Preço do Qwen 3.7 Max

Veja quanto o uso do Qwen 3.7 vai custar se você pretende implantá-lo via API, por milhão de tokens:

  • Entrada padrão: US$ 2,50/1M de tokens
  • Entrada em cache: US$ 0,25/1M de tokens
  • Saída: US$ 7,50/1M de tokens

Para colocar isso em perspectiva, em comparação com o Claude Opus 4.8, por exemplo, o Qwen 3.7 Max custa aproximadamente metade do preço na entrada e menos de um terço na saída. Em relação ao GPT-5.5, a diferença é ainda maior.

Há uma ressalva: o Qwen 3.7 Max é um modelo de raciocínio que pensa bastante antes de responder. Nos testes da Artificial Analysis, o modelo gerou cerca de 97 milhões de tokens para concluir a avaliação do Intelligence Index — cerca de 4 vezes a média de 24 milhões de tokens dos outros modelos no benchmark. Por isso, o uso sai mais caro do que os preços fixos por token sugerem.

Para compensar o custo por tarefa, o Qwen 3.7 Max oferece suporte a cache de prompts a US$ 0,25 por milhão de tokens — um desconto de 90% na entrada em cache. Para fluxos de trabalho que reaproveitam prompts de sistema longos ou documentos de referência ao longo das interações, isso reduz drasticamente o custo efetivo de entrada.

Ou, se você quiser pular a conta da API de vez, pode conversar com o Qwen 3.7 Max no Overchat AI como parte de uma única assinatura que também inclui Claude Opus 4.8, GPT-5.5, Gemini 3.5 Flash, Kimi K2.6 e muito mais.

Limitações do Qwen 3.7

Há duas limitações que vale a pena conhecer antes de escolher os modelos Qwen 3.7.

O Qwen 3.7 Max é apenas de texto. O Qwen 3.7 Max não processa entrada de imagem ou áudio. Para fluxos de trabalho multimodais, você precisa migrar para o Qwen 3.7 Plus.

Taxa de abstenção um tanto alta para um modelo de ponta. Isso significa que, quando o modelo está em dúvida sobre algo, em vez de alucinar uma resposta, ele desiste de realizar a tarefa, o que reduz a precisão geral, porque às vezes o modelo se recusa a continuar.

Para explicar melhor: a taxa de alucinação do Qwen 3.7 Max no benchmark AA-Omniscience caiu 21,3 pontos percentuais em comparação com o Qwen 3.6 Max, o que é bom. Mas a precisão bruta no mesmo benchmark também caiu 7,6 pontos, e a taxa de tentativas do modelo passou de 67,3% para 48,0%. Na prática, você vai receber respostas como "não sei" com mais frequência do que com outros modelos, e ele vai se recusar a responder a alguns casos extremos em que outras IAs pelo menos tentariam. Se isso vai afetar você de forma significativa é muito difícil dizer até que você experimente trabalhar com ele.

Quando você deve usar o Qwen 3.7?

Recorra ao Qwen 3.7 Max quando:

  • Você está fazendo matemática ou raciocínio científico, áreas em que o Qwen 3.7 Max está entre os modelos mais fortes de 2026.
  • Você está trabalhando em problemas complexos e de várias etapas que se beneficiam de cadeias de raciocínio muito longas.
  • Você já usa o Claude Code e quer um backend mais barato sem mudar a sua stack.

Recorra a outra opção quando:

  • Você quer conversar com imagens, vídeos ou arquivos de áudio. Nesse caso, sugerimos usar o Gemini 3.5 Flash.
  • Você precisa do melhor modelo do ranking, sem se importar com o custo — use o Claude Opus 4.8 ou o GPT-5.5.
  • Você precisa de pesos abertos para hospedagem própria ou fine-tuning — use o Kimi K2.6 ou o DeepSeek V4 Pro.
  • Você gosta de conversar com IA e quer respostas rápidas — o raciocínio pesado em cada resposta logo vai parecer lento. Use um modelo sem raciocínio, como uma versão sem raciocínio do DeepSeek, do Sonnet, do Kimi ou do GPT. 

FAQ

Quando o Qwen 3.7 Max foi lançado?

O Qwen 3.7 Max foi anunciado oficialmente em 20 de maio de 2026, no Alibaba Cloud Summit, em Hangzhou. A versão de prévia apareceu pela primeira vez no ranking do LM Arena por volta de 14 de maio, e o acesso à API foi liberado em 19 de maio.

Quanto custa o Qwen 3.7 Max?

O preço da API é de US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída, com a entrada em cache caindo para US$ 0,25 por milhão. Isso faz com que o Qwen 3.7 Max custe aproximadamente metade do preço do Claude Opus 4.8 na entrada e menos de um terço na saída.

O Qwen 3.7 Max é de código aberto?

Não. O Qwen 3.7 Max é proprietário e de pesos fechados, disponível apenas por meio de plataformas parceiras, como o Overchat AI e o Alibaba Cloud Model Studio.

Qual é a diferença entre o Qwen 3.7 Max e o Qwen 3.7 Plus?

O Qwen 3.7 Max é o mais poderoso modelo de raciocínio entre os dois, mas é apenas de texto. O Qwen 3.7 Plus também consegue entender imagens e vídeos, e foi projetado para equilibrar potência e velocidade, sendo mais adequado para tarefas do dia a dia, como conversar.

Qual é melhor, Qwen 3.7 vs GPT-5.5?

O GPT-5.5 é um modelo melhor para a maioria das tarefas, embora também seja duas vezes mais caro por token. Por exemplo, no teste SWE-Bench Verified, que mede o desempenho em programação, o GPT-5.5 alcança 88,7%, enquanto o Qwen 3.7 Max alcança 80,4%. Essa porcentagem mostra quantas tarefas de código o modelo conseguiu resolver. O GPT-5.5 normalmente supera o Qwen 3.7 Max em quase todos os benchmarks, exceto no SWE-Bench Pro, em que o Qwen 3.7 Max supera ligeiramente o GPT-5.5, com 60,6% contra 58,6% das tarefas resolvidas. O SWE-Bench Pro é uma coleção de tarefas de programação muito desafiadoras.

Conclusão

O Qwen 3.7 Max é o modelo de raciocínio de última geração da Alibaba que, no seu lançamento, se tornou o modelo chinês mais bem colocado no Artificial Analysis Intelligence Index. Embora não supere os flagships ocidentais na maioria das tarefas, ele chega muito perto dos níveis de desempenho do Claude Opus 4.8 e do GPT-5.5, custando de metade a um quarto do preço. Ele ainda acrescenta uma janela de contexto de 1M, um raciocínio mais afiado e compatibilidade nativa com o Claude Code.

Para testar o Qwen 3.7 Max nos seus próprios fluxos de trabalho hoje mesmo, acesse o Overchat AI e comece a conversar com o Qwen 3.7 Max.