TLDR
- O Qwen 3.7 é o principal modelo de IA de raciocínio proprietário da Alibaba.
- Ele foi lançado em 20 de maio de 2026, no Alibaba Cloud Summit.
- Com esse lançamento, a Alibaba ampliou a janela de contexto de 256K tokens no Qwen 3.6 Max para 1M de tokens no Qwen 3.7 Max, colocando-o no mesmo patamar do Claude Opus 4.8 e de outros modelos de ponta atuais.
- A Alibaba afirma que o modelo consegue manter mais de 35 horas de execução contínua, trabalhando em uma única tarefa por mais de um dia inteiro.
- A API custa US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída.
- Uma limitação importante a se considerar é que o modelo Max é apenas de texto; já o Qwen 3.7 Plus é multimodal e consegue entender imagens.
- Os usuários vão gostar de saber que o Qwen 3.7 Max é compatível com a API da Anthropic, o que permite usá-lo com o Claude Code de imediato.
O que é o Qwen 3.7 Max?
O Qwen 3.7 Max é o modelo principal da Alibaba. Trata-se de um modelo de raciocínio proprietário, de pesos fechados, construído sobre a série Qwen 3.6.
O Qwen 3.7 Max é um modelo de raciocínio, ou seja, ele gera uma cadeia interna de pensamento antes de produzir a resposta final.
Essa abordagem de raciocínio prolongado é padrão entre os modelos de ponta, mas a Alibaba a otimizou para operação contínua. Como resultado, o Qwen 3.6 consegue trabalhar de forma independente por mais de 35 horas sem interrupção. Isso vale para tarefas de agente, claro, e não para responder a uma pergunta simples.
Na prática, o Qwen 3.7 se destaca em programação e tem uma recuperação de contexto longo bastante precisa. O mais notável é que ele resolve tarefas complexas com facilidade. Por exemplo, a Alibaba confirmou que ele consegue trabalhar com mais de 1.000 ferramentas em uma única execução de prompt.
Junto com o Qwen 3.7 Max, a Alibaba também apresentou uma prévia do Qwen 3.7 Plus — um modelo irmão multimodal que vamos abordar mais adiante.
Recursos do Qwen 3.7
Agora que já temos uma noção geral do modelo, vamos olhar mais de perto alguns dos seus recursos mais importantes.
Janela de contexto de 1M de tokens
A janela de contexto do Qwen 3.7 Max aumentou cerca de 4 vezes, chegando a 1 milhão de tokens, ante 256K do Qwen 3.6 Max. É o mesmo tamanho da janela de contexto do Claude Opus 4.8 e, na prática, isso significa que o modelo raramente esbarra em problemas de contexto limitado, mesmo em tarefas muito longas que se estendem por várias horas. Vale destacar também que o modelo suporta uma saída máxima de 65.536 tokens por resposta.
Trabalho de agente de longo prazo
A Alibaba afirma que o modelo consegue trabalhar de forma independente por mais de 35 horas seguidas, gerenciando mais de 1.000 chamadas de ferramentas sem perder desempenho. Isso é impressionante, já que o desempenho da maioria dos modelos tende a cair quanto mais tempo eles passam trabalhando em uma tarefa. Na prática, isso se traduz em uma execução muito mais rápida e em um consumo de tokens reduzido. Em um teste interno, a Alibaba mediu uma melhora de velocidade de cerca de 10 vezes em relação à versão anterior.
Compatibilidade nativa com a API da Anthropic
Se você usa o Claude Code, vai gostar de saber que o Qwen 3.7 Max oferece suporte nativo à API da Anthropic, o que significa que dá para usá-lo com o Claude Code de imediato. A Alibaba também afirma que ele funciona muito bem com o OpenClaw.
Cache de prompts
O Qwen 3.7 Max oferece suporte a cache de prompts, um mecanismo em que o modelo consegue lembrar — ou armazenar em cache — prompts que são reutilizados várias vezes, e isso reduz drasticamente o custo de uso. Os tokens de entrada em cache custam US$ 0,25 por milhão, o que representa um desconto de 90% em relação à tarifa padrão de US$ 2,50 para entrada.
Qwen 3.7 Plus
Junto com o Max, a Alibaba também lançou o Qwen 3.7 Plus, que traz a capacidade de entender imagens. O Plus ficou em #16 no mundo na categoria Visão do LM Arena, então não é o melhor da classe, mas é bom.
Benchmarks do Qwen 3.7
Nesta seção, vamos examinar os benchmarks especificamente da versão Qwen 3.7 Max, já que é essa a versão disponível no Overchat AI. Também vamos explicar o que cada benchmark significa e como interpretá-lo.
Para começar, o Qwen 3.7 Max registra uma pontuação de 56,6 no benchmark Artificial Analysis Intelligence Index v4.0 (que mede o desempenho geral), e essa é a melhor colocação de um modelo chinês na época do lançamento.
Você pode ver a tabela completa de benchmarks abaixo e, mais adiante, vamos comparar esses números com os de outros modelos da mesma categoria de peso.
| Categoria |
Benchmark |
Pontuação |
| Programação |
SWE-Bench Verified |
80.4% |
| Programação |
SWE-Bench Pro |
60.6% |
| Programação |
Terminal-Bench 2.0 |
69.7% |
| Programação |
LiveCodeBench |
91.6% |
| Raciocínio |
GPQA Diamond |
92.4% |
| Raciocínio |
HMMT 2026 Feb |
97.1% |
| Raciocínio |
Humanity's Last Exam (no tools) |
41.4% |
| Raciocínio |
Apex |
44.5 |
| Agente e uso de ferramentas |
MCP-Atlas |
76.4% |
| Agente e uso de ferramentas |
MCP-Mark |
60.8% |
| Agente e uso de ferramentas |
BFCL-V4 |
75.0% |
| Agente e uso de ferramentas |
Kernel Bench L3 (median speedup) |
1.98x |
| Contexto longo |
MRCR-v2 @ 128k |
90.4% |
Qwen 3.7 Max vs Claude Opus 4.8
O Claude Opus 4.8 é o modelo principal da Anthropic e é amplamente considerado um dos melhores modelos de programação — será que o novo modelo de IA chinês consegue superá-lo?
| Benchmark |
Qwen 3.7 Max |
Claude Opus 4.8 |
| SWE-Bench Verified |
80.4% |
88.6% |
| SWE-Bench Pro |
60.6% |
69.2% |
| GPQA Diamond |
92.4% |
93.6% |
| AA Intelligence Index |
56.6 |
61.4 |
| Input / Output per 1M |
$2.50 / $7.50 |
$5.00 / $25.00 |
Como você pode ver, o Opus 4.8 supera o Qwen 3.7 Max em todos os benchmarks de programação e raciocínio deste conjunto. Porém, é importante lembrar que o Qwen 3.7 Max é muito mais barato tanto na entrada quanto na saída, e a diferença de desempenho não é nem de longe tão grande quanto a diferença de custo.
Qwen 3.7 Max vs GPT-5.5
O GPT-5.5 é atualmente um dos melhores modelos de programação. Mas há um teste em que o Qwen 3.7 Max supera o GPT 5.5.
| Benchmark |
Qwen 3.7 Max |
GPT-5.5 |
| SWE-Bench Verified |
80.4% |
88.7% |
| SWE-Bench Pro |
60.6% |
58.6% |
| GPQA Diamond |
92.4% |
93.6% |
| Terminal-Bench 2.0 |
69.7% |
82.7% |
| AA Intelligence Index |
56.6 |
60.2 |
| Input / Output per 1M |
$2.50 / $7.50 |
$5.00 / $30.00 |
Esse teste é o SWE-Bench Pro, e isso é interessante porque se trata de um benchmark de programação composto por um conjunto selecionado de tarefas de código realistas. Isso indica um excelente desempenho no mundo real.
Qwen 3.7 Max vs DeepSeek V4 Pro
O DeepSeek V4 Pro é outro modelo de IA chinês. À primeira vista, ele tem algumas semelhanças com outros modelos, por exemplo: ambos são modelos de raciocínio com contexto de 1M. Mas veja como eles se comparam:
| Benchmark |
Qwen 3.7 Max |
DeepSeek V4 Pro |
| SWE-Bench Verified |
80.4% |
80.6% |
| SWE-Bench Pro |
60.6% |
55.4% |
| GPQA Diamond |
92.4% |
88.8% |
| LiveCodeBench |
91.6% |
93.5% |
| Input / Output per 1M |
$2.50 / $7.50 |
$0.435 / $0.87 |
Para colocar os números acima em perspectiva, tenha em mente que o DeepSeek V4 Pro é cerca de seis vezes mais barato.
Os dois modelos praticamente empatam no benchmark de programação SWE-Bench Verified, mas o Qwen 3.7 Max abre uma vantagem clara no SWE-Bench Pro (ou seja, tem melhor desempenho em questões de código mais difíceis) e no GPQA Diamond. Este último envolve o modelo resolver problemas selecionados a dedo por pesquisadores de nível de doutorado em biologia, física e química. Esses problemas são feitos de propósito para que o modelo não consiga simplesmente pesquisar a resposta no Google, mas tenha que resolvê-los.
Qwen 3.7 Max vs Kimi K2.6
O Kimi K2.6 é outro modelo de IA da China, especificamente da Moonshot AI. Ele é reconhecido pela escrita criativa de alta qualidade e pelas habilidades de design de front-end, além da capacidade de implantar vários subagentes em tarefas complexas por meio dos Agent Swarms. Mas como ele se compara ao Qwen 3.7?
| Benchmark |
Qwen 3.7 Max |
Kimi K2.6 |
| SWE-Bench Verified |
80.4% |
80.2% |
| SWE-Bench Pro |
60.6% |
58.6% |
| GPQA Diamond |
92.4% |
90.5% |
| LiveCodeBench |
91.6% |
89.6% |
| Terminal-Bench 2.0 |
69.7% |
66.7% |
| Input / Output per 1M |
$2.50 / $7.50 |
$0.95 / $4.00 |
O Qwen 3.7 Max vence em todos os benchmarks deste conjunto, mas por muito pouco — com diferença de até 3 pontos na maioria deles.
O Kimi K2.6 também custa cerca de um terço do preço e é de pesos abertos. A maior diferença aparece nas tarefas de raciocínio mais difíceis, em que o Qwen 3.7 Max sai na frente.
Qwen 3.7 Max vs Gemini 3.5 Flash
O Gemini 3.5 Flash é o novo modelo do Google, e é muito interessante porque o Google o projetou para ser, ao mesmo tempo, rápido, barato e extremamente poderoso. Ele atinge um desempenho de nível flagship a uma velocidade 4 vezes maior e até supera o Gemini 3.1 Pro na maioria dos benchmarks.
| Benchmark |
Qwen 3.7 Max |
Gemini 3.5 Flash |
| SWE-Bench Pro |
60.6% |
55.1% |
| AA Intelligence Index |
56.6 |
55 |
| Humanity's Last Exam (no tools) |
40.2% |
41.4% |
| Input / Output per 1M |
$2.50 / $7.50 |
$1.50 / $9.00 |
O Gemini 3.5 Flash é o único modelo desta lista com preço próximo ao do Qwen 3.7 Max. O Qwen 3.7 Max lidera no SWE-Bench Pro e no Intelligence Index, mas o Gemini 3.5 Flash roda cerca de 4 vezes mais rápido em tokens de saída por segundo e já vem com suporte multimodal nativo.
Preço do Qwen 3.7 Max
Veja quanto o uso do Qwen 3.7 vai custar se você pretende implantá-lo via API, por milhão de tokens:
- Entrada padrão: US$ 2,50/1M de tokens
- Entrada em cache: US$ 0,25/1M de tokens
- Saída: US$ 7,50/1M de tokens
Para colocar isso em perspectiva, em comparação com o Claude Opus 4.8, por exemplo, o Qwen 3.7 Max custa aproximadamente metade do preço na entrada e menos de um terço na saída. Em relação ao GPT-5.5, a diferença é ainda maior.
Há uma ressalva: o Qwen 3.7 Max é um modelo de raciocínio que pensa bastante antes de responder. Nos testes da Artificial Analysis, o modelo gerou cerca de 97 milhões de tokens para concluir a avaliação do Intelligence Index — cerca de 4 vezes a média de 24 milhões de tokens dos outros modelos no benchmark. Por isso, o uso sai mais caro do que os preços fixos por token sugerem.
Para compensar o custo por tarefa, o Qwen 3.7 Max oferece suporte a cache de prompts a US$ 0,25 por milhão de tokens — um desconto de 90% na entrada em cache. Para fluxos de trabalho que reaproveitam prompts de sistema longos ou documentos de referência ao longo das interações, isso reduz drasticamente o custo efetivo de entrada.
Ou, se você quiser pular a conta da API de vez, pode conversar com o Qwen 3.7 Max no Overchat AI como parte de uma única assinatura que também inclui Claude Opus 4.8, GPT-5.5, Gemini 3.5 Flash, Kimi K2.6 e muito mais.
Limitações do Qwen 3.7
Há duas limitações que vale a pena conhecer antes de escolher os modelos Qwen 3.7.
O Qwen 3.7 Max é apenas de texto. O Qwen 3.7 Max não processa entrada de imagem ou áudio. Para fluxos de trabalho multimodais, você precisa migrar para o Qwen 3.7 Plus.
Taxa de abstenção um tanto alta para um modelo de ponta. Isso significa que, quando o modelo está em dúvida sobre algo, em vez de alucinar uma resposta, ele desiste de realizar a tarefa, o que reduz a precisão geral, porque às vezes o modelo se recusa a continuar.
Para explicar melhor: a taxa de alucinação do Qwen 3.7 Max no benchmark AA-Omniscience caiu 21,3 pontos percentuais em comparação com o Qwen 3.6 Max, o que é bom. Mas a precisão bruta no mesmo benchmark também caiu 7,6 pontos, e a taxa de tentativas do modelo passou de 67,3% para 48,0%. Na prática, você vai receber respostas como "não sei" com mais frequência do que com outros modelos, e ele vai se recusar a responder a alguns casos extremos em que outras IAs pelo menos tentariam. Se isso vai afetar você de forma significativa é muito difícil dizer até que você experimente trabalhar com ele.
Quando você deve usar o Qwen 3.7?
Recorra ao Qwen 3.7 Max quando:
- Você está fazendo matemática ou raciocínio científico, áreas em que o Qwen 3.7 Max está entre os modelos mais fortes de 2026.
- Você está trabalhando em problemas complexos e de várias etapas que se beneficiam de cadeias de raciocínio muito longas.
- Você já usa o Claude Code e quer um backend mais barato sem mudar a sua stack.
Recorra a outra opção quando:
- Você quer conversar com imagens, vídeos ou arquivos de áudio. Nesse caso, sugerimos usar o Gemini 3.5 Flash.
- Você precisa do melhor modelo do ranking, sem se importar com o custo — use o Claude Opus 4.8 ou o GPT-5.5.
- Você precisa de pesos abertos para hospedagem própria ou fine-tuning — use o Kimi K2.6 ou o DeepSeek V4 Pro.
- Você gosta de conversar com IA e quer respostas rápidas — o raciocínio pesado em cada resposta logo vai parecer lento. Use um modelo sem raciocínio, como uma versão sem raciocínio do DeepSeek, do Sonnet, do Kimi ou do GPT.
FAQ
Quando o Qwen 3.7 Max foi lançado?
O Qwen 3.7 Max foi anunciado oficialmente em 20 de maio de 2026, no Alibaba Cloud Summit, em Hangzhou. A versão de prévia apareceu pela primeira vez no ranking do LM Arena por volta de 14 de maio, e o acesso à API foi liberado em 19 de maio.
Quanto custa o Qwen 3.7 Max?
O preço da API é de US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída, com a entrada em cache caindo para US$ 0,25 por milhão. Isso faz com que o Qwen 3.7 Max custe aproximadamente metade do preço do Claude Opus 4.8 na entrada e menos de um terço na saída.
O Qwen 3.7 Max é de código aberto?
Não. O Qwen 3.7 Max é proprietário e de pesos fechados, disponível apenas por meio de plataformas parceiras, como o Overchat AI e o Alibaba Cloud Model Studio.
Qual é a diferença entre o Qwen 3.7 Max e o Qwen 3.7 Plus?
O Qwen 3.7 Max é o mais poderoso modelo de raciocínio entre os dois, mas é apenas de texto. O Qwen 3.7 Plus também consegue entender imagens e vídeos, e foi projetado para equilibrar potência e velocidade, sendo mais adequado para tarefas do dia a dia, como conversar.
Qual é melhor, Qwen 3.7 vs GPT-5.5?
O GPT-5.5 é um modelo melhor para a maioria das tarefas, embora também seja duas vezes mais caro por token. Por exemplo, no teste SWE-Bench Verified, que mede o desempenho em programação, o GPT-5.5 alcança 88,7%, enquanto o Qwen 3.7 Max alcança 80,4%. Essa porcentagem mostra quantas tarefas de código o modelo conseguiu resolver. O GPT-5.5 normalmente supera o Qwen 3.7 Max em quase todos os benchmarks, exceto no SWE-Bench Pro, em que o Qwen 3.7 Max supera ligeiramente o GPT-5.5, com 60,6% contra 58,6% das tarefas resolvidas. O SWE-Bench Pro é uma coleção de tarefas de programação muito desafiadoras.
Conclusão
O Qwen 3.7 Max é o modelo de raciocínio de última geração da Alibaba que, no seu lançamento, se tornou o modelo chinês mais bem colocado no Artificial Analysis Intelligence Index. Embora não supere os flagships ocidentais na maioria das tarefas, ele chega muito perto dos níveis de desempenho do Claude Opus 4.8 e do GPT-5.5, custando de metade a um quarto do preço. Ele ainda acrescenta uma janela de contexto de 1M, um raciocínio mais afiado e compatibilidade nativa com o Claude Code.
Para testar o Qwen 3.7 Max nos seus próprios fluxos de trabalho hoje mesmo, acesse o Overchat AI e comece a conversar com o Qwen 3.7 Max.