Qwen3 vs Kimi K2.5: qual modelo de IA open source usar em 2026?
Last Updated:
2026-06-09
Qwen3 vs Kimi K2.5: qual modelo de IA open source usar em 2026?
Além do DeepSeek, o Qwen 3 da Alibaba e o Kimi K2.5 da Moonshot AI são dois dos modelos de IA mais comentados que estão saindo da China neste momento.
Os dois são open source, os dois são elogiados pelo forte desempenho em raciocínio, programação e matemática, e os dois conseguem competir com — e às vezes até superar — modelos proprietários da OpenAI, do Google e da Anthropic.
Então, entre os dois, qual você deveria realmente usar?
Neste artigo, vamos comparar a arquitetura, os resultados de benchmark, os recursos, os preços e o desempenho no mundo real para ajudar você a decidir qual modelo faz mais sentido para as suas necessidades.
Quer testar os dois lado a lado? Acesse a Overchat AI e crie uma conta gratuita para experimentar os dois modelos por conta própria.
O Qwen 3 é a família de modelos open source da Alibaba Cloud, que vai de 0,6B a 235B de parâmetros (MoE), com janela de contexto de 256K expansível até 1M, modos thinking/non-thinking e licença Apache 2.0.
O Kimi K2.5 é o modelo MoE de 1 trilhão de parâmetros da Moonshot AI (32B ativos), com visão multimodal nativa, suporte a vídeo, manipulação de documentos de escritório e o recurso exclusivo Agent Swarm.
Nos benchmarks, o Kimi K2.5 vence tanto em matemática/raciocínio quanto em programação contra o Qwen 3 — embora o mais novo Qwen 3.5 supere o Kimi em programação com uma pontuação de 91,3%.
O recurso de destaque do Kimi K2.5 é o Agent Swarm, capaz de coordenar até 100 subagentes em paralelo e reduzir o tempo de execução em até 4,5x em tarefas complexas — nenhum outro modelo open source oferece isso.
As principais vantagens do Qwen 3: 8 tamanhos de modelo, suporte de ecossistema enorme (vLLM, llama.cpp, Ollama, LM Studio) e implantação local ultraleve com apenas 2GB de RAM.
Recursos exclusivos do Kimi K2.5: visão nativa treinada do zero, compreensão de vídeo, capacidades de agente para Word/Excel/PDF e o Kimi Code CLI para programação agêntica.
Nos preços de API, o Kimi K2.5 é bem mais barato para raciocínio — o modo Thinking dele custa US$ 2,50 por milhão de tokens de saída, contra US$ 8,40 do Qwen 3.
Nos testes do mundo real, o Kimi K2.5 produziu uma escrita criativa visivelmente menos engessada que o Qwen 3, e os dois modelos resolveram corretamente problemas de matemática de nível universitário.
Resumindo: o Qwen 3 é a escolha óbvia para implantação local e hospedagem própria; o Kimi K2.5 é a escolha para empurrar o desempenho ao limite — e os dois estão disponíveis via Overchat AI.
Comparação rápida do Qwen 3 vs Kimi K2.5
Antes de entrar nos detalhes, vamos preparar o terreno rapidamente e explicar as diferenças e os principais recursos de cada modelo.
O que é o Qwen 3?
O Qwen 3 é a geração mais recente dos grandes modelos de linguagem da equipe Qwen da Alibaba Cloud. Ele foi lançado em 28 de abril de 2025 — o que, em tempo de IA, já parece ter sido há um bom tempo. Mesmo assim, os modelos mais fortes da família Qwen 3 continuam entre os sistemas de IA de melhor desempenho do mundo.
Isso acontece em parte porque o Qwen 3 não é um modelo único — é uma linha inteira. A família vai de um modelo leve de 0,6 B de parâmetros, que dá para rodar no celular, até um enorme modelo Mixture-of-Experts (MoE) de 235 B de parâmetros, que rivaliza com sistemas de fronteira proprietários.
O Qwen 3 também consegue alternar de forma transparente entre os modos “thinking” e “non-thinking”, parecido com o GPT-5.2 e o Claude Sonnet 4.6. Isso dá flexibilidade: você pode priorizar um raciocínio mais profundo quando precisa ou respostas mais rápidas para tarefas mais simples.
Outro recurso de destaque é a janela de contexto de 256K tokens, expansível até 1 milhão de tokens. No geral, o Qwen 3 é uma das famílias de modelos open source mais versáteis disponíveis hoje.
O que é o Kimi K2.5?
O Kimi K2.5 é o modelo multimodal mais recente da Moonshot AI — e um dos LLMs mais capazes do mercado.
Ele é construído sobre uma arquitetura Mixture-of-Experts (MoE) de 1 trilhão de parâmetros, embora apenas 32 bilhões de parâmetros sejam ativados por requisição. Na prática, isso significa que o modelo tem uma capacidade bruta enorme, mas só “liga” as partes relevantes para a tarefa em questão. Isso mantém os custos de inferência mais baixos e os tempos de resposta mais rápidos sem sacrificar a qualidade.
O recurso principal dele é o Agent Swarm. O Kimi K2.5 consegue dividir tarefas complexas e delegá-las a até 100 subagentes de IA em paralelo, cada um operando de forma independente e com acesso a ferramentas.
O Agent Swarm pode acelerar drasticamente o trabalho — embora seja relevante principalmente quando você implanta o modelo localmente — ou usá-lo por meio de algo como o OpenClaw.
Tabela comparativa: Qwen 3 vs Kimi K2.5
Veja como os dois modelos se comparam num relance:
Recurso
Qwen 3 (235B–A22B)
Kimi K2.5
Desenvolvedor
Alibaba Cloud
Moonshot AI
Data de lançamento
28 de abril de 2025 (atualizado em julho de 2025)
27 de janeiro de 2026
Arquitetura
Variantes Dense + MoE
MoE
Dados de treinamento
36T tokens
15T tokens
Visão nativa
❌ Apenas texto (a versão de imagem do Qwen3 é um modelo separado)
✅ Sim
Alternância thinking/non-thinking
✅ Sim
✅ Sim
Capacidades de agente
✅ Uso de ferramentas
✅ Agent Swarm (até 100 subagentes)
Janela de contexto
256K (expansível até 1M)
256K tokens
Opções de tamanho de modelo
0.6B, 1.7B, 4B, 8B, 14B, 32B, 30B MoE, 235B MoE
1T/32B ativos
Compreensão de vídeo
❌ Não
✅ Sim
Funciona com o Microsoft Office
❌ Não
✅ Excel, Word, PDF, slides
Licença
Apache 2.0
MIT modificada
Idiomas suportados
119
Não divulgado
Dá para rodar localmente?
✅ Facilmente (a menor versão precisa de ~2GB de RAM)
⚠️ Sim, mas seria bem exigente
Agora que entendemos as capacidades de cada modelo, vamos ver o que os benchmarks nos dizem.
Benchmarks do Qwen 3 vs Kimi K2.5
Os benchmarks nos dão uma forma concreta de comparar o desempenho bruto. Para esta comparação, estamos usando as versões mais recentes disponíveis
Qwen3-235B-A22B-Thinking-2507 (atualizado em julho de 2025) e Kimi K2.5 (janeiro de 2026). Todas as pontuações são autodeclaradas ou vêm de análises de terceiros, então encare-as com um pé atrás — o desempenho no mundo real costuma depender mais da sua tarefa e do seu prompt específicos do que de pontuações de benchmark agregadas.
Matemática e raciocínio
Esses benchmarks testam a capacidade dos modelos de resolver problemas de matemática difíceis e de raciocinar sobre questões científicas complexas.
Benchmark
Qwen 3 (235B Thinking-2507)
Kimi K2.5
O que ele mede
AIME 2025
92.3%
96.1%
Problemas de matemática nível competição (avg@32)
GPQA-Diamond
81.1%
87.6%
Questões científicas nível pós-graduação (avg@8)
Os dois modelos são excelentes em tarefas de matemática e conseguem ajudar com a lição de casa ou resolver problemas de nível pós-graduação com facilidade. Dito isso, o Kimi K2.5 é mais preciso.
Vencedor: Kimi K2.5
Programação
Benchmark
Qwen 3 (235B Thinking-2507)
Kimi K2.5
O que ele mede
SWE-bench Verified
61.7%*
76.8%
Resolução de issues reais do GitHub
Quando o assunto é programação, o Kimi K2.5 supera o Qwen 3 com clareza. Na verdade, ele chega perto de modelos de programação proprietários da geração anterior, como o Claude Opus 4.5, que marcou 80,9%.
Dito isso, o Qwen 3.5, mais novo, vira o jogo — ele supera o Kimi com uma pontuação impressionante de 91,3%.
Vencedor: Kimi K2.5 — pelo menos numa comparação direta com o Qwen3.
Recursos do Qwen 3 vs Kimi K2.5
É aqui que as coisas ficam interessantes.
Recursos que os dois modelos têm
Modos de raciocínio. Os dois modelos oferecem modos thinking e non-thinking. O Qwen 3 os chama de “thinking” e “non-thinking”. O Kimi K2.5 os chama de “Thinking” e “Instant”. Ambos deixam o modelo decidir quanto esforço de raciocínio investir.
Uso de ferramentas. Os dois modelos conseguem se integrar a ferramentas e APIs externas. O Qwen 3 alcança o melhor desempenho entre os modelos open source em tarefas baseadas em agentes. O Kimi K2.5 leva isso ainda mais longe com a orquestração de múltiplas ferramentas.
Pesos abertos. Os dois modelos estão disponíveis para download e implantação local. O Qwen 3 usa a Apache 2.0 (bem permissiva). O Kimi K2.5 usa a MIT modificada (gratuita para a maioria dos usos comerciais, com atribuição exigida acima de 100 milhões de MAU ou US$ 20 milhões de receita mensal).
Recursos que só o Qwen 3 tem
Muitos tamanhos de modelo. Oito, para ser exato, de 0,6B a 235B de parâmetros.
Ecossistema enorme. O Qwen 3 é compatível com praticamente todos os frameworks de inferência: vLLM, SGLang, llama.cpp, Ollama, LM Studio, mlx-lm e muito mais.
Implantação local ultraleve. Os modelos de 0,6 B e 1,7 B rodam tranquilamente no seu PC ou MacBook — você só precisa de 2GB de RAM.
Há também um caminho de atualização na forma do Qwen3.5, que saiu em fevereiro de 2026 — esse modelo adiciona visão nativa e melhora o desempenho em todas as áreas.
Recursos que só o Kimi K2.5 tem
Agent Swarm. O K2.5 consegue criar e coordenar até 100 subagentes ao mesmo tempo, o que reduz o tempo de execução em até 4,5 vezes em tarefas complexas. Nenhum outro modelo open source oferece algo parecido.
Visão multimodal nativa. Treinado em dados visuais e de texto desde o início, o K2.5 se destaca na programação a partir de especificações visuais, como transformar protótipos de interface em código de front-end funcional.
Agente de produtividade para escritório. O Kimi K2.5 consegue criar e editar documentos do Word, planilhas do Excel com fórmulas e trabalhar com arquivos PDF, o que o torna um assistente de IA mais poderoso.
Suporte a vídeo. O Kimi K2.5 consegue entender o que vê nos vídeos.
Kimi Code CLI. Uma ferramenta de linha de comando dedicada, otimizada para programação agêntica com o K2.5.
Preços do Qwen 3 vs Kimi K2.5
Os dois modelos têm pesos abertos, o que significa que você pode rodá-los de graça no seu próprio hardware. Mas, para acesso via API, veja como os custos se comparam:
Preços da API
Modelo
Entrada (por 1M de tokens)
Saída (por 1M de tokens)
Janela de contexto
Qwen3-235B-A22B (Instruct)
US$ 0,70
US$ 2,80
256K
Qwen3-235B-A22B (Thinking)
US$ 0,70
US$ 8,40
256K
Qwen3-30B-A3B
US$ 0,15
US$ 0,60
131K
Kimi K2.5 (Instant)
US$ 0,60
US$ 2,50
256K
Kimi K2.5 (Thinking)
US$ 0,60
US$ 2,50
256K
Algumas coisas saltam aos olhos aqui:
O Qwen3-235B-A22B Instruct (US$ 0,70/US$ 2,80) e o Kimi K2.5 Instant (US$ 0,60/US$ 2,50) estão num patamar parecido, com o Kimi saindo um pouco mais barato tanto na entrada quanto na saída.
Para tarefas de raciocínio, o Qwen3-235B-A22B Thinking cobra US$ 8,40 por milhão de tokens de saída — mais de 3 vezes o que o Kimi K2.5 cobra pelo modo Thinking (US$ 2,50).
Isso acontece porque o modo thinking do Qwen 3 gera longas cadeias de raciocínio que acumulam tokens de saída, e a Alibaba cobra mais por token por isso. O Kimi K2.5 cobra a mesma taxa, independentemente do modo.
Custos de hospedagem própria
É aqui que o Qwen 3 tem uma vantagem clara. Com modelos tão pequenos quanto 0,6 B, dá para rodar o Qwen 3 em hardware de consumo sem custo nenhum. Já o Kimi K2.5, com sua arquitetura MoE de 1 trilhão de parâmetros, exige uma infraestrutura de GPU robusta para a implantação local.
Quer testar os dois sem se preocupar com infraestrutura? Você pode acessar os dois modelos na Overchat AI criando uma conta gratuita aqui.
Vencedor: Qwen 3 para hospedagem própria, Kimi K2.5 para API
Qwen 3 vs Kimi K2.5: comparação no mundo real
Os benchmarks e as listas de recursos contam só uma parte da história. Veja como os dois modelos se saíram em tarefas práticas. Para ser justo, rodamos os dois modelos na Overchat AI.
Escrita
Na escrita criativa, testamos a capacidade de cada modelo de produzir uma prosa envolvente e original. Demos a cada modelo o seguinte prompt:
Prompt de escrita criativa: Escreva o parágrafo de abertura (150 a 200 palavras) de um conto de suspense sobre um pesquisador de águas profundas que descobre que uma IA encarregada de uma estação submarina remota começou a tomar decisões por conta própria. O tom deve ser tenso e claustrofóbico. Foque no ambiente, na inquietação crescente do personagem e nos pequenos detalhes que parecem errados.
Os resultados:
Eu não esperava uma grande diferença aqui — mas houve uma. A escrita do Kimi K2.5 parece visivelmente menos engessada. Ela depende menos de “cacoetes de IA” óbvios e soa mais como uma narrativa de verdade se desenrolando, em vez de uma coleção de frases polidas, porém previsíveis.
Em contrapartida, o Qwen tende a abusar das mesmas estruturas de frase “sofisticadas”, sem uma noção clara de por que elas funcionam. O resultado costuma soar genérico e excessivamente padronizado.
Se a maior parte do seu trabalho gira em torno de escrita e textos longos, o Kimi K2.5 é a aposta mais segura entre os dois.
Matemática
Demos aos modelos um problema de otimização de várias etapas de um curso de cálculo de nível universitário (Cálculo II). Ele testa a compreensão de integração, de fórmulas de área de superfície e da aplicação prática da otimização com restrição.
O problema:
Um tanque de armazenamento esférico deve ser construído para conter exatamente 500 metros cúbicos de gás. O tanque será revestido com dois materiais diferentes: o hemisfério superior usa um revestimento resistente ao calor que custa US$ 12 por metro quadrado, e o hemisfério inferior usa um revestimento padrão que custa US$ 8 por metro quadrado. Encontre o raio que minimiza o custo total do revestimento. Mostre todo o seu desenvolvimento, incluindo:
1. Montar a função de custo em termos do raio
2. Expressar a área de superfície de cada hemisfério
3. Calcular as derivadas
4. Resolver o ponto crítico
5. Confirmar que o resultado é um mínimo
Os resultados:
Os dois modelos resolveram a tarefa corretamente, então deu empate.
Conclusão
Veja onde os dois modelos se posicionam depois da nossa comparação completa:
O Qwen 3 vence em:
Variedade de modelos e flexibilidade de implantação local
Suporte de ecossistema e de comunidade
Cobertura de idiomas (119 idiomas)
Eficiência de custo na hospedagem própria
O Kimi K2.5 vence em:
Fluxos de trabalho agênticos
Compreensão de imagens e vídeos
Trabalho com documentos de escritório
Preços da API
Escrita criativa
Empates:
Os dois têm modos de thinking/raciocínio
Os dois conseguem usar ferramentas
Os dois usam licenciamento de pesos abertos
Desempenho em matemática
Dito isso, há uma nuance importante aqui: esses modelos não estão realmente competindo de igual para igual.
O Qwen 3 é a escolha óbvia se você precisa de algo que dê para rodar localmente. O Kimi K2.5, por outro lado, parece mais um projeto do tipo “vamos construir o melhor modelo que conseguirmos” — menos sobre eficiência e mais sobre empurrar o teto do que é possível. É quase o Crysis da IA: feito para mostrar o que dá para fazer no mais alto nível.
Então, no fim das contas, tudo se resume às suas necessidades específicas.
E aqui vai a boa notícia — você não precisa mesmo escolher. Você pode acessar o Qwen 3 e o Kimi K2.5 na Overchat AI bem aqui: