/
O que é o Gemma 4 — o modelo open source mais capaz da Google
Last Updated:
2026-06-08

O que é o Gemma 4 — o modelo open source mais capaz da Google

A Google DeepMind lançou o Gemma 4 em 2 de abril de 2026 — e ele é o modelo de pesos abertos mais capaz até agora. Veja tudo o que você precisa saber.

O que é o Gemma? O Gemma é uma família de modelos de IA da Google lançados com pesos abertos. Eles são voltados para desenvolvedores e para quem quer rodar IA localmente. Vêm em vários tamanhos diferentes, otimizados para distintos dispositivos de consumo. O Gemma 4 é a quarta geração — e o salto em relação ao Gemma 3 é gigantesco em todas as métricas.

Está procurando um app para rodar modelos de IA locais como o Gemma 4 e o GPT-OSS offline e com total privacidade? O Atomic Chat é o melhor chatbot de IA local: ele ajuda você a configurar uma IA privada em segundos e a rodar qualquer modelo no seu próprio hardware de graça.

Resumo

  • O Gemma 4 chega em quatro tamanhos: E2B (2 bilhões de parâmetros) e E4B (4 bilhões) para dispositivos de borda, além de um modelo MoE de 26B (4B ativos) e um modelo denso de 31B para cargas de trabalho em servidor — todos com janelas de contexto de 128K a 256K.
  • O modelo denso de 31B ocupa a 3ª posição no ranking Arena AI, entregando desempenho comparável ao do Claude Opus 4.6 e sendo muito mais barato de rodar do que as alternativas MoE.
  • Todos os modelos aceitam entrada multimodal (texto, imagens, vídeo), e o E2B e o E4B ainda adicionam entrada de áudio — uma combinação que nenhuma outra família de modelos abertos oferece nesse tamanho.
  • O modo de raciocínio integrado, a chamada nativa de funções e a saída estruturada em JSON tornam o Gemma 4 prático para fluxos de trabalho agênticos e uso de ferramentas em várias etapas.
  • O suporte nativo a mais de 140 idiomas faz dele uma opção forte para tradução e casos de uso fora do inglês.
  • Contra os concorrentes: o Gemma 4 31B é mais eficiente que o Llama 4 Maverick (MoE de 400B), supera o Qwen 3.5 27B em capacidades multimodais e deixa o Phi-4 14B para trás em tudo, exceto em hardware de altíssima limitação.
  • Licença totalmente Apache 2.0 — sem limites de MAU, sem restrições de uso, sem dependência de fornecedor.
  • Indicado principalmente para IA offline, fluxos de trabalho agênticos, implantações locais em empresas e pipelines de RAG com contexto longo — sendo o Atomic Chat a forma mais rápida de rodá-lo na sua máquina.

Tamanhos e arquitetura dos modelos Gemma 4

A família Gemma 4 inclui quatro modelos:

E2B — 2 bilhões de parâmetros, contexto de 128K. Aceita texto, imagens, vídeo e áudio. Você consegue rodar esse modelo em absolutamente qualquer coisa: celulares, Raspberry Pi e Jetson Orin Nano. É o menor modelo da linha.

E4B — 4 bilhões de parâmetros, contexto de 128K. Mesmo suporte a modalidades do E2B, com mais capacidade. Supera o Gemma 3 12B na maioria dos benchmarks, apesar de ter três vezes menos parâmetros.

26B MoE (A4B) — 26 bilhões de parâmetros no total, mas com apenas 4 bilhões ativos a cada momento, graças ao roteamento por mistura de especialistas (mixture-of-experts). Janela de contexto de 256K. Atualmente ocupa a 6ª posição no ranking Arena AI. Entende texto, imagens e vídeo.

31B Denso — 31 bilhões de parâmetros, todos ativos. Contexto de 256K. Ficou em 3º no Arena AI. O desempenho é comparável ao do Claude Opus 4.6, por exemplo.

Essa divisão é intencional. O E2B e o E4B são modelos de borda — offline, no próprio dispositivo, com latência quase nula. Já o 26B e o 31B são modelos de nível servidor, para cargas de produção e pipelines de RAG que precisam de contexto longo.

Recursos do Gemma 4

O Gemma 4 acrescenta cinco recursos que o Gemma 3 ou não tinha ou suportava apenas em parte — e, juntos, eles dão a sensação de um ChatGPT offline.

Modo de raciocínio integrado

Todos os modelos Gemma 4 suportam um modo de pensamento, em que o modelo gera um raciocínio passo a passo antes de produzir a resposta final. Isso melhora o desempenho na maioria das tarefas.

Entrada multimodal

Todo modelo da família aceita texto, imagens e vídeo. Os modelos de borda E2B e E4B também aceitam entrada de áudio. 

Mais de 140 idiomas

O modelo oferece suporte multilíngue nativo a mais de 140 idiomas, o que o torna altamente capaz em tarefas de tradução e ideal para quem prefere idiomas que não o inglês.

Capacidades agênticas

O Gemma 4 suporta chamada nativa de funções e saída estruturada em JSON. Na prática, para você como usuário, isso significa que os modelos conseguem executar planos de várias etapas — receber um objetivo, dividi-lo em tarefas, chamar ferramentas e devolver resultados — mais ou menos como o OpenClaw.

Projetado para a borda

Os modelos E2B e E4B foram pensados desde o início para inferência offline — ou seja, são otimizados para casos de uso de IA offline.

Benchmarks e desempenho do Gemma 4

Estes números contam a história toda.

Modelo Tipo Métricas principais
31B Denso Denso MMLU Pro: 85,2% | AIME 2026: 89,2% | ELO Codeforces: 2150
26B MoE MoE 4B de parâmetros ativos por passagem
E4B (4B) Modelo de borda Supera o Gemma 3 (12B) na maioria dos benchmarks
Gemma 3 (12B) Denso Inferior ao E4B na maioria dos benchmarks

Gemma 4 vs Llama 4 vs Qwen 3.5 vs Phi-4

Veja como o Gemma 4 se compara às principais alternativas.

Gemma 4 31B vs Llama 4 Maverick

Esses modelos usam arquiteturas diferentes: denso vs mistura de especialistas. O Llama 4 Maverick supera ligeiramente o Gemma 4 em benchmarks como o MMLU Pro (85,5% vs 85,2%), mas é um modelo MoE de 400 bilhões de parâmetros, o que torna a inferência bem mais cara e a implantação mais complexa. Em contrapartida, a arquitetura densa do Gemma 4 é muito mais barata de rodar em termos de quanto ela exige do seu hardware.

O licenciamento é outro fator: a licença comunitária do Llama 4 vem com restrições de MAU e limitações de uso aceitável, enquanto o Gemma 4 é totalmente Apache 2.0. Na prática, o Gemma 4 é muito mais eficiente.

Gemma 4 vs Qwen 3.5 27B

Essa é uma comparação bem interessante, já que o Qwen 3.5 é outra família de modelos nova no momento em que escrevemos. 

Vale destacar que o Gemma 4 tem  capacidades multimodais — você pode conversar com vídeo, áudio e imagens  — que faltam ao Qwen.

Ambos são Apache 2.0. O Qwen provavelmente terá melhor desempenho em chinês — um caso de uso bem específico para a maioria das pessoas. Se você quer usar anexos nas conversas, o Gemma 4 é o vencedor claro. Em termos de qualidade das respostas, você provavelmente não vai sentir diferença nas conversas do dia a dia.

Gemma 4 vs Phi-4 14B

O Phi-4 14B é um modelo notavelmente eficiente para o seu tamanho — alcança 84,8% no MMLU Pro com apenas 14 bilhões de parâmetros. No entanto, esse modelo é todo voltado para otimização e para rodar em hardware de baixo desempenho. Ele é, antes de tudo, para desenvolvedores mobile, e não para quem quer extrair o máximo da sua IA offline local.

Por exemplo, o Phi-4 é estritamente apenas texto — sem imagens, vídeo ou áudio — então não consegue competir em nenhum cenário multimodal.

Na maioria dos casos, o Gemma 4 é uma escolha bem melhor, a menos que você esteja usando um hardware muito ultrapassado, que não dê conta dele.

Camada de borda

Este é um caso de uso específico e vai ser irrelevante para a maioria das pessoas, mas ainda vale a pena apontar: nenhum dos outros grandes modelos abertos oferece equivalentes às variantes E2B ou E4B, que permitem cargas multimodais em dispositivos embarcados. 

Quem deve usar o Gemma 4

Cinco casos de uso em que o Gemma 4 é a escolha mais forte neste momento:

IA offline. Os modelos E2B e E4B rodam em qualquer dispositivo — até em notebooks mais antigos — e ainda entregam capacidades multimodais.

Fluxos de trabalho agênticos. O suporte à chamada nativa de funções e à saída estruturada torna o Gemma 4 prático para construir agentes que planejam, usam ferramentas e agem de forma autônoma — localmente ou na nuvem.

Implantações de IA local. Apache 2.0 significa nenhuma dependência de fornecedor, nenhuma restrição de uso e nenhuma surpresa de licenciamento. Governos e empresas que precisam de controle total sobre sua infraestrutura de IA podem implantar o Gemma 4 em qualquer lugar.

RAG com contexto longo. Os modelos de 26B e 31B suportam 256K tokens de contexto. Isso é suficiente para ingerir bases de código inteiras, grandes documentos jurídicos ou bases de conhecimento.

Como começar a usar o Gemma 4

Todos os modelos Gemma 4 já estão disponíveis. Você pode baixar os pesos no Kaggle e no Hugging Face, ou implantar instâncias gerenciadas pelo Vertex AI, do Google Cloud.

Você também vai precisar de uma interface de chat para se comunicar com o modelo. O Atomic Chat é a forma mais rápida de colocar o Gemma 4 para rodar na sua máquina. É um app de desktop feito para rodar modelos abertos localmente — baixe o modelo e comece a conversar na hora.

Conclusão

O Gemma 4 reúne uma combinação de recursos que nenhuma outra família de modelos abertos oferece ao mesmo tempo: 

  • Capacidade de rodar em dispositivos de altíssima limitação
  • Capacidade de processar áudio e vídeo
  • Suporte integrado a cadeia de raciocínio (chain-of-thought)
  • Licença Apache 2.0
  • Desempenho de nível de fronteira

Além disso, os benchmarks mostram que ele compete com modelos que precisam de dez vezes mais poder de computação.

Se você quer rodar um chatbot de IA offline — o Gemma 4 é o modelo para baixar primeiro, e o Atomic Chat é o lugar mais fácil para deixá-lo configurado e rodando.