/
Gemini 3.5 Flash: inteligência de ponta na velocidade do Flash
Last Updated:
2026-06-08

Gemini 3.5 Flash: inteligência de ponta na velocidade do Flash

Com o lançamento do Gemini 3.5 Flash, é a primeira vez que um modelo da linha Flash — normalmente pensado para ser mais rápido e mais barato — supera o Pro da geração anterior na maioria dos benchmarks de programação e de tarefas agênticas.

O modelo oferece uma janela de contexto de 1 milhão de tokens e suporte nativo a entradas de texto, imagem, áudio, vídeo e PDF. Além disso, ele roda cerca de quatro vezes mais rápido do que outros modelos de IA com desempenho parecido. Então, será que chegou a hora de abandonar o Claude Opus 4.7? Vamos analisar isso de perto. 

Se você prefere testar o modelo por conta própria, o Gemini 3.5 Flash já está disponível na Overchat AI.

Resumo rápido

  • O que é o Gemini 3.5 Flash? Lançado em 19 de maio de 2026, no Google I/O 2026, é o  primeiro modelo da família Gemini 3.5.
  • Por que esse lançamento é tão importante? Esse Flash supera o Gemini 3.1 Pro na maioria das tarefas de programação.
  • Quais são os destaques? A velocidade de saída fica em torno de 278 a 289 tokens por segundo — cerca de 4x mais rápida do que a do Claude Opus 4.7 e a do GPT-5.5. Além disso, o modelo é multimodal nativo e entende entradas de texto, imagem, áudio, vídeo e PDF, com uma janela de contexto de 1 milhão de tokens.
  • Quanto custa usar o Gemini 3.5 Flash? O preço da API é de US$ 1,50 por milhão de tokens de entrada e US$ 9 por milhão de tokens de saída, com a entrada em cache a US$ 0,15 — cerca de um terço do custo do Claude Opus 4.7 e do GPT-5.5. Vale notar que o preço triplicou em relação ao Gemini 3 Flash Preview.
  • Onde posso acessar o Gemini 3.5 Flash? Uma das formas mais fáceis de acessar é pela Overchat AI, onde dá para conversar com o modelo online.

O que é o Gemini 3.5 Flash?

O Gemini 3.5 Flash é o modelo intermediário do Google. Foi lançado em 19 de maio de 2026, no Google I/O em Mountain View, e se tornou o primeiro modelo da família Gemini 3.5.

O Google posiciona esse modelo como inteligência de ponta com a latência do Flash — uma IA tão inteligente quanto os modelos Gemini Pro anteriores e tão rápida quanto os modelos Gemini Flash anteriores.

Isso se confirma nos benchmarks: o 3.5 Flash realmente supera o Gemini 3.1 Pro em programação, ao mesmo tempo em que roda cerca de 4x mais rápido por menos da metade do custo. Isso é revolucionário e abre um milhão de casos de uso reais que antes eram simplesmente impossíveis, e que vamos cobrir mais adiante.

O que há de novo no Gemini 3.5 Flash

Desempenho de ponta na linha Flash

Nas próprias comparações de benchmark do Google, o Gemini 3.5 Flash supera o Gemini 3.1 Pro no Terminal-Bench 2.1, no MCP Atlas e no Finance Agent v2. É a primeira vez que um modelo da linha Flash supera com folga o Pro anterior em tantos benchmarks de uma só vez. A comparação completa vem logo abaixo.

Isso permitiu que o Google usasse o modelo para alimentar recursos de IA incrivelmente complexos que vão chegar à busca na web nos próximos meses — como o modelo criar visualizações interativas para responder perguntas no momento em que você digita uma consulta, algo que era impossível com o custo e a velocidade dos modelos Pro.

O que isso provavelmente significa para você é uma experiência de uso muito mais imediata, em que você não precisa esperar tanto pelas respostas. Mais sobre isso abaixo.

Velocidade de saída 4x maior

O Gemini 3.5 Flash escreve a cerca de 278 a 289 tokens por segundo, o que é aproximadamente 4x mais rápido do que o Claude Opus 4.7 (~50 tokens/seg) e o GPT-5.5 (~65 tokens/seg). No Artificial Analysis, ele ocupa a 2ª posição entre 147 modelos de sua faixa de preço em velocidade de saída.‍ 

Se você lembra, quando a OpenAI lançou o GPT-4o Turbo, aquele modelo também escrevia muito rápido, mas os usuários logo perceberam que havia um preço a pagar: a qualidade das respostas. E a OpenAI acabou revertendo isso discretamente. Pois bem, neste caso o Google entrega todas as mesmas vantagens sem as desvantagens — você recebe respostas rápidas sem nenhum impacto na qualidade, com até uma melhora.

Multimodal nativo

O Gemini 3.5 Flash entende entradas de texto, imagem, áudio, vídeo e PDF de forma nativa (embora a saída ainda seja apenas em texto).

Janela de contexto de 1 milhão de tokens

A janela de contexto é de 1.048.576 tokens de entrada, com saída máxima de 65.536 tokens — no mesmo nível do Claude Opus 4.7. O corte de conhecimento é janeiro de 2026.

4 níveis de raciocínio: mínimo, baixo, médio e alto

Para os desenvolvedores, o Gemini 3.5 Flash introduz um novo parâmetro de nível de raciocínio. Os valores são mínimo, baixo, médio e alto. Isso permite controlar o quanto o modelo vai pensar antes de responder e equilibrar precisão e velocidade.

Benchmarks do Gemini 3.5 Flash

O Gemini 3.5 Flash ocupa a 7ª posição entre 147 modelos no Artificial Analysis Intelligence Index v4.0. É uma pontuação impressionante, especialmente considerando que estamos falando de um modelo de velocidade, e não de um modelo de ponta, em que todas as métricas são priorizadas para o raciocínio em detrimento de tudo o mais.

Categoria Benchmark Pontuação
Programação SWE-Bench Pro 55,1%
Programação Terminal-Bench 2.1 76,2%
Agentes e uso de ferramentas MCP Atlas 83,6%
Agentes e uso de ferramentas Toolathlon 56,5%
Agentes e uso de ferramentas Finance Agent v2 57,9%
Agentes e uso de ferramentas GDPval-AA (Elo) 1.656
Raciocínio AA Intelligence Index v4.0 55,3
Raciocínio Humanity's Last Exam (sem ferramentas) 40,2%
Multimodal CharXiv Reasoning 84,2%
Multimodal MMMU-Pro 83,6%
Contexto longo MRCR v2 @ 128k 77,3%
Velocidade Tokens de saída / seg ~278–289

Como ele se compara?

Vamos ver como o modelo se sai em relação a outras opções da mesma categoria de peso.

Gemini 3.5 Flash vs Gemini 3.1 Pro

Já deixamos claro que o novo Flash é melhor do que o modelo anterior, mas aqui está exatamente como ele o supera:

Benchmark Gemini 3.5 Flash Gemini 3.1 Pro
Terminal-Bench 2.1 76,2% 70,3%
MCP Atlas 83,6% 78,2%
Finance Agent v2 57,9% 43,0%
MRCR v2 @ 128k 77,3% 84,9%
Entrada / Saída por 1M US$ 1,50 / US$ 9,00 US$ 2,00 / US$ 12,00

O Terminal-Bench 2.1 mede o quão bem um modelo lida com trabalho real de linha de comando, e dá para ver que, nesse tipo de tarefa, o Gemini 3.5 Flash é melhor. O MCP Atlas é o teste padrão para uso de ferramentas via Model Context Protocol. E a maior diferença de todas aparece no Finance Agent v2, que simula um analista financeiro buscando dados, fazendo cálculos e produzindo um relatório — o Flash vence por quase 15 pontos. A exceção é o MRCR v2 a 128k, em que o Gemini 3.1 Pro ainda lidera. Esse teste avalia o quão bem um modelo consegue extrair fatos específicos de um documento de 128 mil tokens.‍

Gemini 3.5 Flash vs Claude Opus 4.7

O Claude Opus 4.7 é o modelo de destaque atual da Anthropic e o mais forte em benchmarks de programação do mundo real, como o SWE-Bench Pro.

Benchmark Gemini 3.5 Flash Claude Opus 4.7
SWE-Bench Pro 55,1% 64,3%
MCP Atlas 83,6% 79,1%
AA Intelligence Index 55,3 57,3
MRCR v2 @ 128k 77,3% 46,9%
Velocidade de saída (tokens/seg) ~278–289 ~50
Entrada / Saída por 1M US$ 1,50 / US$ 9,00 US$ 5,00 / US$ 25,00

A julgar por esses benchmarks, o Opus 4.7 provavelmente é um modelo de programação melhor, mas é bem possível que haja uma reviravolta quando o Gemini 3.5 Pro for lançado. Vale notar que também há categorias em que o Gemini 3.5 Flash supera o Opus 4.7 e, quando você considera as diferenças de custo e velocidade, isso é notável.

Gemini 3.5 Flash vs GPT-5.5

O GPT-5.5 está atualmente no topo do Artificial Analysis Intelligence Index e lidera nos benchmarks de raciocínio mais difíceis, então ele supera o Flash na maioria das tarefas, exceto no uso de ferramentas MCP (medido pelo Atlas):

Benchmark Gemini 3.5 Flash GPT-5.5
SWE-Bench Pro 55,1% 58,6%
Terminal-Bench 2.1 76,2% 78,2%
MCP Atlas 83,6% 75,3%
AA Intelligence Index 55,3 60,2
Velocidade de saída (tokens/seg) ~278–289 ~65
Entrada / Saída por 1M US$ 1,50 / US$ 9,00 US$ 5,00 / US$ 30,00

Como acessar o Gemini 3.5 Flash

Você pode acessar o Gemini 3.5 Flash de várias formas, e aqui estão elas, sem nenhuma ordem específica:

  • Overchat AI — você pode conversar com o Gemini 3.5 Flash junto com o Claude Opus 4.7, o GPT-5.5, o Qwen 3.7 Max, o Kimi K2.6 e outros modelos de ponta em uma única assinatura.
  • App do Gemini — o Gemini 3.5 Flash agora é o modelo padrão no mundo todo para usuários gratuitos e pagantes.
  • AI Mode na Busca do Google — alimenta a experiência de busca agêntica no mundo inteiro.
  • Google AI Studio — para desenvolvedores que querem testar o modelo em um playground no navegador.
  • API do Gemini — para integrações em produção, com o ID de modelo gemini-3.5-flash.
  • Google Antigravity — a plataforma de desenvolvimento agent-first do Google.
  • Vertex AI — para implantações empresariais no Google Cloud.
  • Gemini Enterprise Agent Platform — para empresas que constroem fluxos de trabalho baseados em agentes.

Preço do Gemini 3.5 Flash

O Gemini 3.5 Flash custa cerca de um terço do Claude Opus 4.7 (US$ 5 / US$ 25) e do GPT-5.5 (US$ 5 / US$ 30), tanto na entrada quanto na saída. Veja o preço da API:

  • Entrada padrão: US$ 1,50 por milhão de tokens
  • Saída: US$ 9,00 por milhão de tokens
  • Entrada em cache: US$ 0,15 por milhão de tokens (90% de desconto)
  • Regiões não globais: US$ 1,65 de entrada / US$ 9,90 de saída por milhão de tokens
  • Processamento em lote: 50% de desconto sobre as tarifas padrão

‍‍

Há uma ressalva importante  — agora tanto a entrada quanto a saída custam 3x mais do que no Flash anterior, e o Artificial Analysis também observou um aumento de 5,5x no custo total de execução dos benchmarks ao levar em conta o novo tokenizador e o nível de raciocínio padrão mais pesado.

O Google afirma que isso foi necessário para que o modelo tivesse um desempenho tão bom em uma velocidade dessas. Ainda assim, o Flash não vai concorrer com modelos chineses hiperotimizados, como o Qwen 3.5 Plus, quando o assunto é preço.

Se você quer pular de vez a matemática da API, dá para conversar com o Gemini 3.5 Flash na Overchat AI como parte de uma única assinatura que também inclui o Claude Opus 4.7, o GPT-5.5, o Qwen 3.7 Max, o Kimi K2.6 e mais.

Limitações do Gemini 3.5 Flash

Há algumas limitações que vale conhecer antes de você desenvolver em cima do Gemini 3.5 Flash.

Ele não é o melhor dos melhores para programação. Tanto o Claude Opus 4.7 quanto o GPT-5.5 são programadores de IA melhores.

O Google não publicou um benchmark SWE-Bench Verified. Esse é o benchmark mais preciso para medir o desempenho real em programação. Talvez o modelo não vá tão bem quanto os outros benchmarks sugerem, dada a ausência desses dados no marketing do Google.

Quando você deve usar o Gemini 3.5 Flash?

Se você está tentando decidir se esse modelo de IA é o ideal para você, aqui estão alguns cenários em que ele é preferível a outras opções:

  • Você quer respostas muito precisas e de alta qualidade entregues com rapidez, e não se importa de pagar mais por tokens de API ou de plataforma.
  • Você está criando fluxos de trabalho agênticos de alto volume, em que velocidade e custo por tarefa importam — saída 4x mais rápida e um terço do preço dos modelos de destaque somam rapidamente em escala.
  • Você quer conversar usando texto, imagens, áudio, vídeo ou PDF.
  • Você usa bastante ferramentas MCP.
  • Você precisa de trabalho com contexto longo que não exija o raciocínio mais profundo de todos.

Procure outra opção quando:

  • Para alcançar o auge absoluto do desempenho de IA, você precisa do Claude Opus 4.7 ou do GPT-5.5.
  • Você quer conversar em volumes maiores e topa abrir mão de um pouco de "inteligência" por preços mais baixos — o Kimi K2.6 ou o DeepSeek V4 Pro são mais baratos.

FAQ

Quando o Gemini 3.5 Flash foi lançado?

O Gemini 3.5 Flash foi lançado em 19 de maio de 2026, no Google I/O 2026, disponível imediatamente como uma versão de disponibilidade geral — sem sufixo de preview, sem lista de espera. Ele pode ser acessado pelo app do Gemini, pelo AI Mode na Busca, pelo Google AI Studio, pela API do Gemini, pelo Antigravity e pelo Vertex AI.

Quanto custa o Gemini 3.5 Flash?

O preço da API é de US$ 1,50 por milhão de tokens de entrada e US$ 9 por milhão de tokens de saída, com a entrada em cache a US$ 0,15 por milhão — um desconto de 90%. Isso equivale a cerca de um terço do custo do Claude Opus 4.7 e do GPT-5.5. O processamento em lote ganha 50% de desconto adicional sobre as tarifas padrão.

O Gemini 3.5 Flash é melhor do que o Gemini 3.1 Pro?

O Gemini 3.5 Flash supera o Gemini 3.1 Pro no Terminal-Bench 2.1 (76,2% vs 70,3%), no MCP Atlas (83,6% vs 78,2%) e no Finance Agent v2 (57,9% vs 43,0%). A exceção é a recuperação de contexto longo, em que o Gemini 3.1 Pro ainda lidera no MRCR v2 a 128k (84,9% vs 77,3%).

Como o Gemini 3.5 Flash se compara ao Claude Opus 4.7?

O Claude Opus 4.7 lidera no SWE-Bench Pro (64,3% vs 55,1%) e no AA Intelligence Index (57,3 vs 55,3). O Gemini 3.5 Flash lidera no MCP Atlas (83,6% vs 79,1%), na recuperação de contexto longo (77,3% vs 46,9% no MRCR v2 a 128k), na velocidade de saída (cerca de 4x mais rápido) e no preço (cerca de um terço do custo). A divisão é clara: o Opus 4.7 para a programação e o raciocínio mais difíceis, e o Gemini 3.5 Flash para trabalho agêntico e multimodal de alto volume.

Conclusão

O Gemini 3.5 Flash marca a primeira vez que um modelo da linha Flash supera com clareza a linha Pro anterior na maioria dos benchmarks de programação e de tarefas agênticas. Aqui estão os principais pontos:

  • O Gemini 3.5 Flash roda quatro vezes mais rápido do que o Claude Opus 4.7 e o GPT-5.5.
  • Ele custa cerca de um terço do preço do Opus 4.7 ou do GPT-5.5 e entende imagens, vídeos, áudio e arquivos PDF de forma nativa.
  • Seu desempenho em programação fica abaixo do dos modelos mais avançados, mas isso já era de se esperar.
  • No momento em que este texto foi escrito, ele era o modelo mais avançado do mundo no uso de MCP, o que faz sentido, já que o Google pretende usá-lo para alimentar a busca com IA.
  • Todas essas conquistas tiveram um custo — literalmente, já que o preço triplicou em relação ao modelo Flash anterior.

Para testar o Gemini 3.5 Flash nos seus próprios fluxos de trabalho hoje mesmo, acesse a Overchat AI e comece a conversar com o Gemini 3.5 Flash.