Gemini 3.7 Flash: Benchmarks, Preços, Disponibilidade da API e o que Mudou

Avatar
Lisa Ernst · 17.08.2026 · Inteligência Artificial · 15 min de leitura

O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, apenas três semanas após o Gemini 3.6 Flash. A atualização é voltada diretamente para codificação, fluxos de trabalho agênticos, desenvolvimento web e trabalho de conhecimento intensivo em documentos, com o Google publicando ganhos substanciais em relação ao 3.6 Flash em vários benchmarks de engenharia de software e automação.

A parte incomum são os preços: o Gemini 3.7 Flash será lançado a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída na API paga padrão até 31 de dezembro de 2026. Essas taxas são temporárias e dobrarão em 1º de janeiro de 2027. Este guia explica os resultados dos benchmarks, disponibilidade da API, limites do modelo, ferramentas suportadas, níveis de preços e as diferenças práticas em relação ao Gemini 3.6 Flash.

Principais conclusões

Gemini 3.7 Flash em resumo

Especificação Gemini 3.7 Flash
Data de lançamento 13 de agosto de 2026
Estágio de lançamento Geralmente disponível (GA)
ID estável do modelo da API gemini-3.7-flash
Modalidades de entrada Texto, imagem, vídeo, áudio e PDF
Modalidade de saída Texto
Limite de tokens de entrada 1.048.576 tokens
Saída máxima 65.536 tokens
Níveis de pensamento Baixo, médio e alto; mínimo não é suportado
Preço da API paga padrão até 31 de dezembro de 2026 US$ 0,75 / 1 milhão de tokens de entrada; US$ 3,75 / 1 milhão de tokens de saída

O que é Gemini 3.7 Flash?

O Gemini 3.7 Flash é a próxima iteração da família Gemini 3 Flash do Google. O Google DeepMind afirma que ele é baseado no Gemini 3.6 Flash e adiciona melhorias algorítmicas à base de raciocínio central do modelo. O posicionamento também se tornou mais explícito: o Google chama o 3.7 Flash de seu principal "cavalo de batalha" para codificação e agentes, em vez de um modelo projetado simplesmente para maximizar a produtividade bruta.

Essa distinção é importante. Os modelos Flash têm sido tradicionalmente selecionados porque são mais rápidos e mais baratos do que os maiores modelos de raciocínio. Com o 3.7, o Google está tentando mover mais trabalho multi-etapas para essa camada de custo-eficiência: codificação em nível de repositório, interação com navegador ou computador, chamada de função, processamento complexo de documentos e fluxos de trabalho de negócios que exigem várias chamadas de ferramenta antes que uma resposta seja concluída.

Se você está vindo do antecessor, o visão geral do Gemini 3.6 Flash fornece o contexto de lançamento para o modelo anterior. A atualização importante agora é que o 3.7 Flash mantém a mesma janela de contexto de um milhão de tokens e um amplo conjunto de ferramentas, enquanto aumenta o desempenho em muitas das avaliações de agentes e codificação publicadas pelo Google.

O que mudou do Gemini 3.6 Flash?

Área Mudança do Gemini 3.7 Flash Efeito prático
Codificação Maiores pontuações em FrontierCode, DeepSWE e Terminal-bench Caso mais forte para trabalho em repositório, depuração e agentes de codificação de longa execução
Desenvolvimento web O Code Arena sobe de 1538 para 1588 Elo no cartão de modelo do Google Melhor desempenho publicado em layouts funcionais e tarefas web completas
Automação empresarial O AutomationBench sobe de 17,0% para 30,4% Mais promissor para fluxos de trabalho que combinam raciocínio, ferramentas e sistemas de negócios
Raciocínio de documentos O GDP.pdf sobe de 22,0% para 34,0% Resultado publicado aprimorado para trabalho de conhecimento baseado em PDF difícil
Contexto longo O GDM-MRCR v2 em 128k sobe de 91,8% para 97,0% Melhor recuperação e raciocínio em entradas longas nessa avaliação
Comportamento do desenvolvedor O Google diz que o modelo se adapta melhor a bloqueios, esclarece a intenção e segue as instruções com mais fidelidade Potencialmente menos retentativas e menos supervisão manual em fluxos de trabalho multi-etapas
Preços O 3.7 é lançado com uma taxa temporária de US$ 0,75 de entrada / US$ 3,75 de saída por 1 milhão de tokens Custo de curto prazo menor do que a taxa de lançamento original do 3.6, embora o 3.6 agora esteja na mesma taxa temporária

A última linha é fácil de mal-entender. O Google descreve o Gemini 3.7 Flash como sendo lançado pela metade do custo original do Gemini 3.6 Flash. No entanto, o cartão de modelo atual do Google lista tanto o 3.6 Flash quanto o 3.7 Flash a US$ 0,75 de entrada e US$ 3,75 de saída por milhão de tokens sob a mesma promoção temporária. Portanto, o 3.7 não é atualmente mais barato por token padrão do que o 3.6; a comparação é contra os preços de lançamento originais do 3.6.

Benchmarks do Gemini 3.7 Flash

O cartão de modelo de agosto de 2026 do Google publica um amplo conjunto de benchmarks cobrindo engenharia de software, uso de terminal agêntico, automação empresarial, trabalho de conhecimento, PDFs, contexto longo, uso de computador e raciocínio científico. Os números abaixo comparam o Gemini 3.7 Flash com o Gemini 3.6 Flash usando os valores desse cartão de modelo.

Benchmark O que ele mede Gemini 3.6 Flash Gemini 3.7 Flash
Índice de Análise de Inteligência Artificial Inteligência de modelo composto 52 56
FrontierCode 1.1 Principal Qualidade de código de produção 34.4% 43.6%
DeepSWE v1.1 Engenharia de software de longo horizonte 48.6% 65.3%
Code Arena Desenvolvimento web 1538 Elo 1588 Elo
Terminal-bench 2.1 Codificação de terminal agêntica 78.0% 85.8%
AutomationBench Automação de fluxo de trabalho empresarial 17.0% 30.4%
GDP.pdf Compreensão de PDF por especialista 22.0% 34.0%
GDM-MRCR v2 a 128k Recuperação e raciocínio de contexto longo 91.8% 97.0%
OSWorld-2.0 Uso de computador agêntico 33.8% 47.9%
Tabela de benchmark do Google comparando Gemini 3.7 Flash com Gemini 3.6 Flash e outros modelos de IA

Fonte: blog.google

A tabela de avaliação de agosto de 2026 do Google mostra ganhos especialmente grandes do 3.7 Flash em engenharia de software de longo horizonte, automação de fluxo de trabalho empresarial, compreensão de documentos e uso de computador. Os benchmarks medem diferentes cargas de trabalho e não devem ser combinados em uma única pontuação universal.

Onde os ganhos são mais fortes

O movimento mais claro é em cargas de trabalho que exigem que o modelo continue trabalhando em vez de responder uma vez. O DeepSWE aumenta de 48,6% para 65,3%, enquanto o AutomationBench passa de 17,0% para 30,4%. Isso apoia a afirmação do Google de que o modelo é mais útil para agentes que precisam planejar, chamar ferramentas, inspecionar resultados e se recuperar de obstáculos.

O trabalho com documentos também melhora substancialmente nos dados publicados pelo Google. O GDP.pdf passa de 22,0% para 34,0%, e a empresa destaca especificamente finanças, direito e biociências como domínios densos em conhecimento onde espera melhor raciocínio. Isso não significa que o modelo possa substituir a revisão especializada em trabalhos regulamentados ou de alto risco; significa que o resultado do benchmark é materialmente superior ao 3.6 Flash nas tarefas testadas.

3.7 Flash não vence todos os benchmarks

O lançamento não é uma vitória limpa. No CharXiv sem ferramentas, o Gemini 3.7 Flash pontua 84,5% contra 85,2% para o 3.6 Flash; com ferramentas, pontua 88,7% contra 89,4%. Na tabela intercomparativa do Google, o GPT-5.6 Terra também permanece à frente em algumas avaliações de codificação e terminal. É por isso que uma tabela de benchmark deve ser usada para identificar cargas de trabalho promissoras, não para declarar um vencedor universal.

Há também uma pequena diferença de relatório que vale a pena notar: o artigo de lançamento do Google arredonda o resultado do Gemini 3.6 Flash DeepSWE para 49,0%, enquanto a ficha detalhada do modelo DeepMind lista 48,6%. Este artigo usa o valor mais preciso da ficha do modelo na tabela de comparação.

Gráfico de custo versus desempenho do Google para Gemini 3.7 Flash no DeepSWE v1.1

Fonte: blog.google

O Google também enquadra o lançamento em torno do custo por tarefa de engenharia de software concluída, não apenas do preço por token. Essa é a métrica de produção correta para agentes: tentativas repetidas, tokens de raciocínio e chamadas de ferramentas repetidas podem importar mais do que a taxa de token de destaque.

Preços do Gemini 3.7 Flash

O Gemini 3.7 Flash tem um cronograma de preços por tempo limitado. As taxas introdutórias atuais vão até 31 de dezembro de 2026. A documentação de preços do Google dobra as taxas de tokens em 1º de janeiro de 2027.

Opção de consumo Entrada / 1M de tokens até 31 de dezembro de 2026 Saída / 1M de tokens até 31 de dezembro de 2026 Entrada / saída a partir de 1º de janeiro de 2027
Pago padrão $0.75 $3.75 $1.50 / $7.50
Em lote $0.375 $1.875 $0.75 / $3.75
Flex $0.375 $1.875 $0.75 / $3.75
Prioridade $1.35 $6.75 $2.70 / $13.50

A precificação de saída inclui tokens de pensamento. O cache de contexto padrão custa US$ 0,075 por milhão de tokens em cache durante o período introdutório, mais US$ 0,50 por milhão de tokens por hora para armazenamento em cache; essas taxas também dobram em 2027. A base de dados do Google Search e a base de dados do Google Maps podem adicionar cobranças separadas após a cota mensal compartilhada descrita na documentação de preços do Google.

A API padrão também tem um nível gratuito listado como gratuito. Isso não deve ser tratado como capacidade de produção garantida: os limites de taxa dependem do modelo, projeto, nível de uso e status da conta, e o Google afirma explicitamente que os limites publicados não são garantidos. Para cargas de trabalho de produção pagas, os custos do modelo são apenas uma parte do orçamento; a base de dados, APIs externas, armazenamento e etapas de agente falhas ou repetidas podem alterar o total.

Exemplos de custos da API padrão

Uso de tokens mensal Custo estimado até 31 de dezembro de 2026 Custo estimado a partir de 1º de janeiro de 2027
10M de entrada + 2M de saída $15.00 $30.00
50M de entrada + 5M de saída $56.25 $112.50
100M de entrada + 20M de saída $150.00 $300.00

Estes exemplos incluem apenas tokens de entrada e saída do modelo. Eles não incluem base de dados, armazenamento em cache, serviços externos ou infraestrutura de aplicação.

Disponibilidade da API Gemini 3.7 Flash

O Gemini 3.7 Flash não é um anúncio apenas para pré-visualização. O Google Cloud lista gemini-3.7-flash como GA com data de lançamento em 13 de agosto de 2026, e a documentação da API Gemini identifica a mesma string como a versão estável do modelo.

Grupo de usuários Onde o Gemini 3.7 Flash está disponível Detalhe importante
Desenvolvedores de API API Gemini e Google AI Studio Use o ID de modelo estável gemini-3.7-flash
Desenvolvedores Android Android Studio O Google lista o Android Studio como uma superfície de lançamento para desenvolvedores
Desenvolvedores de agentes Google Antigravity Projetado para codificação com foco em agentes e fluxos de trabalho de várias etapas
Empresas Plataforma de Agentes Gemini Enterprise e aplicativo Gemini Enterprise Aplicam-se governança corporativa, faturamento e controles regionais
Indivíduos Gemini Spark no aplicativo Gemini O Google afirma que o Spark usa 3.7 Flash para assinantes do Google AI Pro e Ultra em mais de 160 países suportados

Para desenvolvedores que ainda não configuraram o acesso, o guia de chave da API Gemini da Zerlo cobre a configuração do Google AI Studio. Assim que o acesso estiver pronto, a mudança crítica de implantação é o identificador do modelo; a migração de produção ainda deve incluir testes de regressão para ferramentas, esquemas, latência e uso total de tokens.

Desenvolvedor trabalhando com código-fonte em um laptop

Fonte: pexels.com

Mudar para um novo ID de modelo é a parte fácil. A migração mais segura é testar tarefas de codificação e de agente representativas em staging, registrar o sucesso da tarefa, latência, uso de tokens, tentativas e chamadas de ferramentas, e só então transferir o tráfego de produção.

Limites de taxa são específicos do projeto

Não há um único número de Gemini 3.7 Flash RPM ou TPM que se aplique a todas as contas. O Google mede os limites usando requisições por minuto, tokens por minuto e requisições por dia, aplica-os por projeto em vez de por chave de API, e os ajusta por nível de uso e status da conta. O Google recomenda verificar os limites ativos para o projeto diretamente no AI Studio. O tráfego em lote tem limites separados; por exemplo, a fila de lote Nível 1 documentada permite 3.000.000 de tokens enfileirados para Gemini 3.7 Flash.

Janela de contexto, modalidades e ferramentas suportadas

O envelope da API principal é familiar para qualquer pessoa que já esteja usando o 3.6 Flash: um contexto de entrada de 1.048.576 tokens e uma saída de texto máxima de 65.536 tokens. O modelo pode ingerir texto, imagens, vídeo, áudio e documentos PDF, mas não gera imagens ou áudio por si só.

Capacidade Status no Gemini 3.7 Flash
Cache Suportado
Execução de código Suportado
Uso do computador Suportado em Preview
Pesquisa de arquivos Suportado
Chamada de função Suportado
Ancoragem de pesquisa do Google Suportado
Ancoragem do Google Maps Suportado
Saídas estruturadas Suportado
Contexto de URL Suportado
Níveis de pensamento Baixo, médio e alto
API ao vivo Não suportado
Geração de imagem Não suportado
Geração de áudio Não suportado

Uma armadilha de migração é a configuração de pensamento. O Gemini 3.7 Flash suporta baixo, médio e alto. O Google Cloud documenta médio como padrão em sua Plataforma de Agentes Empresariais, enquanto a configuração mínima explícita retorna um erro de validação. Aplicações que anteriormente usavam uma configuração mínima devem mapear esse comportamento para um nível suportado e reavaliar a latência e a qualidade da saída.

Trabalhadores de escritório revisando documentos ao lado de um laptop

Fonte: pexels.com

O Gemini 3.7 Flash melhora os resultados de PDF e trabalho de conhecimento publicados pelo Google, o que é relevante para fluxos de trabalho com muitos documentos. Uma pontuação de benchmark maior não remove o risco de alucinação, portanto, fatos importantes extraídos e decisões consequentes ainda precisam de verificação.

O que as mudanças significam na prática

Para agentes de codificação

O Gemini 3.7 Flash tem a história de atualização mais forte quando uma aplicação faz codificação de longo alcance em vez de trechos isolados. Os ganhos do DeepSWE, FrontierCode e Terminal-bench apontam na mesma direção: o modelo é mais capaz de continuar em tarefas de engenharia multi-etapas. O Google também diz que é mais disciplinado em se adaptar a obstáculos e esclarecer intenções, o que pode importar quando um agente tem permissão para editar arquivos ou chamar ferramentas repetidamente.

Para fluxos de trabalho de documentos e conhecimento

A janela de contexto de um milhão de tokens permanece inalterada, mas a qualidade do trabalho em material denso parece melhorar nas avaliações de lançamento. Isso torna o 3.7 Flash um candidato mais forte para relatórios anuais, pipelines de documentos legais, literatura científica, bases de conhecimento internas e fluxos de trabalho mistos de PDF. Uma janela de contexto enorme não é o mesmo que recuperação perfeita, embora; sistemas de recuperação, Pesquisa de Arquivos e segmentação de prompts ainda podem ser mais confiáveis e baratos do que enviar tudo em todas as requisições.

Para desenvolvimento web

O Google destaca uma precisão de código de primeira passada mais forte, layouts mais funcionais e menos prompts para chegar a aplicativos com recursos completos. A pontuação Elo de 1588 do Code Arena é o indicador publicado mais claro. As equipes ainda devem avaliar a aderência ao design, o comportamento do navegador, a acessibilidade e as convenções específicas do framework em sua própria base de código, pois um benchmark web agregado não pode representar todas as pilhas de front-end.

Para tarefas simples de alto volume

Não assuma que o 3.7 Flash deva substituir todos os modelos mais baratos. Se a carga de trabalho for classificação, extração ou transformação de modelos em volume muito alto, um modelo Flash-Lite ainda pode vencer em custo e throughput. O propósito do 3.7 Flash é impulsionar um raciocínio mais forte e um desempenho de agente para o nível Flash, não se tornar a opção de menor custo para todas as requisições.

Você deve migrar do Gemini 3.6 Flash?

Carga de trabalho Direção recomendada Por quê
Agente de codificação em nível de repositório Teste intensamente o 3.7 Flash Grandes ganhos publicados no DeepSWE e FrontierCode
Automação de processos de negócios Teste o 3.7 Flash O AutomationBench melhora de 17,0% para 30,4%
Análise de PDF e documentos Teste o 3.7 Flash Melhores resultados de GDP.pdf e de contexto longo
Pipeline existente estável do 3.6 Flash Benchmarking antes de mudar As taxas de token introdutórias atuais são as mesmas, portanto, a qualidade, a latência e o custo da tarefa devem decidir
Extração simples de alto volume Compare com Flash-Lite Um modelo mais leve ainda pode ter um melhor perfil de throughput/custo
Aplicação de voz em tempo real Use um modelo compatível com API ao vivo O Gemini 3.7 Flash não suporta API ao vivo
Geração de imagem ou áudio Use outro modelo O 3.7 Flash produz saída de texto, não imagens ou áudio gerados

Lista de verificação de migração para Gemini 3.7 Flash

  1. Altere o modelo de destino para gemini-3.7-flash em um ambiente de staging primeiro.
  2. Revise a configuração de pensamento. Não envie minimal; escolha baixo, médio ou alto.
  3. Reexecute os testes de chamada de função, validação de saída estruturada e verificações de permissão de ferramenta.
  4. Teste fluxos de trabalho de longo contexto e PDF com os mesmos documentos representativos usados em produção.
  5. Meça a conclusão bem-sucedida da tarefa, latência, tokens de entrada, tokens de saída e de pensamento, novas tentativas, turnos e chamadas de ferramenta.
  6. Inclua cobranças de ancoragem e cache ao comparar o custo total por tarefa.
  7. Implante gradualmente e mantenha um caminho de reversão testado para o modelo de produção existente.

Limitações a serem observadas

A ficha do modelo do Google DeepMind lista as limitações padrão dos modelos de fundação, incluindo alucinações, e observa que lentidão ocasional ou problemas de tempo limite podem ocorrer. Ela dá ao Gemini 3.7 Flash um corte de conhecimento em março de 2026, ao mesmo tempo em que adverte que alguns domínios podem efetivamente ser limitados a janeiro de 2025. Portanto, informações atuais ainda requerem ancoragem ou recuperação de fontes atualizadas quando a novidade é importante.

O uso do computador é marcado como Preview, portanto, as aplicações devem restringir permissões, validar ações e manter a confirmação humana para etapas consequentes. O modelo também carece de API ao vivo, geração de imagem e geração de áudio. Finalmente, o preço de lançamento atraente é explicitamente temporário; aplicações com uso significativo em 2027 devem orçar contra as taxas pós-promoção em vez de assumir que os preços de agosto de 2026 persistirão.Comparação técnica Gemini vs. Claude fornece contexto adicional. Como as gerações e os preços dos modelos mudam rapidamente, use a documentação atual do fornecedor para decisões de aquisição e compare os modelos exatos que você planeja implantar.

FAQ

Quando o Gemini 3.7 Flash foi lançado?

O Google anunciou e lançou o Gemini 3.7 Flash em 13 de agosto de 2026. O Google Cloud lista o modelo estável como geralmente disponível em vez de apenas preview.

Qual é o nome do modelo da API Gemini 3.7 Flash?

O identificador do modelo estável é gemini-3.7-flash. O Google lista este ID exato tanto na documentação do modelo da API Gemini quanto em sua documentação de modelos empresariais.

Quanto custa o Gemini 3.7 Flash?

Até 31 de dezembro de 2026, o uso padrão pago da API é de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, incluindo tokens de pensamento. A partir de 1º de janeiro de 2027, essas taxas aumentam para US$ 1,50 e US$ 7,50. Batch, Flex e Priority têm taxas separadas.

O Gemini 3.7 Flash é mais barato que o Gemini 3.6 Flash?

Não nas atuais taxas de token introdutórias. A ficha do modelo de agosto de 2026 do Google lista tanto o Gemini 3.6 Flash quanto o Gemini 3.7 Flash a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026. A redação de lançamento do Google "metade do custo" compara o 3.7 com o preço de lançamento original do 3.6 Flash.

O Gemini 3.7 Flash está disponível na API?

Sim. Ele está disponível através da API Gemini e do Google AI Studio com o ID de modelo estável gemini-3.7-flash. O Google também o distribui através de produtos Antigravity e Gemini empresariais.

Qual é a janela de contexto do Gemini 3.7 Flash?

O limite de tokens de entrada é de 1.048.576 tokens e a saída máxima é de 65.536 tokens. As entradas podem incluir texto, imagens, vídeo, áudio e documentos PDF; a saída é texto.

O Gemini 3.7 Flash suporta a Live API?

Não. A documentação do modelo do Google marca a Live API como não suportada. Aplicações que requerem interação de voz em tempo real nativa devem escolher um modelo compatível com a Live API.

O Gemini 3.7 Flash é melhor que o Gemini 3.6 Flash?

As avaliações publicadas pelo Google mostram melhorias substanciais em vários benchmarks de codificação, automação, PDF, contexto longo e uso de computador, mas nem todos os benchmarks melhoram. A resposta prática depende da carga de trabalho, meta de latência, comportamento da ferramenta e custo por tarefa bem-sucedida, portanto, as equipes de produção devem realizar suas próprias avaliações representativas.

Conclusão

O Gemini 3.7 Flash é uma atualização significativa para a parte da família Flash que mais importa para os desenvolvedores: codificação multi-etapa, agentes, automação e fluxos de trabalho com muitos documentos. As melhorias mais fortes publicadas pelo Google não são pequenos avanços em placares; DeepSWE sobe de 48,6% para 65,3%, AutomationBench de 17,0% para 30,4% e GDP.pdf de 22,0% para 34,0%, enquanto o modelo mantém a mesma janela de contexto de um milhão de tokens e o amplo suporte de ferramentas Gemini.

A história dos preços é igualmente importante. O uso padrão da API é temporariamente de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, mas essas taxas dobram em 1º de janeiro de 2027. Para equipes que já utilizam o Gemini 3.6 Flash, a melhor razão para migrar é, portanto, um melhor desempenho de tarefa pelo mesmo preço introdutório atual por token, não um corte permanente de preço. Teste o 3.7 Flash em cargas de trabalho reais, inclua custos de ferramenta e retentativas e tome a decisão de migração com base no custo e confiabilidade da tarefa bem-sucedida, em vez do nome do modelo sozinho.

Compartilhe nossa publicação!
Fontes