News22 JulhoGoogle lança Gemini 3.5 Flash-Lite, seu modelo mais leve
Edição #161·22 de julho de 2026·2 min

Google lança Gemini 3.5 Flash-Lite, seu modelo mais leve

O Google apresentou o Gemini 3.5 Flash-Lite, descrito como o menor e mais rápido modelo da família Gemini. Segundo Logan Kilpatrick, da equipe do Gemini, ele é mais inteligente que o Gemini 3 em vários cenários e custa o mesmo que o Gemini 2.5 Flash, que está chegando ao fim de vida. --- A ideia é clara: oferecer um modelo que custa pouco, responde rápido e ainda assim entrega qualidade competitiva. Para empresas que rodam milhões de chamadas por dia em chatbots, resumos ou classificação de texto, cada centavo a menos por requisição faz diferença enorme no final do mês. --- É o tipo de lançamento que não faz manchete de jornal mas pode mudar a conta de muita startup que depende de IA no dia a dia.

Google lança Gemini 3.5 Flash-Lite, seu modelo mais leve

O Google lançou o Gemini 3.5 Flash-Lite, novo modelo de linguagem posicionado como o menor e mais rápido da família Gemini. Segundo Logan Kilpatrick, integrante da equipe do Gemini, o modelo supera o Gemini 3 em inteligência em diversos cenários práticos e mantém o mesmo preço do Gemini 2.5 Flash, que está sendo descontinuado. A novidade chega em um momento em que a competição entre gigantes de IA se concentra em otimizar LLMs menores para uso empresarial em massa, e não apenas em recordes de benchmark. Com isso, a Google reforça sua aposta em uma camada de inferência de baixo custo, voltada para aplicações que processam grandes volumes de tokens e não toleram latência elevada.

Mais performance no mesmo custo

O Flash-Lite foi projetado para tarefas que exigem baixa latência e alto throughput sem inflar o orçamento de infraestrutura em nuvem. Ele se encaixa especialmente bem em fluxos de trabalho como: - Classificação de texto e análise de sentimento - Resumo automático e extração de entidades - Tradução em tempo real - Chatbots com milhões de interações diárias

Ao manter o mesmo valor por milhão de tokens do 2.5 Flash, o Google elimina o atrito financeiro da migração: quem já opera com o modelo anterior não enfrenta aumento de custo para ganhar capacidade adicional. Na prática, desenvolvedores podem atualizar a versão na API com impacto zero no custo operacional e ainda obter ganhos de precisão em relação ao Gemini 3, que deixa de ser a referência para tarefas leves.

Implicações para builders e startups brasileiras

No ecossistema brasileiro de tecnologia, onde margens de SaaS e plataformas de IA generativa são apertadas, o preço por requisição define a viabilidade de produtos escaláveis. Startups que processam grandes volumes de dados em português — seja para atendimento automático, análise de documentos jurídicos, triagem de currículos ou geração de conteúdo estruturado — dependem de modelos eficientes para manter preços competitivos no mercado local. O Gemini 3.5 Flash-Lite entra nesse cenário como uma alternativa consistente para quem precisa de respostas rápidas sem assumir os custos de modelos maiores, como os da série Pro. Para founders e CTOs, a previsibilidade de gastos com inferência facilita o planejamento financeiro, especialmente quando o faturamento é em reais e os custos de API são indexados em dólar.

O que muda na prática para devs

O fim do Gemini 2.5 Flash força equipes de engenharia a revisar suas integrações e avaliar se a arquitetura atual suporta a troca de versão sem quebra de compatibilidade. O ciclo de vida mais curto dos modelos da Google exige pipelines de teste ágeis, com validação de prompts e avaliação de regressão antes de promover o novo endpoint para produção. Para times que trabalham com orquestração de múltiplos LLMs, o Flash-Lite pode assumir tarefas de roteamento inicial, filtragem de intenções ou pré-processamento, liberando modelos maiores apenas para etapas que demandam raciocínio complexo. Implementar logs de custo e latência por modelo torna-se essencial para medir o retorno real dessa migração.

geminicustogoogleflashlitemodelomodelosmesmoflashnãolatência

Mais da mesma edição

@NVIDIAAI

🥇IA da NVIDIA tira nota de ouro na Olimpíada de Matemática

A NVIDIA colocou seu modelo Nemotron 3 Ultra para resolver as mesmas provas da Olimpíada Internacional de Matemática (IMO) de 2026, nas mesmas condições dos estudantes: mesmo tempo limite, sem internet e sem ferramentas externas. O resultado? 30 de 42 pontos, acima dos 29 pontos necessários para a medalha de ouro. --- Para quem não acompanha, a IMO é considerada a competição de matemática mais difícil do mundo para jovens. Ter uma IA cruzando a linha do ouro é um marco simbólico importante, ainda que a comparação direta com humanos tenha suas ressalvas. As soluções foram corrigidas pela própria equipe oficial da olimpíada. --- É o tipo de resultado que mostra o avanço real em raciocínio matemático, uma das áreas onde modelos de IA mais apanhavam até pouco tempo atrás.

@GergelyOrosz

📈Codex e ChatGPT Work batem 10 milhões de usuários pagos por dia

Thomas Sottiaux, da OpenAI, anunciou que o Codex e o ChatGPT Work atingiram 10 milhões de usuários ativos diários pagos. Número redondo e impressionante, que levantou uma pergunta legítima: de onde vem tanta gente? --- O jornalista de tecnologia Gergely Orosz fez as contas e notou que existem cerca de 26 a 30 milhões de engenheiros de software no mundo inteiro. Se 10 milhões usam o Codex todo dia, isso significaria algo entre 30% e 35% de todos os devs do planeta. A conclusão mais provável, segundo ele, é que o público do Codex já vai muito além de programadores: gente de finanças, marketing, operações e qualquer área que precise automatizar tarefas está entrando nessa onda.

@ivanhzhao

🗄️Notion prepara novidade para bancos de dados gigantes

Ivan Zhao, cofundador e CEO do Notion, publicou uma provocação: perguntou quem tem bancos de dados no Notion com mais de 100 mil linhas ou fluxos de trabalho complexos, e pediu que entrassem em contato para acesso antecipado a algo novo. A única pista foi que o recurso pode "desbloquear novas possibilidades". --- Quem usa o Notion para gerenciar grandes volumes de dados sabe que a ferramenta começa a engasgar quando as bases ficam muito grandes. Se o Notion está resolvendo isso, é um passo importante para competir de verdade com planilhas e bancos de dados mais robustos. Por enquanto, só temos a provocação, mas vale ficar de olho.

Receba no seu email

Todo dia, grátis pra sempre.

Assinar newsletter