Google Lança Gemini 3.1 Flash-Lite: Uma Ferramenta Poderosa e Econômica com Níveis de Raciocínio Aj…

O Google lançou o Gemini 3.1 Flash-Lite, a entrada mais econômica da série de modelos Gemini 3. Projetado para 'inteligência em escala', este modelo é otimizado para tarefas de alto volume onde baixa latência e custo por token são as principais restrições de engenharia. Atualmente, está disponível em Public Preview via Gemini API (Google AI Studio) e Vertex AI. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-lite/? Recurso Principal: 'Níveis de Raciocínio' Variáveis Uma atualização arquitetônica significativa na série 3.1 é a introdução dos Níveis de Raciocínio. Este recurso permite que os desenvolvedores ajustem programaticamente a profundidade do raciocínio do modelo com base na complexidade específica de uma solicitação. Ao selecionar entre os níveis de raciocínio Mínimo, Baixo, Médio ou Alto, você pode otimizar o tradeoff entre latência e precisão lógica. Mínimo/Baixo: Ideal para tarefas de alto throughput e baixa latência, como classificação, análise de sentimento básica ou extração simples de dados. Médio/Alto: Utiliza a lógica Deep Think Mini para lidar com instruções complexas, raciocínio de várias etapas e geração de dados estruturados. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-lite/? Benchmarks de Performance e Eficiência O Gemini 3.1 Flash-Lite foi projetado para substituir o Gemini 2.5 Flash em workloads de produção que exigem inferência mais rápida sem sacrificar a qualidade da saída. O modelo alcança um Tempo para o Primeiro Token (TTFT) 2,5 vezes mais rápido e um aumento de 45% na velocidade de saída geral em comparação com seu predecessor. No benchmark GPQA Diamond – uma medida de raciocínio de nível especialista – o Gemini 3.1 Flash-Lite obteve 86,9%, igualando ou superando a qualidade de modelos maiores da geração anterior, enquanto opera com um custo computacional significativamente menor. Tabela Comparativa: Gemini 3.1 Flash-Lite x Gemini 2.5 Flash Métrica Gemini 2.5 Flash Gemini 3.1 Flash-Lite Custo de Entrada (por 1M tokens) Mais alto $0,25 Custo de Saída (por 1M tokens) Mais alto $1,50 Velocidade TTFT Linha de base 2,5x Mais rápido Throughput de Saída Linha de base 45% Mais rápido Raciocínio (GPQA Diamond) Competitivo 86,9% Casos de Uso Técnicos para Produção O modelo 3.1 Flash-Lite é especificamente ajustado para workloads que envolvem estruturas complexas e lógica de sequência longa: Geração de UI e Dashboards: O modelo é otimizado para gerar código hierárquico (HTML/CSS, componentes React) e JSON estruturado necessário para renderizar visualizações de dados complexas. Simulações de Sistema: Ele mantém a consistência lógica.

Fonte: MarkTechPost

Publicado em 2026-03-03

Notícias relacionadas

Continue explorando