Google AI Lança Android Bench: Um Framework de Avaliação e Leaderboard para LLMs no Desenvolvimento…

O Google lançou oficialmente o Android Bench , um novo leaderboard e framework de avaliação projetado para mensurar como os Large Language Models (LLMs) se desempenham especificamente em tarefas de desenvolvimento Android. O conjunto de dados, a metodologia e o *test harness* foram tornados open-source e estão publicamente disponíveis no GitHub . Metodologia de Benchmark e Design de Tarefas Benchmarks de codificação gerais frequentemente falham em capturar as dependências específicas da plataforma e as nuances do desenvolvimento mobile. O Android Bench aborda isso curando um conjunto de tarefas extraídas diretamente de repositórios Android reais e públicos do GitHub. Os cenários avaliados cobrem vários níveis de dificuldade, incluindo: Resolução de *breaking changes* entre lançamentos Android. Tarefas específicas de domínio, como rede em dispositivos Wear OS. Migração de código para a versão mais recente do Jetpack Compose (o toolkit moderno do Android para construir interfaces de usuário nativas). Para garantir uma avaliação agnóstica ao modelo, o framework solicita a um LLM que corrija um problema relatado e então verifica a correção usando práticas padrão de teste de desenvolvedor: Testes de unidade: Testes que verificam pequenos, blocos de código isolados (como uma única função ou classe) sem a necessidade do framework Android. Testes de instrumentação: Testes que executam em um dispositivo Android físico ou emulador para verificar como o código interage com o sistema Android e as APIs reais. Mitigando a Contaminação de Dados Um desafio significativo para desenvolvedores que avaliam benchmarks públicos é a contaminação de dados . Isso ocorre quando um LLM é exposto às tarefas de avaliação durante seu processo de treinamento, resultando na memorização das respostas pelo modelo, em vez de demonstrar raciocínio genuíno e capacidades de resolução de problemas. Para garantir a integridade dos resultados do Android Bench, a equipe do Google implementou várias medidas preventivas: Revisão manual das trajetórias do agente: Os desenvolvedores revisam o raciocínio passo a passo e os caminhos de ação que o modelo adota para chegar a uma solução, garantindo que ele esteja ativamente resolvendo o problema. Integração de *canary string*: Uma *string* de texto única e identificável é incorporada ao conjunto de dados do benchmark. Isso atua como um sinal para *web crawlers* e *data scrapers* usados por empresas de IA para excluir explicitamente esses dados de futuras execuções de treinamento de modelos. Resultados Iniciais do Leaderboard do Android Bench Para o lançamento inicial, o benchmark mede estritamente o desempenho do modelo base, omitindo intencionalmente fluxos de trabalho agenticos complexos ou uso de ferramentas. O Score representa a porcentagem média de 100 casos de teste resolvidos com sucesso em 10 execuções independentes.

Fonte: MarkTechPost

Publicado em 2026-03-06

Notícias relacionadas

Continue explorando