Andrej Karpathy Lança ‘Autoresearch’ em Código Aberto: Uma Ferramenta Python de 630 Lin…

Andrej Karpathy lançou o autoresearch, uma ferramenta Python minimalista projetada para permitir que agentes de IA conduzam experimentos de machine learning autonomamente. O projeto é uma versão simplificada do núcleo de treinamento de LLM do nanochat, condensado em um repositório de arquivo único de aproximadamente ~630 linhas de código. Ele é otimizado para execução em uma única GPU NVIDIA. O Loop de Iteração Autônoma O framework estabelece uma divisão específica de trabalho entre o pesquisador humano e o agente de IA. O sistema opera em um loop de feedback contínuo onde o progresso é rastreado via commits git em um branch de feature. Responsabilidade do Componente Formato do Arquivo Humano Itera nas instruções e restrições de pesquisa de alto nível. .md (Markdown) Agente de IA Propõe e implementa modificações no script de treinamento. .py (Python) Execução Conduz uma execução de treinamento de duração fixa para avaliar as mudanças. Shell/Python O agente lê as instruções fornecidas pelo humano, modifica o código de treinamento — ajustando a arquitetura da rede neural, otimizadores ou hiperparâmetros — e executa uma rodada de treinamento que dura exatamente cinco minutos. Métricas de Avaliação e Validação Para garantir que o agente retenha apenas as mudanças benéficas, o sistema usa bits-por-byte (BPB) como a métrica de validação primária. BPB mede a eficiência de compressão do modelo em um conjunto de dados de validação; uma pontuação mais baixa indica um modelo mais preciso. Protocolo de Validação: O agente só faz commit de mudanças de código para o branch git se a pontuação final de BPB for menor que o melhor anterior. Desempenho Observado: Em execuções iniciais, Karpathy demonstrou que o agente foi bem-sucedido em reduzir a perda de validação de 1.0 para 0.97 BPB através de iteração autônoma de código. Granularidade: Cada execução de treinamento de 5 minutos concluída é representada como um ponto de dados, permitindo que os pesquisadores comparem a eficácia de diferentes prompts ou configurações do agente ao longo do tempo. Estudo de Caso: Implementação por Tobi Lutke da Shopify Após o lançamento, o CEO da Shopify, Tobi Lutke, adaptou o framework autoresearch para um projeto interno. Ao permitir que o agente iterasse em uma arquitetura de modelo menor, Lutke relatou uma melhoria de 19% nas pontuações de validação. Notavelmente, o modelo menor otimizado pelo agente acabou superando um modelo maior que havia sido configurado através de métodos manuais padrão. OK esta coisa é totalmente insana. Antes de ir para a cama eu… * tentei criar um novo diretório qmdresearcher * pedi ao meu pi para ler este repositório github e fazer uma versão disso para o modelo de expansão de consulta qmd com o

Fonte: MarkTechPost

Publicado em 2026-03-09

Notícias relacionadas

Continue explorando