Na arena competitiva do Multi-Agent Reinforcement Learning (MARL), o progresso tem sido há muito tempo limitado pela intuição humana. Por anos, pesquisadores refinaram manualmente algoritmos como Counterfactual Regret Minimization (CFR) e Policy Space Response Oracles (PSRO), navegando um vasto espaço combinatório de regras de atualização por tentativa e erro. A equipe de pesquisa do Google DeepMind agora mudou esse paradigma com o AlphaEvolve, um agente de codificação evolucionário alimentado por Large Language Models (LLMs) que descobre automaticamente novos algoritmos de aprendizado multiagente. Ao tratar o código-fonte como um genoma, o AlphaEvolve não apenas ajusta parâmetros — ele inventa lógicas simbólicas inteiramente novas. Evolução Semântica: Além do Ajuste de Hiperparâmetros Ao contrário do AutoML tradicional, que frequentemente otimiza constantes numéricas, o AlphaEvolve realiza evolução semântica. Ele utiliza o Gemini 2.5 pro como um operador genético inteligente para reescrever a lógica, introduzir novos fluxos de controle e injetar operações simbólicas no código-fonte do algoritmo. O framework segue um rigoroso ciclo evolutivo: Inicialização: A população começa com implementações de linha de base padrão, como o CFR padrão. Mutação Orientada por LLM: Um algoritmo pai é selecionado com base na aptidão, e o LLM é solicitado a modificar o código para reduzir a explorabilidade. Avaliação Automatizada: Os candidatos são executados em jogos proxy (por exemplo, Kuhn Poker) para calcular pontuações de explorabilidade negativas. Seleção: Candidatos válidos e de alto desempenho são adicionados de volta à população, permitindo que a busca descubra otimizações não intuitivas. VAD-CFR: Dominando a Volatilidade do Jogo A primeira grande descoberta é o Volatility-Adaptive Discounted (VAD-) CFR. Em Extensive-Form Games (EFGs) com informações imperfeitas, os agentes devem minimizar o arrependimento ao longo de uma sequência de históricos. Enquanto as variantes tradicionais usam desconto estático, o VAD-CFR introduz três mecanismos que frequentemente escapam aos designers humanos: Desconto Adaptativo à Volatilidade: Usando uma Média Móvel Ponderada Exponencial (EWMA) da magnitude do arrependimento instantâneo, o algoritmo rastreia a "instabilidade" do processo de aprendizado. Quando a volatilidade é alta, ele aumenta o desconto para esquecer históricos instáveis mais rapidamente; quando diminui, ele retém mais histórico para ajuste fino. Impulso Instantâneo Assimétrico: O VAD-CFR impulsiona arrependimentos instantâneos positivos por um fator de 1.1. Isso permite que o agente explore imediatamente desvios benéficos sem o atraso associado à acumulação padrão. Hard Wa
Fonte: MarkTechPost
Publicado em 2026-02-24