Novo método pode aumentar a eficiência do treinamento de LLMs

Modelos de linguagem grandes (LLMs) de raciocínio são projetados para resolver problemas complexos, dividindo-os em uma série de etapas menores. Esses modelos poderosos são particularmente bons em tarefas desafiadoras, como programação avançada e planejamento multi-etapas.

Mas o desenvolvimento de modelos de raciocínio exige uma enorme quantidade de computação e energia devido a ineficiências no processo de treinamento. Enquanto alguns dos processadores de alta potência trabalham continuamente em consultas complicadas, outros no grupo ficam ociosos.

Pesquisadores do MIT e de outros lugares encontraram uma maneira de usar esse tempo de inatividade computacional para acelerar eficientemente o treinamento de modelos de raciocínio.

Seu novo método treina automaticamente um modelo menor e mais rápido para prever as saídas do LLM de raciocínio maior, que o modelo maior verifica. Isso reduz a quantidade de trabalho que o modelo de raciocínio precisa fazer, acelerando o processo de treinamento.

A chave para este sistema é sua capacidade de treinar e implantar o modelo menor de forma adaptativa, de modo que ele entre em ação apenas quando alguns processadores estão ociosos. Ao aproveitar recursos computacionais que de outra forma seriam desperdiçados, ele acelera o treinamento sem incorrer em custos adicionais.

Quando testado em múltiplos LLMs de raciocínio, o método dobrou a velocidade de treinamento, mantendo a precisão. Isso poderia reduzir o custo e aumentar a eficiência energética do desenvolvimento de LLMs avançados para aplicações como previsão de tendências financeiras ou detecção de riscos em redes elétricas.

“As pessoas querem modelos que possam lidar com tarefas mais complexas. Mas se esse é o objetivo do desenvolvimento de modelos, então precisamos priorizar a eficiência. Encontramos uma solução sem perdas para este problema e depois desenvolvemos um sistema full-stack que pode proporcionar acelerações bastante dramáticas na prática”, diz Qinghao Hu, um pós-doc do MIT e co-autor principal de um artigo sobre esta técnica .

Ele é acompanhado no artigo pelo co-autor principal Shang Yang, um estudante de pós-graduação em engenharia elétrica e ciência da computação (EECS); Junxian Guo, um estudante de pós-graduação em EECS; o autor sênior Song Han, um professor associado em EECS, membro do Laboratório de Pesquisa de Eletrônica e um cientista distinto da NVIDIA; bem como outros da NVIDIA, ETH Zurich, do MIT-IBM Watson AI Lab e da Universidade de Massachusetts em Amherst. A pesquisa será apresentada na ACM

Fonte: MIT News AI

Publicado em 2026-02-26

Notícias relacionadas

Continue explorando