A customização de Large Language Models (LLMs) atualmente apresenta um trade-off de engenharia significativo entre a flexibilidade do In-Context Learning (ICL) e a eficiência do Context Distillation (CD) ou do Supervised Fine-Tuning (SFT). A Sakana AI, baseada em Tóquio, propôs uma nova abordagem para contornar essas restrições através da amortização de custos. Em dois de seus artigos recentes, eles introduziram o Text-to-LoRA (T2L) e o Doc-to-LoRA (D2L), hypernetworks leves que aprendem por meta-aprendizado a gerar matrizes de Low-Rank Adaptation (LoRA) em uma única passagem para frente. O Gargalo da Engenharia: Latência vs. Memória Para Desenvolvedores de IA, a principal limitação da adaptação padrão de LLMs é a sobrecarga computacional: In-Context Learning (ICL): Embora conveniente, o ICL sofre com custos quadráticos de atenção e crescimento linear do KV-cache, o que aumenta a latência e o consumo de memória à medida que os prompts se alongam. Context Distillation (CD): O CD transfere informações para os parâmetros do modelo, mas a destilação por prompt é frequentemente impraticável devido aos altos custos de treinamento e latência de atualização. SFT: Requer conjuntos de dados específicos da tarefa e um retreinamento caro se as informações mudarem. Os métodos da Sakana AI amortizam esses custos pagando uma taxa única de meta-treinamento. Uma vez treinada, a hypernetwork pode adaptar instantaneamente o LLM base a novas tarefas ou documentos sem backpropagation adicional. https://pub.sakana.ai/doc-to-lora/ Text-to-LoRA (T2L): Adaptação via Linguagem Natural Text-to-LoRA (T2L) é uma hypernetwork projetada para adaptar LLMs em tempo real usando apenas uma descrição de tarefa em linguagem natural. Arquitetura e Treinamento O T2L usa um codificador de tarefas para extrair representações vetoriais de descrições de texto. Essa representação, combinada com embeddings de módulo e camada aprendíveis, é processada através de uma série de blocos MLP para gerar as matrizes de baixo rank A e B para o LLM alvo. O sistema pode ser treinado via dois esquemas principais: Reconstrução LoRA: Destilar adaptadores LoRA existentes e pré-treinados na hypernetwork. Supervised Fine-Tuning (SFT): Otimizar a hypernetwork de ponta a ponta em conjuntos de dados multi-tarefa. A pesquisa indica que o T2L treinado com SFT generaliza melhor para tarefas não vistas porque aprende implicitamente a agrupar funcionalidades relacionadas no espaço de pesos. Em benchmarks, o T2L igualou ou superou adaptadores específicos de tarefas em tarefas como GSM8K e Arc-Challenge, enquanto reduziu os custos de adaptação em mais de 4x em comparação com o ICL de 3-shot. Doc-to-LoRA (D2L): Internalizando o Contexto Doc-to-LoRA (D2L) estende este conceito à internalização de documentos.
Fonte: MarkTechPost
Publicado em 2026-02-27