Explore o Direct Preference Optimization (DPO) com as bibliotecas Hugging Face e trl neste projeto guiado, projetado para ajustar modelos de linguagem. Os participantes aprenderão a alinhar Large Language Models com as preferências do usuário, implementando DPO e pré-processando conjuntos de dados de artigos de notícias categorizados. O projeto oferece experiência prática no treinamento de modelos e avaliação de desempenho, e elucida as distinções entre DPO e outras técnicas, como a otimização de política proximal.
Plataforma: Cognitive Class
Nível: intermediate
Duração: 1h
Curso gratuito