Ajuste Fino de Modelos de Linguagem de Grande Escala com DPO e Hugging Face

Explore o Direct Preference Optimization (DPO) com as bibliotecas Hugging Face e trl neste projeto guiado, projetado para ajustar modelos de linguagem. Os participantes aprenderão a alinhar Large Language Models com as preferências do usuário, implementando DPO e pré-processando conjuntos de dados de artigos de notícias categorizados. O projeto oferece experiência prática no treinamento de modelos e avaliação de desempenho, e elucida as distinções entre DPO e outras técnicas, como a otimização de política proximal.

Plataforma: Cognitive Class

Nível: intermediate

Duração: 1h

Curso gratuito

Cursos relacionados

Continue explorando