Aprenda técnicas essenciais para preparar dados para o treinamento do BERT, incluindo tokenização, mascaramento de texto e pré-processamento para tarefas de modelagem de linguagem mascarada (MLM) e previsão de próxima frase (NSP). Este laboratório prático abrange seleção aleatória de amostras, construção de vocabulário e métodos práticos para criar dados de MLM. Você também estruturará entradas para NSP. Ao final, você entenderá como pré-processar dados de forma eficiente, garantindo que estejam prontos para o treinamento do modelo BERT e tarefas de processamento de linguagem natural (NLP) subsequentes.
Plataforma: Cognitive Class
Nível: intermediate
Duração: 0.5h
Curso gratuito