Antes que os large language models (LLMs) possam processar texto, eles o dividem em "chunks" (blocos), como palavras ou fragmentos de palavras. O LLM por trás do ChatGPT, por exemplo, divide "LMU München" nos três "chunks" "LM", "U" e "München", de modo que nunca vê diretamente as letras individuais em "München". Esta etapa, conhecida como tokenização de subpalavras, torna os LLMs eficientes, mas causa uma série de problemas, como a compreensão limitada em nível de caractere.
Fonte: TechXplore AI
Publicado em 2026-10-09