E se um modelo de linguagem nunca tivesse ouvido falar da internet, smartphones ou mesmo da Segunda Guerra Mundial? Isso não é hipotético — é exatamente o que uma equipe de pesquisadores liderada por Nick Levine, David Duvenaud e Alec Radford construiu. Eles o chamam de talkie, e pode ser o modelo de linguagem grande mais historicamente disciplinado já lançado ao público. Talkie é um modelo de linguagem de código aberto de 13 bilhões de parâmetros treinado exclusivamente em texto inglês pré-1931. O projeto é desenvolvido por uma equipe sem fins lucrativos e introduz o que os pesquisadores chamam de "modelo de linguagem vintage" — um LM com um corte rígido de conhecimento não vinculado a quando foi treinado, mas a um momento específico da história. O Que Exatamente É um Modelo de Linguagem Vintage? Para entender o talkie, você primeiro precisa entender o conceito por trás dele. A maioria dos LLMs modernos como GPT-4, LLaMA, Mistral, etc., são treinados em grandes rastreamentos da web contemporânea. Seu conhecimento reflete o mundo como ele existe hoje, ou a partir da data de corte de seu treinamento. Um modelo de linguagem vintage inverte isso: ele é deliberadamente treinado apenas em dados históricos para que sua "visão de mundo" seja congelada em um ponto específico no passado. Para o talkie, esse corte é 31 de dezembro de 1930 — escolhido precisamente porque essa é a data em que as obras entram em domínio público nos Estados Unidos, tornando o texto pré-1931 legalmente utilizável para treinamento. O modelo — formalmente nomeado talkie-1930-13b-base — foi treinado em 260 bilhões de tokens de texto inglês histórico pré-1931, incluindo livros, jornais, periódicos, periódicos científicos, patentes e jurisprudência. Um checkpoint conversacional pós-treinado separadamente, o talkie-1930-13b-it, também está disponível para uso interativo. A equipe montou uma demonstração ao vivo 24 horas por dia, 7 dias por semana, em talkie-lm.com/chat, onde o Claude Sonnet 4.6 continuamente solicita o modelo ajustado por instruções, permitindo que os visitantes observem a voz e o conhecimento do talkie em tempo real. Por Que um Modelo de 1930? Este não é um projeto de nostalgia. A equipe de pesquisa identificou várias aplicações concretas e tecnicamente significativas que tornam o talkie interessante para a comunidade de pesquisa em IA. 1. Experimentos de generalização sem contaminação: A contaminação de benchmark, onde os dados de teste vazam inadvertidamente para os dados de treinamento — é um dos problemas mais persistentes e subestimados na avaliação moderna de LLMs. Como o talkie foi treinado apenas em texto pré-1931, ele é livre de contaminação por construção em relação a qualquer benchmark moderno. Isso abre um experimento limpo
Fonte: MarkTechPost
Publicado em 2026-04-28