A Aleph Alpha lançou o Kolibri, um modelo de linguagem Mixture-of-Experts (MoE) de peso aberto, construído para alemão e inglês. O Kolibri possui um total de 78.1B de parâmetros, mas ativa apenas 3.46B, ou 4.4%, por token. Ele aceita até 1.048.576 tokens de contexto, permite que os usuários definam o esforço de raciocínio por requisição e é distribuído sob a licença Apache 2.0 no Hugging Face. O objetivo é a implantação soberana em setores regulados, como administração pública, indústria e aeroespacial. É implantável? Sim. O checkpoint FP8 tem cerca de 78GB e é executado em uma única B200, B300 ou H200, ou em 2 GPUs H100 SXM5, servido via vLLM com parsers dedicados de raciocínio e chamada de ferramenta (tool-call) do Kolibri. O que é o Kolibri? Kolibri (Kolibri-1) é um transformador MoE bilíngue inglês-alemão desenvolvido de ponta a ponta por equipes na Alemanha. De acordo com o relatório de pesquisa técnica, a equipe da Aleph Alpha controlou todo o pipeline: dados, arquitetura, infraestrutura de treinamento, pós-treinamento e avaliação. O treinamento foi realizado em infraestrutura na Alemanha e na Finlândia. O design visa o Código de Prática de IA de Uso Geral da UE, o Ato de IA da UE e o GDPR. A Aleph Alpha é signatária desse Código, e seu pipeline de dados edita dados pessoais antes do treinamento. Arquitetura: Experts Esparsos e Atenção Híbrida O Kolibri empilha 50 blocos de transformadores com uma largura de modelo de 2.560. Cada camada MoE pontua todos os 384 experts roteados com um roteador sigmoide, envia cada token para os 6 principais e sempre executa 1 expert compartilhado. O balanceamento de carga do expert é feito com o Exact Quantile Balancing e o Load-Error Injection. A atenção usa atenção de consulta agrupada com 48 cabeças de consulta e 4 cabeças KV. A cada quinto bloco usa atenção completa sem codificação posicional. Os outros 40 blocos usam atenção de janela deslizante sobre os 512 tokens precedentes, com RoPE. As camadas de janela deslizante mantêm um cache KV de tamanho fixo, então apenas 10 camadas crescem com o comprimento do contexto. Em computação equivalente, a equipe da Aleph Alpha relata que o híbrido suporta sequências 4 vezes mais longas do que um modelo de atenção completa. Um Tokenizador Construído para o Alemão Th
Fonte: MarkTechPost
Publicado em 2026-10-04