Reflection AI Apresenta Beam: Um Modelo MoE de Peso Aberto de 501B Com 23B de Parâmetros Ativos par…

A Reflection AI apresentou o Beam, seu primeiro modelo de peso aberto. O Beam é um modelo esparso Mixture-of-Experts (MoE) com 501B de parâmetros totais e 23B ativos por token, construído para codificação, raciocínio e cargas de trabalho agentes. De acordo com a equipe da Reflection AI, o Beam compete diretamente com modelos abertos maiores como o GLM 5.2, utilizando de 3 a 4 vezes menos computação de inferência em benchmarks de raciocínio. Ele pode ser implantado hoje? Não para auto-hospedagem ainda. O Beam está em fase final de "red-teaming". O acesso antecipado é feito por meio de uma lista de espera na plataforma Reflection. O que é o Reflection Beam? O Beam é um modelo de agente geral treinado do zero pela Reflection AI. Ele visa cargas de trabalho de codificação empresarial e agentes. A Reflection posiciona o Beam como um avanço na fronteira de pesos abertos ocidental. A equipe de pesquisa é franca sobre a lacuna. O Kimi K3 permanece à frente em capacidade bruta, então a proposta do Beam é a eficiência no tempo de inferência. Os usuários obtêm um parâmetro de esforço de raciocínio. Configurações mais baixas favorecem respostas curtas. Configurações mais altas permitem um raciocínio mais longo em tarefas difíceis. As equipes podem adequar o esforço à dificuldade da tarefa e ao orçamento de computação. Como o Beam foi Pré-treinado. O Beam foi pré-treinado em 23,8 trilhões de tokens da web, fontes públicas e conjuntos de dados proprietários licenciados. A equipe da Reflection afirma que sua curadoria removeu cerca de 95% dos tokens brutos da internet. Também manteve aproximadamente 1,8 trilhão de tokens de alta qualidade que filtros convencionais teriam descartado. A arquitetura intercala atenção local e global com especialistas roteados de granularidade fina. O balanceamento de carga é baseado no balanceamento sem perda auxiliar do DeepSeek-V3, adicionando decaimento cosseno das atualizações de expert-bias. O especialista mais ativo atingiu apenas 1,04x a carga média no final do pré-treinamento. Em todas as 52 camadas, as normas residuais permaneceram limitadas usando escalonamento baseado em profundidade, SandwichNorm, gating de atenção e acumulação residual FP32. O pré-treinamento terminou em menos de 4 semanas em 6.144 GPUs NVIDIA GB300 NVL72. O goodput atingiu 92,3% perto do final, com 9 rebobinamentos semiautomáticos. O treinamento intermediário estendeu o contexto efetivo para 1M tok

Fonte: MarkTechPost

Publicado em 2026-10-05

Notícias relacionadas

Continue explorando