Prime Intellect Lança Prime Inference: Servidor e Atendimento Reservado para Modelos Abertos de Fro…

A Prime Intellect lançou o Prime Inference, uma plataforma de serviço para modelos abertos de fronteira. Ela oferece endpoints sem servidor e capacidade reservada nas próprias GPUs da Prime em múltiplos datacenters. Antes do lançamento público, processava quase um trilhão de tokens por dia internamente. Esse tráfego vinha de rollouts de RL, geração de dados sintéticos, avaliações e agentes de codificação de longa duração. O que é o Prime Inference? O Prime Inference é a camada de serviço da pilha de treinamento aberta da Prime Intellect. A empresa já oferece ferramentas pós-treinamento, como prime-rl, verificadores e sandboxes. O serviço fecha esse ciclo: os modelos implantados geram rastros de produção que podem retroalimentar o treinamento. A Prime relata que seu endpoint GLM-5.3 está entre os mais rápidos no OpenRouter. Também cita uma taxa de erro de chamada de ferramenta próxima de zero e 100% de tempo de atividade desde o lançamento. Dois modos: endpoints sem servidor para demanda variável, capacidade reservada para cargas de trabalho contínuas. Compatível com OpenAI: aponte qualquer SDK OpenAI para https://api.pinference.ai/api/v1 (docs). Tempo de atividade: o failover automático entre datacenters roteia o tráfego para implantações saudáveis. Hardware: NVIDIA Blackwell hoje, com Vera Rubin listada como “em breve”. Faturamento: faturamento unificado com rastreamento de uso no nível da equipe. O preço por modelo ainda não está totalmente publicado na documentação. Como a pilha de serviço funciona A pilha combina NVIDIA Dynamo, vLLM, Mooncake e FlashInfer. Foi construída com a Inferact e a NVIDIA, e as correções são contribuídas upstream. A carga de trabalho alvo é agêntica. Uma virada típica de agente adiciona cerca de 6K tokens a um prompt de 140K tokens. A Prime avalia essa combinação com SemiAnalysis AgentX, e chegadas frias injetadas. Desagregação de pré-preenchimento/decodificação: O pré-preenchimento e a decodificação são executados em grupos de GPU separados. O Dynamo lida com o roteamento, e o vLLM executa o modelo em cada grupo. Os decodificadores puxam o KV calculado através do NIXL. A Prime relata uma latência inter-token p90 quase 40% menor em seus testes. Roteamento consciente do cache: O roteador consciente do KV do Dynamo pesa a sobreposição de prefixos em cache contra a fila

Fonte: MarkTechPost

Publicado em 2026-10-03

Notícias relacionadas

Continue explorando