Taalas está substituindo GPUs programáveis por chips de IA hardwired para atingir 17.000 tokens por…

No mundo de alto risco da infraestrutura de IA, a indústria tem operado sob uma única suposição: a flexibilidade é primordial. Construímos GPUs de uso geral porque os modelos de IA mudam a cada semana, e precisamos de silício programável que possa se adaptar ao próximo avanço de pesquisa. Mas a Taalas, a startup com sede em Toronto, pensa que a flexibilidade é exatamente o que está atrasando a IA. De acordo com a equipe da Taalas, se queremos que a IA seja tão comum e barata quanto o plástico, devemos parar de 'simular' inteligência em computadores de propósito geral e começar a 'lançá-la' diretamente no silício. O Problema: A 'Parede da Memória' e o Imposto da GPU O custo atual de execução de um Large Language Model (LLM) é impulsionado por um gargalo físico: a Parede da Memória. Processadores tradicionais (GPUs) são baseados em 'Arquitetura de Conjunto de Instruções' (ISA). Eles separam computação e memória. Quando você executa um passe de inferência em um modelo como o Llama-3, o chip gasta a maior parte do seu tempo e energia transportando pesos da High Bandwidth Memory (HBM) para os núcleos de processamento. Este 'imposto sobre movimentação de dados' responde por quase 90% do consumo de energia em data centers de IA modernos. A solução da Taalas é radical: eliminar o ciclo de busca de memória. Usando um fluxo de design automatizado proprietário, a Taalas traduz o grafo computacional de um modelo específico diretamente para o layout físico de um chip. Em seu chip HC1 (Hardcore 1), os pesos e a arquitetura do modelo são literalmente gravados na fiação do silício. https://taalas.com/the-path-to-ubiquitous-ai/ Modelos Hardcore: 17.000 Tokens Por Segundo Os resultados desta abordagem 'direto para o silício' redefinem o teto de desempenho para inferência. Em sua última apresentação, a Taalas demonstrou o HC1 executando um modelo Llama 3.1 8B. Enquanto uma NVIDIA H100 de ponta pode atender um único usuário a ~150 tokens por segundo, o HC1 atende impressionantes 16.000 a 17.000 tokens por segundo. Isso muda a 'economia unitária' da IA: Desempenho: Um único chip HC1 pode superar um pequeno data center de GPU em termos de throughput bruto para um modelo específico. Eficiência: A Taalas afirma uma melhoria de 1000x na eficiência (desempenho por watt e desempenho por dólar) em comparação com chips convencionais. Infraestrutura: Como os pesos são fixos, não há necessidade de HBM externa ou sistemas complexos de resfriamento líquido. Um rack padrão resfriado a ar pode abrigar dez dessas placas de 250W, entregando o poder de um cluster de GPU inteiro em um

Fonte: MarkTechPost

Publicado em 2026-02-23

Notícias relacionadas

Continue explorando