Uma visão diagnóstica na área da saúde. O diálogo de um personagem em um jogo interativo. Uma resolução autônoma de um atendente de serviço ao cliente. Cada uma dessas interações baseadas em IA é construída sobre a mesma unidade de inteligência: um token. Ampliar essas interações de IA exige que as empresas considerem se podem arcar com mais tokens. A resposta está em uma melhor tokenomics — que em sua essência se trata de reduzir o custo de cada token. Essa tendência de queda está se manifestando em diversos setores. Pesquisas recentes do MIT descobriram que as eficiências de infraestrutura e algorítmicas estão reduzindo os custos de inferência para desempenho de nível de fronteira em até 10x anualmente. Para entender como a eficiência da infraestrutura melhora a tokenomics, considere a analogia de uma impressora de alta velocidade. Se a impressora produz 10x mais com um investimento incremental em tinta, energia e na própria máquina, o custo para imprimir cada página individual diminui. Da mesma forma, investimentos em infraestrutura de IA podem levar a uma produção muito maior de tokens em comparação com o aumento do custo — causando uma redução significativa no custo por token. Quando a produção de tokens supera o custo da infraestrutura, o custo de cada token diminui. É por isso que provedores de inferência líderes, incluindo Baseten, DeepInfra, Fireworks AI e Together AI, estão usando a plataforma NVIDIA Blackwell, que os ajuda a reduzir o custo por token em até 10x em comparação com a plataforma NVIDIA Hopper. Esses provedores hospedam modelos avançados de código aberto, que agora atingiram um nível de inteligência de fronteira. Ao combinar inteligência de fronteira de código aberto, o codesign extremo de hardware-software da NVIDIA Blackwell e suas próprias pilhas de inferência otimizadas, esses provedores estão permitindo reduções drásticas de custo de token para empresas em todos os setores. Saúde — Baseten e Sully.ai Reduzem Custos de Inferência de IA em 10x Na área da saúde, tarefas tediosas e demoradas como codificação médica, documentação e gerenciamento de formulários de seguro reduzem o tempo que os médicos podem dedicar aos pacientes. A Sully.ai ajuda a resolver esse problema desenvolvendo “funcionários de IA” que podem lidar com tarefas rotineiras como codificação médica e anotações. À medida que a plataforma da empresa escalava, seus modelos proprietários e de código fechado criaram três gargalos: latência imprevisível em fluxos de trabalho clínicos em tempo real, custos de inferência que escalavam mais rápido que a receita e controle insuficiente sobre a qualidade e atualizações do modelo. A Sully.ai cria funcionários de IA que lidam com tarefas rotineiras para médicos. Para superar esses gargalos, a Sully.ai usa a Model API da Baseten, que
Fonte: NVIDIA AI Blog
Publicado em 2026-02-12