Para acelerar e refinar a tomada de decisões em um mercado global e dinâmico, as empresas podem implantar modelos de inteligência artificial generativa para ajudar a resumir e interpretar os gráficos que frequentemente preenchem os resumos de mercado e relatórios financeiros.
Mas mesmo os modelos de visão-linguagem mais recentes às vezes têm dificuldade com essa tarefa, pois ela exige que um modelo integre a compreensão visual, numérica e linguística. Uma empresa que investe em um modelo de ponta ainda pode receber informações imprecisas ou incompletas.
Para preencher essa lacuna de desempenho, pesquisadores do MIT e do MIT-IBM Computing Research Lab desenvolveram um recurso multifacetado para usuários de IA, especificamente projetado para ensinar modelos de visão-linguagem (VLMs) a interpretar gráficos de forma eficaz.
Eles usaram um método inovador de geração de dados para construir um dataset de ponta que inclui mais de um milhão de gráficos variados. O dataset também codifica muitos componentes visuais, linguísticos e numéricos de cada imagem de gráfico, o que permite que os modelos raciocinem robustamente sobre as informações em um gráfico.
Os pesquisadores usaram este dataset, chamado ChartNet , para treinar uma série de VLMs de código aberto. Muitos desses modelos menores superaram significativamente modelos comerciais ordens de magnitude maiores em tarefas como extração de dados e resumo de gráficos.
Ao permitir que modelos de código aberto superem seus equivalentes comerciais, o ChartNet pode permitir que pequenas empresas com orçamentos limitados utilizem a IA com mais facilidade. O dataset de código aberto pode ser usado para melhorar as capacidades dos modelos de IA para tarefas como análise de tendências de negócios e interpretação de figuras científicas.
“Desenvolvemos o ChartNet para ser um "balcão único" para a compreensão de gráficos, cobrindo basicamente tudo o que um modelo de IA e um profissional que está treinando esse modelo pode necessitar."
Fonte: MIT News - AI
Publicado em 2026-06-03