Construir um pipeline RAG (Retrieval-Augmented Generation) é fácil; construir um que não alucine durante uma auditoria 10-K é quase impossível. Para desenvolvedores do setor financeiro, a abordagem RAG 'padrão' baseada em vetor — fragmentar texto e esperar o melhor — geralmente resulta em uma 'sopa de texto' que perde o contexto estrutural vital de tabelas e balanços. A VectifyAI está tentando preencher essa lacuna com o lançamento do Mafin 2.5, um agente financeiro multimodal, e do PageIndex, um framework de código aberto que direciona a indústria para o 'RAG sem Vetores'. O Problema: Por que o RAG Vetorial Falha nas Finanças O RAG tradicional depende da similaridade semântica. Se você pergunta sobre 'Lucro Líquido', um banco de dados vetorial procura por fragmentos de texto que soem como lucro líquido. No entanto, documentos financeiros são dependentes do layout. Um número em uma célula é sem sentido sem seu cabeçalho, e esses cabeçalhos são frequentemente removidos durante a conversão tradicional de PDF para texto. Esta é a armadilha do 'lixo entra, lixo sai': mesmo o LLM mais inteligente não consegue raciocinar corretamente se os dados de entrada perderam sua estrutura hierárquica. Mafin 2.5: Precisão em Escala O Mafin 2.5 não é apenas um modelo ajustado; é um motor de raciocínio que alcançou 98,7% de precisão no FinanceBench, superando significativamente o GPT-4o e o Perplexity em tarefas de recuperação financeira. O que o diferencia para os desenvolvedores é sua integração nativa com fontes de dados de alta fidelidade: Acesso Abrangente à SEC: Indexação direta de arquivamentos 10-K, 10-Q e 8-K. Inteligência de Lucros: Transcrições de chamadas de lucros em tempo real e históricas. Dados de Mercado: Cotações ao vivo em todo o Russell 3000 e Nasdaq. https://pageindex.ai/blog/Mafin2.5 PageIndex: A Mudança para o RAG 'Sem Vetores' O 'molho secreto' por trás da precisão do Mafin 2.5 é o PageIndex. O PageIndex substitui embeddings planas tradicionais por um índice de árvore hierárquico. Em vez de pesquisar em fragmentos aleatórios, o PageIndex permite que um LLM 'raciocine' através da estrutura de um documento. Ele constrói uma árvore semântica — essencialmente um mapa inteligente do documento — permitindo que o agente identifique a seção exata, página e item de linha necessários. As principais características técnicas incluem: Suporte Nativo a Visão: O PageIndex suporta RAG baseado em Visão, permitindo que os modelos 'vejam' o layout global de uma página (gráficos, grades complexas) em vez de depender apenas do texto OCR. Navegação Hierárquica: Ele transforma PDFs em uma estrutura de árvore navegável, garantindo a relação
Fonte: MarkTechPost
Publicado em 2026-02-23