FireRedTeam Lança FireRed-OCR-2B Utilizando GRPO para Resolver Alucinações Estruturais em Tabelas e…

A digitalização de documentos tem sido um problema multifuncional: primeiro detectar o layout, depois extrair o texto e, finalmente, tentar reconstruir a estrutura. Para Large Vision-Language Models (LVLMs), isso frequentemente leva a ‘alucinações estruturais’—linhas desordenadas, fórmulas inventadas ou sintaxe não fechada. A FireRedTeam lançou o FireRed-OCR-2B, um modelo carro-chefe projetado para tratar o parsing de documentos como uma tarefa de engenharia estrutural, em vez de geração de texto ‘impressionista’. Construído sobre a arquitetura Qwen3-VL-2B-Instruct, este modelo estabelece um novo State-of-the-Art (SOTA) para soluções de ponta a ponta, alcançando uma pontuação geral de 92,94% no benchmark OmniDocBench v1.5. Mudando o Paradigma: Engenharia Estrutural vs. Geração de Texto Desenvolvedores frequentemente descobrem que mesmo os LVLMs gerais mais poderosos têm dificuldade com a lógica espacial densa de um PDF técnico. Quando um modelo ‘vê’ uma tabela complexa ou uma equação LaTeX de várias linhas, ele frequentemente falha em manter a relação hierárquica entre os elementos. O FireRed-OCR-2B aborda isso através de um Pipeline de Treinamento Progressivo especializado, composto por três estágios distintos: Pré-alinhamento Multitarefa: Este estágio estabelece o embasamento espacial treinando o modelo em tarefas de detecção, reconhecimento de região e layout para markdown. SFT Especializado (Supervised Fine-Tuning): O modelo é ajustado em um dataset Markdown padronizado e de alta qualidade para garantir consistência lógica e expressão hierárquica. GRPO Restrito a Formato: O estágio final usa aprendizado por reforço para impor a validade sintática. A Inovação Principal: GRPO Restrito a Formato O diferencial técnico mais significativo do FireRed-OCR é o uso de Group Relative Policy Optimization (GRPO) Restrito a Formato. Enquanto o ajuste fino tradicional se concentra na precisão dos caracteres, o GRPO introduz um ciclo de aprendizado por reforço que recompensa o modelo por traços estruturais específicos: Sintaxe de Fórmula: Garantindo que as equações LaTeX sejam matematicamente válidas. Integridade de Tabela: Mantendo contagens consistentes de linhas/colunas e tags HTML/Markdown adequadas. Fechamento Hierárquico: Verificando se todas as tags estruturais abertas (como listas ou cabeçalhos) são corretamente fechadas. Precisão de Texto: Reduzindo erros em nível de caractere em blocos de texto densos. Ao eliminar a necessidade de um modelo ‘crítico’ separado – um benefício chave do algoritmo GRPO – a FireRedTeam otimizou o processo de treinamento para focar especificamente nas áreas de alta fricção do parsing de documentos. Resolvendo o

Fonte: MarkTechPost

Publicado em 2026-03-02

Notícias relacionadas

Continue explorando