Zhipu AI Apresenta GLM-OCR: Um Modelo OCR Multimodal de 0.9B para Análise de Documentos e Extração…

Por que o OCR de Documentos Ainda Continua Sendo um Problema de Engenharia Difícil? O que é preciso para tornar o OCR útil para documentos reais em vez de imagens de demonstração limpas? E um modelo multimodal compacto pode lidar com análise (parsing), tabelas, fórmulas e extração estruturada sem transformar a inferência em um gasto excessivo de recursos? Esse é o problema visado pelo GLM-OCR, introduzido por pesquisadores da Zhipu AI e da Universidade de Tsinghua. A equipe de pesquisa apresenta o GLM-OCR como um modelo multimodal compacto de 0.9B parâmetros para compreensão de documentos. Ele combina um codificador visual CogViT de 0.4B, um conector cross-modal leve e um decodificador de linguagem GLM de 0.5B. O objetivo declarado é equilibrar a qualidade do reconhecimento de documentos com menor latência e menor custo computacional do que sistemas multimodais maiores. Sistemas OCR tradicionais são frequentemente bons na transcrição de texto simples, mas eles sofrem quando os documentos contêm layouts mistos, tabelas, fórmulas, blocos de código, selos e campos estruturados. LLMs multimodais recentes melhoram a compreensão de documentos, mas a equipe de pesquisa argumenta que seu tamanho e a decodificação autorregressiva padrão os tornam caros para implantação em edge e produção em larga escala. O GLM-OCR é posicionado como um sistema menor construído para essas restrições de implantação, em vez de um modelo de visão-linguagem de propósito geral adaptado ao OCR como uma ideia posterior. Uma Arquitetura Compacta Construída para Cargas de Trabalho de OCR Um ponto técnico chave para esta pesquisa é o uso de Previsão de Múltiplos Tokens (MTP). A decodificação autorregressiva padrão prevê um token por vez, o que não é ideal para tarefas de estilo OCR onde as saídas são frequentemente determinísticas e localmente estruturadas. O GLM-OCR, em vez disso, prevê múltiplos tokens por etapa. O modelo é treinado para prever 10 tokens por etapa e gera 5.2 tokens por etapa de decodificação em média no tempo de inferência, resultando em cerca de 50% de melhoria de throughput. Para manter a sobrecarga de memória gerenciável, a implementação usa um esquema de compartilhamento de parâmetros entre os modelos de rascunho. Análise de Layout em Duas Etapas em Vez de Leitura Plana da Página No nível do sistema, o GLM-OCR adota um pipeline de duas etapas. A primeira etapa usa o PP-DocLayout-V3 para análise de layout, que detecta regiões estruturadas na página. A segunda etapa realiza reconhecimento paralelo a nível de região sobre as áreas detectadas. Isso é importante porque o modelo não está simplesmente lendo uma página inteira da esquerda para a direita, como um modelo genérico de visão-linguagem faria. Ele primeiro divide a página em regiões semanticamente significativas, o que melhora a eficiência e torna

Fonte: MarkTechPost

Publicado em 2026-03-15

Notícias relacionadas

Continue explorando