Datalab Apresenta OmniExtractBench para Corrigir Vieses e Opacidade em Benchmarks de Extração

A Datalab lançou o OmniExtractBench, um benchmark aberto para extração de documentos estruturados. Ele testa a precisão com que um sistema preenche um esquema JSON a partir de um PDF. O benchmark reúne 620 documentos de 4 benchmarks existentes. Um avaliador determinístico os classifica todos e explica cada decisão. O lançamento ocorre enquanto fornecedores de extração publicam seus próprios placares. A Datalab argumenta que esses placares são difíceis de comparar ou auditar. O OmniExtractBench é sua tentativa de uma régua de medição compartilhada. É implantável? Sim, o avaliador é instalado via PyPI como omni-extract-bench (v0.1.7, Python 3.11+, apenas SciPy) sob a licença Apache 2.0. Reexecutar fornecedores requer suas próprias chaves de API e créditos pagos. O que é o OmniExtractBench? O OmniExtractBench é um benchmark de extração estruturada construído pela Datalab. Cada tarefa fornece a um sistema um PDF e um esquema JSON. O sistema retorna JSON, que é pontuado valor por valor em comparação com um arquivo ouro. O código está no GitHub, e os dados estão no Hugging Face sob a licença CC BY 4.0. Os 4 defeitos que ele visa A postagem de lançamento da Datalab menciona 4 problemas recorrentes com os benchmarks de extração existentes: Viés: documentos e pontuação podem favorecer o fornecedor que construiu o benchmark. Harnesses opacos: uma pontuação baixa pode refletir um harness com defeito, não um modelo fraco. Pontuação pouco clara: os leitores não conseguem entender por que um determinado documento obteve uma pontuação baixa. Variedade de documentos estreita: algumas suítes contêm apenas tabelas densas, outras apenas arquivos limpos e não digitalizados. De onde vêm os 620 documentos Suíte | Documentos | Publicador original | Conteúdo ExtractBench | 329 | LlamaIndex | Formulários, declarações, decks Interno | 202 | Datalab (sintético) | Esquemas escalares densos, documentos pequenos LongExtractBench | 47 | micro1 (encomendado pela Reducto) | Tabelas muito grandes LongArray-Extract | 42 | Extend | Tabelas grandes com escalares repetidos Formulários de arquivamento regulatório são a maior categoria, com 88 documentos. 128 documentos têm uma única página. No outro extremo, 33 documentos com mais de 100 páginas contêm 40% de todas as páginas. A própria suíte sintética da Datalab é a segunda maior parcela. Como o avaliador funciona T

Fonte: MarkTechPost

Publicado em 2026-10-02

Notícias relacionadas

Continue explorando