Como extrair dados de PDFs e documentos automaticamente (faturas, contratos, guias)?
Um sistema de extração lê o documento, encontra os campos que interessam (número, data, valores, fornecedor) e entrega-os estruturados ao vosso sistema, mesmo quando cada documento vem num layout diferente. A IA trata da variação que uma regra não cobria; a parte difícil não é ler, é confiar no que foi lido.
A informação de que a empresa precisa já existe, mas está presa dentro de um PDF, de uma foto ou de um email. Alguém abre, lê e copia para o sistema, à mão, dezenas de vezes por dia. É lento, é aborrecido, e é precisamente aí que entra o erro de digitação que ninguém dá por ele.
Como funciona, em três passos
- Ler o documento: texto nativo quando é um PDF "a sério", ou reconhecimento ótico (OCR) quando é um scan ou uma foto.
- Encontrar os campos certos: não é "ler tudo", é perceber onde está o número da fatura, a data, o total, o IVA e o fornecedor, mesmo que cada fornecedor ponha cada coisa num sítio diferente.
- Devolver estruturado e validado ao sistema que o vai usar (o ERP, uma folha, uma base de dados).
Porque é que a IA mudou isto
Antes da IA, cada fornecedor com um layout diferente obrigava a programar um molde novo, e bastava o fornecedor mudar a fatura para partir tudo. Um modelo de hoje lê o documento mais como uma pessoa leria, sem um molde fixo por fornecedor, e absorve a variação. É isto que tornou a extração viável para quem recebe documentos de muitas origens diferentes.
Onde corre mal (o que não acreditar)
- "Lê tudo com total certeza." Não lê. Scans maus, carimbos por cima dos números, tabelas partidas entre páginas e campos ambíguos (há duas datas, qual é a da fatura?) existem sempre.
- O risco não é ler mal; é ler mal e ninguém reparar. Um bom sistema mostra o grau de confiança, assinala o que é duvidoso e põe uma pessoa a confirmar só o incerto, em vez de mandar tudo às cegas ou de obrigar a reconferir tudo.
- Inventar o que não está. Se um campo não aparece no documento, o sistema tem de poder dizer "não encontrei", e não preencher um valor plausível.
- Extrair sem conferir é só copiar um erro mais depressa. O número lido tem de bater com algo que já existe (a encomenda, a guia), senão não se ganhou fiabilidade nenhuma.
Onde faz diferença
Contas a pagar (faturas de fornecedor), receção de mercadoria (guias de remessa), e entrada de novos processos (contratos, documentos), sempre com o cuidado de só tratar os dados pessoais necessários. Num caso real, numa empresa de compras na construção, as faturas e as guias de dezenas de fornecedores, cada uma à sua maneira, deixaram de ser copiadas à mão para passarem a ser lidas, conferidas e postas no sítio.
Como a CAIS AI o faz
Extraímos com a fonte sempre à vista, para se ver de que parte do documento saiu cada campo, assinalamos o que é incerto para uma pessoa confirmar, e cruzamos o que foi lido com o que já existe (a encomenda, a guia) em vez de aceitar o número cego. Os documentos com dados pessoais tratam-se com minimização, como manda o RGPD. Ver também a nota sobre ler e lançar faturas de fornecedor e a nota sobre RGPD e o AI Act.
In English
A document extraction system reads the file, finds the fields you care about (number, date, amounts, supplier) and hands them back structured to your system, even when every document has a different layout. AI handles the variation a rule could not, by reading more like a person would, without a fixed template per supplier. The hard part is not reading, it is trusting what was read: bad scans, stamps, split tables and ambiguous fields always exist, and the real risk is reading wrong and nobody noticing. A good system shows its confidence, flags the uncertain for a person to confirm, says "not found" instead of inventing, and cross-checks the extracted number against something that already exists (the order, the delivery note). CAIS AI extracts with the source always visible, flags the uncertain, and checks against existing data rather than copying a number blindly.