Sistema de Detecção de Documentos Adulterados
Plataforma desenvolvida com PHP, MySQL, Python e OpenCV para comparar um documento original com outro sob análise, identificar diferenças visuais e textuais e assinalar áreas que podem ter sido alteradas.
Sobre o projecto
Desenvolvi este sistema para facilitar a verificação de possíveis alterações em documentos. O utilizador carrega o documento considerado original e uma segunda versão que pretende analisar. A aplicação converte os documentos em imagens, prepara as páginas, compara a estrutura visual e extrai o texto por OCR. No final, apresenta uma percentagem de semelhança e destaca as regiões onde foram encontradas diferenças.
A solução pode auxiliar na observação de textos modificados, elementos removidos ou acrescentados, fotografias substituídas, diferenças em assinaturas, carimbos, datas, valores e outras alterações visíveis. O histórico das análises e os respectivos resultados podem ser guardados na base de dados MySQL.
Como funciona
O que o sistema pode identificar
Documento original
Referência para comparaçãoDocumento analisado
Diferenças destacadasBibliotecas utilizadas
Função das principais tecnologias
O Python executa o motor de análise documental. O OpenCV trata, alinha e compara as imagens. O NumPy permite representar as imagens como matrizes e efectuar cálculos. A biblioteca scikit-image disponibiliza o SSIM, utilizado para medir a semelhança estrutural. O PyMuPDF abre e converte páginas PDF; o Pillow auxilia na manipulação das imagens; e o pytesseract realiza o reconhecimento óptico de caracteres.
O PHP controla o carregamento dos documentos, a comunicação com o motor Python e a apresentação dos resultados. O MySQL armazena os registos dos documentos, percentagens de semelhança, datas e histórico das análises efectuadas.