Description
Develop and evolve the PDF parsing and data extraction engine for electricity bill documents in an environment involving large-scale PDF document processing, OCR, structured parsing, data validation, quality monitoring, and continuous improvement of processing performance and stability.
* Develop and maintain PDF document parsers
* Create new data extraction models
* Evolve OCR and parsing strategies
* Fix extraction failures and inconsistencies
* Improve processing performance and stability
* Work with documents having varied and non-standard layouts
* Monitor model quality and error rate
* Develop internal tools to support operational and technical activities
* Participate in defining technical data extraction strategies
* Investigate complex parsing and OCR cases
* Handle high-volume document processing
* Improve existing pipelines and propose new technical approaches
* Directly contribute to the evolution of the processing architecture