High precision text extraction from PDF documents

Øyvind Raddum Berg · NORA - Norwegian Open Research Archives · 2011

Oppgaven tar for seg problemet med uthenting av informasjon fra dokumenter lagret i PDF-formatet, noe som er vanskelig på grunn av at informasjonen blir lagret visuelt og uten en god struktur. I oppgaven blir det sett på bruk og tilpassning av teori hentet fra OCR for å prøve å gjenopprette denne tapte strukturen.

Read the paper · More papers on PaperTik