OCR – sposób na tłumaczenie plików PDF

Abby_FineReader_OCR

OCR (ang. Optical Character Recognition, czyli Optyczne Rozpoznawanie Znaków) to technologia umożliwiająca komputerowi czytanie pisma. Programy OCR umożliwiają komputerowi odczytywanie dokumentu, który oryginalnie jest w formie pliku graficznego i przetworzenie go na plik komputerowy, który można edytować, wysyłać, lub drukować.

W technologii OCR można wyróżnić ICR (ang. Image Character Recognition). ICR używany jest przy przenoszeniu na komputer dokumentów pisanych ręcznie, jak np. ręcznie wypełnianych formularzy. Możliwości programów ICR ograniczają się do odczytywania ręcznie pisanych cyfr i drukowanych liter. Ponieważ są one zwykle wpisywane w oddzielne pola na formularzach, daje to programowi możliwość ich odczytania.

Po zeskanowaniu dokumentu należy ustalić obraz. Polega to na zróżnicowaniu kontrastu między punktami, z których składa się obraz. W ten sposób program tworzy zarys znaków. Im większa rozdzielność dokumentu, tym lepiej. Następny etap to rozpoznawanie znaków. Program zaznacza wszystko, co jest znakiem, omijając np. ilustracje. Następnie program identyfikuje znaki i porównuje wyniki z danymi na temat fontów (pochyłe, ozdobne, pogrubione, szeryfowe, bezszeryfowe). Dalej program odczytuje całe słowa i porównuje z słowami zapisanymi w słowniku danego języka. Potem kolej na korektę. W zależności od wersji programu korektą zajmuje albo użytkownik, albo sam program. Ostatnim etapem jest zapisanie odczytanego dokumentu jako plik komputerowy (np. jako dokument Worda).

Aby można było używać OCR, wystarczy mieć oprogramowanie OCR oraz skaner o rozdzielczości 300 dpi. OCR jest szczególnie przydatne, gdy trzeba przenieść do komputera ogromne ilości tekstu. Zamiast przepisywać każdą stronę po kolei, wystarczy zeskanować potrzebne dokumenty i użyć oprogramowania OCR do przetworzenia informacji (tekst, ilustracje, tabele, grafiki, wykresy). Przetworzenie jednej strony zajmuje programowi jedną minutę, co jest nieosiągalnym wynikiem dla człowieka przepisującego ręcznie. Co więcej, niemożliwe jest ręczne przeniesienie graficznych elementów tekstu takich jak ilustracje.

Autorka tekstu: Karolina Tkaczyk

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Pola, których wypełnienie jest wymagane, są oznaczone symbolem *