Što je OCR?
Optičko prepoznavanje znakova (OCR) odnosi se na proces pretvaranja tekstualnih slika u strojno čitljiv format teksta. Na primjer, ako skenirate obrazac ili potvrdu, računalo sprema skenirani dokument kao slikovnu datoteku. Ne možete uređivati, pretraživati ili brojati tekst u slikovnoj datoteci pomoću uređivača teksta. Međutim, možete koristiti OCR za pretvaranje slika u tekstualne dokumente i pohranjivanje sadržaja kao tekstualnih podataka.

Zašto je OCR toliko važan?
Većina poslovnih tokova rada uključuje pristup informacijama putem tiskanih medija. Papirnati obrasci, fakture, skenirani pravni dokumenti i tiskani ugovori dio su poslovnog procesa. Potrebno je puno vremena i prostora za pohranu i upravljanje ovim ogromnim dokumentima. Unatoč trendu upravljanja dokumentima bez papira, skeniranje dokumenata u slike i dalje je izazov. Proces zahtijeva ljudsku intervenciju, glomazan je i spor.
Osim toga, digitalizacija sadržaja dokumenta može dovesti do slikovnih datoteka sa skrivenim tekstom. Programi za obradu teksta ne mogu obraditi tekst u slikama na isti način kao tekstualne dokumente. OCR rješava ovaj problem pretvaranjem tekstualnih slika u tekstualne podatke koji se mogu analizirati drugim komercijalnim softverom. Zatim možete koristiti podatke za analizu, poboljšanje operacija, automatizaciju procesa i povećanje produktivnosti.

Kako radi OCR?
Stjecanje slike
Skeneri čitaju dokumente i pretvaraju te dokumente u binarne podatke. OCR softver analizira skeniranu sliku, klasificirajući svijetla područja kao pozadinu, a tamna područja kao tekst.
pretprocesiranje
OCR softver prvo čisti sliku i uklanja pogreške u pripremi za čitanje. Evo nekoliko tehnika čišćenja koje se koriste za to:
Lagana korekcija pomaka ili iskrivljenja skeniranih dokumenata tijekom skeniranja radi rješavanja problema s poravnanjem.
Uklonite šum, mrlje s digitalnih slika ili izgladite rubove tekstualnih slika.
Očistite obrube i linije na slici.
Prepoznavanje skripte s višejezičnom OCR tehnologijom
Prepoznavanje teksta
Dvije glavne vrste OCR algoritama ili softverskih procesa koje koristi OCR softver za prepoznavanje teksta su podudaranje uzoraka i izdvajanje značajki.
Usklađivanje uzorka
Usklađivanje uzorka odvaja sliku znaka (zvanu glif) i uspoređuje je s pohranjenim sličnim glifovima. Usklađivanje uzorka funkcionira samo ako pohranjeni glif ima sličan font i veličinu kao ulazni glif. Ova metoda dobro funkcionira za skenirane slike dokumenata unesenih u poznatim fontovima.
Ekstrakcija značajki
Ekstrakcija značajki segmentira ili rastavlja glifove u značajke kao što su linije, zatvorene petlje, orijentacija linije i fokus linije. Zatim koristi te značajke kako bi pronašao najbolje ili najbliže podudaranje među različitim pohranjenim glifovima.
Naknadna obrada
Nakon analize, sustav pretvara ekstrahirane tekstualne podatke u računalne datoteke. Neki OCR sustavi mogu stvoriti PDF datoteke s bilješkama koje sadrže verzije skeniranih dokumenata prije i nakon skeniranja.


