1Upload de gescande PDF documents; een schone 300 DPI grijswaarden scan geeft de herkenning het meeste om mee te werken.
2It is in taal dy't troch de measte minsken as in memmetaal beskôge wurdt.
3De herkenningspas útfiere; de wurden wurde weromskreaun as in ûnsichtbere laach oer de oarspronklike sideôfbylding hinne.
4De trochsichtich triem PDF ynlade - it liket identiek, mar jo kinne no de tekst deryn sykje en selektearje.
PDF OCR FAQ
Hat de boarne- opmaak ynfloed op de herkenning?
+
Dat docht it. PDF fixearret de side: lettertypen, fetsers, rasterafbyldingen en tekstkoördinaten wurde befêstige sadat elke lêzer deselde yndieling sjocht. Hoe' t de side bewarre wurdt bepaalt mei hokker resolúsje en kleurynformaasje de herkenningsprogramma' s wurkje moatte.
Is der hjir wat spesifyk foar PDF?
+
Ja — in PDF is in objektgrafyk, net in sideôfbylding, dus tekst bliuwt selektearber en fetoren bliuwe scherp, wat der ek mei de raster ynhâld bart. It hat ynfloed op wat de herkenningsprogramma sjen kin.
Hoe krekt is it?
+
Op in skjinne 300 DPI skâns fan printe tekst, heech genôch dat flaters net faak foarkomme en foaral yn ûnferwachte eigennammen. De nauwkeurigheid falt hurd ôf by lege resolúsje, skean, skaad fan in tillefoankamera, ûnferwachte lettertypen en hânskrift - hânskrift is net wêr' t dit foar bedoeld is.
Hoe set OCR PDF in scan om nei tekst?
+
Konkreter, Elke side wurdt werjûn, troch in Tesseract tekst- erkenning pass yn mear as 100 talen, en de erkende wurden wurde werom skreaun as in ûnsichtbere tekst laach pleatst oer de oarspronklike ôfbylding - sadat de side liket net feroare mar is sykbar en selektearje. De side sjocht der noch altyd krekt sa út as doe - de ûntdutsen tekst sit ûnsichtber efter de ôfbylding, sadat sykjen en selektearje wurket sûnder it úterlik te feroarjen.
Kin ik OCR PDF op meardere PDF documents yn ien kear útfiere?
+
Ja - upload de set en se wurde parallel ferwurke ûnder ien set ynstellings, wat it doel is fan it dwaan fan in dokumint wurkflow hjir ynstee fan te klikken troch in buroblêd lêzer.
Blêdwizer, keppelings en formulierfjilden bewarje?
+
Oersjoch, ynterne keppelings en oantekeningen wurde behâlden as de hanneling dat tastiet. Digitale hântekenings binne de útsûndering: elke feroaring yn de triem makket de hântekening ûnjildich, om' t dat krekt is wêr' t in hântekening foar brûkt wurdt.
Is der in triemgrutte beheining op OCR PDF?
+
Ja: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. Skeanprinte PDF's binne it meast foarkommende ding dat it oertreft, en it komprimearjen fan it dokumint earst is normaal genôch om it wer ûnder te bringen.
Will OCR PDF lower the quality of my PDF documents?
+
Tekst en vektorargyf binne objekten ynstee fan piksels, sadat se perfekt scherp bliuwe by elke zoom, wat der ek bart. Allinne de ynsletten rasterafbyldingen kinne ferminderje, en allinne as de aksje dy jo keazen hawwe se opnij samplet.
Wêrom host in side Word OCR PDF?
+
WORD.to is built around the editable end of a document's life — the DOCX that is still being written, still being styled and still being argued over, before anyone flattens it for sending. Office-triemmen binne konteners fol mei media fan oare minsken - ôfbyldings, ynsletten lûd, lettertypen - dus it wurk dat minsken der oan dwaan moatte is trochinoar it wurk dat se dochs wol oan dy ynhâld dwaan soene. OCR PDF deelt it opladen, de kapsels en it akkount mei de konverzjes om dy reden.
Wat moat ik dwaan mei it resultaat as OCR PDF klear is?
+
De konvertearder op dizze side nimt dokuminten út nei PDF foar ferstjoeren, nei ôfbylden foar ynbêding en nei platte tekst foar alles dat se programmatysk lêze moat, en omkeard. As jo dat letter dwaan, dan bliuwt it bewurkjenbere orizjinele omheech, wat it diel is dat jo net werom krije kinne as it ienris flaterleas makke is.
Is OCR PDF hjir itselde ark as de sibben dy't draaie?
+
De motors wurde dield - deselde dokumintarkbân, deselde wurkers, deselde beheiningen. Wat in Word - side tafoeget is in sicht op wat oerlibbet nei it ferlitten fan it Office- formaat en wat net, wat de fraach is dy' t elk fan dizze taken ynskeakelje. It begjint ek fan ien feit oer it formaat wêrnei dizze side neamd is: it dokumint is in zip fan XML, dus tekstbewurking is goedkeap en it gewicht is hast altyd de ynsletten ôfbyldings.
Ha ik in akkount nedich, en wurdt der wat bewarre?
+
Gjin akkount, en neat wurdt behâlden: opladen wurde fuortsmiten fan de wurkers koart nei de taak klear is, neat wurdt lêzen en neat wurdt yndeksearre. Frije akkounts besteane foar skiednis en batchgrutte, net foar tagong.