1Lataa skannattu PDF documents; puhtaan 300 DPI-harmaaskaalaskannauksen avulla tunnistaja voi työskennellä eniten.
2Kerro, mitä kieltä voit odottaa: kielen nimeäminen voittaa sen arvaamisen suurella erolla.
3Suorita tunnustuskortti; sanat kirjoitetaan takaisin alkuperäisen sivun kuvan päälle istuvana näkymättömänä kerroksena.
4Lataa hakukelpoinen PDF tiedosto – se näyttää samalta, mutta voit nyt etsiä ja valita sen tekstin.
OCR-PDF Usein kysytyt kysymykset
Vaikuttaako lähdemuoto tunnistamiseen?
+
Se tekee. PDF korjaa sivun: fontit, vektorit, rasterikuvat ja tekstikoordinaatit ovat jäässä, joten jokainen lukija näkee samanlaisen asettelun. Miten sivu tallennetaan, päättää, minkä resoluution ja väritietojen kanssa tunnistajalla on tehtävä töitä.
Mitään erityistä PDF tässä?
+
Kyllä – PDF on objektigraafi, ei sivukuva, joten teksti pysyy valittavissa ja vektorit pysyvät terävinä riippumatta siitä, mitä sen sisällä olevalle rasterisisällölle tapahtuu. Se vaikuttaa siihen, mitä tunnistaja näkee.
Kuinka tarkka se on?
+
Puhtaassa 300 DPI-kuvauksessa painetun tekstin kohdalla on tarpeeksi korkea virheiden määrä, joka on harvinainen ja useimmiten epätavallinen asiallinen substantiivi. Tarkkuus putoaa terävästi matalan resoluution, vinon, puhelimen kameran varjojen, epätavallisten tyyppien ja käsialan avulla – erityisesti käsiala ei ole sitä, mitä varten se on.
Miten OCR PDF muuttaa skannauksen tekstiksi?
+
Käytännössä Jokainen sivu käännetään, käydään läpi Tesseractin tekstitunnistuskortti yli sadalla kielellä, ja tunnetut sanat kirjoitetaan takaisin alkuperäisen kuvan päälle sijoitettuna näkymättömänä tekstikerroksena – joten sivu näyttää muuttumattomalta, mutta on hakukelpoinen ja valittavissa. Sivu näyttää edelleen aivan samalta kuin se teki – tunnustettu teksti istuu kuvan takana näkymättömänä, joten etsi ja valitse työ ilman, että ulkonäkö muuttuu.
Voinko ajaa OCR PDF usealla PDF documents kerralla?
+
Kyllä – lataa setti ja ne prosessoidaan rinnakkain yhden asetuskokonaisuuden alla, mikä on tarkoitus tehdä dokumenttityön virtaus täällä sen sijaan, että klikkaisi työpöytälukijan kautta.
Selviävätkö kirjanmerkit, linkit ja muotokentät?
+
Esiviivat, sisäiset linkit ja merkinnät säilytetään aina, kun se on toiminnan mahdollista. Digitaaliset allekirjoitukset ovat poikkeus: kaikki muutokset tiedostoon mitätöivät allekirjoituksen, koska se on juuri sitä varten.
Onko tiedostokokoraja OCR PDF?
+
Kyllä: Ilmaistilit käsittelevät asiakirjoja aina 5 MB asti, mikä kattaa useimmat raportit ja sopimukset, mutta ei pitkää skannattua asiakirjaa 600 DPI:ssä; Ghostscript ja qpdf tekevät työn. Skannatut PDF-muodossa olevat ovat tavallista suurempi asia, ja asiakirjan pakkaaminen ensin riittää yleensä palauttamaan sen alle.
Alentaako OCR PDF minun PDF documents laatuani?
+
Teksti- ja vektoritaide ovat kohteita pikseleiden sijaan, joten ne pysyvät täysin terävinä missä tahansa zoomissa, tapahtui mitä tahansa. Vain sulautetut rasterikuvat voivat hajota, ja vain jos valitsemasi toiminto ottaa niistä uudelleen näytteen.
Miksi Word-sivuston isäntä OCR PDF?
+
WORD.to on rakennettu asiakirjan elämän muokattavan lopun ympärille – yhä kirjoitettavan, yhä tyyliteltyjen ja yhä kiisteltyjen DOCX:n ympärille, ennen kuin kukaan lavertelee siitä lähettämisestä. Toimistotiedostot ovat kontteja, jotka ovat täynnä muiden ihmisten mediaa – kuvia, sulautettuja ääni- ja fontteja – joten ihmiset tarvitsevat niissä yleensä työtä, jota he tarvitsevat kyseiseen sisältöön joka tapauksessa. OCR PDF jakaa latauksen, kannet ja tilin muunnelmiin tästä syystä.
Mitä teen tuloksella, kun OCR PDF on valmis?
+
Sivuston muunnin vie dokumentit pdf-muodossa lähetettäviksi, kuviin upotettavien kuvien ja tekstien lähetettäviksi kaikkeen, minkä on luettava ne ohjelmallisesti, ja takaisin toiseen suuntaan. Tämän jälkeen muokattava alkuperäinen pysyy paikoillaan, mikä on se osa, jota ei saa takaisin, kun se on liotettu.
Onko OCR PDF tässä sama työkalu, jota sisarussivustot käyttävät?
+
Moottorit jaetaan – sama asiakirjaketju, samat työntekijät, samat rajat. Se, mitä Word sivusto lisää, on näkymä siitä, mikä selviää toimistosta ja mikä ei, mikä on kysymys, joka jokainen näistä työpaikoista todella käynnistää. Se alkaa myös yhdestä faktasta, jonka mukaan tämä sivusto on nimetty: Asiakirja on XML-kimppu, joten tekstieditorit ovat halpoja ja paino on lähes aina sulautetut kuvat.
Tarvitsenko tilin, ja jääkö mitään kiinni?
+
Ei tiliä, eikä mitään säilytetä: lataukset poistetaan työn päätyttyä, mitään ei lueta eikä mitään indeksoida. Historiasta ja erän koosta on vapaat tilit, ei pääsylle.