Libreng plano: 1 conversion / oras, 1 file sa isang oras
Pumunta sa walang limitasyong →

Ang OCR PDF

Basahin ang mga Salita sa loob ng PDF documents

Piliin ang iyong mga file

*Nabura ang mga file pagkatapos ng 24 oras

Mag-convert ng hanggang 1 GB na file nang libre, maaaring mag-convert ang mga Pro user ng hanggang 100 GB na file; Mag-sign up ngayon

Nag-a-upload

0%

Paano mag-OCR PDF

1 Upload the scanned PDF documents; a clean 300 DPI grayscale scan gives the recogniser the most to work with.
2 Ang lathalaing ito na tungkol sa Talambuhay, Kasaysayan at Pransiya ay isang usbong.
3 Patakbuhin ang pagkilala pass; ang mga salita ay nakasulat pabalik bilang isang invisible layer nakaupo sa ibabaw ng orihinal na imahe ng pahina.
4 I-download ang searchable PDF file — ito ay mukhang magkapareho, ngunit maaari mo na ngayong maghanap at piliin ang teksto sa ito.

Ang OCR PDF Mga Madalas Itanong

Ang source format ay nakakaapekto sa pagkilala?
+
PDF ayusin ang pahina: font, vectors, raster na imahe at teksto coordinates ay frozen kaya ang bawat mambabasa ay nakikita ang parehong layout. Paano ang pahina ay naka-imbak ay nagpasya kung ano ang resolution at kulay ng impormasyon ang recognizer ay may upang gumana sa.
Oo — Ang isang PDF ay isang graph bagay, hindi isang imahe ng pahina, kaya ang teksto ay natiling selectable at vectors manatili matalim kahit ano ang mangyayari sa raster nilalaman sa loob nito. Ito ay nakakaapekto sa kung ano ang recognizer ay maaaring makita.
Sa isang malinis na 300 DPI scan ng naka-print na teksto, mataas na sapat na ang mga error ay bihirang at karamihan sa mga hindi pangkaraniwang mga pangalan. katumpakan ay bumabagsak off malaki sa mababang resolution, nakatiklop, shadows mula sa isang camera ng telepono, hindi pangkaraniwang mga tipo ng titik at pagsulat ng kamay — pagsulat ng kamay sa partikular ay hindi kung ano ito ay para sa.
Konkreto, bawat pahina ay ipinapakita, tumakbo sa pamamagitan ng isang Tesseract text-pagkilala ng pass sa higit sa 100 wika, at ang kinikilalang mga salita ay nakasulat na bumalik bilang isang invisible layer ng teksto na nakalagay sa ibabaw ng orihinal na imahe - kaya ang pahina ay mukhang hindi nagbago ngunit ay searchable at selectable. Ang pahina ay mukhang eksakto tulad ng ginawa nito – ang kinikilalang teksto ay nakaupo invisiblely sa likod ng imahe kaya paghahanap at pagpili ng trabaho nang hindi nagbabago ang hitsura.
Oo — mag-upload ng set at proseso sila sa parallel sa ilalim ng isang set ng mga setting, na kung saan ay ang punto ng paggawa ng isang dokumento workflow dito sa halip na pag-click sa pamamagitan ng isang desktop reader.
Outlines, panloob na mga link at annotations ay preserved saanman ang operasyon ay nagpapahintulot sa ito. Digital signatures ay ang pagbubukod: anumang pagbabago sa file kinakailangan invalidates isang lagda, dahil na ay eksakto kung ano ang isang lagda ay para sa.
Oo: Libreng account proseso ng mga dokumento hanggang sa 5 MB bawat isa, na sumasaklaw sa karamihan ng mga ulat at mga kontrata ngunit hindi isang mahabang scanned dokumento sa 600 DPI; Ghostscript at qpdf gawin ang trabaho. Scanned PDFs ay ang karaniwang bagay na lumampas ito, at compressing ang dokumento unang ay normal na sapat upang dalhin ito pabalik sa ilalim.
Ang teksto at vector artwork ay mga bagay sa halip na pixel, kaya sila ay mananatiling ganap na matulis sa anumang zoom kahit ano ang mangyayari. Lamang ang mga naka-embed na mga imahe raster ay maaaring degrade, at lamang kung ang operasyon na pinili mo resamples ang mga ito.
Ang WORD.to ay binuo sa paligid ng editable dulo ng buhay ng isang dokumento - ang DOCX na pa rin ay nakasulat, pa rin ay styled at pa rin ay argued sa ibabaw, bago ang sinuman flattens ito para sa pagpapadala. Office files are containers full of other people's media — images, embedded audio, fonts — so the work people need on them is usually the work they would need on those contents anyway. Ang OCR PDF shares the upload, the caps and the account with the conversions for that reason.
<Ang converter sa site na ito ay tumatagal ng mga dokumento sa PDF para sa pagpapadala, sa mga imahe para sa pag-embed at sa simpleng teksto para sa anumang bagay na may upang basahin ang mga ito programmatically, at bumalik sa iba pang paraan. Ang paggawa na pagkatapos ay pinapanatili ang editable orihinal sa paligid, na kung saan ay ang bahagi na hindi mo makuha pabalik kapag ito ay na-flattened.
Ang mga engine ay ibinahagi - ang parehong toolchain dokumento, ang parehong mga manggagawa, ang parehong mga limitasyon. Ano ang isang Word site ay nagdaragdag ay isang view sa kung ano ang survives umalis sa Office format at kung ano ang hindi, na kung saan ay ang tanong bawat isa sa mga trabaho na ito ay talagang gumagalaw sa. Ito rin ay nagsisimula mula sa isang katotohanan tungkol sa format site na ito ay pinangalanan pagkatapos: Ang dokumento ay isang zip ng XML, kaya ang mga pag-edit ng teksto ay mura at ang timbang ay halos palaging ang mga naka-embed na mga imahe.
Walang account, at walang bagay ay pinatili: uploads ay tinanggal mula sa mga manggagawa sa ilang sandali pagkatapos ng trabaho ay natapos, walang bagay ay basahin at walang bagay ay indexed. Libreng account umiiral para sa kasaysayan at laki ng batch, hindi para sa access.

I-rate ang tool na ito
5.0/5 - 0 mga boto
Talaan ng mga lungsod sa Nigeria — Bumili ng domain mula sa $2/taon. Online sa loob ng ilang minuto.
O kaya naman ay ilagay ang iyong mga file dito