Вольны план: 1 conversion/hour, 1 file at a time
Неабмежаваная →

PDF OCR

Прачытаць словы ў PDF documents

Выберыце свае файлы

*Файлы выдаляюцца праз 24 гадзіны

Канвертаваць файлы да 1 ГБ бясплатна, карыстальнікі Pro могуць канвертаваць файлы да 100 ГБ; Зарэгіструйцеся зараз

Загрузка

0%

Як распазнаваць PDF

1 Загрузіць сканаваную PDF documents; чыстая 300 DPI сканаваная графіка з шэрымі адценнямі дае найбольш магчымасцяў для працы.
2 У ёй гаворыцца, што мова, якую вывучаюць, павінна быць адной з моў, якія выкарыстоўваюцца ў свеце.
3 Выканаць разлік. Слова будзе запісана ў невідавочным пластзе, які будзе размешчаны над арыгінальным малюнкам старонкі.
4 Сцягнуць файл з магчымасцю пошуку PDF - ён выглядае ідэнтычным, але вы можаце шукаць і вылучаць тэкст у ім.

PDF OCR Часта задаваныя пытанні

Ці ўплывае фармат зыходнага коду на распазнаванне?
+
Гэта так. PDF замацоўвае старонку: шрыфты, вектары, растравыя малюнкі і тэкставыя каардынаты замярзае, так што кожны чытач бачыць ідэнтычную раскладку. Як захоўваецца старонка, вызначае, з якой раздзяляльнасцю і колерамі павінна працаваць праграма распазнавання.
Так - PDF - гэта аб' ектная графіка, а не малюнак старонкі, таму тэкст застаецца вылучаным, а вектары застаюцца рэзкімі, незалежна ад таго, што адбываецца з растравым зместам унутры. Гэта ўплывае на тое, што можа бачыць распілоўшчык.
На чыстай 300 DPI сканаванне друкаванага тэксту, дастаткова высокай, каб памылкі былі рэдкімі і большасць з іх у незвычайных уласных імёнах. Дакладнасць рэзка знізіцца з нізкай раздзяляльнасцю, скажэннем, ценямі з камеры тэлефона, незвычайнымі шрыфтамі і рукапісам - рукапіс у прыватнасці не для гэтага.
У прыватнасці, кожная старонка рэндруецца, праходзіць праз Tesseract для распазнавання тэксту на больш чым 100 мовах, і выяўленыя словы запісваюцца назад як небачныя тэкставыя пласты, размешчаныя над арыгінальным малюнкам - так што старонка выглядае не змененай, але дазваляе пошук і вылучэнне. Старонка выглядае так жа, як і раней - раскрыты тэкст знаходзіцца небазіравана за малюнкам, таму пошук і вылучэнне працуюць без змены выгляду.
Так - загрузіць набор і яны будуць апрацоўвацца паралельна пад адным набор налад, што з' яўляецца мэтай працы з дакументам тут, а не націскання праз працоўны стол чытача.
Кантуры, унутраныя спасылкі і анатацыі захоўваюцца, калі гэта дазваляе аперацыя. Лічбавыя подпісы з' яўляюцца выключэннем: любыя змены ў файле абавязкова робяць подпіс несапраўдным, бо падпіска выкарыстоўваецца менавіта для гэтага.
Так: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. Сканаваныя PDF- дакументы звычайна перавышаюць гэты памер, і спачатку трэба сціснуць дакумент, каб вярнуць яго ў папярэдні памер.
Тэкст і векторныя малюнкі - гэта аб' екты, а не пікселя, таму яны застаюцца рэзкімі пры любым павелічэнні. Толькі ўбудаваныя растравыя малюнкі могуць пагоршыцца, і толькі калі выбраная аперацыя перавыбірае іх.
WORD.to пабудаваны вакол рэдагавання канца жыцця дакумента — DOCX, які ўсё яшчэ напісаны, усё яшчэ стылюецца і абмяркоўваецца, перш чым хто-небудзь сплочвае яго для адпраўкі. Файлы Office - гэта кантэйнеры, поўныя іншых медыя - малюнкаў, убудаваных гукаў, шрыфтоў - таму звычайна патрэбная праца з імі - гэта тая, якая патрэбна для гэтага зместу. OCR PDF падзяляе загрузку, капічныя і рахунак з пераўтварэннямі з гэтай прычыны.
Канвэртар на гэтым сайце выводзіць дакументы ў PDF для адпраўкі, у малюнкі для ўбудоўвання і ў звычайны тэкст для ўсіх, хто павінен чытаць іх праграмна, і назад у іншы бок. Гэтая аперацыя застанецца пасля таго, як будзе зменены арыгінальны малюнак, які не можа быць вярнуты пасля яго згладжвання.
Рухавікі супольныя - той жа шэраг дакументаў, тыя ж работнікі, тыя ж абмежаванні. Што Word сайт дадае - гэта погляд на тое, што перажывае пасля выхаду з фармату Office і што не, што з' яўляецца пытаннем, якое кожны з гэтых заданняў на самай справе ўключае. Ён таксама пачынаецца з аднаго факту пра фармат, у гонар якога названы гэты сайт: дакумент змешчаны ў файл XML, таму рэдагаванне тэксту не патрабуе шмат сіл і вага дакумента амаль заўсёды залежыць ад убудаваных малюнкаў.
Няма рахунку, і нічога не захоўваецца: загружаныя файлы выдаляюцца з worker- аў пасля заканчэння заданняў, нічога не чытаецца і не індэксуецца. Вольныя рахункі існуюць для гісторыі і памеру партыі, а не для доступу.

Ацаніце гэты інструмент
5.0/5 - 0 галасоў
С. 6-7 - 800+ даменных пашырэнняў. Знайдзіце сваё ідэальнае імя.
Або перакіньце сюды свае файлы