1Բեռնել սկանավորված PDF documents-ը։ 300 DPI սևի և սպիտակի շերտերի սկանավորումը ճանաչողին տալիս է առավելագույն հնարավորություններ աշխատանքի համար։
2Ընդունելություն անգլերեն լեզվով (անգլ.՝ Acceptance of English as a Foreign Language)՝ անգլերեն լեզվի ընդունելության ընթացակարգը։
3Օգտագործել ճանաչման անցումը։ Բառերը գրվում են որպես անտեսանելի շերտ, որը տեղադրված է սկզբնական էջում։
4Բեռնել որոնման համար նախատեսված PDF ֆայլը. այն նույնն է, բայց դուք կարող եք փնտրել և ընտրել դրա մեջ գտնվող տեքստերը։
PDF OCR Հաճախակի տրվող հարցեր
Արդյո՞ք սկզբնական ձևաչափը ազդում է ճանաչման վրա։
+
Այն անում է դա։ PDF- ը էջը ճշգրտում է. տառատեսակներ, վեկտորներ, ռաստեր պատկերներ և տեքստի կոորդինատներ կանգ են առնում, որպեսզի յուրաքանչյուր կարդացող տեսնի նույնական դասավորությունը. Էջը պահպանելու ձևը որոշում է, թե որ ճանաչողական սարքը պետք է աշխատի որ ճանաչողական և գույնի տվյալների հետ։
Ո՞րևէ բան, որ հատուկ է PDF-ին:
+
Այո - PDF-ը օբյեկտային գրաֆիկ է, ոչ թե էջերի պատկեր, այնպես որ տեքստը մնում է ընտրելի և վեկտորները մնում են հստակ՝ անկախ նրանից, թե ինչ է պատահում ներսում գտնվող ռեզերային բովանդակությանը. Դա ազդում է այն բանի վրա, թե ինչ կարող է տեսնել ճանաչողը:
Ինչքանո՞վ է ճշգրիտ այն։
+
Տպված տեքստի 300 DPI- ի մաքուր սկանավորման դեպքում, այնքան բարձր, որ սխալները հազվադեպ են և հիմնականում անսովոր սեփական անունների դեպքում։ Պարզությունը զգալիորեն նվազում է ցածր ճանաչողականության, սխալների, հեռախոսի տեսախցիկի տակ եղած մոխրագույնի, անսովոր տառատեսակների և ձեռքի գրության դեպքում, հատկապես ձեռքի գրության դեպքում, այս գործիքը չի աշխատում։
Ինչպե՞ս է OCR PDF-ը սկանը փոխակերպում տեքստի։
+
Հիմնականում, յուրաքանչյուր էջը ցուցադրվում է, անցնում է Tesseract-ի տեքստի ճանաչման գործընթացը 100-ից ավելի լեզուներով, և ճանաչված բառերը գրվում են որպես անտեսանելի տեքստի շերտ, որը տեղադրվում է սկզբնական պատկերի վրա, այսպիսով էջը չի փոխվում, բայց կարող է որոնվել և ընտրվել. էջը դեռևս այնպիսին է, ինչպիսին եղել է՝ ճանաչված տեքստը՝ պատկերի հետևում, այնպես որ որոնումը և ընտրությունը կատարվում են առանց տեսքը փոխելու։
Կարո՞ղ եմ միաժամանակ մի քանի PDF documents համակարգիչների վրա ընթացիկ պահել OCR PDF-ը։
+
Այո, բարձրացրեք հավաքածուն և այն կկատարվի զուգահեռորեն, միևնույն ռեժիմով, ինչը փաստաթղթի աշխատանքային հոսքի նպատակն է, այլ ոչ թե աշխատասեղանի կարդացողի միջոցով սեղմելու նպատակը։
Արդյո՞ք պահպանվում են էջերի ցուցադրման վայրերը, հղումները և ձևի դաշտերը։
+
Կառույցները, ներքին հղումները և ակնարկները պահպանվում են այնտեղ, որտեղ ընթացքը թույլ է տալիս դրանք։ Առցանց ստորագրությունները բացառություն են՝ ֆայլի ցանկացած փոփոխությունը անպայման անօրինականացնում է ստորագրությունը, քանի որ ստորագրությունը հենց դրա համար է։
Արդյո՞ք OCR PDF-ում ցուցադրվում է ֆայլի չափի սահմանափակում
+
Այո: ազատ հաշիվները կարող են յուրաքանչյուրը մինչև 5 MB փաստաթղթերի ընթացք տալ, ինչը ներառում է զեկույցների և պայմանագրերի մեծամասնությունը, բայց ոչ երկար 600 DPI-ով սկանավորված փաստաթղթերը։ Ghostscript-ն ու qpdf-ը կատարում են աշխատանքը. Սկանավորված PDF-ները սովորաբար գերազանցում են այս ցուցակը, և փաստաթղթի նախնական ճնշումը սովորաբար բավարար է այն վերադարձնելու համար:
Արդյոք OCR PDF-ը կնվազեցնի իմ PDF documents-ի որակը։
+
Ձեռագրերը և վեկտորային նկարները օբյեկտներ են, ոչ թե կետեր, այնպես որ դրանք մնում են ամբողջությամբ ճշգրիտ ցանկացած մեծացման դեպքում, անկախ նրանից, թե ինչ է կատարվում։ Միայն ներկառուցված ռաստերային պատկերները կարող են նվազել, և միայն եթե ձեր ընտրած գործողությունը վերամշակում է դրանք։
Ինչո՞ւ է Word կայքը ապահովում OCR PDF?
+
WORD.to-ը կառուցված է փաստաթղթի կյանքի խմբագրելի վերջի շուրջ՝ DOCX-ը, որը դեռ գրվում է, դեռ ձևավորվում է և դեռ քննարկվում է, մինչև որևէ մեկը այն փաթաթում է ուղարկելու համար. Office ֆայլերը լի են այլ մարդկանց մամուլի նյութերով՝ պատկերներ, ներկառուցված ձայն, տառատեսակներ, այնպես որ մարդկանց անհրաժեշտ աշխատանքը դրանց վրա սովորաբար այն աշխատանքն է, որը նրանք պետք է կատարեն այդ բովանդակության վրա։ OCR PDF կիսում է վերբեռնումը, փակագծերը և հաշիվը փոխակերպումների հետ այդ պատճառով։
Ի՞նչ պետք է անեմ արդյունքի հետ, երբ OCR PDF-ը ավարտվել է։
+
Այս կայքի փոխակերպիչը փաստաթղթերը PDF ձևաչափով է արտահանում ուղարկելու համար, պատկերներ՝ ներառելու համար և պարզ տեքստ՝ այն ամենի համար, ինչը պետք է կարդալ ծրագրային կերպով, և հակառակը։ Այս գործողությունը պահպանում է խմբագրելի սկզբնական պատկերը, որը այն մասն է, որը դուք չեք կարող վերադարձնել, երբ այն մաքրել եք։
Արդյո՞ք OCR PDF-ում նույն գործիքն է, ինչ որ սերնդակից կայքերում։
+
Դիժեներները նույնական են` նույն փաստաթղթի գործիքային խումբը, նույն աշխատողները, նույն սահմանափակումները։ Word կայքը ավելացնում է տեսանկյուն Office ձևաչափից դուրս գալու և ինչ- որ բանի չկատարելու մասին, որը հարց է, որ այս աշխատանքներից յուրաքանչյուրը իրականում ներբեռնում է։ Այն նաև սկսվում է մի փաստից, որը վերաբերում է ձևաչափին, որի անունով է այս կայքը կոչվում: փաստաթուղթը XML-ի zip-ի է նման, այնպես որ տեքստը խմբագրելը շատ էժան է, իսկ ծանրությունը գրեթե միշտ ներառված պատկերներն են
Ես հաշիվ ունեմ, և ինչ-որ բան պահվում է։
+
Ոչ մի հաշիվ, և ոչինչ չի պահվում: վերբեռնումները հեռացվում են աշխատողներից աշխատանքի ավարտից անմիջապես հետո, ոչինչ չի կարդացվում և ոչինչ չի ինդեքսավորվում: Ազատ հաշիվներ կան պատմության և խմբի չափի համար, ոչ թե մուտք գործելու համար: