1Ladda upp den skannade PDF documents; en ren 300 DPI gråskala scan ger igenkänningen mest att arbeta med.
2Berätta vilket språk man kan förvänta sig — att namnge språket är bättre än att låta det gissa med bred marginal.
3Kör igenkänningspasset; orden skrivs tillbaka som ett osynligt lager som sitter över den ursprungliga sidbilden.
4Ladda ner filen PDF — den ser identisk ut, men du kan nu söka och välja texten i den.
OCR PDF Vanliga frågor
Påverkar källformatet igenkänning?
+
Det gör det. PDF fixar sidan: teckensnitt, vektorer, rasterbilder och textkoordinater fryses så att varje läsare ser identisk layout. Hur sidan lagras avgör vilken upplösning och färginformation som kännaren måste arbeta med.
Något specifikt till PDF här?
+
Yes — en PDF är en objektgraf, inte en sidbild, så text förblir valbar och vektorer förblir skarpa oavsett vad som händer med rasterinnehållet inuti den. It affects what the recogniser can see.
Hur exakt är den?
+
På en ren 300 DPI scan av tryckt text, tillräckligt hög att fel är sällsynta och mestadels i ovanliga riktiga substantiv. Noggrannhet faller kraftigt med låg upplösning, skev, skuggor från en telefonkamera, ovanliga typsnitt och handstil — särskilt handstil är inte vad detta är till för.
Hur förvandlar OCR PDF en skanning till text?
+
Konkret, varje sida återges, körs genom en Tesseract text erkännande passera på över 100 språk, och de erkända orden skrivs tillbaka som en osynlig text lager placerad över den ursprungliga bilden - så sidan ser oförändrad men är sökbar och valbar. Sidan ser fortfarande exakt ut som den gjorde — den erkända texten sitter osynligt bakom bilden så sök och urval fungerar utan att ändra utseendet.
Can I run OCR PDF on several PDF documents at once?
+
Ja — ladda upp uppsättningen och de behandlar parallellt under en uppsättning inställningar, vilket är poängen med att göra ett dokument arbetsflöde här snarare än att klicka genom en skrivbordsläsare.
Överlever bokmärken, länkar och formulärfält?
+
Outlines, interna länkar och anteckningar bevaras varhelst åtgärden tillåter det. Digitala signaturer är undantag: varje ändring i filen nödvändigtvis upphäver en signatur, eftersom det är just det en signatur är till för.
Finns det en filstorleksgräns på OCR PDF?
+
Ja: gratis konton processa dokument upp till 5 MB varje, som täcker de flesta rapporter och kontrakt men inte en lång skannad dokument vid 600 DPI; Ghostscript och qpdf gör arbetet. Skannade PDF-filer är det vanliga som överskrider det, och komprimera dokumentet först är normalt nog att föra det tillbaka under.
Kommer OCR PDF sänka kvaliteten på min PDF documents?
+
Text- och vektorkonst är objekt snarare än bildpunkter, så de är helt skarpa vid alla zoombilder oavsett vad som händer. Endast de inbäddade rasterbilderna kan brytas ned, och endast om operationen du valde återprovger dem.
Varför en Word webbplats värd OCR PDF?
+
WORD.to byggs runt den redigerbara änden av ett dokuments liv — DOCX som fortfarande skrivs, fortfarande är stylat och fortfarande argumenteras över, innan någon plattar till det för att skicka. Kontorsfiler är behållare fulla av andra människors media — bilder, inbäddat ljud, teckensnitt — så det arbete människor behöver på dem är vanligtvis det arbete de skulle behöva på dessa innehåll ändå. OCR PDF delar uppladdning, kapsyler och kontot med omvandlingar av den anledningen.
Vad ska jag göra med resultatet när OCR PDF är klar?
+
Konverteraren på denna webbplats tar dokument ut till PDF för att skicka, till bilder för inbäddning och till vanlig text för allt som måste läsa dem programmatiskt, och tillbaka åt andra hållet. Att göra det efteråt håller redigeringsbart original runt, vilket är den del du inte kan få tillbaka när det har plattats till.
Är OCR PDF här samma verktyg som syskonplatserna kör?
+
Motorerna delas — samma dokument verktygskedja, samma arbetare, samma gränser. Vad en Word webbplats lägger till är en vy på vad som överlever att lämna Office-formatet och vad som inte gör det, vilket är frågan alla dessa jobb faktiskt slår på. Det börjar också från ett faktum om formatet denna webbplats är uppkallad efter: dokumentet är en zip av XML, så textredigeringar är billiga och vikten är nästan alltid inbäddade bilder.
Behöver jag ett konto och får nåt behållas?
+
Inget konto, och ingenting sparas: uppladdningar raderas från arbetarna kort efter jobbets slut, ingenting läses och ingenting indexeras. Gratis konton finns för historik och batchstorlek, inte för åtkomst.