1Laden Sie den gescannten PDF documents hoch; ein sauberer 300 DPI Graustufen-Scan gibt dem Erkennungsgerät das meiste, mit dem zu arbeiten ist.
2Sag ihm, welche Sprache zu erwarten ist — die Bezeichnung der Sprache schlägt, indem sie sie mit einem breiten Rand raten lässt.
3Führen Sie den Erkennungspass aus; die Wörter werden als unsichtbare Ebene über dem Originalbild zurückgeschrieben.
4Laden Sie die durchsuchbare PDF Datei herunter — sie sieht identisch aus, aber Sie können jetzt den Text darin suchen und auswählen.
OCR-PDF Häufig gestellte Fragen
Beeinflusst das Quellformat die Erkennung?
+
Es tut es. PDF behebt die Seite: Schriftarten, Vektoren, Rasterbilder und Textkoordinaten werden eingefroren, so dass jeder Leser identisches Layout sieht. Wie die Seite gespeichert wird, entscheidet, mit welcher Auflösung und Farbinformation der Reknowler arbeiten muss.
Irgendetwas Besonderes an PDF hier?
+
Ja, ein PDF ist ein Objektgraph, kein Seitenbild, also bleibt Text wählbar und Vektoren bleiben scharf, egal was mit dem Rasterinhalt darin geschieht. Es wirkt sich auf das aus, was der Erkenner sehen kann.
Wie genau ist es?
+
Auf einem sauberen 300 DPI Scan gedruckten Textes, hoch genug, dass Fehler selten und meist in ungewöhnlichen richtigen Substantiven sind. Genauigkeit fällt mit geringer Auflösung, Skew, Schatten von einer Telefonkamera, ungewöhnliche Schriften und Handschriften stark ab — insbesondere Handschrift ist nicht das, wofür dies ist.
Wie wird OCR PDF ein Scan in Text verwandelt?
+
Konkret jede Seite wird gerendert, läuft durch einen Tesseract Text-Erkennung übergeben in über 100 Sprachen, und die erkannten Wörter werden als unsichtbare Textebene über dem Originalbild positioniert zurückgeschrieben — so sieht die Seite unverändert aus, ist aber durchsuchbar und wählbar. Die Seite sieht immer noch genau so aus wie sie es tat — der anerkannte Text sitzt unsichtbar hinter dem Bild, so dass Suche und Auswahl ohne Änderung des Aussehens funktionieren.
Kann ich OCR PDF auf mehreren PDF documents gleichzeitig laufen?
+
Ja — Laden Sie den Satz hoch und sie verarbeiten parallel unter einer Reihe von Einstellungen, was der Punkt ist, einen Dokumenten-Workflow hier zu tun, anstatt über einen Desktop-Reader zu klicken.
Überleben Lesezeichen, Links und Formularfelder?
+
Es werden alle Zeilen, interne Links und Anmerkungen erhalten, wo immer dies möglich ist. Digitale Signaturen sind die Ausnahme: jede Änderung der Datei entwertet zwangsläufig eine Signatur, denn genau dafür ist eine Signatur.
Gibt es eine Dateigröße auf OCR PDF?
+
Ja: Kostenlose Konten bearbeiten Dokumente bis 5 MB, die die meisten Berichte und Verträge abdecken, aber kein lange gescanntes Dokument bei 600 DPI; Ghostscript und qpdf erledigen die Arbeit. Gescannte PDFs sind das Übliche, was sie übersteigt, und das Komprimieren des Dokuments reicht normalerweise aus, um es wieder unterzubringen.
Wird OCR PDF die Qualität meiner PDF documents senken?
+
Text und Vektorgrafik sind Objekte statt Pixel, so dass sie bei jedem Zoom perfekt scharf bleiben, egal was passiert. Nur die eingebetteten Rasterbilder können abwerten, und nur wenn die Operation sie neu ausprobiert.
Warum ist ein Word Site Host OCR PDF?
+
WORD.to ist um das editierbare Ende des Lebens eines Dokuments herum gebaut — der DOCX, der noch geschrieben wird, noch gestylt wird und immer noch über die Diskussion gestritten wird, bevor es jemand zum Senden flacht. Office-Dateien sind Container voller Medien anderer Menschen – Bilder, eingebettete Audio-, Schriftarten – also ist die Arbeit, die die Menschen brauchen, in der Regel die Arbeit, die sie auf diesen Inhalten sowieso benötigen würden. OCR PDF teilt den Upload, die Caps und das Konto mit den Konvertierungen aus diesem Grund.
Was soll ich mit dem Ergebnis machen, wenn OCR PDF fertig ist?
+
Der Konverter auf dieser Seite führt Dokumente zum Senden in PDF, zu Bildern zum Einbetten und zum Klartext für alles, was sie programmatisch lesen muss, und umgekehrt. Dass danach das editierbare Original herumhält, das ist der Teil, den man nicht zurückbekommen kann, sobald es abgeflacht wurde.
Ist OCR PDF hier das gleiche Werkzeug, das die Geschwisterseiten laufen?
+
Die Motoren werden geteilt — die gleiche Dokument-Toolchain, die gleichen Arbeiter, die gleichen Grenzen. Was eine Word Website hinzufügt, ist eine Ansicht darüber, was überlebt, das Office-Format zu verlassen und was nicht, die Frage ist, jeder dieser Jobs tatsächlich eingeschaltet wird. Es beginnt auch mit einer Tatsache über das Format, nach dem diese Website benannt ist: das Dokument ist ein Zip von XML, so dass Textbearbeitungen billig sind und das Gewicht fast immer die eingebetteten Bilder ist.
Brauche ich ein Konto und wird irgendetwas aufbewahrt?
+
Kein Konto, und nichts wird gehalten: Uploads werden von den Arbeitern kurz nach dem Job gelöscht, nichts wird gelesen und nichts wird indiziert. Kostenlose Konten für Geschichte und Batch-Größe, nicht für den Zugriff.
Laden und konvertieren Sie mehrere Dateien auf einmal mit einem Pro-Plan. Sparen Sie Zeit - keine Notwendigkeit, sie eins nach dem anderen zu verarbeiten.