1Wyślij skanowany PDF documents; czysty skan od szarego kąta 300 DPI daje rozpoznawcy najwięcej do pracy.
2Powiedz, który język można oczekiwać — nazwa języka to lepsze niż to, by zgadnąć o szerokim stopniu.
3Uruchom przepustkę rozpoznawania; słowa są zapisane jako niewidzialna warstwa siedząca nad oryginalnym obrazem strony.
4Pobierz plik wyszukiwalny PDF — wygląda identyczny, ale teraz możesz wyszukać i wybrać tekst w nim.
OCR PDF Często zadawane pytania
Czy format źródła wpływa na rozpoznanie?
+
Tak jest. PDF poprawia stronę: czcionki, wektory, rastrowe obrazy i współrzędne tekstu są zamrożone, tak aby każdy czytelnik widział identyczny układ. Jak przechowywana jest strona decyduje, z jakiej rozdzielczością i kolorem musi pracować rozpoznawca.
Coś konkretnego do PDF?
+
Tak – a PDF to wykres obiektu, a nie obraz strony, więc tekst pozostaje wybrany i wektory pozostają ostre, bez względu na to, co się stanie z zawartością rasteru wewnątrz. To wpływa na to, co widzi rozpoznawca.
Jak dokładnie?
+
Na czystym skanowaniu 300 DPI drukowanego tekstu, wystarczająco wysokim, że błędy są rzadkie i głównie w niezwykłych właściwych jęcześciach. Dokładność odpada ostrie z niską rozdzielczością, ścierpieniem, cieniami z kamery telefonicznej, niezwykłymi liczbami i pisaniem — nie jest to w szczególności to, do czego służy pisanie.
Jak OCR PDF przekształca skan w tekst?
+
Konkretnie, Każda strona jest wyświetlana, przebiega przez przepustkę Tesseract tekstu rozpoznawania w ponad 100 językach, a uznane słowa są napisane z powrotem jako niewidzialna warstwa tekstu umieszczona nad oryginalnym obrazem – więc strona wygląda niezmieniona, ale jest wyszukiwana i wybierana. Strona wciąż wygląda dokładnie tak, jak to zrobiła – rozpoznany tekst siedzi niewidzialnie za obrazem, więc wyszukiwanie i selekcja pracy bez zmiany wyglądu.
Can I run OCR PDF on several PDF documents at once?
+
Tak — wysyłanie zestawu i przetwarzanie równoległe pod jednym zestawem ustawień, co jest punktem wykonywania dokumentu przepływu pracy tutaj zamiast kliknięcia przez czytacz pulpitu.
Czy zakładki, linki i formy przetrwają?
+
Określenia, wewnętrzne linki i anotacje są zachowane wszędzie, gdzie to pozwala na operację. Podpisy cyfrowe są wyjątkiem: każda zmiana pliku musi koniecznie unieważnić podpis, ponieważ właśnie to jest podpis.
Is there a file size limit on OCR PDF?
+
Tak: bezpłatne konta przetwarzają dokumenty do 5 MB każde, które obejmują większość raportów i kontraktów, ale nie długi dokument skanowany w 600 DPI; Ghostscript i qpdf wykonywają pracę. Skanowane PDF są zwykłą rzeczą, która przewyższa go, a ścisnięcie dokumentu najpierw jest zwykle wystarczające, aby go ponownie podnieść.
Czy OCR PDF obniżyć jakość mojego PDF documents?
+
Tekst i wektorowe grafiki to obiekty zamiast pikseli, więc pozostają one idealnie ostre w każdym powiększeniu, bez względu na to co się stanie. Tylko wbudowane obrazy rasterowe mogą zniższyć, i tylko jeśli operacja, którą wybrałeś, je przeprodukuje.
Dlaczego serwer Word jest serwerem OCR PDF?
+
WORD.to jest zbudowane wokół edytowanego końca życia dokumentu – DOCX, który jest jeszcze napisane, jest wciąż stylowany i wciąż kłóci się, zanim ktoś zginie do wysłania. Pliki biurowe są pojemniki pełne mediów innych ludzi — obrazy, wbudowane dźwięki, czcionki — więc praca, której ludzie potrzebują, to zazwyczaj praca, której potrzebują na tej zawartości. OCR PDF dzieli się z tego powodu przesyłką, czapkami i konwersjami.
Co mam zrobić z wynikiem po skończeniu OCR PDF?
+
Konwerter na tej stronie przenosi dokumenty do PDF do wysyłki, do obrazów do wbudowania i do zwykłego tekstu dla wszystkiego, co musi je czytać programematycznie, a w inny sposób. Robiąc to później trzyma się w pobliżu oryginału edycyjnego, który jest częścią, którą nie można wrócić po złamaniu.
Czy OCR PDF jest to samo narzędzie, które prowadzi się przez rodzynnych stron?
+
Silniki są udostępniane – to samo narzędzie dokumentowe, te same pracownicy, te same granice. Co dodaje strona Word widok na to, co przetrwa opuszczanie formatu Office a co nie, co jest pytanie każde z tych miejsc pracy rzeczywiście włącza. Zaczyna się również od jednego faktu o formatie tej strony nazwany jest po: dokument jest zip XML, więc edycje tekstu są tanie i waga jest prawie zawsze wbudowane obrazy.
Potrzebuję konta i czy coś się zachowuje?
+
Nie ma konta i nic nie jest przechowywane: przesyłki są usuwane z pracowników wkrótce po zakończeniu pracy, nic nie jest czytane i nic nie jest indeksowane. Istnieją bezpłatne konta dla historii i rozmiaru partii, a nie dla dostępu.