1Subir o digitalizado PDF documents; uma digitalização limpa 300 DPI escala de cinzas dá ao reconhecedor mais para trabalhar.
2Diga-lhe que linguagem esperar — nomear a língua bate deixando-a adivinhar por uma ampla margem.
3Execute o passe de reconhecimento; as palavras são escritas de volta como uma camada invisível sentado sobre a imagem da página original.
4Baixe o arquivo PDF pesquisado — parece idêntico, mas agora você pode pesquisar e selecionar o texto nele.
OCR PDF Perguntas frequentes
O formato de origem afeta o reconhecimento?
+
Ele faz. PDF corrige a página: fontes, vetores, imagens de raster e coordenadas de texto são congelados para que cada leitor veja um layout idêntico. Como a página é armazenada decide com que informação de resolução e cor o reconhecedor tem que trabalhar.
Alguma coisa específica para PDF aqui?
+
Sim — um PDF é um gráfico de objetos, não uma imagem de página, por isso o texto permanece selecionável e os vetores permanecem nítidos independentemente do que acontece com o conteúdo de raster dentro dele. Afecta o que o reconhecedor pode ver.
Quão precisa é?
+
Em uma digitalização limpa 300 PPP de texto impresso, o suficiente de alto que erros são raros e principalmente em nomes incomum adequados. A precisão cai bruscamente com baixa resolução, esmaga, sombras de uma câmera de telefone, caras incomum e escrita — em particular, a escrita de mão não é para isso.
Como OCR PDF transforma uma varredura em texto?
+
Concretamente, cada página é renderizada, passa por um texto de reconhecimento de Teseract em mais de 100 idiomas, e as palavras reconhecidas são escritas de volta como uma camada de texto invisível posicionada sobre a imagem original — assim a página parece inalterada, mas é pesquisable e selecionável. A página ainda parece exatamente como fez — o texto reconhecido fica visívelmente atrás da imagem, então a pesquisa e seleção funcionam sem alterar a aparência.
Posso correr OCR PDF em vários PDF documents de uma vez?
+
Sim — upload o set e eles processam em paralelo sob um conjunto de configurações, que é o ponto de fazer aqui um fluxo de trabalho de documento em vez de clicar através de um leitor de desktop.
Os marcadores, links e campos de formulário sobrevivem?
+
Contornos, links internos e anotação são preservados onde a operação lhe permite. As assinaturas digitais são a exceção: qualquer alteração ao arquivo invalida necessariamente uma assinatura, porque é precisamente para isso que uma assinatura é.
Existe um limite de tamanho do arquivo em OCR PDF?
+
Sim: documentos de processo de contas livres até 5 MB cada, que abrange a maioria dos relatórios e contratos, mas não um documento escaneado longo no 600 DPI; Ghostscript e qpdf fazem o trabalho. PDF escaneados são a coisa habitual que o excede, e comprimir o documento primeiro é normalmente suficiente para trazê-lo de volta.
Will OCR PDF lower the quality of my PDF documents?
+
Texto e arte vetorial são objetos em vez de pixels, por isso eles permanecem perfeitamente afiados em qualquer zoom não importa o que acontecer. Somente as imagens de raster incorporadas podem degradar, e apenas se a operação que você escolheu reamostrá-las.
Por que um Word host do site OCR PDF?
+
WORD.to é construído em torno do final editável da vida de um documento — o DOCX que ainda está sendo escrito, ainda sendo estilizado e ainda sendo discutido, antes que alguém o aplane para o envio. Os arquivos de escritório são contentores cheios de mídia de outras pessoas — imagens, áudio incorporado, fontes de letra — então o trabalho as pessoas precisam nelas é geralmente o trabalho que precisaria nesses conteúdos de qualquer forma. OCR PDF compartilha o upload, os caps e a conta com as conversões por esse motivo.
O que devo fazer com o resultado uma vez OCR PDF terminado?
+
O conversor deste site tira documentos para PDF para enviar, para imagens para incrustar e para texto simples para qualquer coisa que tem que le-los programáticamente, e para trás para o outro caminho. Fazendo isso depois mantém o original editável ao redor, que é a parte que você não pode voltar uma vez que foi aplanado.
OCR PDF é aqui a mesma ferramenta que os sites de irmãos funcionam?
+
Os motores são compartilhados — o mesmo documento toolchain, os mesmos trabalhadores, os mesmos limites. O que um Word site adiciona é uma visão sobre o que sobrevive deixa o formato do escritório e o que não, que é a questão cada um destes trabalhos realmente se activa. Ele também começa de um fato sobre o formato este site é nomeado depois: o documento é um zip do XML, então as editações de texto são baratas e o peso é quase sempre as imagens incorporadas.
Preciso de uma conta e alguma coisa fica guardada?
+
Sem conta, e nada é mantido: os uploads são excluídos dos trabalhadores pouco depois do trabalho terminado, nada é lido e nada é indexado. Contas gratuitas existem para história e tamanho do lote, não para acesso.