1Sube el PDF documents escaneado; un escaneo de escala de grises limpio de 300 DPI le da al reconocidor el máximo con el que trabajar.
2Dile qué idioma esperar — nombrar el idioma late dejando que adivine por un amplio margen.
3Ejecute el pase de reconocimiento; las palabras se escriben de nuevo como una capa invisible sentada sobre la imagen original de la página.
4Descargue el archivo PDF que puede buscarse, pero ahora puede buscar y seleccionar el texto que contiene.
PDF con reconocimiento óptico de caracteres Preguntas frecuentes
¿El formato de origen afecta el reconocimiento?
+
Lo hace. PDF corrige la página: fuentes, vectores, imágenes de raster y coordenadas de texto se congelan para que cada lector vea la distribución idéntica. Cómo se almacena la página decide con qué resolución y color tiene que trabajar el reconocidor.
¿Algo específico para PDF aquí?
+
Sí — un PDF es un gráfico de objetos, no una imagen de página, por lo que el texto permanece seleccionable y los vectores permanecen en forma aguda sin importar lo que pase con el contenido de raster dentro de él. Afecta lo que el reconocidor puede ver.
¿Qué tan exacto es?
+
En un escaneo limpio de 300 DPI de texto impreso, lo suficientemente alto como para que los errores sean raros y sobre todo en sustantivos apropiados inusuales. La precisión se desconecta bruscamente con baja resolución, sesgo, sombras de una cámara telefónica, tipografías inusuales y escritura a mano — la escritura a mano en particular no es para lo que esto es.
¿Cómo OCR PDF convierte un escaneo en texto?
+
Concretamente, cada página se representa, se ejecuta a través de un pase de reconocimiento de texto Tesseract en más de 100 idiomas, y las palabras reconocidas se escriben de nuevo como una capa de texto invisible posicionada sobre la imagen original — por lo que la página se ve sin cambios pero es buscable y seleccionable. La página todavía se ve exactamente como lo hizo — el texto reconocido se encuentra invisiblemente detrás de la imagen así que la búsqueda y selección de trabajo sin cambiar la apariencia.
¿Puedo ejecutar OCR PDF en varios PDF documents a la vez?
+
Sí — subir el conjunto y procesar en paralelo bajo un conjunto de ajustes, que es el punto de hacer un flujo de trabajo de documentos aquí en lugar de hacer clic a través de un lector de escritorio.
¿Sobreviven marcadores, enlaces y campos de forma?
+
Los esquejes, los enlaces internos y las anotaciones se conservan donde la operación lo permita. Las firmas digitales son la excepción: cualquier cambio en el archivo invalida necesariamente una firma, porque para eso es precisamente una firma.
¿Hay un límite de tamaño de archivo en OCR PDF?
+
Sí: cuentas libres procesan documentos hasta 5 MB cada uno, que cubre la mayoría de los informes y contratos, pero no un documento escaneado largo en 600 DPI; Ghostscript y qpdf hacen el trabajo. Los PDF escaneados son lo habitual que lo supera, y comprimir el documento primero es normalmente suficiente para traerlo de vuelta debajo.
¿Bajará OCR PDF la calidad de mi PDF documents?
+
Texto y vector de arte son objetos en lugar de píxeles, por lo que permanecen perfectamente nítidos en cualquier zoom no importa lo que suceda. Sólo las imágenes de raster incrustadas pueden degradarse, y sólo si la operación que usted eligió los vuelve a muestrear.
¿Por qué un Word sitio host OCR PDF?
+
WORD.to se construye alrededor del final editable de la vida de un documento — el DOCX que todavía se está escribiendo, todavía se está diseñando y todavía se discute sobre, antes de que nadie lo aplana para enviar. Los archivos de Office son contenedores llenos de medios de comunicación de otras personas —imágenes, audio incrustado, fuentes— por lo que el trabajo que la gente necesita en ellos es generalmente el trabajo que necesitarían en esos contenidos de todos modos. OCR PDF comparte la carga, los topes y la cuenta con las conversiones por esa razón.
¿Qué debo hacer con el resultado una vez que OCR PDF esté terminado?
+
El convertidor de este sitio lleva documentos a PDF para enviar, a imágenes para incrustar y a texto plano para cualquier cosa que tenga que leerlos programáticamente, y volver al otro lado. Hacer eso después mantiene el original editable alrededor, que es la parte que no puedes recuperar una vez que ha sido aplanado.
Is OCR PDF here the same tool the sibling sites run?
+
Los motores son compartidos — la misma cadena de herramientas de documento, los mismos trabajadores, los mismos límites. Lo que un sitio Word añade es una vista sobre lo que sobrevive dejando el formato de Office y lo que no, que es la pregunta cada uno de estos trabajos realmente se enciende. También comienza de un hecho sobre el formato de este sitio se llama después: el documento es una zip de XML, por lo que las ediciones de texto son baratas y el peso es casi siempre las imágenes incrustadas.
¿Necesito una cuenta, y se guarda algo?
+
No hay cuenta, y nada se guarda: las cargas se eliminan de los trabajadores poco después de que el trabajo termina, nada se lee y nada se indexa. Existen cuentas gratuitas para el historial y el tamaño de lote, no para el acceso.