1Tải lên PDF documents đã quét; một bản quét màu xám 300 DPI sạch sẽ cho phép người nhận diện làm việc nhiều nhất.
2Nói cho nó biết ngôn ngữ nào để mong đợi — đặt tên ngôn ngữ đánh bại để nó đoán trước một khoảng cách rộng.
3Chạy quá trình nhận dạng; các từ được viết lại như một lớp vô hình nằm trên hình ảnh trang gốc.
4Tải về tập tin PDF có thể tìm kiếm — nó trông giống nhau, nhưng bây giờ bạn có thể tìm kiếm và chọn văn bản trong nó.
PDF OCR Câu hỏi thường gặp
Định dạng nguồn có ảnh hưởng đến việc nhận dạng không?
+
Nó có. PDF sửa trang: phông chữ, vector, hình ảnh raster và tọa độ văn bản được đóng băng để mọi người đọc thấy bảng bố trí giống nhau. Cách trang được lưu giữ quyết định độ phân giải và thông tin màu nào mà bộ nhận diện phải làm việc với.
Có gì đặc biệt về PDF ở đây không?
+
Đúng — PDF là đồ thị đối tượng, không phải là hình ảnh trang, vì vậy văn bản vẫn có thể chọn và vector vẫn sắc nét dù có gì xảy ra với nội dung raster bên trong nó. Nó ảnh hưởng đến những gì người nhận dạng có thể thấy.
Nó chính xác đến mức nào?
+
Trong một bản scan văn bản in sạch 300 DPI, độ cao đủ cao để lỗi hiếm và hầu hết là trong các danh từ chính bất thường. Độ chính xác giảm mạnh với độ phân giải thấp, lệch, bóng tối từ máy ảnh điện thoại, phông chữ bất thường và chữ viết tay — đặc biệt là chữ viết tay không phải là mục đích của nó.
Làm thế nào OCR PDF chuyển đổi một bản scan thành văn bản?
+
Concretely, mỗi trang được vẽ, chạy qua một Tesseract văn bản nhận dạng đi qua hơn 100 ngôn ngữ, và các từ được nhận ra được viết lại như một lớp văn bản vô hình đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
Tôi có thể chạy OCR PDF trên nhiều PDF documents cùng một lúc không?
+
Có — tải lên tập tin và chúng sẽ xử lý song song dưới một tập hợp các cài đặt, đó là điểm của việc làm một luồng tài liệu ở đây thay vì click qua một trình đọc desktop.
Đánh dấu, liên kết và các ô biểu mẫu có còn tồn tại không?
+
Các đường nét, liên kết nội bộ và ghi chú được giữ lại bất cứ khi nào thao tác cho phép. Chữ ký số là ngoại lệ: bất kỳ thay đổi nào vào tập tin đều làm hỏng chữ ký, vì đó chính xác là mục đích của chữ ký.
Có giới hạn kích thước tập tin trên OCR PDF không?
+
Có: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. PDF quét là thứ thường xuyên vượt quá nó, và nén tài liệu trước thường là đủ để mang nó trở lại dưới.
OCR PDF sẽ làm giảm chất lượng PDF documents của tôi không?
+
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo ở bất kỳ độ phóng to nào dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
Tại sao một trang Word lại có OCR PDF?
+
WORD.to được xây dựng xung quanh phần cuối có thể chỉnh sửa của một tài liệu - DOCX vẫn đang được viết, vẫn đang được kiểu dáng và vẫn đang được tranh luận, trước khi ai đó làm phẳng nó để gửi. Tập tin văn phòng là những thùng chứa đầy các phương tiện truyền thông của người khác - hình ảnh, âm thanh nhúng, phông chữ - vì vậy công việc người ta cần trên chúng thường là công việc họ cần trên những nội dung đó dù sao đi nữa. OCR PDF chia sẻ tải lên, các caps và tài khoản với các chuyển đổi vì lý do đó.
Tôi nên làm gì với kết quả khi OCR PDF hoàn thành?
+
Thiết bị chuyển đổi trên trang web này đưa tài liệu ra PDF để gửi, đến hình ảnh để nhúng và đến văn bản đơn giản cho bất kỳ điều gì phải đọc chúng theo chương trình, và ngược lại. Việc làm sau đó giữ nguyên bản có thể chỉnh sửa xung quanh, đó là phần bạn không thể lấy lại sau khi nó đã được phẳng.
Có phải OCR PDF ở đây là công cụ giống như các trang web chị em chạy?
+
Các động cơ được chia sẻ — cùng một chuỗi công cụ tài liệu, cùng một người làm việc, cùng một giới hạn. Những gì một Word trang web thêm vào là một cái nhìn về những gì tồn tại sau khi rời khỏi định dạng Office và những gì không, đó là câu hỏi mà mỗi một trong những công việc này thực sự bật lên. Nó cũng bắt đầu từ một sự thật về định dạng mà trang web này được đặt tên theo: tài liệu là một tập tin zip của XML, vì vậy việc sửa chữa văn bản là rẻ và trọng lượng gần như luôn luôn là hình ảnh được nhúng.
Tôi có cần một tài khoản không, và có gì được giữ không?
+
Không có tài khoản, và không gì được giữ: các tải lên sẽ bị xóa khỏi người làm việc ngay sau khi công việc kết thúc, không có gì được đọc và không có gì được chỉ mục. Các tài khoản miễn phí tồn tại cho lịch sử và kích thước gói, không cho truy cập.