Công cụ PDF / 11
PDF được quét sang văn bản (OCR)
Đọc văn bản từ PDF được quét không có văn bản có thể chọn, theo từng trang và hoàn toàn trong trình duyệt.
PDF được quét sang văn bản (OCR): TOEA kết xuất từng trang thành hình ảnh, chạy nhận dạng ký tự quang học trên mỗi trang và gắn nhãn kết quả theo trang để bạn biết từng phần xuất phát từ đâu. Chạy 100% cục bộ trong trình duyệt của bạn, không có tệp nào được tải lên máy chủ.
- Danh mục
- Công cụ PDF
- Lượt chạy
- Trong trình duyệt của bạn
- Chi phí
- Miễn phí · không cần đăng ký
- Trạng thái khả dụng
- Sẵn sàng sử dụng
Chạy hoàn toàn trong trình duyệt của bạn
PDF · tối đa 30 MB, không được tải lên
Có kết quả đọc rõ hơn
Mỗi trang được kết xuất ở 200 DPI trước khi đọc, nên giới hạn nằm ở chính bản quét. Văn bản nội dung được quét ở 300 DPI thường cho kết quả tốt; ảnh chụp một trang bằng điện thoại ở góc nghiêng hoặc bản quét chất lượng fax với chữ nhỏ sẽ tạo ra nhiều phỏng đoán. Các trang bị xoay ngang hoặc lộn ngược cho kết quả đọc rất kém, vì vậy hãy xoay chúng thẳng đứng bằng xoay PDF trước khi nhận dạng.
Hãy chọn ngôn ngữ được sử dụng trong tài liệu, vì mỗi ngôn ngữ có một mô hình riêng. Tiếng Trung có mô hình Giản thể và Phồn thể; chọn sai mô hình sẽ làm giảm đáng kể độ chính xác. Tài liệu trộn hai ngôn ngữ cho kết quả tốt nhất khi dùng mô hình của ngôn ngữ chiếm phần lớn văn bản.
Kiểm tra kết quả nhận được
Chỉ số độ tin cậy là mức trung bình trên tất cả các trang, nên một trang kém có thể bị che khuất trong một điểm số tốt. Khoảng 90 trở lên thường có nghĩa là chỉ thỉnh thoảng xảy ra lỗi; dưới 75, hãy dự đoán lỗi trong phần lớn các đoạn văn. Những nhầm lẫn thường gặp là 0 và O, 1, l và I, rn bị đọc thành m, và 5 thành S; điều này đặc biệt quan trọng với số tiền, ngày tháng và số tham chiếu, vì vậy hãy đối chiếu mọi con số với trang gốc.
Hãy bật tùy chọn Gộp các dòng thành đoạn cho văn xuôi, nơi tùy chọn này nối lại các câu bị ngắt ở cuối mỗi dòng in. Hãy tắt tùy chọn này cho địa chỉ, danh sách và bảng, vì ngắt dòng mang ý nghĩa.
Cách sử dụng
- Chọn một PDF được quét.
- Chọn ngôn ngữ của văn bản.
- Đọc kết quả, rồi sao chép hoặc tải xuống.
Quyền riêng tư và giới hạn
Tệp của bạn không bao giờ được tải lên. Công cụ nhận dạng và mô hình ngôn ngữ được tải xuống một lần — khoảng 10 MB — rồi được lưu vào bộ nhớ đệm của trình duyệt; sau đó mọi thứ chạy trên chính máy của bạn. Các dịch vụ OCR được lưu trữ hoạt động theo cách ngược lại: chúng yêu cầu tài liệu của bạn. Tài liệu dài sẽ mất một lúc, vì từng trang phải được kết xuất rồi đọc lần lượt.
Công cụ liên quan
Câu hỏi thường gặp
Khi nào tôi cần dùng công cụ này thay vì PDF sang văn bản?
Trước tiên, hãy dùng PDF sang văn bản — công cụ đó cho kết quả tức thì và chính xác khi tài liệu có văn bản thực bên trong. Công cụ này dành cho trường hợp kết quả trả về không có gì, nghĩa là các trang trong tài liệu là ảnh chụp.
Tại sao công cụ chạy chậm?
Mỗi trang được kết xuất thành hình ảnh rồi đọc từng ký tự một. Một vài trang sẽ được xử lý nhanh; bản quét dài một trăm trang sẽ mất nhiều thời gian và bạn phải giữ tab mở.
Công cụ có giữ nguyên bố cục không?
Không. Các cột, bảng và tiêu đề được xuất thành những dòng văn bản thuần theo thứ tự đọc, vì vậy một trang phức tạp sẽ cần được chỉnh sửa lại.
Công cụ có thể làm cho PDF có thể tìm kiếm không?
Không — việc đó cần ghi thêm một lớp văn bản ẩn vào tệp. Công cụ này cung cấp văn bản để bạn sử dụng ở nơi khác.
Công cụ miễn phí · trong trình duyệt của bạn lượt chạy · không cần tài khoản