Công cụ tệp / 05

Công cụ phát hiện mã hóa văn bản

Kiểm tra dấu BOM, khả năng tương thích với ASCII và tính hợp lệ nghiêm ngặt của UTF-8 trong một mẫu tệp cục bộ.

Công cụ phát hiện mã hóa văn bản: TOEA phát hiện dấu thứ tự byte UTF-8 và UTF-16, ASCII thuần túy cùng UTF-8 hợp lệ nghiêm ngặt; các byte khác sẽ nhận kết quả thận trọng là không xác định/kế thừa. Chạy 100% cục bộ trong trình duyệt của bạn, không có tệp nào được tải lên máy chủ.

Lượt chạy
Trong trình duyệt của bạn
Chi phí
Miễn phí · không cần đăng ký
Trạng thái khả dụng
Sẵn sàng sử dụng
Text encoding detectorXử lý cục bộ

Chạy hoàn toàn trong trình duyệt của bạn

Khi kết quả là bảng mã cũ hoặc không xác định

Văn bản không hợp lệ theo UTF-8 thường nhất là văn bản dùng một bảng mã đơn byte cũ. Với văn bản Tây Âu, đó thường là Windows-1252 hoặc ISO-8859-1. Hãy chuyển đổi một lần rồi dùng UTF-8 từ đó về sau: iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt trên Linux hoặc macOS, hoặc mở tệp trong trình chỉnh sửa cho phép chọn bảng mã rồi lưu dưới dạng UTF-8. Công cụ chỉ kiểm tra 1 MB đầu tiên, vì vậy một tệp lớn có megabyte đầu tiên chỉ gồm ASCII vẫn có thể chứa văn bản không phải ASCII ở phần sau.

Dấu thứ tự byte và UTF-16

Dấu thứ tự byte UTF-8 (EF BB BF) giúp Excel mở CSV có dấu chính xác, nhưng lại gây lỗi cho những thành phần khác: dòng #! của tập lệnh shell, đầu ra PHP được gửi trước header và tên cột đầu tiên của CSV khi được mã đọc nhưng không loại bỏ dấu này. Tệp UTF-16 thường xuất phát từ Windows, chẳng hạn từ chuyển hướng > của Windows PowerShell 5.1. Nhiều công cụ Unix đọc chúng như văn bản đầy các byte null.

Cách sử dụng

  1. Chọn một tệp dạng văn bản có dung lượng tối đa 50 MB.
  2. Kiểm tra cục bộ 1 MB đầu tiên.
  3. Xem mã hóa và nhãn độ tin cậy.

Quyền riêng tư và giới hạn

Tệp vẫn ở trên thiết bị của bạn. Việc phát hiện mã hóa không có BOM dựa trên heuristic và không phải lúc nào cũng phân biệt được các bộ ký tự kế thừa.

Công cụ liên quan

Câu hỏi thường gặp

Vì sao ASCII được gọi là tương thích với UTF-8?

Các byte ASCII sử dụng cùng giá trị trong UTF-8, nên dữ liệu ASCII hợp lệ cũng được giải mã như UTF-8.

Công cụ có thể xác định mọi mã hóa kế thừa không?

Không. Nhiều mã hóa một byte có thể không phân biệt được nếu thiếu ngữ cảnh ngôn ngữ.

Công cụ miễn phí · trong trình duyệt của bạn lượt chạy · không cần tài khoản