Bàn mã hóa

Văn bản sang Hex

Mã hóa văn bản thành các byte UTF-8 viết hoa ở định dạng Hex cách nhau rõ ràng.

Văn bản sang Hex: Hiển thị các byte UTF-8 của một chuỗi văn bản dưới dạng các cặp số thập lục phân viết hoa, cách nhau bằng khoảng trắng. Văn bản sang Hex giúp bạn nhìn thấy khoảng trắng, ký tự xuống dòng và các ký tự nhiều byte. Hãy dùng công cụ này để so sánh văn bản đã sao chép hoặc chuẩn bị một ví dụ về mã hóa; chuỗi byte biểu diễn văn bản, không phải phép chuyển đổi cơ số số học. Chạy 100% cục bộ trong trình duyệt của bạn, không có tệp nào được tải lên máy chủ.

Lượt chạy
Trong trình duyệt của bạn
Chi phí
Miễn phí · không cần đăng ký
Trạng thái khả dụng
Sẵn sàng sử dụng
Text → Hex / môi trường làm việc cục bộXử lý cục bộ

Chạy hoàn toàn trong trình duyệt của bạn

Đầu vào 100,000 ký tự · đầu ra 400,000 ký tự

Kết quả

Sẵn sàng

Đầu ra là Hex UTF-8 viết hoa, có khoảng trắng giữa các byte. Văn bản được mã hóa cục bộ và không bao giờ được tải lên.

Quy tắc hiển thị byte với một ví dụ kết hợp

Trước tiên, mã hóa đầu vào thành các byte UTF-8 b_1 đến b_m, sau đó viết mỗi byte thành hai chữ số thập lục phân in hoa, với một khoảng trắng giữa các byte. Với m > 0, độ dài hiển thị = 2m + (m − 1) = 3m − 1. Đầu vào Aé có các byte 65, 195 và 169 ở dạng thập phân, cho 41 C3 A9. Với m = 3, phần hiển thị sử dụng 3×3 − 1 = 8 ký tự. A đóng góp một byte và é đóng góp hai byte; khoảng trắng giữa C3 và A9 là định dạng đầu ra, không phải khoảng trắng đầu vào. Mã hóa URL chuẩn bị văn bản cho các ngữ cảnh URL bằng các quy tắc thoát riêng.

Tính hợp lệ và dung lượng UTF-8

RFC 3629 (https://www.rfc-editor.org/rfc/rfc3629) ghi lại các chuỗi byte UTF-8. Một surrogate UTF-16 đứng riêng trong chuỗi đầu vào sẽ được thay thế trong quá trình mã hóa bằng U+FFFD, hiển thị là EF BF BD; điều này khác với các công cụ ký tự chỉ nhận scalar, vốn từ chối các giá trị surrogate. Văn bản được giới hạn ở 100.000 điểm mã, đồng thời trình soạn thảo cũng tính các đơn vị UTF-16 vào giới hạn 100.000 ký tự; nhiều emoji chiếm hai đơn vị trong số đó. Đầu ra hiển thị được giới hạn ở 400.000 ký tự, bao gồm cả khoảng trắng phân cách. Vì vậy, không phải mọi đầu vào không phải ASCII có độ dài tối đa đều phù hợp: mã hóa nhiều byte làm kết quả dài hơn. Hãy lưu văn bản nguồn và thử các phần nhỏ hơn khi đạt giới hạn đầu ra.

Cách sử dụng

  1. Nhập giá trị theo định dạng được minh họa bên dưới.
  2. Chạy quá trình chuyển đổi và đối chiếu kết quả với quy ước của dữ liệu nguồn.
  3. Sao chép hoặc tải xuống đầu ra theo định dạng mà nơi đích yêu cầu.

Quyền riêng tư và giới hạn

Quá trình chuyển đổi chạy trong trình duyệt của bạn. Giá trị và kết quả của bạn không được tải lên.

Công cụ liên quan

Câu hỏi thường gặp

Tại sao một chữ cái có dấu lại tạo ra nhiều cặp byte?

UTF-8 sử dụng từ một đến bốn byte cho mỗi giá trị vô hướng Unicode, vì vậy số byte và số chữ cái hiển thị có thể khác nhau. Chữ é tạo ra C3 A9, còn một biểu tượng cảm xúc có thể cần bốn byte. Một chữ cái dựng sẵn và một chữ cái đi kèm dấu kết hợp có thể trông giống nhau nhưng tạo ra các chuỗi byte khác nhau.

Ký tự xuống dòng và khoảng trắng có bị xóa trước khi mã hóa không?

Không. Khoảng trắng thông thường trở thành 20, tab trở thành 09, LF trở thành 0A và CRLF trở thành 0D 0A. Bộ chuyển đổi không chuẩn hóa văn bản hoặc ký tự kết thúc dòng. Việc dán trong trình duyệt có thể đã thay đổi ký tự kết thúc dòng của dữ liệu nguồn, vì vậy kết quả này hiển thị các byte của văn bản thực sự được nhập.

Đầu ra này có phải UTF-16, BCD hoặc số nguyên little-endian không?

Công cụ luôn mã hóa văn bản UTF-8. Các chữ số được nhập dưới dạng văn bản sẽ trở thành byte ký tự: 42 cho kết quả 34 32, không phải Hex của số nguyên thông thường là 2A hoặc BCD đóng gói là 42. Không có cài đặt độ rộng trường số hoặc thứ tự byte, và việc đảo ngược các cặp byte này sẽ làm hỏng nhiều ký tự nhiều byte.

Công cụ miễn phí · trong trình duyệt của bạn lượt chạy · không cần tài khoản