파일 도구 / 05
텍스트 인코딩 감지 도구
로컬 파일 샘플에서 BOM 표시, ASCII 호환성 및 엄격한 UTF-8 유효성을 확인합니다.
텍스트 인코딩 감지 도구: TOEA는 UTF-8 및 UTF-16 BOM, 순수 ASCII, 엄격하게 유효한 UTF-8을 감지합니다. 그 외 바이트에는 신중하게 미상/레거시 결과를 표시합니다. 서버에 파일을 전혀 업로드하지 않고 브라우저에서 100% 로컬로 실행됩니다.
- 카테고리
- 개발자 도구
- 실행 횟수
- 브라우저에서
- 비용
- 무료 · 가입 불필요
- 사용 가능 여부
- 사용 가능
브라우저에서 전부 실행됩니다
레거시 인코딩이거나 알 수 없는 경우
유효한 UTF-8이 아닌 텍스트는 대부분 오래된 단일 바이트 인코딩으로 작성되었습니다. 서유럽 텍스트라면 대개 Windows-1252 또는 ISO-8859-1입니다. 한 번 변환한 뒤에는 계속 UTF-8을 사용하십시오. Linux 또는 macOS에서는 iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt를 사용하거나, 인코딩을 선택할 수 있는 편집기에서 열어 UTF-8로 저장하십시오. 처음 1 MB만 검사하므로, 첫 1 MB가 일반 ASCII인 대용량 파일에는 뒤쪽에 비ASCII 텍스트가 여전히 포함될 수 있습니다.
바이트 순서 표시와 UTF-16
UTF-8 바이트 순서 표시(EF BB BF)가 있으면 Excel에서 악센트가 포함된 CSV를 올바르게 열 수 있지만, 다른 부분에서는 문제가 됩니다. 셸 스크립트의 #! 줄, 헤더보다 먼저 전송되는 PHP 출력, 표시를 제거하지 않는 코드가 읽는 CSV의 첫 번째 열 이름을 깨뜨릴 수 있습니다. UTF-16 파일은 대개 Windows에서 생성됩니다. 예를 들어 Windows PowerShell 5.1의 > 리디렉션이 있습니다. 많은 Unix 도구는 이를 널 바이트로 가득한 텍스트로 읽습니다.
사용 방법
- 최대 50 MB의 텍스트 계열 파일을 선택합니다.
- 로컬에서 처음 1 MB를 검사합니다.
- 인코딩 및 신뢰도 레이블을 확인합니다.
개인정보 보호 및 제한사항
파일은 로컬에 유지됩니다. BOM이 없는 인코딩 감지는 휴리스틱 방식이므로 레거시 문자 집합을 항상 구분할 수는 없습니다.
관련 도구
자주 묻는 질문
ASCII를 UTF-8 호환이라고 하는 이유는 무엇입니까?
ASCII 바이트는 UTF-8에서도 같은 값을 사용하므로 유효한 ASCII는 UTF-8로도 디코딩됩니다.
모든 레거시 인코딩을 식별할 수 있습니까?
아니요. 많은 단일 바이트 인코딩은 언어 맥락이 없으면 서로 구분하기 어렵습니다.
무료 도구 · 브라우저에서회 실행 · 계정 불필요