文件工具 / 05
文本编码检测工具
检查本地文件样本中的BOM标记、ASCII兼容性和严格UTF-8有效性。
文本编码检测工具: TOEA可检测UTF-8和UTF-16字节顺序标记、纯ASCII以及严格有效的UTF-8;其他字节会显示为谨慎判断的未知/旧式编码结果。 完全在浏览器中本地运行,文件不会上传到服务器。
- 类别
- 开发者工具
- 使用次数
- 在浏览器中
- 费用
- 免费·无需注册
- 可用性
- 可直接使用
完全在浏览器中运行
结果属于旧编码或未知编码时
不是有效UTF-8的文本,最常见的是较旧的单字节编码。对于西欧文本,通常是Windows-1252或ISO-8859-1。请转换一次,此后一直使用UTF-8:Linux或macOS上使用iconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txt,或者在允许选择编码的编辑器中打开,并另存为UTF-8。工具只检查前1MB,因此如果大型文件的前1MB都是纯ASCII,后面仍可能包含非ASCII文本。
字节顺序标记和UTF-16
UTF-8字节顺序标记(EF BB BF)可以帮助Excel正确打开包含重音符号的CSV,但也会造成其他问题:Shell脚本的#!行、在标头发送前输出的PHP内容,以及由不会去除该标记的代码读取的CSV第一列名称。UTF-16文件通常来自Windows,例如Windows PowerShell5.1的>重定向。许多Unix工具会将其读取为充满空字节的文本。
使用方法
- 选择一个不超过50 MB的文本类文件。
- 在本地检查文件开头的1 MB数据。
- 查看编码和置信度标签。
隐私与限制
文件会保留在本地。不含BOM的编码检测基于启发式判断,无法始终区分旧式字符集。
相关工具
常见问题
为什么说ASCII兼容UTF-8?
ASCII字节在UTF-8中使用相同的值,因此有效的ASCII文本也可以按UTF-8解码。
它能识别所有旧式编码吗?
不能。许多单字节编码在缺少语言上下文时无法明确区分。
免费工具·使用在浏览器中次·无需账户