ファイルツール / 05
テキストエンコーディング検出
ローカルのファイルサンプルでBOMマーカー、ASCII互換性、厳密なUTF-8の有効性をチェックします。
テキストエンコーディング検出: TOEAはUTF-8とUTF-16のBOM(バイトオーダーマーク)、純粋なASCII、厳密に有効なUTF-8を検出します。その他のバイト列は慎重にunknown/legacyとして結果を返します。 サーバーへのファイルアップロードは一切なく、100%ブラウザ内でローカル実行します。
- カテゴリ
- 開発者ツール
- 実行回数
- ブラウザ内で
- コスト
- 無料 · 登録不要
- 提供状況
- すぐに使えます
完全にブラウザ内で実行します
レガシーまたは不明な結果の場合
UTF-8として無効なテキストは、多くの場合、古い1バイトエンコーディングで記録されています。西ヨーロッパのテキストでは、通常Windows-1252またはISO-8859-1です。1度変換したら、それ以降はUTF-8を使い続けてください。LinuxまたはmacOSではiconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txtを実行できます。または、エンコーディングを選択できるエディターで開き、UTF-8として保存してください。検査されるのは最初の1 MBだけなので、先頭1 MBがASCIIだけの大きなファイルでも、その後に非ASCIIテキストが含まれている可能性があります。
バイトオーダーマークとUTF-16
UTF-8のバイトオーダーマーク(EF BB BF)があると、Excelでアクセント付きのCSVを正しく開けますが、別の問題を引き起こします。シェルスクリプトの#!行、ヘッダー送信前のPHP出力、そして除去処理を行わないコードで読み込んだCSVの最初の列名に影響します。UTF-16ファイルは通常Windows由来で、たとえばWindows PowerShell 5.1の>リダイレクトで作成されます。多くのUnixツールでは、nullバイトだらけのテキストとして読み込まれます。
使い方
- 最大50 MBのテキスト系ファイルを選びます。
- 先頭1 MBをローカルで解析します。
- エンコーディングと信頼度ラベルを確認します。
プライバシーと制限事項
ファイルはローカルに留まります。BOMなしのエンコーディング検出はヒューリスティックで、レガシー文字セットを常に判別できるわけではありません。
関連ツール
よくある質問
なぜASCIIはUTF-8互換と呼ばれるのですか?
ASCIIのバイト値はUTF-8でも同じであるため、有効なASCIIはUTF-8としてもデコードされます。
すべてのレガシーエンコーディングを特定できますか?
いいえ。多くのシングルバイトエンコーディングは言語の文脈がないと曖昧です。
無料ツール · ブラウザ内で · アカウント不要