ファイルツール / 05

テキストエンコーディング検出

ローカルのファイルサンプルでBOMマーカー、ASCII互換性、厳密なUTF-8の有効性をチェックします。

テキストエンコーディング検出: TOEAはUTF-8とUTF-16のBOM(バイトオーダーマーク)、純粋なASCII、厳密に有効なUTF-8を検出します。その他のバイト列は慎重にunknown/legacyとして結果を返します。 サーバーへのファイルアップロードは一切なく、100%ブラウザ内でローカル実行します。

カテゴリ
開発者ツール
実行回数
ブラウザ内で
コスト
無料 · 登録不要
提供状況
すぐに使えます
Text encoding detectorローカル処理

完全にブラウザ内で実行します

レガシーまたは不明な結果の場合

UTF-8として無効なテキストは、多くの場合、古い1バイトエンコーディングで記録されています。西ヨーロッパのテキストでは、通常Windows-1252またはISO-8859-1です。1度変換したら、それ以降はUTF-8を使い続けてください。LinuxまたはmacOSではiconv -f WINDOWS-1252 -t UTF-8 in.txt > out.txtを実行できます。または、エンコーディングを選択できるエディターで開き、UTF-8として保存してください。検査されるのは最初の1 MBだけなので、先頭1 MBがASCIIだけの大きなファイルでも、その後に非ASCIIテキストが含まれている可能性があります。

バイトオーダーマークとUTF-16

UTF-8のバイトオーダーマーク(EF BB BF)があると、Excelでアクセント付きのCSVを正しく開けますが、別の問題を引き起こします。シェルスクリプトの#!行、ヘッダー送信前のPHP出力、そして除去処理を行わないコードで読み込んだCSVの最初の列名に影響します。UTF-16ファイルは通常Windows由来で、たとえばWindows PowerShell 5.1の>リダイレクトで作成されます。多くのUnixツールでは、nullバイトだらけのテキストとして読み込まれます。

使い方

  1. 最大50 MBのテキスト系ファイルを選びます。
  2. 先頭1 MBをローカルで解析します。
  3. エンコーディングと信頼度ラベルを確認します。

プライバシーと制限事項

ファイルはローカルに留まります。BOMなしのエンコーディング検出はヒューリスティックで、レガシー文字セットを常に判別できるわけではありません。

関連ツール

よくある質問

なぜASCIIはUTF-8互換と呼ばれるのですか?

ASCIIのバイト値はUTF-8でも同じであるため、有効なASCIIはUTF-8としてもデコードされます。

すべてのレガシーエンコーディングを特定できますか?

いいえ。多くのシングルバイトエンコーディングは言語の文脈がないと曖昧です。

無料ツール · ブラウザ内で · アカウント不要