文字化け 復元・解読ツール|縺・繧・ã・‚ƒ を元に戻す、メール件名・%E3・CSVの文字コード変換
化けた文字を貼り付けると、UTF-8・Shift_JIS・EUC-JP・Latin-1 のどの組み合わせで化けたかを総当たりで調べ、日本語として読める文章に戻します。UTF-8 を Shift_JIS で開いたときに出る「�」で欠けた文字も、文字コードの決まりから推測して補い、ほかの候補も選べます。2回化けた文字や、ESC が消えた JIS のメール($B…(B)にも対応。メール件名の =?UTF-8?B?…?=・=?ISO-2022-JP?B?…?=、URL の %E3%81%82、JSON の \u3042、git の \343\201\202、Python の \xe3、HTML の あ、Quoted-Printable、日本語ドメインの xn-- も読めます。CSV などのファイルは文字コード・BOM・改行コードを判定し、Excel で化けない UTF-8(BOM付き)や Shift_JIS に変換して保存できます。すべてブラウザの中で処理し、文章やファイルはどこにも送りません。
化けた文章を貼り付ける
メール・CSV・Web ページなどで化けた文字を、そのまま貼り付けてください。考えられる化け方をすべて試して、日本語として読めるものを並べます。
ABOUT
文字化け 復元・解読ツール|縺・繧・ã・‚ƒ を元に戻す、メール件名・%E3・CSVの文字コード変換について
文字化け 復元・解読ツールは、化けてしまった日本語を元に戻すツールです。文字化けは「ある文字コードで保存した文章を、別の文字コードとして読んだ」ときに起きます。たとえば UTF-8 の「こんにちは」を Shift_JIS として読むと「縺薙s縺ォ縺。縺ッ」、Latin-1(Windows-1252)として読むと「ã“ã‚“ã«ã¡ã¯」、Shift_JIS の文章を Latin-1 として読むと「‚±‚ñ‚É‚¿‚Í」になります。このツールは、貼り付けた文字を UTF-8・Shift_JIS・EUC-JP・Latin-1 のすべての組み合わせで読み直し、日本語として自然なものを並べます。UTF-8 を Shift_JIS で読んだときに出る「�」は元のバイトが1〜2個失われた印ですが、UTF-8 の決まった形から欠けたバイトの数と位置を割り出し、日本語として読める文字を推測して補います(補った文字は押すと別の候補に入れ替えられます)。ほかに、ESC が消えた JIS のメール($BJ8;z2=$1(B → 文字化け)、2回化けた文字、メール件名の =?UTF-8?B?…?= や =?ISO-2022-JP?B?…?=、URL の %E3%81%82、JSON の \u3042、git の \343\201\202、Python の \xe3\x81\x82、HTML の あ、Quoted-Printable、日本語ドメインの xn-- も読めます。CSV などのファイルは文字コード・BOM・改行コードを判定し、Excel で化けない UTF-8(BOM付き)や Shift_JIS に変換して保存できます。
文字化け 復元・解読ツール|縺・繧・ã・‚ƒ を元に戻す、メール件名・%E3・CSVの文字コード変換の使い方
- 1化けた文章(縺・繧・ã・‚ などが並んだ文字)を、そのまま「文字化けを直す」の欄に貼り付ける
- 2「いちばん有力」に出た文章を確かめる。どの文字コードの組み合わせで化けていたかも表示される
- 3黄色の文字は「�」から推測して補った文字。違っていたら押して、ほかの候補に入れ替える
- 4「戻した文章をコピー」でコピーする
- 5%E3%81%82 や =?UTF-8?B?…?= のような符号のままの文字は「符号を読む」に貼り付ける
- 6CSV などのファイルは「ファイル・CSV」で選び、保存する文字コード(UTF-8 BOM付き・Shift_JIS)を選んで「変換して保存」を押す
使いやすい場面
- 「縺」「繧」「譁」だらけになったメールや Web ページの文章を読みたい
- 「ã」「â€」「é」が並んだ WordPress やデータベースの文字を元に戻したい
- メールの件名が =?UTF-8?B?… や =?ISO-2022-JP?B?… のまま表示されて読めない
- 古いメールで「$B」「(B」にはさまれた英数字が並んでいるのを読みたい
- UTF-8 の CSV を Excel で開くと化けるので、BOM 付きや Shift_JIS に変換したい
- 受け取った CSV・テキストファイルの文字コードと改行コードを確かめたい
- URL の %E6%96%87… や、JSON の \u3042、ログの \xe3\x81 を日本語で読みたい
- git status で日本語のファイル名が \343\201\202 のように表示されるのを読みたい
利用時のポイント
- 化けた文字を「間違えて読んだ文字コード」でバイト列に戻し、「本来の文字コード」で読み直して復元します。文字コードの対応表は、お使いのブラウザの文字コード変換(WHATWG Encoding)をそのまま使っています。
- 「�」(U+FFFD)は、読めなかったバイトを捨てた印です。UTF-8 を Shift_JIS で読んだときの「�」は1〜2バイト分なので、前後のバイトから推測して補えますが、推測なので違う文字になることがあります。黄色で示した文字は、押すとほかの候補を選べます。
- Shift_JIS や EUC-JP の文章を UTF-8 として読んで「�」ばかりになったものや、保存のときに「?」に置き換わったものは、元のデータが残っていないため戻せません。元のファイルを「ファイル・CSV」で読み込み直してください。
- コピーの途中で見えない文字(Latin-1 の制御文字など)が落ちていると、その部分も推測で補います。元の文章をできるだけそのまま貼り付けるほど、正確に戻せます。
- ファイルの文字コードは、BOM、UTF-8 として正しく読めるか、ESC(JIS)があるか、Shift_JIS と EUC-JP のどちらで読むと日本語らしいか、の順で判定します。英数字ばかりのファイルは判定が難しいため、プレビューを見て必要なら読み込む文字コードを変えてください。
- Shift_JIS で保存すると、絵文字や「𠮷」など Shift_JIS にない文字は「?」になります。どの文字が書けないかは保存の前に表示します。
- 文章やファイルはブラウザの中だけで処理し、サーバーには送りません。
こんなときに使えます
文字化け 復元・解読ツール|縺・繧・ã・‚ƒ を元に戻す、メール件名・%E3・CSVの文字コード変換は、次のような場面の答えになります。
- 縺や繧だらけの文字化けを直したい
- ãやâ€が並んだ文字化けを元に戻したい
- メールの件名の=?UTF-8?B?を読みたい
- メールの$B…(Bを日本語にしたい
- CSVをExcelで開くと文字化けするのを直したい
- ファイルの文字コードがUTF-8かShift_JISか知りたい
- %E3%81%82のようなURLを日本語にしたい
- gitの日本語ファイル名の\343を読みたい
よくある質問
- 「縺」「繧」だらけの文字化けは、何が原因ですか?
- UTF-8 で保存された文章を、Shift_JIS として表示したのが原因です。UTF-8 のひらがなは「E3 81 xx」「E3 82 xx」という3バイトで、その「E3 81」「E3 82」を Shift_JIS として読むと「縺」「繧」になるため、ひらがなの多い文章ほど「縺」「繧」が並びます。たとえば「こんにちは」は「縺薙s縺ォ縺。縺ッ」になります。このツールに貼り付けると元に戻せ、「�」になって欠けた文字も推測して補います。
- 「ã」「â€」「é」のような文字化けは戻せますか?
- 戻せます。UTF-8 の文章を Latin-1(Windows-1252)として表示したときの化け方で、海外製のソフトや、WordPress・MySQL などのデータベースの文字コード設定が合っていないときによく起きます。「こんにちは」は「ã“ã‚“ã«ã¡ã¯」のようになります。2回続けて化けると「ãÂ」のように長くなりますが、2回分まとめて戻せます。
- 「�」や「???」ばかりの文字化けは戻せますか?
- 多くの場合、戻せません。「�」は読めなかったバイトを捨てた印で、Shift_JIS や EUC-JP の文章を UTF-8 として読むと、ほとんどの文字が「�」になって元のデータが残りません。「?」は保存するときに書けない文字を置き換えた印なので、保存した時点で消えています。元のファイルやメールが残っていれば、「ファイル・CSV」で読み込むか、ソフトの文字コードを切り替えて開き直してください。
- CSV を Excel で開くと文字化けするのはなぜですか?
- 日本語版の Excel は、BOM のない CSV を Shift_JIS として開くためです。Web サービスやプログラムが書き出す CSV の多くは UTF-8 なので、そのまま開くと化けます。このツールの「ファイル・CSV」で「UTF-8(BOM付き)」に変換して保存すれば、ダブルクリックで開いても化けません。古いソフトや社内システムに読み込ませるなら「Shift_JIS」を選んでください。
- メールの件名の「=?UTF-8?B?…?=」は何ですか?
- メールのヘッダーに日本語を入れるための書き方(MIME エンコード)で、「?B?」なら Base64、「?Q?」なら Quoted-Printable で文字を符号にしています。メールソフトが対応していないと、そのまま表示されます。たとえば「=?UTF-8?B?44GK6KaL56mN44KC44KK44Gu44GU5L6d6aC8?=」は「お見積もりのご依頼」です。「符号を読む」に貼り付けると、=?ISO-2022-JP?B?…?= も含めて日本語に戻せます。
- メールに「$B」と「(B」にはさまれた英数字が並ぶのはなぜですか?
- JIS(ISO-2022-JP)で書かれた日本語から、切り替えの合図の ESC という見えない文字が消えた状態です。JIS では「ESC $ B」から「ESC ( B」までが日本語なので、ESC が消えると「$BJ8;z2=$1(B」(=文字化け)のように英数字だけが残ります。このツールに貼り付けると、ESC を補って元の日本語に戻します。
- git で日本語のファイル名が「\343\201\202」のように表示されます。
- git は初期設定で、ASCII 以外の文字を含むファイル名を、UTF-8 のバイトを8進数で書いた形(\343\201\202 =「あ」)で表示します。「符号を読む」に貼り付けると読めます。表示自体を日本語にしたいときは、git config --global core.quotepath false を実行します。
ARTICLES
文字化け 復元・解読ツール|縺・繧・ã・‚ƒ を元に戻す、メール件名・%E3・CSVの文字コード変換の使い方ガイド
Special Thanks