一言でいうと

UTF-8とは、文字をコンピュータで保存・送信するときのルールで、世界中のすべての文字(日本語、英語、中国語など)を同じ方法で扱えるようにしたものです。

もう少し詳しく

コンピュータの中では、すべての情報が「0」と「1」の数字で記録されています。文字も例外ではなく、「あ」という文字も「0」と「1」の組み合わせに変換されて保存されます。

UTF-8は、この「文字を0と1に変換するルール」を決めたもの。たとえるなら、世界中の言葉を同じ辞書で引けるようにした翻訳システムのようなものです。

UTF-8を使えば、日本語のメールに英語やアラビア文字が混ざっていても、コンピュータは正しく読み取ることができます。逆にルールが違うと、文字が「???」のように文字化けして読めなくなってしまいます。

よく使われる場面

ウェブサイトのソースコード、メールの送受信、テキストファイルの保存など、ほぼすべての場面で使われています。エラーログが正しく表示されない場合、このUTF-8の設定がズレていることが原因の一つです。

関連する言葉

  • 文字コード:文字を数字に変換するルール全般
  • 文字化け:文字コードが合わないときに起こる現象
  • エンコード:文字を0と1に変換すること