Konverter Pengodean Berkas Teks

Ketika teks menampilkan café sebagai café atau naïve sebagai naïve, karakternya sebenarnya baik-baik saja: pengodean yang salah dibaca. Tempel teksnya, beri tahu konverter pengodean mana yang harus dipakai untuk membaca dan mana untuk menulis, lalu konverter mengodekan ulang secara bersih antara UTF-8, UTF-16, ISO-8859-1 (Latin-1), Windows-1252, dan halaman kode umum lainnya. Salin hasil yang sudah benar langsung ke editor, spreadsheet, atau basis data Anda.

Cara mengonversi pengodean teks

  1. 1

    Tempel teks Anda

    Teks apa pun yang tampak rusak atau yang perlu dikodekan ulang untuk program lain.

  2. 2

    Periksa deteksinya

    Petunjuk perkiraan menampilkan kemungkinan pengodean di atas kotak.

  3. 3

    Pilih pengodean sumber

    Atur «Dari» sesuai cara byte harus dibaca: UTF-8, Windows-1252, ISO-8859-1, SJIS, dan lainnya.

  4. 4

    Pilih pengodean tujuan

    UTF-8 adalah standar modern; UTF-16, Big5, atau GB2312 tersedia bila program tertentu memerlukannya.

  5. 5

    Konversi dan salin

    Teks dikodekan ulang dan satu klik menyalin hasilnya ke papan klip.

Dari mana ketidakcocokan pengodean berasal

Sumber Kemungkinan pengodean
Excel «Simpan sebagai CSV» di Windows Windows-1252
Aplikasi Windows lawas Windows-1252
Utilitas Unix lawas ISO-8859-1 (Latin-1)
Editor macOS/Linux modern UTF-8
Teks Jepang di Windows Shift-JIS (SJIS)
Tionghoa Sederhana di Windows GB2312
Tionghoa Tradisional (Taiwan/Hong Kong) Big5

Gejala klasik

  • café tampil sebagai café ketika byte UTF-8 dibaca sebagai Latin-1. Atur «Dari» ke UTF-8 untuk menafsirkan byte dengan benar lagi.
  • ñ menjadi ñ karena alasan yang sama.
  • Mojibake ganda seperti café berarti teks disimpan ulang setelah salah baca pertama, sehingga tafsiran yang keliru dikodekan untuk kedua kalinya.
  •  di awal adalah tanda urutan byte UTF-8 yang terbaca sebagai tiga karakter Latin-1.

Begitu Anda mengenali gejalanya, jalannya biasanya jelas: baca teks sebagai apa adanya (Latin-1, Windows-1252, atau yang sesuai), lalu tulis kembali sebagai UTF-8.

Tanda urutan byte (BOM)

Konverter ini tidak menambah atau menghapus tanda urutan byte secara sengaja: perilakunya mengikuti pengodean tujuan. Keluaran UTF-8 tidak memiliki BOM. Keluaran UTF-16 biasa diawali BOM dan bersifat big-endian, sedangkan UTF-16BE dan UTF-16LE menulis byte tanpa BOM. Pilih UTF-8 kecuali program tertentu meminta UTF-16.

Ketika sebuah karakter tak punya padanan

Sebagian byte tidak bermakna dalam pengodean sumber yang Anda pilih, dan sebagian karakter tidak bisa direpresentasikan dalam pengodean tujuan. Bila itu terjadi, konversi mengganti dengan penanda alih-alih berhenti. Yang paling penting adalah memilih pengodean sumber yang tepat: string yang hanya berisi ASCII valid di semua pengodean, sehingga ketidakcocokan biasanya baru muncul saat ada karakter beraksen atau non-Latin.

Pertanyaan yang Sering Diajukan

Daftar «Dari» dan «Ke» sama-sama menyediakan UTF-8, UTF-16, UTF-16BE, UTF-16LE, ISO-8859-1, ISO-8859-15, Windows-1252, ASCII, EUC-JP, SJIS (Shift-JIS), GB2312, dan Big5. Anda dapat mengonversi dari salah satunya ke pengodean lain mana pun.

Untuk web, basis data, dan hampir semua alur modern, ya. Pengecualiannya adalah aplikasi Windows lawas yang hanya membaca Windows-1252, sejumlah alat mainframe lama, dan perangkat lunak Jepang tertentu yang mengharapkan Shift-JIS.

Ini tebakan perkiraan berdasarkan pola byte, dipilih dari UTF-8, UTF-16, ISO-8859-1, Windows-1252, dan ASCII. Bisa keliru untuk teks pendek atau hanya-ASCII, jadi anggaplah sebagai petunjuk dan atur sendiri pengodean «Dari» bila Anda lebih tahu.

Teks dikirim ke server kami untuk menjalankan konversi dan tidak disimpan setelah respons dikembalikan. Untuk materi rahasia, sebaiknya gunakan editor luring dengan konverter pengodean bawaan.

Alat Terkait

Alat ini tersedia dalam bahasa lain