Pemeriksa Mojibake

Perbandingan hipotesis enkode
Teks yang ditempel dan setiap kandidat tetap berada di browser ini. Mode funnel menyimpan satu rekaman tervalidasi di tab ini hingga 30 menit dan hanya menaruh ID tugas yang buram di URL. Tidak ada teks yang dikirim melalui server kami atau API pemulihan.

Tempel teks yang tampak rusak

Tempel teks seperti café atau tulisan Jepang yang tidak terbaca setelah ketidakcocokan enkode. Teks asli tetap tidak berubah di editor.

Maksimal 50.000 karakter. Alat ini hanya membandingkan teks Unicode yang ditempel; alat tidak memeriksa atau memperbaiki berkas, aliran byte, basis data, atau header HTTP.

Mojibake adalah data yang masih terbaca sebagai karakter, tetapi tampil keliru karena byte didekode dengan set karakter yang tidak cocok. Contoh yang umum ialah café ketika café dikodekan sebagai UTF-8 tetapi bytenya dibaca sebagai Latin-1 atau Windows-1252. Tempel teks yang terlihat untuk membandingkan hipotesis pemulihan yang benar-benar reversibel. Alat ini mempertahankan teks asli, menandai setiap kandidat sebagai hipotesis, dan menjalankan perbandingan secara lokal di browser Anda.

Cara membandingkan hipotesis pemulihan mojibake

  1. 1

    Tempel teks yang terlihat

    Gunakan teks persis seperti saat diterima. Alat tidak mengunggah atau memeriksa berkas sumber.

  2. 2

    Setujui perbandingan

    Minta browser menguji interpretasi byte Latin-1 dan Windows-1252 dengan dekoder UTF-8 yang ketat.

  3. 3

    Bandingkan tanpa berasumsi

    Baca teks asli yang tidak berubah di samping setiap kandidat reversibel dan pilih hanya jika konteks mendukungnya.

  4. 4

    Salin sebagai teks biasa

    Salin, unduh, atau cetak hipotesis yang dipilih tanpa menimpa teks asli.

Hal yang dapat dan tidak dapat ditetapkan oleh hipotesis pemulihan

Enkode memetakan karakter menjadi byte dan sebaliknya. UTF-8 mewakili é dengan dua byte C3 A9. Jika perangkat lunak mendekode byte itu sebagai Windows-1252 atau ISO-8859-1, hasil yang terlihat dapat menjadi é. Hipotesis yang berguna membalik kekeliruan khusus tersebut: perlakukan karakter lawas yang terlihat sebagai nilai byte, dekode byte itu secara ketat sebagai UTF-8, lalu pastikan pengodean kandidat kembali ke UTF-8 menghasilkan byte yang sama.

Pemeriksaan perjalanan pulang-pergi menolak urutan UTF-8 yang tidak lengkap atau cacat. Kandidat yang berisi karakter pengganti juga ditolak karena informasi yang digantikan karakter itu sudah hilang. Perjalanan pulang-pergi yang valid mendukung sebuah hipotesis, tetapi tidak membuktikan enkode yang dipakai sistem sumber atau maksud penulis.

Teks yang terlihat Hipotesis yang diuji Kemungkinan kandidat Hal yang perlu diperiksa
café Byte UTF-8 dibaca sebagai Latin-1 café Cocokkan ejaan dengan sumber
It’s Byte UTF-8 dibaca sebagai Windows-1252 It’s Periksa tanda baca dan gaya penulisan
文字化け Byte UTF-8 dibaca sebagai Latin-1 文字化け Cocokkan teks Jepang dengan salinan tepercaya
café Dua kekeliruan enkode berurutan café Periksa kedua tahap terkendali

Mengapa teks Jepang memerlukan konteks

Istilah Jepang 文字化け berarti karakter yang menjadi kacau. Teks Jepang dalam UTF-8 dapat berubah menjadi campuran panjang huruf Latin, simbol, dan karakter mirip kontrol ketika bytenya didekode melalui pemetaan lawas yang keliru. Reversibilitas membantu, tetapi nama pendek atau satu karakter tetap dapat ambigu. Bandingkan kandidat dengan dokumen asli, hasil ekspor basis data, pengirim, atau salinan berwenang lainnya.

Batasan dan pemulihan yang lebih aman

Alat ini menerima teks Unicode yang sudah didekode oleh browser. Alat tidak dapat memulihkan byte yang sebelumnya dibuang, menebak enkode dari berkas biner, memperbaiki kolom basis data, atau mengubah header HTTP Content-Type. Jika tidak ada kandidat, pertahankan teks asli. Jika memungkinkan, dapatkan byte sumber sebenarnya, buat cadangan, identifikasi enkode yang dinyatakan dan enkode sebenarnya, lalu dekode sekali dengan alat yang dirancang untuk berkas atau aliran byte. Jangan berulang kali menyimpan teks rusak di atas satu-satunya salinan sumber.

Pertanyaan yang Sering Diajukan

Tidak. Artinya, satu interpretasi byte lawas tertentu berhasil didekode sebagai UTF-8 yang valid dan melewati pemeriksaan byte yang persis. Lebih dari satu interpretasi dapat menghasilkan teks yang sama-sama tampak masuk akal. Konteks dan sumber berwenang tetap diperlukan.

Karakter yang terlihat mungkin bukan byte UTF-8 yang keliru dibaca sebagai ISO-8859-1 atau Windows-1252, urutannya mungkin tidak lengkap, atau karakter pengganti sudah menghapus informasi. Pertahankan teks asli lalu periksa byte serta metadata enkode yang sebenarnya.

Tidak. Alat hanya membandingkan teks Unicode yang ditempel. Alat tidak membaca berkas, mendeteksi enkode berkas, terhubung ke basis data, menulis ulang nilai tersimpan, atau memperbaiki header server. Cadangkan sumber sebelum memakai alur konversi yang mengolah byte.

Tidak. Perbandingan, pemilihan kandidat, penyalinan, pembuatan TXT, dan persiapan cetak berlangsung di browser Anda. Mode funnel dapat menyimpan satu rekaman tervalidasi di tab ini hingga 30 menit dan hanya memasukkan ID tugas yang buram ke URL.

Alat Terkait