Pemeriksa Mojibake
Perbandingan pribadi ini tidak tersedia lagi
Buka alat satu halaman lengkapTempel teks yang tampak rusak
Tempel teks seperti café atau tulisan Jepang yang tidak terbaca setelah ketidakcocokan enkode. Teks asli tetap tidak berubah di editor.
Maksimal 50.000 karakter. Alat ini hanya membandingkan teks Unicode yang ditempel; alat tidak memeriksa atau memperbaiki berkas, aliran byte, basis data, atau header HTTP.
Mojibake adalah data yang masih terbaca sebagai karakter, tetapi tampil keliru karena byte didekode dengan set karakter yang tidak cocok. Contoh yang umum ialah café ketika café dikodekan sebagai UTF-8 tetapi bytenya dibaca sebagai Latin-1 atau Windows-1252. Tempel teks yang terlihat untuk membandingkan hipotesis pemulihan yang benar-benar reversibel. Alat ini mempertahankan teks asli, menandai setiap kandidat sebagai hipotesis, dan menjalankan perbandingan secara lokal di browser Anda.
Cara membandingkan hipotesis pemulihan mojibake
-
1
Tempel teks yang terlihat
Gunakan teks persis seperti saat diterima. Alat tidak mengunggah atau memeriksa berkas sumber.
-
2
Setujui perbandingan
Minta browser menguji interpretasi byte Latin-1 dan Windows-1252 dengan dekoder UTF-8 yang ketat.
-
3
Bandingkan tanpa berasumsi
Baca teks asli yang tidak berubah di samping setiap kandidat reversibel dan pilih hanya jika konteks mendukungnya.
-
4
Salin sebagai teks biasa
Salin, unduh, atau cetak hipotesis yang dipilih tanpa menimpa teks asli.
Hal yang dapat dan tidak dapat ditetapkan oleh hipotesis pemulihan
Enkode memetakan karakter menjadi byte dan sebaliknya. UTF-8 mewakili é dengan dua byte C3 A9. Jika perangkat lunak mendekode byte itu sebagai Windows-1252 atau ISO-8859-1, hasil yang terlihat dapat menjadi é. Hipotesis yang berguna membalik kekeliruan khusus tersebut: perlakukan karakter lawas yang terlihat sebagai nilai byte, dekode byte itu secara ketat sebagai UTF-8, lalu pastikan pengodean kandidat kembali ke UTF-8 menghasilkan byte yang sama.
Pemeriksaan perjalanan pulang-pergi menolak urutan UTF-8 yang tidak lengkap atau cacat. Kandidat yang berisi karakter pengganti � juga ditolak karena informasi yang digantikan karakter itu sudah hilang. Perjalanan pulang-pergi yang valid mendukung sebuah hipotesis, tetapi tidak membuktikan enkode yang dipakai sistem sumber atau maksud penulis.
| Teks yang terlihat | Hipotesis yang diuji | Kemungkinan kandidat | Hal yang perlu diperiksa |
|---|---|---|---|
café |
Byte UTF-8 dibaca sebagai Latin-1 | café |
Cocokkan ejaan dengan sumber |
It’s |
Byte UTF-8 dibaca sebagai Windows-1252 | It’s |
Periksa tanda baca dan gaya penulisan |
æååã |
Byte UTF-8 dibaca sebagai Latin-1 | 文字化け |
Cocokkan teks Jepang dengan salinan tepercaya |
café |
Dua kekeliruan enkode berurutan | café |
Periksa kedua tahap terkendali |
Mengapa teks Jepang memerlukan konteks
Istilah Jepang 文字化け berarti karakter yang menjadi kacau. Teks Jepang dalam UTF-8 dapat berubah menjadi campuran panjang huruf Latin, simbol, dan karakter mirip kontrol ketika bytenya didekode melalui pemetaan lawas yang keliru. Reversibilitas membantu, tetapi nama pendek atau satu karakter tetap dapat ambigu. Bandingkan kandidat dengan dokumen asli, hasil ekspor basis data, pengirim, atau salinan berwenang lainnya.
Batasan dan pemulihan yang lebih aman
Alat ini menerima teks Unicode yang sudah didekode oleh browser. Alat tidak dapat memulihkan byte yang sebelumnya dibuang, menebak enkode dari berkas biner, memperbaiki kolom basis data, atau mengubah header HTTP Content-Type. Jika tidak ada kandidat, pertahankan teks asli. Jika memungkinkan, dapatkan byte sumber sebenarnya, buat cadangan, identifikasi enkode yang dinyatakan dan enkode sebenarnya, lalu dekode sekali dengan alat yang dirancang untuk berkas atau aliran byte. Jangan berulang kali menyimpan teks rusak di atas satu-satunya salinan sumber.
Pertanyaan yang Sering Diajukan
Tidak. Artinya, satu interpretasi byte lawas tertentu berhasil didekode sebagai UTF-8 yang valid dan melewati pemeriksaan byte yang persis. Lebih dari satu interpretasi dapat menghasilkan teks yang sama-sama tampak masuk akal. Konteks dan sumber berwenang tetap diperlukan.
Karakter yang terlihat mungkin bukan byte UTF-8 yang keliru dibaca sebagai ISO-8859-1 atau Windows-1252, urutannya mungkin tidak lengkap, atau karakter pengganti sudah menghapus informasi. Pertahankan teks asli lalu periksa byte serta metadata enkode yang sebenarnya.
Tidak. Alat hanya membandingkan teks Unicode yang ditempel. Alat tidak membaca berkas, mendeteksi enkode berkas, terhubung ke basis data, menulis ulang nilai tersimpan, atau memperbaiki header server. Cadangkan sumber sebelum memakai alur konversi yang mengolah byte.
Tidak. Perbandingan, pemilihan kandidat, penyalinan, pembuatan TXT, dan persiapan cetak berlangsung di browser Anda. Mode funnel dapat menyimpan satu rekaman tervalidasi di tab ini hingga 30 menit dan hanya memasukkan ID tugas yang buram ke URL.
Alat Terkait
Penghitung kata transisi bahasa Inggris
Hitung 18 kata dan frasa transisi bahasa Inggris dalam draf Anda. Lihat total, jumlah per istilah, dan densitas dibandingkan semua kata.
Pemeriksa tata bahasa Inggris
Pemeriksaan cepat untuk tata bahasa dan ejaan teks bahasa Inggris: mendeteksi salah ketik umum, apostrof yang hilang pada kontraksi, dan kata yang berulang.
Generator Nama Fantasi
Buat nama karakter fantasi berdasarkan ras, kelas, dan nuansa gender untuk kampanye D&D, pembangunan dunia, novel, dan daftar NPC.
Generator Akronim
Buat akronim dari frasa, nama proyek, atau topik. Pilih panjang dan nada, lalu pilih kandidat yang mudah diucapkan dan lebih mudah diingat.
Generator Bibliografi
Buat entri bibliografi yang diformat benar dalam APA 7, MLA 9, Chicago 17, dan Harvard. Buku, jurnal, situs web, film, dan lainnya.
Alat parafrase
Tulis ulang kalimat bahasa Inggris dengan mode sinonim, ringkas, formal, dan sederhana, lalu periksa makna serta atribusi.