Pencarian Unicode

Jatuhkan karakter misterius, spasi putih aneh yang ditempel pengguna Anda, glif dari pratinjau font, emoji yang merusak regex Anda, dan pencarian mengembalikan titik kode Unicode-nya (U+XXXX) dan byte UTF-8 mentah dalam heksadesimal, satu baris per karakter.

Cara mengidentifikasi karakter Unicode

  1. 1

    Tempel karakter

    Anda dapat menempel satu glif atau seluruh string: tiap karakter dianalisis berurutan.

  2. 2

    Baca titik kode

    Dapatkan notasi U+ kanonik dalam huruf besar, dipadkan nol hingga minimal empat digit heksadesimal.

  3. 3

    Inspeksi byte UTF-8

    Lihat sekuens 1–4 byte yang ditempati karakter di disk atau di kawat.

  4. 4

    Salin hasilnya

    Keluarannya berupa tabel format CSV (karakter, titik kode, byte UTF-8) yang bisa Anda pilih dan tempel ke spreadsheet atau laporan bug.

Pekerjaan detektif khas yang dapat Anda lakukan dengan pencarian

Sebagian besar bug Unicode terlihat identik di layar. Satu-satunya cara membedakan spasi biasa dari spasi tanpa-jeda, atau apostrof melengkung dari prime, adalah dengan menginspeksi titik kodenya.

Jebakan umum yang dipecahkan pencarian

Terlihat seperti Sebenarnya Titik kode
Spasi No-break space U+00A0
Spasi Narrow no-break space U+202F
(tak ada) Zero-width space U+200B
(tak ada) Zero-width joiner U+200D
Apostrof Right single quotation mark U+2019
Apostrof Prime (kaki/menit) U+2032
Tanda hubung En dash U+2013
Tanda hubung Non-breaking hyphen U+2011

Tata letak byte UTF-8 sekilas

  • 1 byte, ASCII, U+0000 sampai U+007F (0xxxxxxx)
  • 2 byte, Suplemen Latin, Arab, Ibrani (110xxxxx 10xxxxxx)
  • 3 byte, CJK, sebagian besar simbol (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 byte, Emoji, aksara langka (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Jika kolom database Anda berpanjang byte tetap, emoji 4-byte akan memakan empat slot meskipun ia dirender sebagai satu glif, sumber umum bug pemangkasan.

Pertanyaan yang Sering Diajukan

Biasanya penanda BOM (U+FEFF) di awal file atau zero-width joiner nyasar dari pengolah kata. Tempel salah satunya ke pencarian dan ia akan langsung memberi tahu Anda, lalu Anda dapat menghapusnya dengan find-and-replace sederhana.

Ya. Pencarian beriterasi karakter demi karakter, jadi satu kata menghasilkan satu baris per karakter dengan titik kode dan byte UTF-8-nya.

Titik kode adalah identitas abstrak sebuah karakter, U+00E9 selalu “é” di mana pun Anda menyimpannya. UTF-8 adalah salah satu dari beberapa pengodean yang mengubah titik kode menjadi byte; “é” yang sama adalah dua byte C3 A9 dalam UTF-8 tetapi satu byte E9 dalam Latin-1.

Ya. Pencarian dihitung di server kami: karakter yang Anda tempel dikirim, dianalisis, dan titik kode serta byte UTF-8-nya langsung dikembalikan. Kami tidak menyimpan teks yang Anda kirim.

Alat Terkait

Alat ini tersedia dalam bahasa lain