Konverter HTML ke Teks

Email teks biasa, analisis teks, serta alur penghitungan jumlah kata semuanya memerlukan HTML diubah menjadi string yang mudah dibaca seperti yang dilihat manusia, tanpa adanya artefak penanda. Cukup tempelkan HTML-nya; alat ini akan menghapus semua tag, mendekode entitas (misalnya & menjadi &), menggabungkan rangkaian ruang kosong akibat penjajaran, lalu menghasilkan blok teks bersih yang mudah dibaca, siap untuk dianalisis atau digunakan sebagai bagian teks biasa dalam email multibagian.

Cara mengonversi HTML menjadi teks

  1. 1

    Tampal HTML

    Dalam ukuran apa pun, cuplikan, isi email yang lengkap, atau halaman penuh.

  2. 2

    Konversi

    Satu klik: semua tag dan atribut dihapus serta entitas didekode.

  3. 3

    Periksa pemisahan baris

    Paragraf, item daftar, dan baris tabel menjadi baris terpisah, sehingga teks tetap mempertahankan strukturnya.

  4. 4

    Salin teks

    Hasilnya berupa teks Unicode biasa yang aman untuk digunakan dalam alat penghitung kata, templat email, atau model sentimen.

Cara konversi menangani tag yang rumit

Mengonversi HTML menjadi teks bukan sekadar proses string.replace(/<[^>]+>/, ""); ekspresi reguler yang sederhana akan menyisakan kode entitas dan spasi hasil penjajaran, serta tidak mengetahui bahwa </p> seharusnya memulai baris baru.

Tingkat Blok vs Inline

Tag tingkat blok (<br>, dan tag penutup </p>, </div>, </h1> hingga </h6>, </li>, </tr>) masing-masing menghasilkan pemisahan baris. Tag inline (<a>, <span>, <strong>) tidak meninggalkan ruang kosong sehingga kata-kata tidak menyatu.

Perilaku Tag Tertentu

Tag Penanganan
<br> Satu pergantian baris
</p>, </div>, </h1> hingga </h6> Satu pergantian baris per tag penutup
</li>, </tr> Satu pergantian baris; poin daftar dan pemisah sel tabel tidak ditambahkan
<a href="url">text</a> text; atribut href dihapus
<img alt="text"> Tidak ada, tag ini tidak memiliki teks yang terlihat
<script>, <style> Tag dihapus, teks di antaranya tetap dipertahankan

Dekode Entitas

  • Entitas bernama (&amp;, &copy;, &eacute;) didekode menjadi karakter Unicode masing-masing.
  • Entitas numerik (&#169;, &#x00A9;) juga didekode.
  • Entitas yang tidak dikenal dipertahankan apa adanya, sehingga alat analisis tetap dapat melihatnya.

Normalisasi Spasi

  • Spasi dan tab sebelum pergantian baris dihapus.
  • Tiga baris kosong atau lebih dirangkum menjadi satu baris kosong.
  • Spasi antarkata dipertahankan apa adanya; konverter tidak menyusun ulang teks.

Kegunaan

  • Membuat bagian text/plain dari email multipart.
  • Membersihkan artikel hasil scraping sebelum diteruskan ke model bahasa.
  • Mengisi indeks pencarian teks biasa.
  • Menghitung jumlah kata secara akurat tanpa memperhitungkan markup.

Pertanyaan yang Sering Diajukan

Format visual (tebal, warna, jenis huruf) hilang, dan itulah intinya. Struktur bertahan sebagai pemisahan baris: paragraf, item daftar, dan baris tabel menjadi baris terpisah, sehingga teks tetap mudah dibaca.

Teks tautan yang terlihat tetap ada, tetapi URL ikut terhapus bersama atribut tag. Jika Anda membutuhkan URL-nya, gunakan konverter HTML ke Markdown khusus.

Konverter hanya menghapus tag-nya, tetapi teks di antara tag tetap dipertahankan, sehingga isi blok <script> dan <style> masih ada di hasil. Hapus terlebih dahulu dari HTML sumber jika tidak diinginkan.

Ya. Hasilnya berformat UTF-8 dan mempertahankan semua karakter non-ASCII dari data masukan. Entitas seperti &copy; dan &eacute; didekode menjadi versi Unicode-nya masing-masing.

Alat Terkait

Alat ini tersedia dalam bahasa lain