Ekstrak URL dari Teks

Tempel log obrolan, dokumen Markdown, rangkaian email, atau dump HTML mentah, lalu dapatkan daftar bersih semua tautan http:// dan https:// di dalamnya. Alat ini membuang tanda baca di akhir, memahami sintaks tautan Markdown dan HTML, serta menghapus duplikat yang persis sama, sehingga daftarnya bisa langsung dialirkan ke crawler atau alat arsip.

Cara mengekstrak URL

  1. 1

    Tempel sumber

    Masukkan teks atau HTML. Tanda kutip, kurung sudut, sintaks tautan Markdown, dan tanda baca akhir ditangani secara otomatis.

  2. 2

    Jalankan pemindaian

    Semua tautan `http://` dan `https://` dicocokkan, tanda baca akhir dibuang, dan duplikat yang persis sama dihapus.

  3. 3

    Periksa jumlahnya

    Anda melihat berapa banyak URL unik yang ditemukan beserta daftar lengkapnya.

  4. 4

    Salin atau ekspor

    Satu URL per baris, siap dipakai dengan `curl -I`, alat pengarsip, layanan tangkapan layar, atau daftar seed Screaming Frog.

Apa yang dianggap sebagai URL

Deteksi URL lebih sulit dari kelihatannya, dan alat ekstraksi ini sengaja memakai satu aturan aman: hanya tautan lengkap http:// dan https:// yang diambil. Semua hal lain tetap ada di teks Anda.

Bentuk yang dikenali

Bentuk Contoh
HTTPS absolut https://example.com/path?q=1
HTTP absolut http://example.com
Target tautan Markdown [text](https://example.com)
href absolut dalam HTML href="https://example.com"

Aturan pemangkasan

Tanda baca di akhir dibuang, jadi (https://example.com). menjadi https://example.com. Spasi, tanda kutip, kurung sudut, tanda kurung, kurung siku, koma, dan titik koma menghentikan pencocokan. URL yang mengandung tanda kurung dipotong pada tanda kurung buka pertama, jadi judul bergaya Wikipedia hanya tertangkap sampai tanda kurung buka.

Yang dilewati

  • mailto:, tel:, ftp:, dan skema lain yang bukan http atau https.
  • Tautan relatif terhadap protokol seperti //cdn.example.com/asset.js.
  • Domain mentah dan alamat berawalan www. tanpa skema, seperti example.com/docs/intro atau www.example.com/page.
  • Fragmen berjangkar saja seperti #section dan pseudo-URL JavaScript.

Cara duplikat ditangani

Duplikat yang persis sama dihapus: https://example.com dihitung sekali berapa pun kemunculannya, sedangkan Example.com dan example.com tetap menjadi entri terpisah. Daftar mempertahankan urutan kemunculan pertama setiap URL.

Tips pemrosesan lanjutan

  • Ubah ke huruf kecil untuk deduplikasi kanonik. Jika Example.com dan example.com ingin dihitung sebagai satu host, ubah keluaran ke huruf kecil lalu deduplikasi lagi.
  • Buang parameter pelacakan dengan pembersih UTM sebelum pengarsipan, jika tidak Anda akan mendapat puluhan duplikat yang nyaris sama.
  • Periksa status. Lewatkan daftar pada pemeriksa tautan rusak untuk membuang 404 sebelum menetapkan daftar.

Pertanyaan yang Sering Diajukan

Hanya jika tautan pendek ditulis dengan skema lengkap. bit.ly/xyz saja tidak tertangkap, tetapi https://bit.ly/xyz diperlakukan sebagai URL biasa. Alat ini tidak mengikuti pengalihan; selesaikan sendiri jika Anda memerlukan tujuan akhirnya.

Ya, jika href berupa URL http:// atau https:// lengkap. Nilainya diekstrak bersih tanpa tag di sekelilingnya; href relatif tidak tertangkap.

Tetap dipertahankan apa adanya. Jika ingin membuang utm_* dan parameter pelacakan serupa, gunakan pembersih URL setelah ekstraksi.

Tidak. Teks diproses selama permintaan dan isinya tidak disimpan atau dicatat.

Alat Terkait

Alat ini tersedia dalam bahasa lain