Ekstraktor N-gram
N-gram adalah rangkaian berurutan dari n kata dalam sebuah teks. Ekstraktor ini mengubah teks Anda menjadi huruf kecil, memecahnya menjadi kata pada setiap spasi dan tanda baca, lalu menghitung setiap n-gram sepanjang ukuran yang Anda pilih (1 sampai 8). Hasilnya berupa tabel frekuensi CSV yang diurutkan dari yang paling sering muncul: tabel semacam inilah yang menjadi dasar pemeriksaan kerapatan kata kunci SEO, penghalusan model bahasa, dan deteksi plagiarisme.
Cara mengekstrak n-gram
-
1
Tempel teks Anda
Masukkan artikel, transkrip, atau salinan produk. Tidak ada batas panjang untuk masukan yang wajar.
-
2
Pilih n
Unigram (1), bigram (2), trigram (3), hingga 8. Satu ukuran untuk setiap kali proses.
-
3
Ekstrak
Teks diubah menjadi huruf kecil lalu dipecah menjadi kata; tanda baca diperlakukan sebagai pemisah dan dibuang.
-
4
Baca tabel frekuensi
Setiap n-gram muncul beserta jumlah kemunculannya, diurutkan dari yang paling sering.
-
5
Salin CSV-nya
Keluarannya dipisahkan koma (N-gram,Count), siap ditempel ke lembar kerja.
Apa yang diberitahukan oleh setiap panjang n-gram
| N | Nama | Kasus penggunaan |
|---|---|---|
| 1 | Unigram | Kerapatan kata kunci, pemetaan topik |
| 2 | Bigram | Frasa (“search intent”, “page speed”), kolokasi |
| 3 | Trigram | Frasa ekor panjang, deteksi fitur |
| 4+ | Empat-gram ke atas | Deteksi konten duplikat, penanda plagiarisme |
Bagaimana alat ini memecah teks Anda
- Semua diubah menjadi huruf kecil, sehingga “The” dan “the” masuk ke baris yang sama.
- Kata adalah setiap rangkaian huruf, angka, atau apostrof. Karakter lain (tanda baca, simbol, ganti baris) dianggap pemisah dan dibuang.
- Batas kalimat tidak dipertahankan. Kata terakhir sebuah kalimat dan kata pertama kalimat berikutnya masih bisa membentuk satu n-gram, jadi perlakukan pasangan lintas kalimat dengan hati-hati. Jika hal itu penting, analisislah satu kalimat atau paragraf setiap kali.
- Stopword tetap dipertahankan. Tidak ada yang disaring untuk Anda; hapus baris-baris tersebut dari CSV jika Anda hanya menginginkan frasa semantis.
- Kata dikenali lewat spasi dan tanda baca. Artinya alat ini menghitung n-gram kata untuk bahasa yang memisahkan kata dengan spasi, seperti bahasa Indonesia. Bahasa Tionghoa, Jepang, dan Thai tidak memakai spasi antarkata: satu rangkaian tanpa spasi akan masuk sebagai satu kata. Segmentasikan teks itu lebih dulu (dengan tokenizer seperti jieba, MeCab, atau pemenggal kata Thai) agar kata-katanya dipisahkan spasi, baru tempelkan hasilnya di sini.
Kapan stopword sebaiknya dibuang
Stopword adalah kata fungsi berfrekuensi tinggi seperti “the”, “a”, “of”, dan “and” dalam bahasa Inggris, atau “yang”, “di”, “dan”, dan “untuk” dalam bahasa Indonesia. Membiarkannya akan membanjiri daftar bigram dengan pasangan tak berguna seperti “of the” dan “yang di”. Ekstraktor ini mempertahankannya, jadi hapus baris tersebut dari hasil ekspor bila Anda ingin frasa semantis saja, dan biarkan bila Anda meneliti gaya penulisan, atribusi kepengarangan klasik, atau model bahasa yang justru mengandalkan kata fungsi sebagai sinyal.
Kasus penggunaan SEO
Untuk artikel yang menargetkan “nginx config generator”, periksa:
- Bigram dan trigram target Anda muncul di 20 besar. Jika “nginx config” berada di peringkat 40, kemungkinan besar Anda kurang menggunakan istilah tersebut.
- Anda tidak menjejalkan kata kunci. Jika istilah itu menempati peringkat 1 dengan selisih yang sangat jauh, tulisan Anda akan terbaca seperti spam.
- Ada tetangga semantis. Bigram terkait seperti “server block”, “proxy pass”, dan “ssl certificate” meyakinkan mesin pencari bahwa topiknya benar-benar dibahas.
Penggunaan di NLP dan dunia akademik
- Model bahasa memakai frekuensi n-gram untuk penghalusan (smoothing) dan backoff (Kneser-Ney, Good-Turing).
- Studi atribusi kepengarangan membandingkan sebaran trigram antar calon penulis.
- Evaluasi terjemahan mesin (BLEU) menilai tumpang tindih n-gram antara terjemahan kandidat dan terjemahan rujukan.
Pertanyaan yang Sering Diajukan
Mulai dari satu cuitan (yang membuat n-gram nyaris tidak bermakna) hingga satu bab buku. Untuk keandalan statistik pada bigram, gunakan 1.000 kata atau lebih; untuk trigram, 10.000 atau lebih. Di bawah itu, peringkatnya berisik dan tidak stabil.
Tidak di sini. Teks selalu diubah ke huruf kecil sebelum dihitung, sehingga “The” dan “the” (atau “Apple” dan “apple”) berbagi satu baris, bukan terpecah menjadi dua. Tidak ada mode peka huruf besar-kecil: jika Anda perlu membedakan nama diri atau kode, tandai kata-kata itu sebelum menempelkan teksnya.
Keduanya berfungsi sebagai pemisah kata dan tidak pernah masuk ke dalam n-gram. Namun keduanya tidak memotong jendela hitung: kata terakhir sebuah kalimat dan kata pertama kalimat berikutnya tetap dihitung bersama sebagai bigram. Proseslah kalimat atau paragraf secara terpisah bila Anda memerlukan batas kalimat yang ketat.
Hanya jika teksnya Anda segmentasikan lebih dulu. Kata dideteksi sebagai rangkaian huruf dan angka di antara pemisah, sedangkan ketiga bahasa itu ditulis tanpa spasi antarkata, sehingga seluruh kalimat tanpa spasi masuk sebagai satu kata. Jalankan melalui pemenggal kata (jieba, MeCab, pemenggal kata Thai) agar kata-katanya dipisahkan spasi, lalu tempelkan hasilnya di sini. Bahasa Indonesia sendiri tidak bermasalah karena sudah memakai spasi antarkata.
Alat ini tidak menerapkan daftar apa pun, jadi penyaringan dilakukan setelah ekspor. Daftar stopword bahasa Inggris yang paling umum adalah kumpulan 179 kata dari NLTK, yang dipakai sebagian besar alat SEO. Snowball, SpaCy, dan scikit-learn menyediakan daftar yang sedikit berbeda. Untuk bahasa Indonesia, gunakan daftar stopword khusus seperti milik Sastrawi.
Alat Terkait
Generator Nama Kota
Buat nama kota, kota kecil, desa, dan ibu kota fiktif untuk worldbuilding, peta, game, cerita, dan data contoh, lengkap dengan catatan singkat untuk tiap hasil.
Penghasil Nama Domain
Hasilkan ide nama domain dari satu kata kunci: prefiks, sufiks, huruf ganda, dan akhiran angka di enam TLD umum.
Simbol panah untuk disalin
Salin panah Unicode umum sekali klik: lurus, ganda, diagonal, berkait, melingkar, dan segitiga untuk dokumen, chat, dan desain.
Simbol Kurang Dari atau Sama Dengan
Salin tanda ≤ beserta simbol perbandingan matematika terkait. Termasuk Unicode, entitas HTML, dan markah LaTeX untuk spreadsheet, makalah, dan halaman web.
Konverter Teks Ramah Disleksia
Atur ulang teks yang ditempel menjadi paragraf pendek dan baris sekitar 72 karakter agar lebih mudah dibaca. Salin hasilnya ke dokumen, surel, atau editor mana pun.
Keyboard Emoji Online
Tulis pesan, sisipkan emoji pilihan pada posisi kursor, lalu salin draf lengkap di browser. Tanpa akun, unggahan, atau pengganti keyboard perangkat.
Alat ini tersedia dalam bahasa lain
- N-gram 抽出ツール [JA]
- Trình trích xuất N-gram [VI]
- N-그램 추출기 [KO]
- مستخرج N-gram [AR]
- Extrator de n-gramas [PT]
- N-Gramm-Extraktor [DE]
- Extractor de n-gramas [ES]
- Extracteur de n-grammes [FR]
- N-gram-extractor [NL]
- N-gram-extraktor [SV]
- เครื่องมือแยก N-gram [TH]
- Ekstraktor n-gramów [PL]
- N-gram Extractor [EN]
- Estrattore di n-grammi [IT]
- Экстрактор N-грамм [RU]
- N-gram Çıkarıcı [TR]
- N-gram 提取器 [ZH]