Model tas-kata-kata
Model tas-kata-kata () ialah sebuah gambaran sederhana digunakan dalam pengolahan bahasa alami dan pencarian informasi. Dikenal sebagai model ruang vektor. Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai token, mengabaikan tata bahasa dan bahkan urutan kata tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.
Contoh Implementasi
Terdapat dua dokumen teks sederhana D1 dan D2:
D1: "The Sun is a star. Sun is beautiful."
D2: "The Moon is a satellite."
Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun:
Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus.
Catatan kaki
Sumber dan atribusi
Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.