Model tas-kata-kata: Perbedaan antara revisi
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 28481602; atribusi sumber disertakan. |
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi |
||
| Baris 1: | Baris 1: | ||
'''Model tas-kata-kata''' () ialah sebuah gambaran sederhana digunakan dalam [[Pemrosesan bahasa alami|pengolahan bahasa alami]] dan [[Sistem temu balik informasi|pencarian informasi]]. Dikenal sebagai model [[ruang vektor]]. Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai ''[[Tokenisasi|token]]'', mengabaikan [[tata bahasa]] dan bahkan [[urutan kata]] tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen. | '''Model tas-kata-kata''' () ialah sebuah gambaran sederhana digunakan dalam [[Pemrosesan bahasa alami|pengolahan bahasa alami]] dan [[Sistem temu balik informasi|pencarian informasi]].<ref>Soumya George K, Shibily Joseph. ''Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature''. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38</ref> Dikenal sebagai model [[ruang vektor]].<ref>McTear, Michael (''et al''.) (2016). ''The Conversational Interface - Talking to Smart Devices''. hlm. 166.</ref> Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai ''[[Tokenisasi|token]]'', mengabaikan [[tata bahasa]] dan bahkan [[urutan kata]] tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.<ref>McTear, Michael (''et al''.) (2016). ''The Conversational Interface - Talking to Smart Devices''. hlm. 166.</ref><ref>Saxena, D., Saritha, S. K., & Prasad, V. (2017). ''Survey Paper on Feature Extraction Methods in Text Categorization''. International Journal of Computer Applications, 166(11).</ref> | ||
== Contoh Implementasi == | == Contoh Implementasi == | ||
Terdapat dua dokumen teks sederhana D1 dan D2: | Terdapat dua dokumen teks sederhana D1 dan D2:<ref>Soumya George K, Shibily Joseph. ''Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature''. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38</ref> | ||
D1: "''The Sun is a star. Sun is beautiful''." | D1: "''The Sun is a star. Sun is beautiful''." | ||
| Baris 10: | Baris 10: | ||
Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun: | Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun: | ||
<syntaxhighlight lang="text"> | |||
{ | |||
"The":1 | |||
"Sun":2 | |||
"is":3 | |||
"a":4 | |||
"star":5 | |||
"beautiful":6 | |||
"Moon":7 | |||
"satellite":8 | |||
} | |||
</syntaxhighlight> | |||
Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus. | Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus. | ||
== | == Referensi == | ||
<references /> | |||
== Sumber dan atribusi == | == Sumber dan atribusi == | ||
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Model+tas-kata-kata&oldid=28481602 Wikipedia bahasa Indonesia], revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku. | Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Model+tas-kata-kata&oldid=28481602 Wikipedia bahasa Indonesia], revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku. | ||
<!-- WIKI_UNISSULA_PRESENTATION_V4 --> | |||
Revisi terkini sejak 23 Agustus 2026 10.36
Model tas-kata-kata () ialah sebuah gambaran sederhana digunakan dalam pengolahan bahasa alami dan pencarian informasi.[1] Dikenal sebagai model ruang vektor.[2] Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai token, mengabaikan tata bahasa dan bahkan urutan kata tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.[3][4]
Contoh Implementasi
Terdapat dua dokumen teks sederhana D1 dan D2:[5]
D1: "The Sun is a star. Sun is beautiful."
D2: "The Moon is a satellite."
Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun:
<syntaxhighlight lang="text"> {
"The":1 "Sun":2 "is":3 "a":4 "star":5 "beautiful":6 "Moon":7 "satellite":8
} </syntaxhighlight>
Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus.
Referensi
- ↑ Soumya George K, Shibily Joseph. Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38
- ↑ McTear, Michael (et al.) (2016). The Conversational Interface - Talking to Smart Devices. hlm. 166.
- ↑ McTear, Michael (et al.) (2016). The Conversational Interface - Talking to Smart Devices. hlm. 166.
- ↑ Saxena, D., Saritha, S. K., & Prasad, V. (2017). Survey Paper on Feature Extraction Methods in Text Categorization. International Journal of Computer Applications, 166(11).
- ↑ Soumya George K, Shibily Joseph. Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38
Sumber dan atribusi
Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.