Lompat ke isi

Model tas-kata-kata: Perbedaan antara revisi

Ensiklopedia Pengetahuan Universitas Islam Sultan Agung
Maintenance script (bicara | kontrib)
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 28481602; atribusi sumber disertakan.
 
Maintenance script (bicara | kontrib)
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi
 
Baris 1: Baris 1:
'''Model tas-kata-kata''' () ialah sebuah gambaran sederhana digunakan dalam [[Pemrosesan bahasa alami|pengolahan bahasa alami]] dan [[Sistem temu balik informasi|pencarian informasi]]. Dikenal sebagai model [[ruang vektor]]. Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai ''[[Tokenisasi|token]]'', mengabaikan [[tata bahasa]] dan bahkan [[urutan kata]] tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.
'''Model tas-kata-kata''' () ialah sebuah gambaran sederhana digunakan dalam [[Pemrosesan bahasa alami|pengolahan bahasa alami]] dan [[Sistem temu balik informasi|pencarian informasi]].<ref>Soumya George K, Shibily Joseph. ''Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature''. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38</ref> Dikenal sebagai model [[ruang vektor]].<ref>McTear, Michael (''et al''.) (2016). ''The Conversational Interface - Talking to Smart Devices''. hlm. 166.</ref> Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai ''[[Tokenisasi|token]]'', mengabaikan [[tata bahasa]] dan bahkan [[urutan kata]] tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.<ref>McTear, Michael (''et al''.) (2016). ''The Conversational Interface - Talking to Smart Devices''. hlm. 166.</ref><ref>Saxena, D., Saritha, S. K., & Prasad, V. (2017). ''Survey Paper on Feature Extraction Methods in Text Categorization''. International Journal of Computer Applications, 166(11).</ref>


== Contoh Implementasi ==
== Contoh Implementasi ==
Terdapat dua dokumen teks sederhana D1 dan D2:
Terdapat dua dokumen teks sederhana D1 dan D2:<ref>Soumya George K, Shibily Joseph. ''Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature''. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38</ref>


D1: "''The Sun is a star. Sun is beautiful''."
D1: "''The Sun is a star. Sun is beautiful''."
Baris 10: Baris 10:
Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun:
Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun:


<syntaxhighlight lang="text">
{
"The":1
"Sun":2
"is":3
"a":4
"star":5
"beautiful":6
"Moon":7
"satellite":8
}
</syntaxhighlight>


Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus.
Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus.


== Catatan kaki ==
== Referensi ==
 
<references />
 


== Sumber dan atribusi ==
== Sumber dan atribusi ==


Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Model+tas-kata-kata&oldid=28481602 Wikipedia bahasa Indonesia], revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Model+tas-kata-kata&oldid=28481602 Wikipedia bahasa Indonesia], revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
<!-- WIKI_UNISSULA_PRESENTATION_V4 -->

Revisi terkini sejak 23 Agustus 2026 10.36

Model tas-kata-kata () ialah sebuah gambaran sederhana digunakan dalam pengolahan bahasa alami dan pencarian informasi.[1] Dikenal sebagai model ruang vektor.[2] Pada model ini, tiap kalimat dalam dokumen digambarkan sebagai token, mengabaikan tata bahasa dan bahkan urutan kata tetapi menghitung frekuensi kejadian atau kemunculan kata dari dokumen.[3][4]

Contoh Implementasi

Terdapat dua dokumen teks sederhana D1 dan D2:[5]

D1: "The Sun is a star. Sun is beautiful."

D2: "The Moon is a satellite."

Berdasar pada kedua dokumen tersebut, sebuah kamus dibangun:

<syntaxhighlight lang="text"> {

"The":1
"Sun":2
"is":3
"a":4
"star":5
"beautiful":6
"Moon":7
"satellite":8

} </syntaxhighlight>

Dokumen memiliki 8 kata berbeda. Tiap dokumen digambarkan sebagai 8 unsur vektor [1, 2, 2, 1, 1, 1, 0, 0] [1, 0, 1, 1, 0, 0, 1, 1] yang mana tiap entri dari vektor mengacu pada jumlah entri dalam kamus.

Referensi

  1. Soumya George K, Shibily Joseph. Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38
  2. McTear, Michael (et al.) (2016). The Conversational Interface - Talking to Smart Devices. hlm. 166.
  3. McTear, Michael (et al.) (2016). The Conversational Interface - Talking to Smart Devices. hlm. 166.
  4. Saxena, D., Saritha, S. K., & Prasad, V. (2017). Survey Paper on Feature Extraction Methods in Text Categorization. International Journal of Computer Applications, 166(11).
  5. Soumya George K, Shibily Joseph. Text Classification by Augmenting Bag of Words (BOW) Representation with Co-occurrence Feature. IOSR Journal of Computer Engineering (IOSR-JCE) Volume 16, Issue 1, Ver. V (Jan. 2014), PP 34-38

Sumber dan atribusi

Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28481602 (2025-11-14T07:35:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.