<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="id">
	<id>https://wiki.unissula.ac.id/index.php?action=history&amp;feed=atom&amp;title=Tf%E2%80%93idf</id>
	<title>Tf–idf - Riwayat revisi</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.unissula.ac.id/index.php?action=history&amp;feed=atom&amp;title=Tf%E2%80%93idf"/>
	<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;action=history"/>
	<updated>2026-09-16T08:22:00Z</updated>
	<subtitle>Riwayat revisi halaman ini di wiki</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;diff=353&amp;oldid=prev</id>
		<title>Maintenance script: Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi</title>
		<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;diff=353&amp;oldid=prev"/>
		<updated>2026-08-23T03:07:23Z</updated>

		<summary type="html">&lt;p&gt;Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi&lt;/p&gt;
&lt;a href=&quot;https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;amp;diff=353&amp;amp;oldid=193&quot;&gt;Lihat perubahan&lt;/a&gt;</summary>
		<author><name>Maintenance script</name></author>
	</entry>
	<entry>
		<id>https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;diff=193&amp;oldid=prev</id>
		<title>Maintenance script: Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 29588112; atribusi sumber disertakan.</title>
		<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Tf%E2%80%93idf&amp;diff=193&amp;oldid=prev"/>
		<updated>2026-08-23T02:26:21Z</updated>

		<summary type="html">&lt;p&gt;Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 29588112; atribusi sumber disertakan.&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Halaman baru&lt;/b&gt;&lt;/p&gt;&lt;div&gt;Dalam [[temu balik informasi]], &amp;#039;&amp;#039;&amp;#039;tf–idf&amp;#039;&amp;#039;&amp;#039;, &amp;#039;&amp;#039;&amp;#039;TF*IDF&amp;#039;&amp;#039;&amp;#039;, atau &amp;#039;&amp;#039;&amp;#039;TFIDF&amp;#039;&amp;#039;&amp;#039; (singkatan dari , ) adalah ukuran statistik yang menggambarkan pentingnya suatu istilah terhadap sebuah [[dokumen]] dalam sebuah kumpulan atau [[korpus]]. Ukuran ini sering dipakai sebagai [[Pembobotan|faktor pembobot]] dalam pencarian temu balik informasi, [[penambangan teks]], dan [[pemodelan pengguna]]. Nilai tf–idf bertambah [[Kesebandingan (matematika)|sebanding]] dengan jumlah kemunculan istilah dalam dan bergantung pada jumlah dokumen dalam korpus yang memiliki istilah tersebut.&lt;br /&gt;
&lt;br /&gt;
== Latar belakang ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Definisi ==&lt;br /&gt;
=== Frekuensi istilah ===&lt;br /&gt;
Frekuensi istilah, , adalah frekuensi istilah ,&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tf}(t, d) = \frac{f_{t,d}}{\sum_{t&amp;#039; \in d} f_{t&amp;#039;\!,d}}&amp;lt;/math&amp;gt;&lt;br /&gt;
dengan  adalah &amp;#039;&amp;#039;pencacahan mentah&amp;#039;&amp;#039; istilah dalam dokumen, yaitu jumlah kemunculan istilah  dalam dokumen . Semakin sering suatu istilah muncul, semakin besar nilai tf-nya. Terdapat beberapa cara untuk mendefinisikan frekuensi istilah.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Inversi frekuensi dokumen ===&lt;br /&gt;
Inversi frekuensi dokumen, , adalah ukuran informasi yang diberikan oleh istilah , yaitu seberapa sering atau jarang sebuah istilah muncul dalam seluruh dokumen. Semakin jarang suatu istilah di antara dokumen, semakin besar nilai idf-nya. Nilainya adalah logaritma dari kebalikan dari jumlah dokumen yang memiliki istilah  yang dibagi jumlah seluruh dokumen (),&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{idf}(t, D) = \log \frac{N}&amp;lt;/math&amp;gt;&lt;br /&gt;
dengan himpunan  adalah himpunan dokumen  dalam  yang memiliki istilah .&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Frekuensi istilah–inversi frekuensi dokumen ===&lt;br /&gt;
Nilai frekuensi istilah–inversi frekuensi dokumen (tf–idf) dapat dihitung dengan&lt;br /&gt;
:&lt;br /&gt;
&lt;br /&gt;
Nilai ini akan besar ketika istilah tersebut sering muncul (tf besar), tetapi hanya dalam sedikit dokumen (idf besar atau df kecil). Nilai ini biasanya membuang istilah-istilah umum.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Peran idf ==&lt;br /&gt;
Nilai idf dikenalkan sebagai &amp;quot;kekhasan istilah&amp;quot; oleh [[Karen Spärck Jones]] dalam sebuah makalah tahun 1972. Meski ia bekerja dengan baik sebagai [[heuristik]], dasar-dasar teoretisnya telah menjadi masalah setidaknya selama tiga puluh tahun. Para peneliti mencoba untuk mencari alasannya secara [[teori informasi|teoretis informasi]].&lt;br /&gt;
&lt;br /&gt;
Penjelasan dari Spärck Jones sendiri tidak terlalu mengajukan banyak teori selain hubungannya dengan [[hukum Zipf]]. Beberapa upaya telah dilakukan untuk menempatkan idf dalam bidang [[Peluang (matematika)|probabilistik]] dengan memperkirakan probabilitas bahwa dokumen  memiliki istilah  sebagai frekuensi relatif dokumen,&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(t|D) = \frac{N},&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
sehingga kita bisa mendefinisikan idf sebagai berikut.&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;&lt;br /&gt;
\begin{align}&lt;br /&gt;
\mathrm{idf} &amp;amp;= -\log P(t|D) \\&lt;br /&gt;
             &amp;amp;= \log \frac{1}{P(t|D)} \\&lt;br /&gt;
             &amp;amp;= \log \frac{N}&lt;br /&gt;
\end{align}&lt;br /&gt;
&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Dengan kata lain, inversi frekuensi dokumen adalah logaritma dari &amp;quot;inversi&amp;quot; frekuensi dokumen relatif.&lt;br /&gt;
&lt;br /&gt;
Penafsiran probabilistik ini memakai bentuk yang sama dengan [[isi informasi]]. Namun, penerapan cara pandang informasi-teoretis ke masalah dalam temu balik informasi menyebabkan masalah ketika mencoba untuk mendefinisikan [[ruang sampel]] untuk [[sebaran probabilitas]]: tidak hanya dokumen yang harus diperhatikan, tetapi juga kueri dan istilah.&lt;br /&gt;
&lt;br /&gt;
== Kaitan dengan teori informasi ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Contoh tf–idf ==&lt;br /&gt;
Misalkan terdapat tabel jumlah istilah dalam korpus yang berisi dua dokumen seperti tabel-tabel di samping.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Untuk menghitung tf–idf istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039;, dapat dilakukan langkah-langkah berikut.&lt;br /&gt;
&lt;br /&gt;
Dalam bentuk frekuensi mentahnya, tf hanyalah frekuensi istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039; dalam tiap dokumen. Dalam tiap dokumen, istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039; sama-sama muncul sekali. Namun, karena dokumen 2 punya lebih banyak kata, frekuensi relatifnya lebih kecil.&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tf}(\mathsf{&amp;#039;&amp;#039;ini&amp;#039;&amp;#039;}, d_1) = \frac{1}{5} = 0,\!2&amp;lt;/math&amp;gt;&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tf}(\mathsf{&amp;#039;&amp;#039;ini&amp;#039;&amp;#039;}, d_2) = \frac{1}{7} \approx 0,\!14&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Nilai idf bersifat tetap per korpus dan bergantung pada jumlah dokumen yang memiliki istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039;. Dalam kasus ini, kita memiliki korpus yang semua dokumennya memiliki istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039;.&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{idf}(\mathsf{&amp;#039;&amp;#039;ini&amp;#039;&amp;#039;}, D) = \log \left(\frac{2}{2}\right) = 0&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Jadi, nilai tf–idf istilah &amp;#039;&amp;#039;ini&amp;#039;&amp;#039; adalah nol yang berarti bahwa istilah ini tidak terlalu bermakna karena muncul dalam seluruh dokumen.&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tfidf}(\mathsf{&amp;#039;&amp;#039;ini&amp;#039;&amp;#039;}, d_1, D) = 0,\!2 \times 0 = 0&amp;lt;/math&amp;gt;&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tfidf}(\mathsf{&amp;#039;&amp;#039;ini&amp;#039;&amp;#039;}, d_2, D) = 0,\!14 \times 0 = 0&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Contoh lainnya, istilah &amp;#039;&amp;#039;contoh&amp;#039;&amp;#039; muncul tiga kali, tetapi hanya dalam dokumen 2.&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_1) = \frac{0}{5} = 0&amp;lt;/math&amp;gt;&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_2) = \frac{3}{7} \approx 0,\!429&amp;lt;/math&amp;gt;&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{idf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, D) = \log \left(\frac{2}{1}\right) = 0,\!301&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Terakhir,&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tfidf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_1, D) = \mathrm{tf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_1) \times \mathrm{idf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, D) = 0 \times 0,\!301 = 0&amp;lt;/math&amp;gt;&lt;br /&gt;
: &amp;lt;math&amp;gt;\mathrm{tfidf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_2, D) = \mathrm{tf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, d_2) \times \mathrm{idf}(\mathsf{&amp;#039;&amp;#039;contoh&amp;#039;&amp;#039;}, D) = 0,\!429 \times 0,\!301 \approx 0,\!129&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Penggunaan lain ==&lt;br /&gt;
Konsep tf–idf juga dipakai untuk hal selain istilah. Pada tahun 1998, konsep idf dipakai untuk sitasi. Peneliti tersebut mengusulkan bahwa, bila sitasi yang jarang dipakai itu dipakai oleh dua dokumen berbeda, ia harus berbobot lebih tinggi daripada sitasi yang dipakai oleh banyak dokumen. Selain itu, tf–idf juga diterapkan untuk &amp;quot;kata visual&amp;quot; dengan tujuan untuk mencocokan objek dalam video dan kalimat lengkap.&lt;br /&gt;
&lt;br /&gt;
Namun, konsep tf–idf tidak terbukti lebih efektif daripada hanya tf (tanpa idf) untuk semua kasus. Ketika tf–idf diterapkan untuk sitasi, para peneliti tidak menemukan peningkatan kinerja dibanding pencacahan-sitasi sederhana yang tidak memakai komponen idf.&lt;br /&gt;
&lt;br /&gt;
== Turunan ==&lt;br /&gt;
Ada beberapa skema pembobotan istilah yang dikembangkan dari tf–idf. Salah satunya adalah TF–PDF (frekuensi istilah–frekuensi dokumen seimbang). TF–PDF dikenalkan pada tahun 2001 dalam konteks pengidentifikasi topik baru di media. Komponen PDF mengukur perbedaan jumlah kemunculan sebuah istilah dalam berbagai bidang.&lt;br /&gt;
&lt;br /&gt;
Skema lainnya adalah TF–IDuF. Dalam TF–IDuF, nilai idf tidak dihitung berdasarkan korpus yang akan dicari, tetapi dihitung dari kumpulan dokumen pribadi pengguna. Penulis tersebut melaporkan bahwa TF–IDuF hampir seefektif tf–idf, tetapi juga bisa dipakai dalam keadaan semisal tiada akses ke korpus dokumen global.&lt;br /&gt;
&lt;br /&gt;
== Lihat pula ==&lt;br /&gt;
&lt;br /&gt;
* [[Alokasi laten Dirichlet]]&lt;br /&gt;
* [[Analisis semantik laten]]&lt;br /&gt;
* [[Informasi bersama]]&lt;br /&gt;
* [[Jumlah kata]]&lt;br /&gt;
* [[Kelompok kata benda]]&lt;br /&gt;
* [[Model ruang vektor]]&lt;br /&gt;
* [[Okapi BM25]]&lt;br /&gt;
* [[PageRank]]&lt;br /&gt;
* [[Penyematan kata]]&lt;br /&gt;
* [[Penyimpangan Kullback–Leibler]]&lt;br /&gt;
* [[SMART Information Retrieval System]]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Daftar pustaka ==&lt;br /&gt;
*&lt;br /&gt;
*&lt;br /&gt;
*&lt;br /&gt;
&lt;br /&gt;
== Referensi ==&lt;br /&gt;
&lt;br /&gt;
== Sumber dan atribusi ==&lt;br /&gt;
&lt;br /&gt;
Artikel ini diadaptasi dalam mode teks dari&lt;br /&gt;
[https://id.wikipedia.org/w/index.php?title=Tf%E2%80%93idf&amp;amp;oldid=29588112 Wikipedia bahasa Indonesia],&lt;br /&gt;
revisi 29588112 (2026-08-16T11:09:42Z).&lt;br /&gt;
Gambar, media, infobox, templat navigasi, dan kategori sumber&lt;br /&gt;
tidak diimpor ke Wiki Unissula.&lt;br /&gt;
Atribusi dan lisensi mengikuti ketentuan Creative Commons&lt;br /&gt;
Atribusi-BerbagiSerupa (CC BY-SA) pada sumber Wikipedia.&lt;/div&gt;</summary>
		<author><name>Maintenance script</name></author>
	</entry>
</feed>