<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="id">
	<id>https://wiki.unissula.ac.id/index.php?action=history&amp;feed=atom&amp;title=Model_teks-ke-gambar</id>
	<title>Model teks-ke-gambar - Riwayat revisi</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.unissula.ac.id/index.php?action=history&amp;feed=atom&amp;title=Model_teks-ke-gambar"/>
	<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Model_teks-ke-gambar&amp;action=history"/>
	<updated>2026-09-15T12:12:33Z</updated>
	<subtitle>Riwayat revisi halaman ini di wiki</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.unissula.ac.id/index.php?title=Model_teks-ke-gambar&amp;diff=368&amp;oldid=prev</id>
		<title>Maintenance script: Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi</title>
		<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Model_teks-ke-gambar&amp;diff=368&amp;oldid=prev"/>
		<updated>2026-08-23T03:07:59Z</updated>

		<summary type="html">&lt;p&gt;Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi&lt;/p&gt;
&lt;table style=&quot;background-color: #fff; color: #202122;&quot; data-mw-interface=&quot;&quot;&gt;
				&lt;col class=&quot;diff-marker&quot; /&gt;
				&lt;col class=&quot;diff-content&quot; /&gt;
				&lt;col class=&quot;diff-marker&quot; /&gt;
				&lt;col class=&quot;diff-content&quot; /&gt;
				&lt;tr class=&quot;diff-title&quot; lang=&quot;id&quot;&gt;
				&lt;td colspan=&quot;2&quot; style=&quot;background-color: #fff; color: #202122; text-align: center;&quot;&gt;← Revisi sebelumnya&lt;/td&gt;
				&lt;td colspan=&quot;2&quot; style=&quot;background-color: #fff; color: #202122; text-align: center;&quot;&gt;Revisi per 23 Agustus 2026 03.07&lt;/td&gt;
				&lt;/tr&gt;&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot; id=&quot;mw-diff-left-l1&quot;&gt;Baris 1:&lt;/td&gt;
&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot;&gt;Baris 1:&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-deleted&quot;&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;[[File:Astronaut_Riding_a_Horse_Hiroshige_(SD3.5).webp|thumb|right|280px|Astronaut Riding a Horse Hiroshige (SD3.5)]]&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-deleted&quot;&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model &amp;#039;&amp;#039;&amp;#039;teks-ke-gambar&amp;#039;&amp;#039;&amp;#039; adalah sebuah model [[pembelajaran mesin]] yang menerima masukan berupa deskripsi [[bahasa alami]] dan menghasilkan sebuah gambar sesuai dengan deskripsi tersebut. Model-model tersebut mulai dikembangkan pada pertengahan 2010-an, sebagai hasil dari kemajuan di [[pemelajaran dalam]]. Pada tahun 2022, keluaran dari model teks-ke-gambar seperti DALL-E 2 oleh [[OpenAI]], Imagen oleh [[Google]], [[Stable Diffusion]], dan [[Midjourney]] mulai mencapai kualitas seperti foto dan karya seni buatan manusia.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model &amp;#039;&amp;#039;&amp;#039;teks-ke-gambar&amp;#039;&amp;#039;&amp;#039; adalah sebuah model [[pembelajaran mesin]] yang menerima masukan berupa deskripsi [[bahasa alami]] dan menghasilkan sebuah gambar sesuai dengan deskripsi tersebut. Model-model tersebut mulai dikembangkan pada pertengahan 2010-an, sebagai hasil dari kemajuan di [[pemelajaran dalam]]. Pada tahun 2022, keluaran dari model teks-ke-gambar seperti DALL-E 2 oleh [[OpenAI]], Imagen oleh [[Google]], [[Stable Diffusion]], dan [[Midjourney]] mulai mencapai kualitas seperti foto dan karya seni buatan manusia.&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot; id=&quot;mw-diff-left-l8&quot;&gt;Baris 8:&lt;/td&gt;
&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot;&gt;Baris 10:&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Tugas sebaliknya, [[Penghasil bahasa alami|pendeskripsian gambar]], lebih mudah dibuat dan sejumlah model pemelajaran dalam pendeskripsian gambar muncul sebelum model teks-ke-gambar pertama.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Tugas sebaliknya, [[Penghasil bahasa alami|pendeskripsian gambar]], lebih mudah dibuat dan sejumlah model pemelajaran dalam pendeskripsian gambar muncul sebelum model teks-ke-gambar pertama.&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model teks-ke-gambar modern pertama, alignDRAW, diperkenalkan pada tahun 2015 oleh peneliti dari [[Universitas Toronto]]. alignDRAW memperluas arsitektur DRAW untuk dikondisikan berdasarkan urutan teks. Gambar yang dihasilkan oleh alignDRAW cenderung blur dan tidak fotorealistis, tetapi model dapat menghasilkan objek yang tidak ada pada data latih (seperti bis sekolah berwarna merah), dan menangani perintah yang tidak lazim seperti &quot;sebuah rambu tanda berhenti melayang di langit biru&quot;, menunjukan bahwa dia tidak sekadar &quot;menghafal&quot; data dari kumpulan data latih.Pada tahun 2016, Reed, Akata, Yan et al. berhasil menjadi yang pertama dalam menggunakan jaringan adversarial generatif untuk tugas teks-ke-gambar. Dengan model yang dilatih pada kumpulan data yang sempit dan spesifik, mereka dapat menghasilkan gambar dengan &quot;tampilan meyakinkan&quot; seperti gambar burung dan bunga dari deskripsi teks seperti &quot;Sebuah burung berwarna hitam sepenuhnya dengan paruh yang unik dan bulat&quot;. Sebuah model yang dilatih pada kumpulan data COCO menghasilkan gambar yang &quot;dipandang dari jauh... meyakinkan&quot;, tetapi secara detil kurang koherensi. Sistem selanjutnya meliputi VQGAN+CLIP, XMC-GAN, dan GauGAN2.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model teks-ke-gambar modern pertama, alignDRAW, diperkenalkan pada tahun 2015 oleh peneliti dari [[Universitas Toronto]]. alignDRAW memperluas arsitektur DRAW untuk dikondisikan berdasarkan urutan teks. Gambar yang dihasilkan oleh alignDRAW cenderung blur dan tidak fotorealistis, tetapi model dapat menghasilkan objek yang tidak ada pada data latih (seperti bis sekolah berwarna merah), dan menangani perintah yang tidak lazim seperti &quot;sebuah rambu tanda berhenti melayang di langit biru&quot;, menunjukan bahwa dia tidak sekadar &quot;menghafal&quot; data dari kumpulan data latih.Pada tahun 2016, Reed, Akata, Yan et al. berhasil menjadi yang pertama dalam menggunakan jaringan adversarial generatif untuk tugas teks-ke-gambar. Dengan model yang dilatih pada kumpulan data yang sempit dan spesifik, mereka dapat menghasilkan gambar dengan &quot;tampilan meyakinkan&quot; seperti gambar burung dan bunga dari deskripsi teks seperti &quot;Sebuah burung berwarna hitam sepenuhnya dengan paruh yang unik dan bulat&quot;. Sebuah model yang dilatih pada kumpulan data COCO menghasilkan gambar yang &quot;dipandang dari jauh... meyakinkan&quot;, tetapi secara detil kurang koherensi. Sistem selanjutnya meliputi VQGAN+CLIP,&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Jesus Rodriguez. [https://thesequence.substack.com/p/edge229 🌅 Edge#229: VQGAN + CLIP]. &#039;&#039;thesequence.substack.com&#039;&#039;.&amp;lt;/ref&amp;gt; &lt;/ins&gt;XMC-GAN, dan GauGAN2.&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Jesus Rodriguez. [https://thesequence.substack.com/p/edge231 🎆🌆 Edge#231: Text-to-Image Synthesis with GANs]. &#039;&#039;thesequence.substack.com&#039;&#039;.&amp;lt;/ref&amp;gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Sebuah model teks-ke-gambar pertama yang menarik perhatian publik adalah [[OpenAI]] DALL-E, sebuah sistem transformer yang diumumkan pada Januari 2021. Sebuah penerus yang dapat menghasilkan gambar yang lebih kompleks dan realistis , DALL-E 2, diperkenalkan pada April 2022, diikuti oleh [[Stable Diffusion]] yang dirilis secara publik pada Agustus 2022.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Sebuah model teks-ke-gambar pertama yang menarik perhatian publik adalah [[OpenAI]] DALL-E, sebuah sistem transformer yang diumumkan pada Januari 2021. Sebuah penerus yang dapat menghasilkan gambar yang lebih kompleks dan realistis , DALL-E 2, diperkenalkan pada April 2022, diikuti oleh [[Stable Diffusion]] yang dirilis secara publik pada Agustus 2022.&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;[https://stability.ai/blog/stable-diffusion-public-release Stable Diffusion Public Release]. &#039;&#039;Stability.Ai&#039;&#039;.&amp;lt;/ref&amp;gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Mengikuti model teks-ke-gambar lainnya, platform teks-ke-video seperti Runway, Make-A-Video, Imagen Video, Midjourney, dan Phenaki dapat menghasilkan video dari perintah teks dan/atau teks/gambar.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Mengikuti model teks-ke-gambar lainnya, platform teks-ke-video seperti Runway, Make-A-Video,&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Ashish Kumar. [https://www.marktechpost.com/2022/10/03/meta-ai-introduces-make-a-video-an-artificial-intelligence-system-that-generates-videos-from-text/ Meta AI Introduces &#039;Make-A-Video&#039;: An Artificial Intelligence System That Generates Videos From Text]. &#039;&#039;MarkTechPost&#039;&#039;. 2022-10-03.&amp;lt;/ref&amp;gt; &lt;/ins&gt;Imagen Video,&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Benj Edwards. [https://arstechnica.com/information-technology/2022/10/googles-newest-ai-generator-creates-hd-video-from-text-prompts/ Google&#039;s newest AI generator creates HD video from text prompts]. &#039;&#039;Ars Technica&#039;&#039;. 2022-10-05.&amp;lt;/ref&amp;gt; &lt;/ins&gt;Midjourney,&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Jesus Rodriguez. [https://thesequence.substack.com/p/edge237 🎨 Edge#237: What is Midjourney?]. &#039;&#039;thesequence.substack.com&#039;&#039;.&amp;lt;/ref&amp;gt; &lt;/ins&gt;dan Phenaki&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;[https://phenaki.video/?mc_cid=9fee7eeb9d&amp;amp;mc_eid=6e7303fddd#interactive Phenaki]. &#039;&#039;phenaki.video&#039;&#039;.&amp;lt;/ref&amp;gt; &lt;/ins&gt;dapat menghasilkan video dari perintah teks dan/atau teks/gambar.&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;ref&amp;gt;Benj Edwards. [https://arstechnica.com/information-technology/2022/09/runway-teases-ai-powered-text-to-video-editing-using-written-prompts/ Runway teases AI-powered text-to-video editing using written prompts]. Ars Technica. 9 September 2022.&amp;lt;/ref&amp;gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Arsitektur dan pelatihan ==&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Arsitektur dan pelatihan ==&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model teks-ke-gambar telah dibuat menggunakan berbagai jenis arsitektur. untuk langkah menghasilkan gambar, jaringan adversarial generatif kondisional telah umum digunakan, dengan [[model difusi]] juga menjadi populer akhir-akhir ini. Ketimbang melatih secara langsung sebuah model untuk menghasilkan keluaran beresolusi tinggi yang dikondisikan pada sebuah sematan teks, teknik populer adalah dengan melatih sebuah model untuk menghasilkan keluaran beresolusi rendah, dan lalu menggunakan model pemelajaran dalam untuk meningkatkan resolusi, dengan mengisi detil yang lebih dalam.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Model teks-ke-gambar telah dibuat menggunakan berbagai jenis arsitektur. untuk langkah menghasilkan gambar, jaringan adversarial generatif kondisional telah umum digunakan, dengan [[model difusi]] juga menjadi populer akhir-akhir ini. Ketimbang melatih secara langsung sebuah model untuk menghasilkan keluaran beresolusi tinggi yang dikondisikan pada sebuah sematan teks, teknik populer adalah dengan melatih sebuah model untuk menghasilkan keluaran beresolusi rendah, dan lalu menggunakan model pemelajaran dalam untuk meningkatkan resolusi, dengan mengisi detil yang lebih dalam.&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot; id=&quot;mw-diff-left-l21&quot;&gt;Baris 21:&lt;/td&gt;
&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot;&gt;Baris 22:&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Kumpulan data ==&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Kumpulan data ==&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Melatih model teks-ke-gambar membutuhkan sebuah kumpulan data yang dipadukan dengan deskripsi teks. Sebuah kumpulan data yang umum digunakan untuk tujuan ini adalah COCO (Common Objects in Context). Dirilis oleh Microsoft pada tahun 2014, COCO berisi kurang lebih 123,000 gambar yang memperlihatkan keanekaragaman objek, dengan lima deskripsi per gambar, yang dihasilkan oleh manusia. Oxford-120 Flowers dan CUB-200 Birds adalah kumpulan data yang lebih kecil, dimana masing-masing terbatas pada bunga dan burung. Menggunakan kumpulan data tersebut dianggap lebih mudah untuk melatih model teks-ke-gambar berkualitas tinggi, dikarenakan materinya lebih sempit.&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Melatih model teks-ke-gambar membutuhkan sebuah kumpulan data yang dipadukan dengan deskripsi teks. Sebuah kumpulan data yang umum digunakan untuk tujuan ini adalah COCO (Common Objects in Context). Dirilis oleh Microsoft pada tahun 2014, COCO berisi kurang lebih 123,000 gambar yang memperlihatkan keanekaragaman objek, dengan lima deskripsi per gambar, yang dihasilkan oleh manusia. Oxford-120 Flowers dan CUB-200 Birds adalah kumpulan data yang lebih kecil, dimana masing-masing terbatas pada bunga dan burung. Menggunakan kumpulan data tersebut dianggap lebih mudah untuk melatih model teks-ke-gambar berkualitas tinggi, dikarenakan materinya lebih sempit.&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot; id=&quot;mw-diff-left-l28&quot;&gt;Baris 28:&lt;/td&gt;
&lt;td colspan=&quot;2&quot; class=&quot;diff-lineno&quot;&gt;Baris 28:&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Lihat pula ==&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Lihat pula ==&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;* [[Seni kecerdasan buatan]]&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;* [[Seni kecerdasan buatan]]&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Referensi ==&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Referensi ==&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-deleted&quot;&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;references /&amp;gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Sumber dan atribusi ==&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;== Sumber dan atribusi ==&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot;&gt;&lt;/td&gt;&lt;td style=&quot;background-color: #f8f9fa; color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #eaecf0; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;br&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Artikel &lt;/del&gt;ini diadaptasi &lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;dalam mode teks &lt;/del&gt;dari&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Konten artikel &lt;/ins&gt;ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Model+teks&lt;/ins&gt;-ke-gambar&amp;amp;oldid=29354286 Wikipedia bahasa Indonesia], revisi 29354286 (2026-06-16T17:59:22Z), &lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;yang tersedia berdasarkan &lt;/ins&gt;lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA)&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;. Gambar &lt;/ins&gt;pada &lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;artikel ini bersumber dari Wikimedia Commons dan mengikuti ketentuan lisensi masing-masing berkas. Mohon gunakan konten dan media secara bijak serta sesuai dengan ketentuan lisensi yang berlaku&lt;/ins&gt;.&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;[https://id.wikipedia.org/w/index.php?title=&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Model_teks&lt;/del&gt;-ke-gambar&amp;amp;oldid=29354286 Wikipedia bahasa Indonesia],&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt; &lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;revisi 29354286 (2026-06-16T17:59:22Z)&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;.&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;+&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #a3d3ff; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;ins style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;&amp;lt;!-- WIKI_UNISSULA_PRESENTATION_V4 --&amp;gt;&lt;/ins&gt;&lt;/div&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Gambar, media, infobox, templat navigasi&lt;/del&gt;, &lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;dan kategori sumber&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;tidak diimpor ke Wiki Unissula.&lt;/del&gt;&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;&lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;Atribusi dan &lt;/del&gt;lisensi &lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;mengikuti ketentuan &lt;/del&gt;Creative Commons&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td class=&quot;diff-marker&quot; data-marker=&quot;−&quot;&gt;&lt;/td&gt;&lt;td style=&quot;color: #202122; font-size: 88%; border-style: solid; border-width: 1px 1px 1px 4px; border-radius: 0.33em; border-color: #ffe49c; vertical-align: top; white-space: pre-wrap;&quot;&gt;&lt;div&gt;Atribusi-BerbagiSerupa (CC BY-SA) pada &lt;del style=&quot;font-weight: bold; text-decoration: none;&quot;&gt;sumber Wikipedia&lt;/del&gt;.&lt;/div&gt;&lt;/td&gt;&lt;td colspan=&quot;2&quot; class=&quot;diff-side-added&quot;&gt;&lt;/td&gt;&lt;/tr&gt;
&lt;/table&gt;</summary>
		<author><name>Maintenance script</name></author>
	</entry>
	<entry>
		<id>https://wiki.unissula.ac.id/index.php?title=Model_teks-ke-gambar&amp;diff=209&amp;oldid=prev</id>
		<title>Maintenance script: Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 29354286; atribusi sumber disertakan.</title>
		<link rel="alternate" type="text/html" href="https://wiki.unissula.ac.id/index.php?title=Model_teks-ke-gambar&amp;diff=209&amp;oldid=prev"/>
		<updated>2026-08-23T02:28:08Z</updated>

		<summary type="html">&lt;p&gt;Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 29354286; atribusi sumber disertakan.&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Halaman baru&lt;/b&gt;&lt;/p&gt;&lt;div&gt;Model &amp;#039;&amp;#039;&amp;#039;teks-ke-gambar&amp;#039;&amp;#039;&amp;#039; adalah sebuah model [[pembelajaran mesin]] yang menerima masukan berupa deskripsi [[bahasa alami]] dan menghasilkan sebuah gambar sesuai dengan deskripsi tersebut. Model-model tersebut mulai dikembangkan pada pertengahan 2010-an, sebagai hasil dari kemajuan di [[pemelajaran dalam]]. Pada tahun 2022, keluaran dari model teks-ke-gambar seperti DALL-E 2 oleh [[OpenAI]], Imagen oleh [[Google]], [[Stable Diffusion]], dan [[Midjourney]] mulai mencapai kualitas seperti foto dan karya seni buatan manusia.&lt;br /&gt;
&lt;br /&gt;
Model teks-ke-gambar secara umum menggabungkan sebuah [[model bahasa]], yang mengubah teks masukan kedalam sebuah representasi laten, dan sebuah model gambar generatif, yang menghasilkan sebuah gambar berdasarkan representasi tersebut. Model yang paling efektif umumnya dilatih di data teks dan gambar berskala besar yang diambil dari web.&lt;br /&gt;
&lt;br /&gt;
== Sejarah ==&lt;br /&gt;
Sebelum berkembangnya [[pemelajaran dalam]], langkah-langkah untuk membangun model teks-ke-gambar terbatas hanya pada [[kolase]] dengan mengurutkan gambar yang sudah ada, seperti dari basis data [[clip art]].&lt;br /&gt;
&lt;br /&gt;
Tugas sebaliknya, [[Penghasil bahasa alami|pendeskripsian gambar]], lebih mudah dibuat dan sejumlah model pemelajaran dalam pendeskripsian gambar muncul sebelum model teks-ke-gambar pertama.&lt;br /&gt;
&lt;br /&gt;
Model teks-ke-gambar modern pertama, alignDRAW, diperkenalkan pada tahun 2015 oleh peneliti dari [[Universitas Toronto]]. alignDRAW memperluas arsitektur DRAW untuk dikondisikan berdasarkan urutan teks. Gambar yang dihasilkan oleh alignDRAW cenderung blur dan tidak fotorealistis, tetapi model dapat menghasilkan objek yang tidak ada pada data latih (seperti bis sekolah berwarna merah), dan menangani perintah yang tidak lazim seperti &amp;quot;sebuah rambu tanda berhenti melayang di langit biru&amp;quot;, menunjukan bahwa dia tidak sekadar &amp;quot;menghafal&amp;quot; data dari kumpulan data latih.Pada tahun 2016, Reed, Akata, Yan et al. berhasil menjadi yang pertama dalam menggunakan jaringan adversarial generatif untuk tugas teks-ke-gambar. Dengan model yang dilatih pada kumpulan data yang sempit dan spesifik, mereka dapat menghasilkan gambar dengan &amp;quot;tampilan meyakinkan&amp;quot; seperti gambar burung dan bunga dari deskripsi teks seperti &amp;quot;Sebuah burung berwarna hitam sepenuhnya dengan paruh yang unik dan bulat&amp;quot;. Sebuah model yang dilatih pada kumpulan data COCO menghasilkan gambar yang &amp;quot;dipandang dari jauh... meyakinkan&amp;quot;, tetapi secara detil kurang koherensi. Sistem selanjutnya meliputi VQGAN+CLIP, XMC-GAN, dan GauGAN2.&lt;br /&gt;
&lt;br /&gt;
Sebuah model teks-ke-gambar pertama yang menarik perhatian publik adalah [[OpenAI]] DALL-E, sebuah sistem transformer yang diumumkan pada Januari 2021. Sebuah penerus yang dapat menghasilkan gambar yang lebih kompleks dan realistis , DALL-E 2, diperkenalkan pada April 2022, diikuti oleh [[Stable Diffusion]] yang dirilis secara publik pada Agustus 2022.&lt;br /&gt;
&lt;br /&gt;
Mengikuti model teks-ke-gambar lainnya, platform teks-ke-video seperti Runway, Make-A-Video, Imagen Video, Midjourney, dan Phenaki dapat menghasilkan video dari perintah teks dan/atau teks/gambar.&lt;br /&gt;
&lt;br /&gt;
== Arsitektur dan pelatihan ==&lt;br /&gt;
&lt;br /&gt;
Model teks-ke-gambar telah dibuat menggunakan berbagai jenis arsitektur. untuk langkah menghasilkan gambar, jaringan adversarial generatif kondisional telah umum digunakan, dengan [[model difusi]] juga menjadi populer akhir-akhir ini. Ketimbang melatih secara langsung sebuah model untuk menghasilkan keluaran beresolusi tinggi yang dikondisikan pada sebuah sematan teks, teknik populer adalah dengan melatih sebuah model untuk menghasilkan keluaran beresolusi rendah, dan lalu menggunakan model pemelajaran dalam untuk meningkatkan resolusi, dengan mengisi detil yang lebih dalam.&lt;br /&gt;
&lt;br /&gt;
Model teks-ke-gambar dilatih pada kumpulan data berpasangan (teks, gambar), umumnya diambil dari web. Dengan model Imagen tahun 2022, Google Brain melaporkan hasil yang positif dari penggunaan [[model bahasa besar]] yang dilatih secara terpisah pada kumpulan teks saja (dengan bobot yang dibekukan), sebuah perbedaan dari pendekatan standar yang umum digunakan.&lt;br /&gt;
&lt;br /&gt;
== Kumpulan data ==&lt;br /&gt;
&lt;br /&gt;
Melatih model teks-ke-gambar membutuhkan sebuah kumpulan data yang dipadukan dengan deskripsi teks. Sebuah kumpulan data yang umum digunakan untuk tujuan ini adalah COCO (Common Objects in Context). Dirilis oleh Microsoft pada tahun 2014, COCO berisi kurang lebih 123,000 gambar yang memperlihatkan keanekaragaman objek, dengan lima deskripsi per gambar, yang dihasilkan oleh manusia. Oxford-120 Flowers dan CUB-200 Birds adalah kumpulan data yang lebih kecil, dimana masing-masing terbatas pada bunga dan burung. Menggunakan kumpulan data tersebut dianggap lebih mudah untuk melatih model teks-ke-gambar berkualitas tinggi, dikarenakan materinya lebih sempit.&lt;br /&gt;
&lt;br /&gt;
== Evaluasi ==&lt;br /&gt;
Melakukan evaluasi dan membandingkan kualitas model teks-ke-gambar adalah tantangan, termasuk didalamnya menilai beberapa kriteria yang dianggap penting. Seperti pada semua model gambar pada umumnya, tentu sangat diharapkan bahwa gambar yang dihasilkan adalah realistis (dalam maksud bahwa gambar tersebut tampil seperti pada kumpulan data latih yang digunakan), dan memiliki gaya yang beragam. Sebuah kriteria penting pada model teks-ke-gambar adalah gambar yang dihasilkan selaras dengan deskripsi teks yang digunakan untuk menghasilkannya. Sejumlah skema telah dirancang untuk menilai hal tersebut, sebagian bersifat otomatis dan lainnya berdasarkan penilaian manusia.&lt;br /&gt;
&lt;br /&gt;
== Lihat pula ==&lt;br /&gt;
&lt;br /&gt;
* [[Seni kecerdasan buatan]]&lt;br /&gt;
&lt;br /&gt;
== Referensi ==&lt;br /&gt;
&lt;br /&gt;
== Sumber dan atribusi ==&lt;br /&gt;
&lt;br /&gt;
Artikel ini diadaptasi dalam mode teks dari&lt;br /&gt;
[https://id.wikipedia.org/w/index.php?title=Model_teks-ke-gambar&amp;amp;oldid=29354286 Wikipedia bahasa Indonesia],&lt;br /&gt;
revisi 29354286 (2026-06-16T17:59:22Z).&lt;br /&gt;
Gambar, media, infobox, templat navigasi, dan kategori sumber&lt;br /&gt;
tidak diimpor ke Wiki Unissula.&lt;br /&gt;
Atribusi dan lisensi mengikuti ketentuan Creative Commons&lt;br /&gt;
Atribusi-BerbagiSerupa (CC BY-SA) pada sumber Wikipedia.&lt;/div&gt;</summary>
		<author><name>Maintenance script</name></author>
	</entry>
</feed>