Stable Diffusion: Perbedaan antara revisi
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 28683580; atribusi sumber disertakan. |
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi |
||
| Baris 1: | Baris 1: | ||
[[File:Astronaut_Riding_a_Horse_(SD3.5).webp|thumb|right|280px|Astronaut Riding a Horse (SD3.5)]] | |||
Stable Diffusion adalah model [[difusi]] laten, sebuah jenis [[jaringan saraf tiruan]] generatif. Bobot kode dan modelnya telah dirilis secara publik, dan dapat berjalan di sebagian besar perangkat keras tipe konsumen yang dilengkapi dengan [[Unit pemroses grafis|kartu grafis]] sederhana dengan minimal kapasitas memori grafis sebesar 8 GB. Ini berbeda dari model teks-ke-gambar sebelumnya seperti [[DALL-E]] dan [[Midjourney]] yang hanya dapat diakses melalui [[Komputasi awan|layanan komputasi awan]]. | '''Stable Diffusion''' adalah sebuah [[model teks-ke-gambar]] berbasis [[kecerdasan buatan]], bagian dari [[pemelajaran dalam]] yang dirilis pada tahun 2022.<ref>Iwan Setiyawan. [https://www.kompas.id/baca/foto/2023/03/04/hak-cipta-dan-kebebasan-berkarya-di-ai Hak Cipta dan Kebebasan Berkarya di AI]. ''kompas.id''. 2023-03-06.</ref> Umumnya digunakan untuk menghasilkan gambar berdasarkan deskripsi teks, tetapi dapat juga digunakan untuk hal terkait seperti teknik inpainting, outpainting, dan menghasilkan keluaran gambar-ke-gambar yang dipandu oleh [[perintah kalimat]].<ref name=":0">[https://huggingface.co/spaces/huggingface/diffuse-the-rest Diffuse The Rest - a Hugging Face Space by huggingface]. ''huggingface.co''.</ref> Model Ini dikembangkan oleh para peneliti dari kelompok CompVis di [[Universitas Ludwig Maximilian München]] dan Runway dengan dukungan komputasi oleh Stability AI dan kumpulan data latih dari sejumlah organisasi nirlaba.<ref name="sifted_financialtimes">[https://sifted.eu/articles/stability-ai-fundraise-leak Leaked deck raises questions over Stability AI's Series A pitch to investors]. ''sifted.eu''.</ref><ref name="lmu_lauch">[https://www.lmu.de/en/newsroom/news-overview/news/revolutionizing-image-generation-by-ai-turning-text-into-images.html Revolutionizing image generation by AI: Turning text into images]. ''www.lmu.de''.</ref><ref>Emad Mostaque. [https://twitter.com/EMostaque/status/1587844074064822274?lang=en Stable Diffusion came from the Machine Vision & Learning research group (CompVis) @LMU_Muenchen]. ''Twitter''. November 2, 2022.</ref> | ||
Stable Diffusion adalah model [[difusi]] laten, sebuah jenis [[jaringan saraf tiruan]] generatif. Bobot kode dan modelnya telah dirilis secara publik,<ref name="stable-diffusion-github">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> dan dapat berjalan di sebagian besar perangkat keras tipe konsumen yang dilengkapi dengan [[Unit pemroses grafis|kartu grafis]] sederhana dengan minimal kapasitas memori grafis sebesar 8 GB. Ini berbeda dari model teks-ke-gambar sebelumnya seperti [[DALL-E]] dan [[Midjourney]] yang hanya dapat diakses melalui [[Komputasi awan|layanan komputasi awan]].<ref name="pcworld">[https://www.pcworld.com/article/916785/creating-ai-art-local-pc-stable-diffusion.html The new killer app: Creating AI art will absolutely crush your PC]. ''PCWorld''.</ref> | |||
== Sejarah pengembangan == | == Sejarah pengembangan == | ||
Pengembangan Stable Diffusion didanai dan didukung oleh [[perusahaan rintisan]] Stability AI.<ref name="forbes">[https://www.forbes.com/sites/kenrickcai/2023/06/04/stable-diffusion-emad-mostaque-stability-ai-exaggeration/?sh=347a8fcb75c5 The AI Founder Taking Credit For Stable Diffusion's Success Has A History Of Exaggeration]. ''www.forbes.com''.</ref><ref name="CNN-Getty2">Jennifer Korn. [https://www.cnn.com/2023/01/17/tech/getty-images-stability-ai-lawsuit/index.html Getty Images suing the makers of popular AI art tool for allegedly stealing photos]. ''CNN''. 2023-01-17.</ref> Lisensi teknis untuk model tersebut dirilis oleh kelompok CompVis di Universitas Ludwig Maximilian München. Pengembangan dipimpin oleh Patrick Esser dari Runway dan Robin Rombach dari CompVis, yang termasuk di antara para peneliti yang sebelumnya menemukan arsitektur model difusi laten yang digunakan oleh Stable Diffusion. Stability AI juga memberikan apresiasi terhadap [[EleutherAI]] dan [[LAION]] (organisasi nirlaba [[Jerman]] yang mengumpulkan kumpulan data tempat pelatihan Stable Diffusion) sebagai pendukung proyek. | |||
Pada Oktober 2022, Stability AI berhasil mengumpulkan US$101 juta dalam program pendanaan yang dipimpin oleh Lightspeed Venture Partners dan Coatue Management.<ref>Kyle Wiggers. [https://techcrunch.com/2022/10/17/stability-ai-the-startup-behind-stable-diffusion-raises-101m/ Stability AI, the startup behind Stable Diffusion, raises $101M]. ''Techcrunch''. 17 October 2022.</ref> | |||
Pada Oktober 2022, Stability AI berhasil mengumpulkan US$101 juta dalam program pendanaan yang dipimpin oleh Lightspeed Venture Partners dan Coatue Management. | |||
== Teknologi == | == Teknologi == | ||
=== Arsitektur === | === Arsitektur === | ||
Stable Diffusion menggunakan sebuah jenis model difusi yang disebut model difusi laten yang dikembangkan oleh kelompok CompVis di Universitas Ludwig Maximilian München.<ref name="stable-diffusion-github">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> | |||
Dengan 860 juta parameter di U-Net dan 123 juta di enkoder teks, Stable Diffusion dianggap relatif ringan menurut standar tahun 2022, dan tidak seperti model difusi lainnya, model ini dapat berjalan pada kartu grafis tipe konsumen.<ref>[https://huggingface.co/docs/diffusers/v0.5.1/en/api/pipelines/stable_diffusion Stable diffusion pipelines]. ''huggingface.co''.</ref> | |||
Dengan 860 juta parameter di U-Net dan 123 juta di enkoder teks, Stable Diffusion dianggap relatif ringan menurut standar tahun 2022, dan tidak seperti model difusi lainnya, model ini dapat berjalan pada kartu grafis tipe konsumen. | |||
=== Data latih === | === Data latih === | ||
Stable Diffusion dilatih pada pasangan gambar dan teks yang diambil dari LAION-5B, sebuah kumpulan data yang tersedia untuk umum yang berasal dari data [[Common Crawl]] yang diambil dari web, di mana 5 miliar pasangan gambar-teks diklasifikasikan berdasarkan bahasa dan disaring ke dalam kumpulan data terpisah berdasarkan resolusi, kemungkinan terdapatnya [[Penandaairan digital|tanda air digital]], dan skor "estetika" yang diprediksi (misalnya kualitas visual secara subjektif). | Stable Diffusion dilatih pada pasangan gambar dan teks yang diambil dari LAION-5B, sebuah kumpulan data yang tersedia untuk umum yang berasal dari data [[Common Crawl]] yang diambil dari web, di mana 5 miliar pasangan gambar-teks diklasifikasikan berdasarkan bahasa dan disaring ke dalam kumpulan data terpisah berdasarkan resolusi, kemungkinan terdapatnya [[Penandaairan digital|tanda air digital]], dan skor "estetika" yang diprediksi (misalnya kualitas visual secara subjektif). <ref name="Waxy">Andy Baio. [https://waxy.org/2022/08/exploring-12-million-of-the-images-used-to-train-stable-diffusions-image-generator/ Exploring 12 Million of the 2.3 Billion Images Used to Train Stable Diffusion's Image Generator]. ''Waxy.org''. 2022-08-30.</ref> Kumpulan data ini dibuat oleh [[LAION]], organisasi nirlaba Jerman yang menerima dana dari Stability AI.<ref name="Waxy" /><ref>[https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/ This artist is dominating AI-generated art. And he's not happy about it]. ''MIT Technology Review''.</ref> Model Stable Diffusion dilatih pada tiga [[himpunan bagian]] LAION-5B yaitu laion2B-en, laion-high-resolution, dan laion-aesthetics v2 5+.<ref name="Waxy" /> Analisis pihak ketiga terhadap data latih model menunjukan sekitar 47% dari ukuran sampel gambar berasal dari 100 domain web berbeda, dengan [[Pinterest]] mengambil 8,5% bagian, diikuti oleh situs web seperti [[WordPress]], [[Blogger (layanan)|Blogspot]], [[Flickr]], [[DeviantArt]], dan [[Wikimedia Commons]].<ref>Alex Ivanovs. [https://stackdiary.com/stable-diffusion-resources/ Stable Diffusion: Tutorials, Resources, and Tools]. ''Stack Diary''. 2022-09-08.</ref><ref name="Waxy" /> | ||
=== Prosedur pelatihan === | === Prosedur pelatihan === | ||
Model ini awalnya dilatih pada subset laion2B-en dan laion-high-resolution, dengan beberapa putaran terakhir pelatihan dilakukan terhadap LAION-Aesthetics v2 5+, subset dari sekitar 600 juta gambar dengan judul yang diprediksi oleh LAION-Aesthetics Predictor V2 bahwa rata-rata manusia akan memberikan skor setidaknya 5 dari 10 berdasarkan penilaian seberapa besar mereka menyukainya. Subset LAION-Aesthetics v2 5+ juga mengecualikan gambar yang memiliki beresolusi rendah dan gambar yang diidentifikasi oleh LAION-5B-WatermarkDetection memiliki [[Penandaairan digital|tanda air digital]] dengan probabilitas lebih dari 80%. | Model ini awalnya dilatih pada subset laion2B-en dan laion-high-resolution, dengan beberapa putaran terakhir pelatihan dilakukan terhadap LAION-Aesthetics v2 5+, subset dari sekitar 600 juta gambar dengan judul yang diprediksi oleh LAION-Aesthetics Predictor V2 bahwa rata-rata manusia akan memberikan skor setidaknya 5 dari 10 berdasarkan penilaian seberapa besar mereka menyukainya.<ref>Christoph Schuhmann. [https://github.com/christophschuhmann/improved-aesthetic-predictor CLIP+MLP Aesthetic Score Predictor]. 2022-11-02.</ref><ref name="Waxy">Andy Baio. [https://waxy.org/2022/08/exploring-12-million-of-the-images-used-to-train-stable-diffusions-image-generator/ Exploring 12 Million of the 2.3 Billion Images Used to Train Stable Diffusion's Image Generator]. ''Waxy.org''. 2022-08-30.</ref><ref name="LAION-Aesthetics">[https://laion.ai/blog/laion-aesthetics LAION-Aesthetics LAION]. ''laion.ai''.</ref> Subset LAION-Aesthetics v2 5+ juga mengecualikan gambar yang memiliki beresolusi rendah dan gambar yang diidentifikasi oleh LAION-5B-WatermarkDetection memiliki [[Penandaairan digital|tanda air digital]] dengan probabilitas lebih dari 80%.<ref name="Waxy" /> | ||
Model ini dilatih menggunakan 256 kartu grafis Nvidia A100 di [[Amazon Web Services]] dengan total 150.000 jam kartu grafis, dengan biaya sebesar US$600.000. | Model ini dilatih menggunakan 256 kartu grafis Nvidia A100 di [[Amazon Web Services]] dengan total 150.000 jam kartu grafis, dengan biaya sebesar US$600.000.<ref>Emad Mostaque. [https://twitter.com/emostaque/status/1563870674111832066 Cost of construction]. ''Twitter''. August 28, 2022.</ref><ref name="stable-diffusion-model-card-1-4">[https://huggingface.co/CompVis/stable-diffusion-v1-4 CompVis/stable-diffusion-v1-4 · Hugging Face]. ''huggingface.co''.</ref><ref>Kyle Wiggers. [https://techcrunch.com/2022/08/12/a-startup-wants-to-democratize-the-tech-behind-dall-e-2-consequences-be-damned/ A startup wants to democratize the tech behind DALL-E 2, consequences be damned]. ''TechCrunch''. 2022-08-12.</ref> | ||
=== Keterbatasan === | === Keterbatasan === | ||
Stable Diffusion memiliki masalah dengan degradasi dan ketidakakuratan dalam skenario tertentu. Rilis awal model ini dilatih pada kumpulan data yang terdiri dari gambar beresolusi 512×512, yang berarti bahwa kualitas gambar yang dihasilkan menurun drastis saat spesifikasi pengguna menyimpang dari resolusi 512×512 yang "diharapkan"; versi 2.0 dari model Stable Diffusion kemudian memperkenalkan kemampuan untuk menghasilkan gambar secara alami pada resolusi 768×768. Tantangan lain adalah dalam menghasilkan anggota tubuh manusia karena kualitas data anggota tubuh yang buruk di data LAION (umumnya terlihat pada tangan). Keterbatasan pada Stable Diffusion mulai diatasi secara perlahan dengan model versi SDXL yang dirilis pada tanggal 26 Juli 2023, SDXL mendukung gambar beresolusi 1024x1024 dan menghasilkan anggota tubuh dan teks yang lebih sempurna. | Stable Diffusion memiliki masalah dengan degradasi dan ketidakakuratan dalam skenario tertentu. Rilis awal model ini dilatih pada kumpulan data yang terdiri dari gambar beresolusi 512×512, yang berarti bahwa kualitas gambar yang dihasilkan menurun drastis saat spesifikasi pengguna menyimpang dari resolusi 512×512 yang "diharapkan";<ref name="diffusers">[https://huggingface.co/blog/stable_diffusion Stable Diffusion with 🧨 Diffusers]. ''huggingface.co''.</ref> versi 2.0 dari model Stable Diffusion kemudian memperkenalkan kemampuan untuk menghasilkan gambar secara alami pada resolusi 768×768.<ref name="release2.0">[https://stability.ai/blog/stable-diffusion-v2-release Stable Diffusion 2.0 Release]. ''stability.ai''.</ref> Tantangan lain adalah dalam menghasilkan anggota tubuh manusia karena kualitas data anggota tubuh yang buruk di data LAION (umumnya terlihat pada tangan).<ref>[https://laion.ai/ LAION]. ''laion.ai''.</ref> Keterbatasan pada Stable Diffusion mulai diatasi secara perlahan dengan model versi SDXL yang dirilis pada tanggal 26 Juli 2023, SDXL mendukung gambar beresolusi 1024x1024 dan menghasilkan anggota tubuh dan teks yang lebih sempurna.<ref>[https://stability.ai/blog/stable-diffusion-sdxl-1-announcement Announcing SDXL 1.0]. ''Stability AI''.</ref> | ||
Keterjangkauan untuk pengembang individu juga bisa menjadi masalah. Untuk menyesuaikan model untuk kasus penggunaan baru yang tidak termasuk dalam kumpulan data, seperti membuat karakter [[anime]] ("waifu difusion"), data baru dan pelatihan lebih lanjut diperlukan. Adaptasi penyempurnaan terhadap Stable Diffusion yang dibuat melalui pelatihan ulang tambahan telah digunakan untuk berbagai kasus penggunaan yang berbeda, mulai dari [[pencitraan medis]] hingga [[Riffusion|musik yang dihasilkan dengan algoritma]]. Namun, proses penyempurnaan ini sensitif terhadap kualitas data baru; gambar beresolusi rendah atau resolusi yang berbeda dari data asli tidak hanya dapat gagal mempelajari tugas baru tetapi juga menurunkan kinerja model secara keseluruhan. Bahkan ketika model dilatih lebih lanjut terhadap kumpulan gambar berkualitas tinggi, sulit bagi individu untuk menjalankan model dalam perangkat elektronik tipe konsumen. Misalnya, proses pelatihan waifu-diffusion membutuhkan minimal kapasitas memori grafis sebesar 30 GB, yang melebihi sumber daya yang disediakan di kartu grafis tipe konsumen. | Keterjangkauan untuk pengembang individu juga bisa menjadi masalah. Untuk menyesuaikan model untuk kasus penggunaan baru yang tidak termasuk dalam kumpulan data, seperti membuat karakter [[anime]] ("waifu difusion"),<ref>[https://huggingface.co/hakurei/waifu-diffusion hakurei/waifu-diffusion · Hugging Face]. ''huggingface.co''.</ref> data baru dan pelatihan lebih lanjut diperlukan. Adaptasi penyempurnaan terhadap Stable Diffusion yang dibuat melalui pelatihan ulang tambahan telah digunakan untuk berbagai kasus penggunaan yang berbeda, mulai dari [[pencitraan medis]] hingga [[Riffusion|musik yang dihasilkan dengan algoritma]].<ref>Seth Forsgren. [https://www.riffusion.com/about Riffusion - Stable diffusion for real-time music generation]. ''Riffusion''.</ref> Namun, proses penyempurnaan ini sensitif terhadap kualitas data baru; gambar beresolusi rendah atau resolusi yang berbeda dari data asli tidak hanya dapat gagal mempelajari tugas baru tetapi juga menurunkan kinerja model secara keseluruhan. Bahkan ketika model dilatih lebih lanjut terhadap kumpulan gambar berkualitas tinggi, sulit bagi individu untuk menjalankan model dalam perangkat elektronik tipe konsumen. Misalnya, proses pelatihan waifu-diffusion membutuhkan minimal kapasitas memori grafis sebesar 30 GB,<ref>Anthony Mercurio. [https://github.com/harubaru/waifu-diffusion/blob/6bf942eb6368ebf6bcbbb24b6ba8197bda6582a0/docs/en/training/README.md Waifu Diffusion]. 2022-10-31.</ref> yang melebihi sumber daya yang disediakan di kartu grafis tipe konsumen.<ref>Ryan Smith. [https://www.anandtech.com/show/17204/nvidia-quietly-launches-geforce-rtx-3080-12gb-more-vram-more-power-more-money NVIDIA Quietly Launches GeForce RTX 3080 12GB: More VRAM, More Power, More Money]. ''www.anandtech.com''.</ref> | ||
Pencipta Stable Diffusion mengakui potensi [[bias algoritme|bias algoritma]], karena model tersebut dilatih pada gambar yang kebanyakan memiliki deskripsi [[bahasa Inggris]]. Akibatnya, gambar yang dihasilkan memperkuat bias sosial yang berasal dari perspektif budaya Barat, karena pembuatnya model tersebut kekurangan data dari komunitas dan budaya lain. | Pencipta Stable Diffusion mengakui potensi [[bias algoritme|bias algoritma]], karena model tersebut dilatih pada gambar yang kebanyakan memiliki deskripsi [[bahasa Inggris]].<ref name="stable-diffusion-model-card-1-4">[https://huggingface.co/CompVis/stable-diffusion-v1-4 CompVis/stable-diffusion-v1-4 · Hugging Face]. ''huggingface.co''.</ref> Akibatnya, gambar yang dihasilkan memperkuat bias sosial yang berasal dari perspektif budaya Barat, karena pembuatnya model tersebut kekurangan data dari komunitas dan budaya lain.<ref name="stable-diffusion-model-card-1-4" /> | ||
=== Penyempurnaan oleh pengguna akhir === | === Penyempurnaan oleh pengguna akhir === | ||
Untuk mengatasi keterbatasan proses pelatihan awal model, pengguna akhir dapat memilih untuk melakukan pelatihan tambahan untuk menyempurnakan keluaran agar sesuai dengan kasus penggunaan yang lebih spesifik. Ada tiga metode di mana penyempurnaan oleh pengguna akhir dapat diterapkan: | Untuk mengatasi keterbatasan proses pelatihan awal model, pengguna akhir dapat memilih untuk melakukan pelatihan tambahan untuk menyempurnakan keluaran agar sesuai dengan kasus penggunaan yang lebih spesifik. Ada tiga metode di mana penyempurnaan oleh pengguna akhir dapat diterapkan: | ||
* "Embedding" dapat dilatih dari kumpulan gambar yang disediakan oleh pengguna, dan memungkinkan model menghasilkan gambar yang mirip secara visual setiap kali nama sematan digunakan dalam perintah pembuatan. Penyematan didasarkan pada konsep "inversi tekstual" yang dikembangkan oleh para peneliti dari [[Universitas Tel Aviv]] pada tahun 2022 dengan dukungan dari [[NVIDIA|Nvidia]], di mana representasi vektor untuk token tertentu yang digunakan oleh pembuat enkode teks model ditautkan ke kata-kata semu baru. Penyematan dapat digunakan untuk mengurangi bias dalam model aslinya, atau meniru gaya visual tertentu. | * "Embedding" dapat dilatih dari kumpulan gambar yang disediakan oleh pengguna, dan memungkinkan model menghasilkan gambar yang mirip secara visual setiap kali nama sematan digunakan dalam perintah pembuatan.<ref>Dave James. [https://www.pcgamer.com/nvidia-rtx-4090-stable-diffusion-training-aharon-kahana/ I thrashed the RTX 4090 for 8 hours straight training Stable Diffusion to paint like my uncle Hermann]. ''PC Gamer''. October 28, 2022.</ref> Penyematan didasarkan pada konsep "inversi tekstual" yang dikembangkan oleh para peneliti dari [[Universitas Tel Aviv]] pada tahun 2022 dengan dukungan dari [[NVIDIA|Nvidia]], di mana representasi vektor untuk token tertentu yang digunakan oleh pembuat enkode teks model ditautkan ke kata-kata semu baru. Penyematan dapat digunakan untuk mengurangi bias dalam model aslinya, atau meniru gaya visual tertentu. | ||
* "Hypernetwork" adalah jaringan saraf pra-pelatihan kecil yang diterapkan ke berbagai titik dalam jaringan saraf yang lebih besar, dan mengacu pada teknik yang dibuat oleh pengembang [[NovelAI]] Kurumuz pada tahun 2021, awalnya ditujukan untuk [[Transformer (model pembelajaran mesin)|model transformator]] pembuatan teks. Hypernetwork mengarahkan hasil ke arah tertentu, memungkinkan model berbasis Stable Diffusion untuk meniru gaya seni [[seniman]] tertentu, bahkan jika seniman tersebut tidak dikenali oleh model aslinya; mereka memproses gambar dengan menemukan area kunci yang penting seperti rambut dan mata, lalu menambal area tersebut di ruang laten sekunder. | * "Hypernetwork" adalah jaringan saraf pra-pelatihan kecil yang diterapkan ke berbagai titik dalam jaringan saraf yang lebih besar, dan mengacu pada teknik yang dibuat oleh pengembang [[NovelAI]] Kurumuz pada tahun 2021, awalnya ditujukan untuk [[Transformer (model pembelajaran mesin)|model transformator]] pembuatan teks. Hypernetwork mengarahkan hasil ke arah tertentu, memungkinkan model berbasis Stable Diffusion untuk meniru gaya seni [[seniman]] tertentu, bahkan jika seniman tersebut tidak dikenali oleh model aslinya; mereka memproses gambar dengan menemukan area kunci yang penting seperti rambut dan mata, lalu menambal area tersebut di ruang laten sekunder.<ref>[https://blog.novelai.net/novelai-improvements-on-stable-diffusion-e10d38db82ac NovelAI Improvements on Stable Diffusion]. ''NovelAI''. October 11, 2022.</ref> | ||
* [[DreamBooth]] adalah model generasi pembelajaran mendalam yang dikembangkan oleh para peneliti dari [[Google|Google Research]] dan [[Universitas Boston]] pada tahun 2022 yang dapat menyempurnakan model untuk menghasilkan keluaran yang dipersonalisasi dan presisi yang menggambarkan subjek tertentu, mengikuti pelatihan melalui serangkaian gambar yang menggambarkan subjek tersebut. | * [[DreamBooth]] adalah model generasi pembelajaran mendalam yang dikembangkan oleh para peneliti dari [[Google|Google Research]] dan [[Universitas Boston]] pada tahun 2022 yang dapat menyempurnakan model untuk menghasilkan keluaran yang dipersonalisasi dan presisi yang menggambarkan subjek tertentu, mengikuti pelatihan melalui serangkaian gambar yang menggambarkan subjek tersebut.<ref>Yuki Yamashita. [https://www.itmedia.co.jp/news/articles/2209/01/news041.html 愛犬の合成画像を生成できるAI 文章で指示するだけでコスプレ 米Googleが開発]. ''ITmedia Inc''. September 1, 2022.</ref> | ||
== Kemampuan == | == Kemampuan == | ||
Model Stable Diffusion mendukung kemampuan untuk menghasilkan gambar baru dengan menggunkan perintah teks yang berisikan elemen-elemen yang akan disertakan atau dikecualikan dari keluaran. Gambar yang sudah ada dapat digambar ulang oleh model untuk menambahkan elemen baru yang berdasarkan sebuah perintah teks (proses ini dikenal sebagai "pembuatan gambar terpandu") melalui mekanisme difusi-denoising. Juga, model ini memungkinkan penggunaan perintah untuk mengubah gambar yang ada dengan teknik inpainting dan outpainting, ketika digunakan dengan antarmuka yang sesuai, yang mana tersedia dalam berbagai macam implementasi dengan sumber terbuka. | Model Stable Diffusion mendukung kemampuan untuk menghasilkan gambar baru dengan menggunkan perintah teks yang berisikan elemen-elemen yang akan disertakan atau dikecualikan dari keluaran.<ref name="stable-diffusion-github2">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> Gambar yang sudah ada dapat digambar ulang oleh model untuk menambahkan elemen baru yang berdasarkan sebuah perintah teks (proses ini dikenal sebagai "pembuatan gambar terpandu"<ref>Chenlin Meng. ''SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations''. August 2, 2021.</ref>) melalui mekanisme difusi-denoising.<ref name="stable-diffusion-github3">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> Juga, model ini memungkinkan penggunaan perintah untuk mengubah gambar yang ada dengan teknik inpainting dan outpainting, ketika digunakan dengan antarmuka yang sesuai, yang mana tersedia dalam berbagai macam implementasi dengan sumber terbuka.<ref name="webui_showcase">[https://github.com/AUTOMATIC1111/stable-diffusion-webui-feature-showcase Stable Diffusion web UI]. ''GitHub''. 10 November 2022.</ref> | ||
Stable Diffusion disarankan untuk dijalankan dengan 10 GB atau lebih memori grafis, namun pengguna yang memiliki kapasitas memori grafis lebih sedikit dapat memilih untuk memuat bobot dengan presisi [[float16]] ketimbang bobot bawaan dengan presisi [[float32]] dengan kompromi pada performa model yang lebih rendah. | Stable Diffusion disarankan untuk dijalankan dengan 10 GB atau lebih memori grafis, namun pengguna yang memiliki kapasitas memori grafis lebih sedikit dapat memilih untuk memuat bobot dengan presisi [[float16]] ketimbang bobot bawaan dengan presisi [[float32]] dengan kompromi pada performa model yang lebih rendah.<ref name="diffusers2">[https://huggingface.co/blog/stable_diffusion Stable Diffusion with 🧨 Diffusers]. ''huggingface.co''.</ref> | ||
=== Pembuatan teks ke gambar === | === Pembuatan teks ke gambar === | ||
Fitur pembuatan teks ke gambar dalam Stable Diffusion, yang dikenal sebagai "txt2img", menggunakan perintah teks dengan sejumlah parameter opsi yang mencakup jenis pengambilan sampel, dimensi gambar keluaran, dan nilai benih. Perintah mengeluarkan berkas gambar berdasarkan interpretasi model dari kalimat.<ref name="stable-diffusion-github">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> Gambar yang dihasilkan ditandai dengan [[Penandaairan digital|tanda air digital]] yang tidak kasat mata untuk memungkinkan pengguna mengidentifikasi gambar yang dihasilkan oleh Stable Diffusion,<ref name="stable-diffusion-github" /> meskipun tanda air ini dapat pudar jika gambar diubah ukurannya atau diputar.<ref>[https://github.com/ShieldMnt/invisible-watermark/blob/9802ce3e0c3a5ec43b41d503f156717f0c739584/README.md invisible-watermark]. Shield Mountain. 2022-11-02.</ref> | |||
Setiap generasi txt2img akan melibatkan nilai benih tertentu yang memengaruhi gambar keluaran. Pengguna dapat memilih untuk mengacak nilai benih untuk menjelajahi keluaran yang berbeda, atau menggunakan benih yang sama untuk mendapatkan keluaran gambar yang serupa dengan gambar yang dihasilkan sebelumnya.<ref name="diffusers">[https://huggingface.co/blog/stable_diffusion Stable Diffusion with 🧨 Diffusers]. ''huggingface.co''.</ref> Pengguna juga dapat menyesuaikan jumlah langkah inferensi untuk sampler; nilai yang lebih tinggi membutuhkan durasi waktu yang lebih lama, tetapi nilai yang lebih kecil dapat menyebabkan timbulnya cacat visual pada keluaran.<ref name="diffusers" /> Opsi lain yang dapat dikonfigurasi adalah nilai skala panduan bebas pengklasifikasi, memungkinkan pengguna untuk menyesuaikan seberapa dekat gambar keluaran sesuai dengan perintah.<ref name=":5">[https://id.wikipedia.org/w/index.php?title=Stable+Diffusion&oldid=28683580 sumber pada Wikipedia bahasa Indonesia]</ref> Kasus penggunaan yang lebih eksperimental mungkin memilih nilai yang lebih rendah, sementara kasus penggunaan yang ditujukan untuk keluaran yang lebih spesifik mungkin menggunakan nilai yang lebih tinggi.<ref name="diffusers" /> | |||
Fitur text2img tambahan disediakan oleh penerapan [[Bagian depan dan bagian belakang (komputasi)|front-end]] Stable Diffusion, yang memungkinkan pengguna untuk mengubah bobot yang diberikan ke bagian tertentu dari perintah teks. Metode alternatif untuk menyesuaikan bobot ke bagian perintah adalah "perintah negatif". Perintah negatif adalah fitur yang disertakan dalam beberapa implementasi front-end, termasuk layanan komputasi awan DreamStudio dan Clipdrop milik Stability AI dan layanan eksternal NightCafe Studio, dan memungkinkan pengguna untuk menentukan hal yang harus dihindari model selama pembuatan gambar. Perintah yang ditentukan mungkin merupakan fitur gambar yang tidak diinginkan yang seharusnya ada dalam keluaran gambar karena perintah positif yang diberikan oleh pengguna, atau karena bagaimana awalnya model dilatih, dengan contoh umum berupa tangan manusia yang berantakan.<ref name="webui_showcase">[https://github.com/AUTOMATIC1111/stable-diffusion-webui-feature-showcase Stable Diffusion web UI]. ''GitHub''. 10 November 2022.</ref><ref name="release2.1">[https://stability.ai/blog/stablediffusion2-1-release7-dec-2022 Stable Diffusion v2.1 and DreamStudio Updates 7-Dec 22]. ''stability.ai''.</ref> | |||
Fitur text2img tambahan disediakan oleh penerapan [[Bagian depan dan bagian belakang (komputasi)|front-end]] Stable Diffusion, yang memungkinkan pengguna untuk mengubah bobot yang diberikan ke bagian tertentu dari perintah teks. Metode alternatif untuk menyesuaikan bobot ke bagian perintah adalah "perintah negatif". Perintah negatif adalah fitur yang disertakan dalam beberapa implementasi front-end, termasuk layanan komputasi awan DreamStudio dan Clipdrop milik Stability AI dan layanan eksternal NightCafe Studio, dan memungkinkan pengguna untuk menentukan hal yang harus dihindari model selama pembuatan gambar. Perintah yang ditentukan mungkin merupakan fitur gambar yang tidak diinginkan yang seharusnya ada dalam keluaran gambar karena perintah positif yang diberikan oleh pengguna, atau karena bagaimana awalnya model dilatih, dengan contoh umum berupa tangan manusia yang berantakan. | |||
=== Modifikasi gambar === | === Modifikasi gambar === | ||
Stable Diffusion juga menyertakan fitur lain, "img2img", yang menggunakan perintah teks, hubungan ke gambar yang ada, dan nilai kekuatan antara 0,0 dan 1,0. Fitur ini mengeluarkan gambar baru berdasarkan gambar yang sudah ada yang juga menampilkan elemen yang disediakan dalam perintah teks. Nilai kekuatan menunjukkan jumlah noise yang ditambahkan ke gambar keluaran. Nilai kekuatan yang lebih tinggi menghasilkan lebih banyak variasi dalam gambar.<ref name="stable-diffusion-github">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> | |||
Kemampuan img2img untuk menambahkan noise ke gambar asli membuatnya berpotensi berguna untuk [[anonimisasi data]] dan [[augmentasi data]], di mana karakteristik visual data gambar diubah dan dianonimkan.<ref name=":1">Lorenzo Luzi. ''Boomerang: Local sampling on image manifolds using diffusion models''. 2022-10-21.</ref> Proses yang sama mungkin juga berguna untuk peningkatan resolusi gambar, di mana resolusi gambar ditingkatkan, dengan lebih banyak detil ditambahkan ke gambar.<ref name=":1" /> Selain itu, Stable Diffusion telah diujicoba sebagai alat untuk kompresi gambar. Dibandingkan dengan format [[JPEG]] dan [[WebP]], metode terbaru yang digunakan untuk kompresi gambar dalam Stable Diffusion memiliki keterbatasan dalam mempertahankan teks dan wajah kecil.<ref>Matthias Bühlmann. [https://pub.towardsai.net/stable-diffusion-based-image-compresssion-6f1f0a399202 Stable Diffusion Based Image Compression]. ''Medium''. 2022-09-28.</ref> | |||
Stable Diffusion | Kasus penggunaan tambahan untuk modifikasi gambar melalui img2img ditawarkan oleh banyak implementasi front-end model Stable Diffusion. Inpainting melibatkan modifikasi selektif sebagian dari gambar yang ada dengan lapisan topeng yang disediakan pengguna, yang mengisi ruang bertopeng dengan konten yang baru dibuat berdasarkan kalimat yang diberikan.<ref name="webui_showcase">[https://github.com/AUTOMATIC1111/stable-diffusion-webui-feature-showcase Stable Diffusion web UI]. ''GitHub''. 10 November 2022.</ref> Model khusus yang untuk kasus penggunaan inpainting dibuat oleh Stability AI bersamaan dengan peluncuran Stable Diffusion 2.0.<ref name="release2.0">[https://stability.ai/blog/stable-diffusion-v2-release Stable Diffusion 2.0 Release]. ''stability.ai''.</ref> Sebaliknya, outpainting memperluas gambar melampaui dimensi aslinya, mengisi ruang kosong sebelumnya dengan konten yang dihasilkan berdasarkan kalimat yang disediakan.<ref name="webui_showcase" /> | ||
Model dengan panduan kedalaman, bernama "depth2img", diperkenalkan dengan rilis Stable Diffusion 2.0 pada 24 November 2022; model ini menyimpulkan kedalaman gambar masukan yang disediakan, dan menghasilkan gambar keluaran baru berdasarkan perintah teks dan informasi kedalaman, yang memungkinkan koherensi dan kedalaman gambar masukan asli dipertahankan dalam keluaran yang dihasilkan.<ref name="release2.0">[https://stability.ai/blog/stable-diffusion-v2-release Stable Diffusion 2.0 Release]. ''stability.ai''.</ref> | |||
Model dengan panduan kedalaman, bernama "depth2img", diperkenalkan dengan rilis Stable Diffusion 2.0 pada 24 November 2022; model ini menyimpulkan kedalaman gambar masukan yang disediakan, dan menghasilkan gambar keluaran baru berdasarkan perintah teks dan informasi kedalaman, yang memungkinkan koherensi dan kedalaman gambar masukan asli dipertahankan dalam keluaran yang dihasilkan. | |||
=== ControlNet === | === ControlNet === | ||
ControlNet adalah sebuah arsitektur jaringan saraf yang dirancang untuk mengelola model difusi dengan memasukkan kondisi tambahan. Ini menduplikasi bobot blok jaringan saraf menjadi salinan "terkunci" dan salinan "dapat dilatih". Salinan "dapat dilatih" mempelajari kondisi yang diinginkan, sedangkan salinan "terkunci" mempertahankan model aslinya. Konvolusi nol" adalah konvolusi 1×1 dengan bobot dan bias diinisialisasi ke nol. Sebelum pelatihan, semua konvolusi nol menghasilkan output nol, mencegah distorsi yang disebabkan oleh ControlNet. Metode ini memungkinkan pelatihan pada perangkat berskala kecil atau bahkan perangkat pribadi. | ControlNet<ref name="controlnet-paper">''Adding Conditional Control to Text-to-Image Diffusion Models''. 10 February 2023.</ref> adalah sebuah arsitektur jaringan saraf yang dirancang untuk mengelola model difusi dengan memasukkan kondisi tambahan. Ini menduplikasi bobot blok jaringan saraf menjadi salinan "terkunci" dan salinan "dapat dilatih". Salinan "dapat dilatih" mempelajari kondisi yang diinginkan, sedangkan salinan "terkunci" mempertahankan model aslinya. Konvolusi nol" adalah konvolusi 1×1 dengan bobot dan bias diinisialisasi ke nol. Sebelum pelatihan, semua konvolusi nol menghasilkan output nol, mencegah distorsi yang disebabkan oleh ControlNet. Metode ini memungkinkan pelatihan pada perangkat berskala kecil atau bahkan perangkat pribadi. | ||
=== LoRA (Low-Rank Adaptation) === | === LoRA (Low-Rank Adaptation) === | ||
LoRA (Low-Rank Adaptation) merupakan sebuah teknik yang digunakan dalam pelatihan model [[Pemelajaran mesin|pembelajaran mesin]], terutama model bahasa besar (Large Language Models/LLMs), untuk mengurangi kompleksitas komputasi dan kebutuhan penyimpanan tanpa mengorbankan performa. LoRA memanfaatkan dekomposisi matriks dengan pangkat rendah untuk memperbarui hanya sebagian dari parameter model yang besar, sehingga mempercepat proses fine-tuning dan membuatnya lebih efisien dalam hal penggunaan sumber daya. | LoRA (Low-Rank Adaptation) merupakan sebuah teknik yang digunakan dalam pelatihan model [[Pemelajaran mesin|pembelajaran mesin]], terutama model bahasa besar (Large Language Models/LLMs), untuk mengurangi kompleksitas komputasi dan kebutuhan penyimpanan tanpa mengorbankan performa. LoRA memanfaatkan dekomposisi matriks dengan pangkat rendah untuk memperbarui hanya sebagian dari parameter model yang besar, sehingga mempercepat proses fine-tuning dan membuatnya lebih efisien dalam hal penggunaan sumber daya.<ref>Edward Hu Yuanzhi Li. [https://arxiv.org/pdf/2106.09685 LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS]. ''LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS''. 2021-10-16. Vol. Version 2. hlm. 26.</ref> | ||
Dalam model deep learning konvensional, proses fine-tuning sering kali membutuhkan pembaruan seluruh parameter model, yang memerlukan sumber daya komputasi besar dan memori yang tinggi. LoRA mengatasi hal ini dengan memproyeksikan perubahan parameter model ke dalam ruang pangkat rendah, di mana perubahan kecil dan terarah dapat diwakili secara efisien dengan parameter yang lebih sedikit. | Dalam model deep learning konvensional, proses fine-tuning sering kali membutuhkan pembaruan seluruh parameter model, yang memerlukan sumber daya komputasi besar dan memori yang tinggi. LoRA mengatasi hal ini dengan memproyeksikan perubahan parameter model ke dalam ruang pangkat rendah, di mana perubahan kecil dan terarah dapat diwakili secara efisien dengan parameter yang lebih sedikit. | ||
| Baris 80: | Baris 74: | ||
Rilis model meliputi: | Rilis model meliputi: | ||
* V1.4, Agustus 2022 | * V1.4, Agustus 2022<ref>[https://huggingface.co/CompVis/stable-diffusion-v1-4 CompVis/stable-diffusion-v1-4 · Hugging Face]. ''huggingface.co''.</ref> | ||
* V1.5, Oktober 2022 | * V1.5, Oktober 2022<ref>[https://huggingface.co/runwayml/stable-diffusion-v1-5 runwayml/stable-diffusion-v1-5 · Hugging Face]. ''huggingface.co''.</ref> | ||
* V2.0, November 2022 | * V2.0, November 2022<ref>[https://huggingface.co/stabilityai/stable-diffusion-2 stabilityai/stable-diffusion-2 · Hugging Face]. ''huggingface.co''.</ref> | ||
* V2.1, Desember 2022 | * V2.1, Desember 2022<ref>[https://huggingface.co/stabilityai/stable-diffusion-2-1 stabilityai/stable-diffusion-2-1 · Hugging Face]. ''huggingface.co''.</ref> | ||
* SDXL 1.0, Juli 2023 | * SDXL 1.0, Juli 2023<ref>[https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0 stabilityai/stable-diffusion-xl-base-1.0 · Hugging Face]. ''huggingface.co''.</ref> | ||
== Penggunaan dan kontroversi == | == Penggunaan dan kontroversi == | ||
Stable Diffusion tidak mengklaim hak cipta atas gambar yang dihasilkan dan secara bebas memberikan hak cipta pada gambar yang dihasilkan dari model kepada pengguna asalkan konten gambar tidak ilegal atau membahayakan individu. Kebebasan yang diberikan kepada pengguna atas penggunaan gambar telah menyebabkan kontroversi tentang etika kepemilikan, karena Stable Diffusion dan model generatif lainnya dilatih dari gambar yang dilindungi hak cipta tanpa persetujuan pemilik. | Stable Diffusion tidak mengklaim hak cipta atas gambar yang dihasilkan dan secara bebas memberikan hak cipta pada gambar yang dihasilkan dari model kepada pengguna asalkan konten gambar tidak ilegal atau membahayakan individu. Kebebasan yang diberikan kepada pengguna atas penggunaan gambar telah menyebabkan kontroversi tentang etika kepemilikan, karena Stable Diffusion dan model generatif lainnya dilatih dari gambar yang dilindungi hak cipta tanpa persetujuan pemilik.<ref name=":13">Kenrick Cai. [https://www.forbes.com/sites/kenrickcai/2022/09/07/stability-ai-funding-round-1-billion-valuation-stable-diffusion-text-to-image/ Startup Behind AI Image Generator Stable Diffusion Is In Talks To Raise At A Valuation Up To $1 Billion]. ''Forbes''.</ref> | ||
Karena gaya seni dan [[Komposisi (seni rupa)|komposisi]] tidak memiliki hak cipta, sering kali ditafsirkan bahwa pengguna Stable Diffusion yang menghasilkan gambar karya seni tidak dapat dianggap melanggar hak cipta terhadap karya visual yang serupa. Namun, individu yang digambarkan dalam gambar yang dihasilkan dapat dilindungi oleh hak kepribadian jika gambar mereka digunakan, dan [[kekayaan intelektual]] seperti logo merek yang dapat dikenali masih dilindungi oleh hak merek dagang. Namun, sejumlah seniman visual menyatakan kekhawatiran bahwa penggunaan luas perangkat lunak sintesis gambar seperti Stable Diffusion dapat berpotensi menyebabkan seniman manusia, bersama dengan fotografer, model, sinematografer, dan aktor, secara bertahap kehilangan viabilitas komersial terhadap pesaing berbasis [[kecerdasan buatan]]. | Karena gaya seni dan [[Komposisi (seni rupa)|komposisi]] tidak memiliki hak cipta, sering kali ditafsirkan bahwa pengguna Stable Diffusion yang menghasilkan gambar karya seni tidak dapat dianggap melanggar hak cipta terhadap karya visual yang serupa.<ref name="automaton" /> Namun, individu yang digambarkan dalam gambar yang dihasilkan dapat dilindungi oleh hak kepribadian jika gambar mereka digunakan, dan [[kekayaan intelektual]] seperti logo merek yang dapat dikenali masih dilindungi oleh hak merek dagang.<ref name="automaton">[https://automaton-media.com/articles/newsjp/20220824-216074/ 高性能画像生成AI「Stable Diffusion」無料リリース。「kawaii」までも理解し創造する画像生成AI]. ''Automaton Media''. August 24, 2022.</ref> Namun, sejumlah seniman visual menyatakan kekhawatiran bahwa penggunaan luas perangkat lunak sintesis gambar seperti Stable Diffusion dapat berpotensi menyebabkan seniman manusia, bersama dengan fotografer, model, sinematografer, dan aktor, secara bertahap kehilangan viabilitas komersial terhadap pesaing berbasis [[kecerdasan buatan]]. | ||
Stable Diffusion lebih permisif dalam jenis konten yang mungkin dihasilkan pengguna, seperti gambar kekerasan atau eksplisit secara seksual, dibandingkan dengan produk kecerdasan buatan generatif komersial lainnya. Mengatasi kekhawatiran bahwa model tersebut dapat digunakan untuk tujuan yang tidak pantas, CEO Stability AI, Emad Mostaque, berpendapat bahwa "[itu] adalah tanggung jawab masyarakat, apakah mereka etis, bermoral, dan legal dalam cara mereka mengoperasikan teknologi ini", dan menempatkan kemampuan Stable Diffusion ke tangan publik akan menghasilkan teknologi yang memberikan manfaat, terlepas dari potensi konsekuensi negatifnya. Selain itu, Mostaque berpendapat bahwa niat dibalik tersedianya Stable Diffusion secara terbuka adalah untuk mengakhiri kontrol dan dominasi korporasi atas teknologi tersebut, yang sebelumnya hanya mengembangkan sistem kecerdasan buatan tertutup untuk sintesis gambar. Hal ini tercermin dari fakta bahwa batasan yang diterapkan oleh Stability AI pada konten yang dihasilkan pengguna dapat dengan mudah dilewati karena ketersediaan kode sumber. | Stable Diffusion lebih permisif dalam jenis konten yang mungkin dihasilkan pengguna, seperti gambar kekerasan atau eksplisit secara seksual, dibandingkan dengan produk kecerdasan buatan generatif komersial lainnya.<ref name="bijapan">Ryo Shimizu. [https://www.businessinsider.jp/post-258369 Midjourneyを超えた? 無料の作画AI「 #StableDiffusion 」が「AIを民主化した」と断言できる理由]. ''Business Insider Japan''. August 26, 2022.</ref> Mengatasi kekhawatiran bahwa model tersebut dapat digunakan untuk tujuan yang tidak pantas, CEO Stability AI, Emad Mostaque, berpendapat bahwa "[itu] adalah tanggung jawab masyarakat, apakah mereka etis, bermoral, dan legal dalam cara mereka mengoperasikan teknologi ini", dan menempatkan kemampuan Stable Diffusion ke tangan publik akan menghasilkan teknologi yang memberikan manfaat, terlepas dari potensi konsekuensi negatifnya. Selain itu, Mostaque berpendapat bahwa niat dibalik tersedianya Stable Diffusion secara terbuka adalah untuk mengakhiri kontrol dan dominasi korporasi atas teknologi tersebut, yang sebelumnya hanya mengembangkan sistem kecerdasan buatan tertutup untuk sintesis gambar.<ref name="bijapan" /> Hal ini tercermin dari fakta bahwa batasan yang diterapkan oleh Stability AI pada konten yang dihasilkan pengguna dapat dengan mudah dilewati karena ketersediaan kode sumber.<ref name=":13">Kenrick Cai. [https://www.forbes.com/sites/kenrickcai/2022/09/07/stability-ai-funding-round-1-billion-valuation-stable-diffusion-text-to-image/ Startup Behind AI Image Generator Stable Diffusion Is In Talks To Raise At A Valuation Up To $1 Billion]. ''Forbes''.</ref> | ||
== Gugatan == | == Gugatan == | ||
Pada Januari 2023, tiga seniman: Sarah Andersen, Kelly McKernan, dan Karla Ortiz mengajukan gugatan [[pelanggaran hak cipta]] terhadap Stability AI, [[Midjourney]], dan [[DeviantArt]], mengklaim bahwa perusahaan-perusahaan tersebut telah melanggar hak jutaan artis dengan melatih model kecerdasan buatan pada lima miliar gambar diambil dari web tanpa persetujuan dari seniman aslinya. Di bulan yang sama, Stability AI juga digugat oleh [[Getty Images]] karena menggunakan gambarnya dalam data pelatihan. | Pada Januari 2023, tiga seniman: Sarah Andersen, Kelly McKernan, dan Karla Ortiz mengajukan gugatan [[pelanggaran hak cipta]] terhadap Stability AI, [[Midjourney]], dan [[DeviantArt]], mengklaim bahwa perusahaan-perusahaan tersebut telah melanggar hak jutaan artis dengan melatih model kecerdasan buatan pada lima miliar gambar diambil dari web tanpa persetujuan dari seniman aslinya.<ref>James Vincent. [https://www.theverge.com/2023/1/16/23557098/generative-ai-art-copyright-legal-lawsuit-stable-diffusion-midjourney-deviantart AI art tools Stable Diffusion and Midjourney targeted with copyright lawsuit]. ''The Verge''. January 16, 2023.</ref> Di bulan yang sama, Stability AI juga digugat oleh [[Getty Images]] karena menggunakan gambarnya dalam data pelatihan.<ref name="CNN-Getty">Jennifer Korn. [https://www.cnn.com/2023/01/17/tech/getty-images-stability-ai-lawsuit/index.html Getty Images suing the makers of popular AI art tool for allegedly stealing photos]. ''CNN''. 2023-01-17.</ref> | ||
Pada Juli 2023, Hakim Distrik AS [[William Orrick III|William Orrick]] menolak sebagian besar tuntutan hukum yang diajukan oleh Andersen, McKernan, dan Ortiz tetapi mengizinkan mereka mengajukan keluhan baru. | Pada Juli 2023, Hakim Distrik AS [[William Orrick III|William Orrick]] menolak sebagian besar tuntutan hukum yang diajukan oleh Andersen, McKernan, dan Ortiz tetapi mengizinkan mereka mengajukan keluhan baru.<ref name="Reuters-SDLawsuit">Blake Brittain. [https://www.reuters.com/legal/litigation/us-judge-finds-flaws-artists-lawsuit-against-ai-companies-2023-07-19/ US judge finds flaws in artists' lawsuit against AI companies]. ''Reuters''. 2023-07-19.</ref> | ||
== Lisensi == | == Lisensi == | ||
Tidak seperti model lainnya seperti DALL-E, Stable Diffusion membuat kode sumbernya tersedia beserta dengan model (bobot pralatih). Lisensi yang berlaku adalah Creative ML OpenRAIL-M, sebuah lisensi kecerdasan buatan yang memiliki misi "bertanggung jawab sampai ke model". Lisensi ini melarang sejumlah kasus penggunaan, seperti tindakan kriminal, [[fitnah]], [[pelecehan]], [[doksing]], "mengeksploitasi ... anak di bawah umur", memberikan nasihat medis, membuat kewajiban hukum secara otomatis, memproduksi bukti hukum, dan "mendiskriminasi atau melakukan tindakan kekerasan terhadap individu dan kelompok berdasarkan ... perilaku sosial atau ... karakteristik pribadi atau kepribadian ... [atau] kategori dan karakteristik yang dilindungi hukum". Pengguna memiliki hak cipta terhadap gambar keluaran dan diperkenankan menggunakannya secara komersial. | Tidak seperti model lainnya seperti DALL-E, Stable Diffusion membuat kode sumbernya tersedia<ref name="stability">[https://stability.ai/blog/stable-diffusion-public-release Stable Diffusion Public Release]. ''Stability.Ai''.</ref><ref name="stable-diffusion-github">[https://github.com/CompVis/stable-diffusion Stable Diffusion Repository on GitHub]. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.</ref> beserta dengan model (bobot pralatih). Lisensi yang berlaku adalah Creative ML OpenRAIL-M, sebuah lisensi kecerdasan buatan yang memiliki misi "bertanggung jawab sampai ke model".<ref>[https://www.licenses.ai/blog/2022/8/18/naming-convention-of-responsible-ai-licenses From RAIL to Open RAIL: Topologies of RAIL Licenses]. ''Responsible AI Licenses (RAIL)''. 18 August 2022.</ref> Lisensi ini melarang sejumlah kasus penggunaan, seperti tindakan kriminal, [[fitnah]], [[pelecehan]], [[doksing]], "mengeksploitasi ... anak di bawah umur", memberikan nasihat medis, membuat kewajiban hukum secara otomatis, memproduksi bukti hukum, dan "mendiskriminasi atau melakukan tindakan kekerasan terhadap individu dan kelompok berdasarkan ... perilaku sosial atau ... karakteristik pribadi atau kepribadian ... [atau] kategori dan karakteristik yang dilindungi hukum".<ref name="washingtonpost">[https://www.washingtonpost.com/technology/2022/08/30/deep-fake-video-on-agt/ Ready or not, mass video deepfakes are coming]. ''The Washington Post''. 2022-08-30.</ref><ref>[https://huggingface.co/spaces/CompVis/stable-diffusion-license License - a Hugging Face Space by CompVis]. ''huggingface.co''.</ref> Pengguna memiliki hak cipta terhadap gambar keluaran dan diperkenankan menggunakannya secara komersial.<ref>Katsuo Ishida. [https://forest.watch.impress.co.jp/docs/review/1434893.html 言葉で指示した画像を凄いAIが描き出す「Stable Diffusion」 ~画像は商用利用も可能]. ''Impress Corporation''. August 26, 2022.</ref> | ||
== Lihat pula == | == Lihat pula == | ||
* [[Seni kecerdasan buatan]] | * [[Seni kecerdasan buatan]] | ||
* [[Hugging Face]] | * [[Hugging Face]] | ||
== Pranala luar == | == Pranala luar == | ||
* [https://huggingface.co/spaces/stabilityai/stable-diffusion Demo Stable Diffusion] | * [https://huggingface.co/spaces/stabilityai/stable-diffusion Demo Stable Diffusion] | ||
* [https://poloclub.github.io/diffusion-explainer/ Penjelasan Interaktif Stable Diffusion] | * [https://poloclub.github.io/diffusion-explainer/ Penjelasan Interaktif Stable Diffusion] | ||
== Referensi == | |||
<references /> | |||
== Sumber dan atribusi == | == Sumber dan atribusi == | ||
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Stable+Diffusion&oldid=28683580 Wikipedia bahasa Indonesia], revisi 28683580 (2025-12-10T09:29:06Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Gambar pada artikel ini bersumber dari Wikimedia Commons dan mengikuti ketentuan lisensi masing-masing berkas. Mohon gunakan konten dan media secara bijak serta sesuai dengan ketentuan lisensi yang berlaku. | |||
[https://id.wikipedia.org/w/index.php?title= | |||
revisi 28683580 (2025-12-10T09:29:06Z) | <!-- WIKI_UNISSULA_PRESENTATION_V4 --> | ||
Atribusi-BerbagiSerupa (CC BY-SA) pada | |||
Revisi terkini sejak 23 Agustus 2026 03.04

Stable Diffusion adalah sebuah model teks-ke-gambar berbasis kecerdasan buatan, bagian dari pemelajaran dalam yang dirilis pada tahun 2022.[1] Umumnya digunakan untuk menghasilkan gambar berdasarkan deskripsi teks, tetapi dapat juga digunakan untuk hal terkait seperti teknik inpainting, outpainting, dan menghasilkan keluaran gambar-ke-gambar yang dipandu oleh perintah kalimat.[2] Model Ini dikembangkan oleh para peneliti dari kelompok CompVis di Universitas Ludwig Maximilian München dan Runway dengan dukungan komputasi oleh Stability AI dan kumpulan data latih dari sejumlah organisasi nirlaba.[3][4][5]
Stable Diffusion adalah model difusi laten, sebuah jenis jaringan saraf tiruan generatif. Bobot kode dan modelnya telah dirilis secara publik,[6] dan dapat berjalan di sebagian besar perangkat keras tipe konsumen yang dilengkapi dengan kartu grafis sederhana dengan minimal kapasitas memori grafis sebesar 8 GB. Ini berbeda dari model teks-ke-gambar sebelumnya seperti DALL-E dan Midjourney yang hanya dapat diakses melalui layanan komputasi awan.[7]
Sejarah pengembangan
Pengembangan Stable Diffusion didanai dan didukung oleh perusahaan rintisan Stability AI.[8][9] Lisensi teknis untuk model tersebut dirilis oleh kelompok CompVis di Universitas Ludwig Maximilian München. Pengembangan dipimpin oleh Patrick Esser dari Runway dan Robin Rombach dari CompVis, yang termasuk di antara para peneliti yang sebelumnya menemukan arsitektur model difusi laten yang digunakan oleh Stable Diffusion. Stability AI juga memberikan apresiasi terhadap EleutherAI dan LAION (organisasi nirlaba Jerman yang mengumpulkan kumpulan data tempat pelatihan Stable Diffusion) sebagai pendukung proyek.
Pada Oktober 2022, Stability AI berhasil mengumpulkan US$101 juta dalam program pendanaan yang dipimpin oleh Lightspeed Venture Partners dan Coatue Management.[10]
Teknologi
Arsitektur
Stable Diffusion menggunakan sebuah jenis model difusi yang disebut model difusi laten yang dikembangkan oleh kelompok CompVis di Universitas Ludwig Maximilian München.[6]
Dengan 860 juta parameter di U-Net dan 123 juta di enkoder teks, Stable Diffusion dianggap relatif ringan menurut standar tahun 2022, dan tidak seperti model difusi lainnya, model ini dapat berjalan pada kartu grafis tipe konsumen.[11]
Data latih
Stable Diffusion dilatih pada pasangan gambar dan teks yang diambil dari LAION-5B, sebuah kumpulan data yang tersedia untuk umum yang berasal dari data Common Crawl yang diambil dari web, di mana 5 miliar pasangan gambar-teks diklasifikasikan berdasarkan bahasa dan disaring ke dalam kumpulan data terpisah berdasarkan resolusi, kemungkinan terdapatnya tanda air digital, dan skor "estetika" yang diprediksi (misalnya kualitas visual secara subjektif). [12] Kumpulan data ini dibuat oleh LAION, organisasi nirlaba Jerman yang menerima dana dari Stability AI.[12][13] Model Stable Diffusion dilatih pada tiga himpunan bagian LAION-5B yaitu laion2B-en, laion-high-resolution, dan laion-aesthetics v2 5+.[12] Analisis pihak ketiga terhadap data latih model menunjukan sekitar 47% dari ukuran sampel gambar berasal dari 100 domain web berbeda, dengan Pinterest mengambil 8,5% bagian, diikuti oleh situs web seperti WordPress, Blogspot, Flickr, DeviantArt, dan Wikimedia Commons.[14][12]
Prosedur pelatihan
Model ini awalnya dilatih pada subset laion2B-en dan laion-high-resolution, dengan beberapa putaran terakhir pelatihan dilakukan terhadap LAION-Aesthetics v2 5+, subset dari sekitar 600 juta gambar dengan judul yang diprediksi oleh LAION-Aesthetics Predictor V2 bahwa rata-rata manusia akan memberikan skor setidaknya 5 dari 10 berdasarkan penilaian seberapa besar mereka menyukainya.[15][12][16] Subset LAION-Aesthetics v2 5+ juga mengecualikan gambar yang memiliki beresolusi rendah dan gambar yang diidentifikasi oleh LAION-5B-WatermarkDetection memiliki tanda air digital dengan probabilitas lebih dari 80%.[12]
Model ini dilatih menggunakan 256 kartu grafis Nvidia A100 di Amazon Web Services dengan total 150.000 jam kartu grafis, dengan biaya sebesar US$600.000.[17][18][19]
Keterbatasan
Stable Diffusion memiliki masalah dengan degradasi dan ketidakakuratan dalam skenario tertentu. Rilis awal model ini dilatih pada kumpulan data yang terdiri dari gambar beresolusi 512×512, yang berarti bahwa kualitas gambar yang dihasilkan menurun drastis saat spesifikasi pengguna menyimpang dari resolusi 512×512 yang "diharapkan";[20] versi 2.0 dari model Stable Diffusion kemudian memperkenalkan kemampuan untuk menghasilkan gambar secara alami pada resolusi 768×768.[21] Tantangan lain adalah dalam menghasilkan anggota tubuh manusia karena kualitas data anggota tubuh yang buruk di data LAION (umumnya terlihat pada tangan).[22] Keterbatasan pada Stable Diffusion mulai diatasi secara perlahan dengan model versi SDXL yang dirilis pada tanggal 26 Juli 2023, SDXL mendukung gambar beresolusi 1024x1024 dan menghasilkan anggota tubuh dan teks yang lebih sempurna.[23]
Keterjangkauan untuk pengembang individu juga bisa menjadi masalah. Untuk menyesuaikan model untuk kasus penggunaan baru yang tidak termasuk dalam kumpulan data, seperti membuat karakter anime ("waifu difusion"),[24] data baru dan pelatihan lebih lanjut diperlukan. Adaptasi penyempurnaan terhadap Stable Diffusion yang dibuat melalui pelatihan ulang tambahan telah digunakan untuk berbagai kasus penggunaan yang berbeda, mulai dari pencitraan medis hingga musik yang dihasilkan dengan algoritma.[25] Namun, proses penyempurnaan ini sensitif terhadap kualitas data baru; gambar beresolusi rendah atau resolusi yang berbeda dari data asli tidak hanya dapat gagal mempelajari tugas baru tetapi juga menurunkan kinerja model secara keseluruhan. Bahkan ketika model dilatih lebih lanjut terhadap kumpulan gambar berkualitas tinggi, sulit bagi individu untuk menjalankan model dalam perangkat elektronik tipe konsumen. Misalnya, proses pelatihan waifu-diffusion membutuhkan minimal kapasitas memori grafis sebesar 30 GB,[26] yang melebihi sumber daya yang disediakan di kartu grafis tipe konsumen.[27]
Pencipta Stable Diffusion mengakui potensi bias algoritma, karena model tersebut dilatih pada gambar yang kebanyakan memiliki deskripsi bahasa Inggris.[18] Akibatnya, gambar yang dihasilkan memperkuat bias sosial yang berasal dari perspektif budaya Barat, karena pembuatnya model tersebut kekurangan data dari komunitas dan budaya lain.[18]
Penyempurnaan oleh pengguna akhir
Untuk mengatasi keterbatasan proses pelatihan awal model, pengguna akhir dapat memilih untuk melakukan pelatihan tambahan untuk menyempurnakan keluaran agar sesuai dengan kasus penggunaan yang lebih spesifik. Ada tiga metode di mana penyempurnaan oleh pengguna akhir dapat diterapkan:
- "Embedding" dapat dilatih dari kumpulan gambar yang disediakan oleh pengguna, dan memungkinkan model menghasilkan gambar yang mirip secara visual setiap kali nama sematan digunakan dalam perintah pembuatan.[28] Penyematan didasarkan pada konsep "inversi tekstual" yang dikembangkan oleh para peneliti dari Universitas Tel Aviv pada tahun 2022 dengan dukungan dari Nvidia, di mana representasi vektor untuk token tertentu yang digunakan oleh pembuat enkode teks model ditautkan ke kata-kata semu baru. Penyematan dapat digunakan untuk mengurangi bias dalam model aslinya, atau meniru gaya visual tertentu.
- "Hypernetwork" adalah jaringan saraf pra-pelatihan kecil yang diterapkan ke berbagai titik dalam jaringan saraf yang lebih besar, dan mengacu pada teknik yang dibuat oleh pengembang NovelAI Kurumuz pada tahun 2021, awalnya ditujukan untuk model transformator pembuatan teks. Hypernetwork mengarahkan hasil ke arah tertentu, memungkinkan model berbasis Stable Diffusion untuk meniru gaya seni seniman tertentu, bahkan jika seniman tersebut tidak dikenali oleh model aslinya; mereka memproses gambar dengan menemukan area kunci yang penting seperti rambut dan mata, lalu menambal area tersebut di ruang laten sekunder.[29]
- DreamBooth adalah model generasi pembelajaran mendalam yang dikembangkan oleh para peneliti dari Google Research dan Universitas Boston pada tahun 2022 yang dapat menyempurnakan model untuk menghasilkan keluaran yang dipersonalisasi dan presisi yang menggambarkan subjek tertentu, mengikuti pelatihan melalui serangkaian gambar yang menggambarkan subjek tersebut.[30]
Kemampuan
Model Stable Diffusion mendukung kemampuan untuk menghasilkan gambar baru dengan menggunkan perintah teks yang berisikan elemen-elemen yang akan disertakan atau dikecualikan dari keluaran.[31] Gambar yang sudah ada dapat digambar ulang oleh model untuk menambahkan elemen baru yang berdasarkan sebuah perintah teks (proses ini dikenal sebagai "pembuatan gambar terpandu"[32]) melalui mekanisme difusi-denoising.[33] Juga, model ini memungkinkan penggunaan perintah untuk mengubah gambar yang ada dengan teknik inpainting dan outpainting, ketika digunakan dengan antarmuka yang sesuai, yang mana tersedia dalam berbagai macam implementasi dengan sumber terbuka.[34]
Stable Diffusion disarankan untuk dijalankan dengan 10 GB atau lebih memori grafis, namun pengguna yang memiliki kapasitas memori grafis lebih sedikit dapat memilih untuk memuat bobot dengan presisi float16 ketimbang bobot bawaan dengan presisi float32 dengan kompromi pada performa model yang lebih rendah.[35]
Pembuatan teks ke gambar
Fitur pembuatan teks ke gambar dalam Stable Diffusion, yang dikenal sebagai "txt2img", menggunakan perintah teks dengan sejumlah parameter opsi yang mencakup jenis pengambilan sampel, dimensi gambar keluaran, dan nilai benih. Perintah mengeluarkan berkas gambar berdasarkan interpretasi model dari kalimat.[6] Gambar yang dihasilkan ditandai dengan tanda air digital yang tidak kasat mata untuk memungkinkan pengguna mengidentifikasi gambar yang dihasilkan oleh Stable Diffusion,[6] meskipun tanda air ini dapat pudar jika gambar diubah ukurannya atau diputar.[36]
Setiap generasi txt2img akan melibatkan nilai benih tertentu yang memengaruhi gambar keluaran. Pengguna dapat memilih untuk mengacak nilai benih untuk menjelajahi keluaran yang berbeda, atau menggunakan benih yang sama untuk mendapatkan keluaran gambar yang serupa dengan gambar yang dihasilkan sebelumnya.[20] Pengguna juga dapat menyesuaikan jumlah langkah inferensi untuk sampler; nilai yang lebih tinggi membutuhkan durasi waktu yang lebih lama, tetapi nilai yang lebih kecil dapat menyebabkan timbulnya cacat visual pada keluaran.[20] Opsi lain yang dapat dikonfigurasi adalah nilai skala panduan bebas pengklasifikasi, memungkinkan pengguna untuk menyesuaikan seberapa dekat gambar keluaran sesuai dengan perintah.[37] Kasus penggunaan yang lebih eksperimental mungkin memilih nilai yang lebih rendah, sementara kasus penggunaan yang ditujukan untuk keluaran yang lebih spesifik mungkin menggunakan nilai yang lebih tinggi.[20]
Fitur text2img tambahan disediakan oleh penerapan front-end Stable Diffusion, yang memungkinkan pengguna untuk mengubah bobot yang diberikan ke bagian tertentu dari perintah teks. Metode alternatif untuk menyesuaikan bobot ke bagian perintah adalah "perintah negatif". Perintah negatif adalah fitur yang disertakan dalam beberapa implementasi front-end, termasuk layanan komputasi awan DreamStudio dan Clipdrop milik Stability AI dan layanan eksternal NightCafe Studio, dan memungkinkan pengguna untuk menentukan hal yang harus dihindari model selama pembuatan gambar. Perintah yang ditentukan mungkin merupakan fitur gambar yang tidak diinginkan yang seharusnya ada dalam keluaran gambar karena perintah positif yang diberikan oleh pengguna, atau karena bagaimana awalnya model dilatih, dengan contoh umum berupa tangan manusia yang berantakan.[34][38]
Modifikasi gambar
Stable Diffusion juga menyertakan fitur lain, "img2img", yang menggunakan perintah teks, hubungan ke gambar yang ada, dan nilai kekuatan antara 0,0 dan 1,0. Fitur ini mengeluarkan gambar baru berdasarkan gambar yang sudah ada yang juga menampilkan elemen yang disediakan dalam perintah teks. Nilai kekuatan menunjukkan jumlah noise yang ditambahkan ke gambar keluaran. Nilai kekuatan yang lebih tinggi menghasilkan lebih banyak variasi dalam gambar.[6]
Kemampuan img2img untuk menambahkan noise ke gambar asli membuatnya berpotensi berguna untuk anonimisasi data dan augmentasi data, di mana karakteristik visual data gambar diubah dan dianonimkan.[39] Proses yang sama mungkin juga berguna untuk peningkatan resolusi gambar, di mana resolusi gambar ditingkatkan, dengan lebih banyak detil ditambahkan ke gambar.[39] Selain itu, Stable Diffusion telah diujicoba sebagai alat untuk kompresi gambar. Dibandingkan dengan format JPEG dan WebP, metode terbaru yang digunakan untuk kompresi gambar dalam Stable Diffusion memiliki keterbatasan dalam mempertahankan teks dan wajah kecil.[40]
Kasus penggunaan tambahan untuk modifikasi gambar melalui img2img ditawarkan oleh banyak implementasi front-end model Stable Diffusion. Inpainting melibatkan modifikasi selektif sebagian dari gambar yang ada dengan lapisan topeng yang disediakan pengguna, yang mengisi ruang bertopeng dengan konten yang baru dibuat berdasarkan kalimat yang diberikan.[34] Model khusus yang untuk kasus penggunaan inpainting dibuat oleh Stability AI bersamaan dengan peluncuran Stable Diffusion 2.0.[21] Sebaliknya, outpainting memperluas gambar melampaui dimensi aslinya, mengisi ruang kosong sebelumnya dengan konten yang dihasilkan berdasarkan kalimat yang disediakan.[34]
Model dengan panduan kedalaman, bernama "depth2img", diperkenalkan dengan rilis Stable Diffusion 2.0 pada 24 November 2022; model ini menyimpulkan kedalaman gambar masukan yang disediakan, dan menghasilkan gambar keluaran baru berdasarkan perintah teks dan informasi kedalaman, yang memungkinkan koherensi dan kedalaman gambar masukan asli dipertahankan dalam keluaran yang dihasilkan.[21]
ControlNet
ControlNet[41] adalah sebuah arsitektur jaringan saraf yang dirancang untuk mengelola model difusi dengan memasukkan kondisi tambahan. Ini menduplikasi bobot blok jaringan saraf menjadi salinan "terkunci" dan salinan "dapat dilatih". Salinan "dapat dilatih" mempelajari kondisi yang diinginkan, sedangkan salinan "terkunci" mempertahankan model aslinya. Konvolusi nol" adalah konvolusi 1×1 dengan bobot dan bias diinisialisasi ke nol. Sebelum pelatihan, semua konvolusi nol menghasilkan output nol, mencegah distorsi yang disebabkan oleh ControlNet. Metode ini memungkinkan pelatihan pada perangkat berskala kecil atau bahkan perangkat pribadi.
LoRA (Low-Rank Adaptation)
LoRA (Low-Rank Adaptation) merupakan sebuah teknik yang digunakan dalam pelatihan model pembelajaran mesin, terutama model bahasa besar (Large Language Models/LLMs), untuk mengurangi kompleksitas komputasi dan kebutuhan penyimpanan tanpa mengorbankan performa. LoRA memanfaatkan dekomposisi matriks dengan pangkat rendah untuk memperbarui hanya sebagian dari parameter model yang besar, sehingga mempercepat proses fine-tuning dan membuatnya lebih efisien dalam hal penggunaan sumber daya.[42]
Dalam model deep learning konvensional, proses fine-tuning sering kali membutuhkan pembaruan seluruh parameter model, yang memerlukan sumber daya komputasi besar dan memori yang tinggi. LoRA mengatasi hal ini dengan memproyeksikan perubahan parameter model ke dalam ruang pangkat rendah, di mana perubahan kecil dan terarah dapat diwakili secara efisien dengan parameter yang lebih sedikit.
Dalam praktiknya, LoRA menguraikan matriks besar dari parameter model menjadi dua matriks dengan pangkat lebih rendah, sehingga memperkecil dimensi parameter yang diperbarui. Dengan demikian, teknik ini mempertahankan performa model yang baik pada berbagai tugas, sekaligus mengurangi overhead komputasi dan memori yang diperlukan selama proses adaptasi atau fine-tuning.
LoRA telah menjadi populer dalam aplikasi seperti penyesuaian model bahasa besar pada domain spesifik, di mana pengurangan sumber daya yang dibutuhkan sangat penting untuk penerapan yang lebih luas dan efisien.
Rilis
Rilis model meliputi:
- V1.4, Agustus 2022[43]
- V1.5, Oktober 2022[44]
- V2.0, November 2022[45]
- V2.1, Desember 2022[46]
- SDXL 1.0, Juli 2023[47]
Penggunaan dan kontroversi
Stable Diffusion tidak mengklaim hak cipta atas gambar yang dihasilkan dan secara bebas memberikan hak cipta pada gambar yang dihasilkan dari model kepada pengguna asalkan konten gambar tidak ilegal atau membahayakan individu. Kebebasan yang diberikan kepada pengguna atas penggunaan gambar telah menyebabkan kontroversi tentang etika kepemilikan, karena Stable Diffusion dan model generatif lainnya dilatih dari gambar yang dilindungi hak cipta tanpa persetujuan pemilik.[48]
Karena gaya seni dan komposisi tidak memiliki hak cipta, sering kali ditafsirkan bahwa pengguna Stable Diffusion yang menghasilkan gambar karya seni tidak dapat dianggap melanggar hak cipta terhadap karya visual yang serupa.[49] Namun, individu yang digambarkan dalam gambar yang dihasilkan dapat dilindungi oleh hak kepribadian jika gambar mereka digunakan, dan kekayaan intelektual seperti logo merek yang dapat dikenali masih dilindungi oleh hak merek dagang.[49] Namun, sejumlah seniman visual menyatakan kekhawatiran bahwa penggunaan luas perangkat lunak sintesis gambar seperti Stable Diffusion dapat berpotensi menyebabkan seniman manusia, bersama dengan fotografer, model, sinematografer, dan aktor, secara bertahap kehilangan viabilitas komersial terhadap pesaing berbasis kecerdasan buatan.
Stable Diffusion lebih permisif dalam jenis konten yang mungkin dihasilkan pengguna, seperti gambar kekerasan atau eksplisit secara seksual, dibandingkan dengan produk kecerdasan buatan generatif komersial lainnya.[50] Mengatasi kekhawatiran bahwa model tersebut dapat digunakan untuk tujuan yang tidak pantas, CEO Stability AI, Emad Mostaque, berpendapat bahwa "[itu] adalah tanggung jawab masyarakat, apakah mereka etis, bermoral, dan legal dalam cara mereka mengoperasikan teknologi ini", dan menempatkan kemampuan Stable Diffusion ke tangan publik akan menghasilkan teknologi yang memberikan manfaat, terlepas dari potensi konsekuensi negatifnya. Selain itu, Mostaque berpendapat bahwa niat dibalik tersedianya Stable Diffusion secara terbuka adalah untuk mengakhiri kontrol dan dominasi korporasi atas teknologi tersebut, yang sebelumnya hanya mengembangkan sistem kecerdasan buatan tertutup untuk sintesis gambar.[50] Hal ini tercermin dari fakta bahwa batasan yang diterapkan oleh Stability AI pada konten yang dihasilkan pengguna dapat dengan mudah dilewati karena ketersediaan kode sumber.[48]
Gugatan
Pada Januari 2023, tiga seniman: Sarah Andersen, Kelly McKernan, dan Karla Ortiz mengajukan gugatan pelanggaran hak cipta terhadap Stability AI, Midjourney, dan DeviantArt, mengklaim bahwa perusahaan-perusahaan tersebut telah melanggar hak jutaan artis dengan melatih model kecerdasan buatan pada lima miliar gambar diambil dari web tanpa persetujuan dari seniman aslinya.[51] Di bulan yang sama, Stability AI juga digugat oleh Getty Images karena menggunakan gambarnya dalam data pelatihan.[52]
Pada Juli 2023, Hakim Distrik AS William Orrick menolak sebagian besar tuntutan hukum yang diajukan oleh Andersen, McKernan, dan Ortiz tetapi mengizinkan mereka mengajukan keluhan baru.[53]
Lisensi
Tidak seperti model lainnya seperti DALL-E, Stable Diffusion membuat kode sumbernya tersedia[54][6] beserta dengan model (bobot pralatih). Lisensi yang berlaku adalah Creative ML OpenRAIL-M, sebuah lisensi kecerdasan buatan yang memiliki misi "bertanggung jawab sampai ke model".[55] Lisensi ini melarang sejumlah kasus penggunaan, seperti tindakan kriminal, fitnah, pelecehan, doksing, "mengeksploitasi ... anak di bawah umur", memberikan nasihat medis, membuat kewajiban hukum secara otomatis, memproduksi bukti hukum, dan "mendiskriminasi atau melakukan tindakan kekerasan terhadap individu dan kelompok berdasarkan ... perilaku sosial atau ... karakteristik pribadi atau kepribadian ... [atau] kategori dan karakteristik yang dilindungi hukum".[56][57] Pengguna memiliki hak cipta terhadap gambar keluaran dan diperkenankan menggunakannya secara komersial.[58]
Lihat pula
Pranala luar
Referensi
- ↑ Iwan Setiyawan. Hak Cipta dan Kebebasan Berkarya di AI. kompas.id. 2023-03-06.
- ↑ Diffuse The Rest - a Hugging Face Space by huggingface. huggingface.co.
- ↑ Leaked deck raises questions over Stability AI's Series A pitch to investors. sifted.eu.
- ↑ Revolutionizing image generation by AI: Turning text into images. www.lmu.de.
- ↑ Emad Mostaque. Stable Diffusion came from the Machine Vision & Learning research group (CompVis) @LMU_Muenchen. Twitter. November 2, 2022.
- ↑ 6,0 6,1 6,2 6,3 6,4 6,5 Stable Diffusion Repository on GitHub. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.
- ↑ The new killer app: Creating AI art will absolutely crush your PC. PCWorld.
- ↑ The AI Founder Taking Credit For Stable Diffusion's Success Has A History Of Exaggeration. www.forbes.com.
- ↑ Jennifer Korn. Getty Images suing the makers of popular AI art tool for allegedly stealing photos. CNN. 2023-01-17.
- ↑ Kyle Wiggers. Stability AI, the startup behind Stable Diffusion, raises $101M. Techcrunch. 17 October 2022.
- ↑ Stable diffusion pipelines. huggingface.co.
- ↑ 12,0 12,1 12,2 12,3 12,4 12,5 Andy Baio. Exploring 12 Million of the 2.3 Billion Images Used to Train Stable Diffusion's Image Generator. Waxy.org. 2022-08-30.
- ↑ This artist is dominating AI-generated art. And he's not happy about it. MIT Technology Review.
- ↑ Alex Ivanovs. Stable Diffusion: Tutorials, Resources, and Tools. Stack Diary. 2022-09-08.
- ↑ Christoph Schuhmann. CLIP+MLP Aesthetic Score Predictor. 2022-11-02.
- ↑ LAION-Aesthetics LAION. laion.ai.
- ↑ Emad Mostaque. Cost of construction. Twitter. August 28, 2022.
- ↑ 18,0 18,1 18,2 CompVis/stable-diffusion-v1-4 · Hugging Face. huggingface.co.
- ↑ Kyle Wiggers. A startup wants to democratize the tech behind DALL-E 2, consequences be damned. TechCrunch. 2022-08-12.
- ↑ 20,0 20,1 20,2 20,3 Stable Diffusion with 🧨 Diffusers. huggingface.co.
- ↑ 21,0 21,1 21,2 Stable Diffusion 2.0 Release. stability.ai.
- ↑ LAION. laion.ai.
- ↑ Announcing SDXL 1.0. Stability AI.
- ↑ hakurei/waifu-diffusion · Hugging Face. huggingface.co.
- ↑ Seth Forsgren. Riffusion - Stable diffusion for real-time music generation. Riffusion.
- ↑ Anthony Mercurio. Waifu Diffusion. 2022-10-31.
- ↑ Ryan Smith. NVIDIA Quietly Launches GeForce RTX 3080 12GB: More VRAM, More Power, More Money. www.anandtech.com.
- ↑ Dave James. I thrashed the RTX 4090 for 8 hours straight training Stable Diffusion to paint like my uncle Hermann. PC Gamer. October 28, 2022.
- ↑ NovelAI Improvements on Stable Diffusion. NovelAI. October 11, 2022.
- ↑ Yuki Yamashita. 愛犬の合成画像を生成できるAI 文章で指示するだけでコスプレ 米Googleが開発. ITmedia Inc. September 1, 2022.
- ↑ Stable Diffusion Repository on GitHub. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.
- ↑ Chenlin Meng. SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations. August 2, 2021.
- ↑ Stable Diffusion Repository on GitHub. CompVis - Machine Vision and Learning Research Group, LMU Munich. 17 September 2022.
- ↑ 34,0 34,1 34,2 34,3 Stable Diffusion web UI. GitHub. 10 November 2022.
- ↑ Stable Diffusion with 🧨 Diffusers. huggingface.co.
- ↑ invisible-watermark. Shield Mountain. 2022-11-02.
- ↑ sumber pada Wikipedia bahasa Indonesia
- ↑ Stable Diffusion v2.1 and DreamStudio Updates 7-Dec 22. stability.ai.
- ↑ 39,0 39,1 Lorenzo Luzi. Boomerang: Local sampling on image manifolds using diffusion models. 2022-10-21.
- ↑ Matthias Bühlmann. Stable Diffusion Based Image Compression. Medium. 2022-09-28.
- ↑ Adding Conditional Control to Text-to-Image Diffusion Models. 10 February 2023.
- ↑ Edward Hu Yuanzhi Li. LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS. LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS. 2021-10-16. Vol. Version 2. hlm. 26.
- ↑ CompVis/stable-diffusion-v1-4 · Hugging Face. huggingface.co.
- ↑ runwayml/stable-diffusion-v1-5 · Hugging Face. huggingface.co.
- ↑ stabilityai/stable-diffusion-2 · Hugging Face. huggingface.co.
- ↑ stabilityai/stable-diffusion-2-1 · Hugging Face. huggingface.co.
- ↑ stabilityai/stable-diffusion-xl-base-1.0 · Hugging Face. huggingface.co.
- ↑ 48,0 48,1 Kenrick Cai. Startup Behind AI Image Generator Stable Diffusion Is In Talks To Raise At A Valuation Up To $1 Billion. Forbes.
- ↑ 49,0 49,1 高性能画像生成AI「Stable Diffusion」無料リリース。「kawaii」までも理解し創造する画像生成AI. Automaton Media. August 24, 2022.
- ↑ 50,0 50,1 Ryo Shimizu. Midjourneyを超えた? 無料の作画AI「 #StableDiffusion 」が「AIを民主化した」と断言できる理由. Business Insider Japan. August 26, 2022.
- ↑ James Vincent. AI art tools Stable Diffusion and Midjourney targeted with copyright lawsuit. The Verge. January 16, 2023.
- ↑ Jennifer Korn. Getty Images suing the makers of popular AI art tool for allegedly stealing photos. CNN. 2023-01-17.
- ↑ Blake Brittain. US judge finds flaws in artists' lawsuit against AI companies. Reuters. 2023-07-19.
- ↑ Stable Diffusion Public Release. Stability.Ai.
- ↑ From RAIL to Open RAIL: Topologies of RAIL Licenses. Responsible AI Licenses (RAIL). 18 August 2022.
- ↑ Ready or not, mass video deepfakes are coming. The Washington Post. 2022-08-30.
- ↑ License - a Hugging Face Space by CompVis. huggingface.co.
- ↑ Katsuo Ishida. 言葉で指示した画像を凄いAIが描き出す「Stable Diffusion」 ~画像は商用利用も可能. Impress Corporation. August 26, 2022.
Sumber dan atribusi
Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28683580 (2025-12-10T09:29:06Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Gambar pada artikel ini bersumber dari Wikimedia Commons dan mengikuti ketentuan lisensi masing-masing berkas. Mohon gunakan konten dan media secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.