Imagen (model teks-ke-gambar): Perbedaan antara revisi
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 28396250; atribusi sumber disertakan. |
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi |
||
| Baris 1: | Baris 1: | ||
'''Imagen''' adalah model difusi teks-ke-gambar yang dikembangkan oleh [[Google Search|Google Research]] untuk menghasilkan gambar dari deskripsi teks dengan tingkat [[fotorealisme]] tinggi dan pemahaman bahasa yang mendalam. Model ini memadukan kemampuan [[model bahasa besar]] dalam memahami teks dengan kekuatan ''diffusion model'' dalam menghasilkan gambar berkualitas tinggi. | '''Imagen''' adalah model difusi teks-ke-gambar yang dikembangkan oleh [[Google Search|Google Research]] untuk menghasilkan gambar dari deskripsi teks dengan tingkat [[fotorealisme]] tinggi dan pemahaman bahasa yang mendalam. Model ini memadukan kemampuan [[model bahasa besar]] dalam memahami teks dengan kekuatan ''diffusion model'' dalam menghasilkan gambar berkualitas tinggi.<ref>[https://imagen.research.google/ Imagen: Text-to-Image Diffusion Models]. ''imagen.research.google''.</ref> | ||
== Perkembangan == | == Perkembangan == | ||
Imagen pertama kali diperkenalkan oleh [[Google Search|Google Research]] melalui publikasi ilmiah pada Mei 2022, yang menandai kemunculan awal sistem teks ke gambar dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam. Setelah itu, Google meluncurkan Imagen 2 pada Desember 2023, yang membawa peningkatan signifikan melalui fitur baru berupa kemampuan menghasilkan teks dan logo secara langsung di dalam gambar. Pengembangan berlanjut dengan hadirnya Imagen 3 pada Agustus 2024, yang difokuskan pada peningkatan kualitas detail visual serta pencahayaan agar hasil gambar tampak lebih realistis dan alami. Terakhir, pada 20 Mei 2025, dalam ajang [[Google I/O]] 2025, Google memperkenalkan Imagen 4, versi terbaru yang diklaim memiliki kemampuan pemrosesan lebih cepat dan resolusi keluaran hingga 2K, menegaskan posisinya sebagai salah satu model teks-ke-gambar paling maju di bidang kecerdasan buatan generatif. | Imagen pertama kali diperkenalkan oleh [[Google Search|Google Research]] melalui publikasi ilmiah pada Mei 2022, yang menandai kemunculan awal sistem teks ke gambar dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam.<ref>Chitwan Saharia. [http://arxiv.org/abs/2205.11487 Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding]. 2022-05-23. doi:10.48550/arXiv.2205.11487.</ref> Setelah itu, Google meluncurkan Imagen 2 pada Desember 2023, yang membawa peningkatan signifikan melalui fitur baru berupa kemampuan menghasilkan teks dan logo secara langsung di dalam gambar.<ref>[https://deepmind.google/models/imagen/ Imagen]. ''Google DeepMind''.</ref> Pengembangan berlanjut dengan hadirnya Imagen 3 pada Agustus 2024, yang difokuskan pada peningkatan kualitas detail visual serta pencahayaan agar hasil gambar tampak lebih realistis dan alami.<ref>Ben Schoon. [https://9to5google.com/2024/08/16/google-imagen-3-launch/ Google opens access to Imagen 3, its latest model for AI image generation]. ''9to5Google''. 2024-08-16.</ref> Terakhir, pada 20 Mei 2025, dalam ajang [[Google I/O]] 2025, Google memperkenalkan Imagen 4, versi terbaru yang diklaim memiliki kemampuan pemrosesan lebih cepat dan resolusi keluaran hingga 2K, menegaskan posisinya sebagai salah satu model teks-ke-gambar paling maju di bidang kecerdasan buatan generatif.<ref>Kyle Wiggers. [https://techcrunch.com/2025/05/20/imagen-4-is-googles-newest-ai-image-generator/ Imagen 4 is Google's newest AI image generator]. ''TechCrunch''. 2025-05-20.</ref> | ||
== Teknologi == | == Teknologi == | ||
Imagen dibangun atas dua komponen utama. Komponen pertama adalah [[model bahasa besar]] berbasis [[Transformator|transformer]], khususnya [[T5]], yang berfungsi untuk memahami teks dan mengubahnya menjadi representasi numerik yang dapat digunakan dalam proses [[sintesis gambar]]. Komponen kedua adalah [[model difusi bertingkat]] (''cascaded diffusion models''), yang digunakan untuk menghasilkan gambar dengan tingkat ketepatan dan ''fidelitas'' tinggi. Pada versi terbaru, Imagen 4, model ini mendukung pembuatan gambar dengan resolusi hingga 2K. | Imagen dibangun atas dua komponen utama. Komponen pertama adalah [[model bahasa besar]] berbasis [[Transformator|transformer]], khususnya [[T5]], yang berfungsi untuk memahami teks dan mengubahnya menjadi representasi numerik yang dapat digunakan dalam proses [[sintesis gambar]]. Komponen kedua adalah [[model difusi bertingkat]] (''cascaded diffusion models''), yang digunakan untuk menghasilkan gambar dengan tingkat ketepatan dan ''fidelitas'' tinggi.<ref>Chitwan Saharia. [http://arxiv.org/abs/2205.11487 Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding]. 2022-05-23. doi:10.48550/arXiv.2205.11487.</ref> Pada versi terbaru, Imagen 4, model ini mendukung pembuatan gambar dengan resolusi hingga 2K.<ref>[https://deepmind.google/models/imagen/ Imagen]. ''Google DeepMind''.</ref> | ||
== Referensi == | == Referensi == | ||
<references /> | |||
== Sumber dan atribusi == | == Sumber dan atribusi == | ||
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Imagen+%28model+teks-ke-gambar%29&oldid=28396250 Wikipedia bahasa Indonesia], revisi 28396250 (2025-11-10T06:43:31Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku. | Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Imagen+%28model+teks-ke-gambar%29&oldid=28396250 Wikipedia bahasa Indonesia], revisi 28396250 (2025-11-10T06:43:31Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku. | ||
<!-- WIKI_UNISSULA_PRESENTATION_V4 --> | |||
Revisi terkini sejak 23 Agustus 2026 04.11
Imagen adalah model difusi teks-ke-gambar yang dikembangkan oleh Google Research untuk menghasilkan gambar dari deskripsi teks dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam. Model ini memadukan kemampuan model bahasa besar dalam memahami teks dengan kekuatan diffusion model dalam menghasilkan gambar berkualitas tinggi.[1]
Perkembangan
Imagen pertama kali diperkenalkan oleh Google Research melalui publikasi ilmiah pada Mei 2022, yang menandai kemunculan awal sistem teks ke gambar dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam.[2] Setelah itu, Google meluncurkan Imagen 2 pada Desember 2023, yang membawa peningkatan signifikan melalui fitur baru berupa kemampuan menghasilkan teks dan logo secara langsung di dalam gambar.[3] Pengembangan berlanjut dengan hadirnya Imagen 3 pada Agustus 2024, yang difokuskan pada peningkatan kualitas detail visual serta pencahayaan agar hasil gambar tampak lebih realistis dan alami.[4] Terakhir, pada 20 Mei 2025, dalam ajang Google I/O 2025, Google memperkenalkan Imagen 4, versi terbaru yang diklaim memiliki kemampuan pemrosesan lebih cepat dan resolusi keluaran hingga 2K, menegaskan posisinya sebagai salah satu model teks-ke-gambar paling maju di bidang kecerdasan buatan generatif.[5]
Teknologi
Imagen dibangun atas dua komponen utama. Komponen pertama adalah model bahasa besar berbasis transformer, khususnya T5, yang berfungsi untuk memahami teks dan mengubahnya menjadi representasi numerik yang dapat digunakan dalam proses sintesis gambar. Komponen kedua adalah model difusi bertingkat (cascaded diffusion models), yang digunakan untuk menghasilkan gambar dengan tingkat ketepatan dan fidelitas tinggi.[6] Pada versi terbaru, Imagen 4, model ini mendukung pembuatan gambar dengan resolusi hingga 2K.[7]
Referensi
- ↑ Imagen: Text-to-Image Diffusion Models. imagen.research.google.
- ↑ Chitwan Saharia. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. 2022-05-23. doi:10.48550/arXiv.2205.11487.
- ↑ Imagen. Google DeepMind.
- ↑ Ben Schoon. Google opens access to Imagen 3, its latest model for AI image generation. 9to5Google. 2024-08-16.
- ↑ Kyle Wiggers. Imagen 4 is Google's newest AI image generator. TechCrunch. 2025-05-20.
- ↑ Chitwan Saharia. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. 2022-05-23. doi:10.48550/arXiv.2205.11487.
- ↑ Imagen. Google DeepMind.
Sumber dan atribusi
Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28396250 (2025-11-10T06:43:31Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.