Lompat ke isi

Imagen (model teks-ke-gambar)

Ensiklopedia Pengetahuan Universitas Islam Sultan Agung
Revisi sejak 23 Agustus 2026 04.11 oleh Maintenance script (bicara | kontrib) (Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi)
(beda) ← Revisi sebelumnya | Revisi terkini (beda) | Revisi selanjutnya → (beda)

Imagen adalah model difusi teks-ke-gambar yang dikembangkan oleh Google Research untuk menghasilkan gambar dari deskripsi teks dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam. Model ini memadukan kemampuan model bahasa besar dalam memahami teks dengan kekuatan diffusion model dalam menghasilkan gambar berkualitas tinggi.[1]

Perkembangan

Imagen pertama kali diperkenalkan oleh Google Research melalui publikasi ilmiah pada Mei 2022, yang menandai kemunculan awal sistem teks ke gambar dengan tingkat fotorealisme tinggi dan pemahaman bahasa yang mendalam.[2] Setelah itu, Google meluncurkan Imagen 2 pada Desember 2023, yang membawa peningkatan signifikan melalui fitur baru berupa kemampuan menghasilkan teks dan logo secara langsung di dalam gambar.[3] Pengembangan berlanjut dengan hadirnya Imagen 3 pada Agustus 2024, yang difokuskan pada peningkatan kualitas detail visual serta pencahayaan agar hasil gambar tampak lebih realistis dan alami.[4] Terakhir, pada 20 Mei 2025, dalam ajang Google I/O 2025, Google memperkenalkan Imagen 4, versi terbaru yang diklaim memiliki kemampuan pemrosesan lebih cepat dan resolusi keluaran hingga 2K, menegaskan posisinya sebagai salah satu model teks-ke-gambar paling maju di bidang kecerdasan buatan generatif.[5]

Teknologi

Imagen dibangun atas dua komponen utama. Komponen pertama adalah model bahasa besar berbasis transformer, khususnya T5, yang berfungsi untuk memahami teks dan mengubahnya menjadi representasi numerik yang dapat digunakan dalam proses sintesis gambar. Komponen kedua adalah model difusi bertingkat (cascaded diffusion models), yang digunakan untuk menghasilkan gambar dengan tingkat ketepatan dan fidelitas tinggi.[6] Pada versi terbaru, Imagen 4, model ini mendukung pembuatan gambar dengan resolusi hingga 2K.[7]

Referensi

  1. Imagen: Text-to-Image Diffusion Models. imagen.research.google.
  2. Chitwan Saharia. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. 2022-05-23. doi:10.48550/arXiv.2205.11487.
  3. Imagen. Google DeepMind.
  4. Ben Schoon. Google opens access to Imagen 3, its latest model for AI image generation. 9to5Google. 2024-08-16.
  5. Kyle Wiggers. Imagen 4 is Google's newest AI image generator. TechCrunch. 2025-05-20.
  6. Chitwan Saharia. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. 2022-05-23. doi:10.48550/arXiv.2205.11487.
  7. Imagen. Google DeepMind.

Sumber dan atribusi

Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28396250 (2025-11-10T06:43:31Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.