AI ile sentetik rüya

Mar 11 2023
Midjourney'e yaptığım kısa yolculuk sırasında ortaya çıkan görüntülerin doğası ya da onlara - sanat eserleri - demeyi tercih ederseniz, sentetik rüyalar olarak tanımlanabilir. Herhangi bir berrak rüya deneyiminin ötesinde bir kontrol seviyesi vardır, ancak rüya zihninin dönüşü de aynı şekilde bilinemez.
İlk değişkenlerden son seçimlere yolculuk.

Midjourney'e yaptığım kısa yolculuk sırasında ortaya çıkan görüntülerin doğası ya da onlara - sanat eserleri - demeyi tercih ederseniz, sentetik rüyalar olarak tanımlanabilir. Herhangi bir berrak rüya deneyiminin ötesinde bir kontrol seviyesi vardır, ancak rüya zihninin dönüşü de aynı şekilde bilinemez. Süreçte, bunu, öznitelik eşleştirme ile geniş veri örneklerinin güçlü bir şekilde birleştirilmesi olarak anlıyorum. Sonuç olarak, basit anahtar kelimelerin garip ama tanıdık biçimlere dönüşmesi çok zor.

Bir makineyi düşündürmek, bir insanı düşündürmekle aynı şey değildir. Ortak bir anlayış olmadığı için, bu görüntülere yol açan istemlerin her şeyi açık hale getirmesi gerekir. Daha sonra ilk taslakları sentezlemek için eşleştirilip harmanlanabilecek sağduyulu ve yapılandırılmış talimatlar açısından diyalogdan farklı olmalıdır. İstenilen sayıda taslak oluşturulabilir. Burada gerçekten kullanmak için daha iyi bir terim 'ilham vermek', çünkü yapay zekadan herhangi bir belirli görüntüyü görevlendiremez veya talep edemezdim.

Oysa on dakikadır zar zor tanıdığım bir illüstratöre 'olağanüstü durumda, belki 19. yüzyıldan kalma, altın detaylarla süslenmiş Bastet'in muhteşem bir heykeli' diyebilirdim, burada ilk temastan saatler sonra bile şunu belirtmek zorunda kaldım: 'bastet otoportre, Mısır tanrısı, Mısır kedisi, sfenks, 50 mm lens, fotoğraf, gerçek fotoğraf, hiper-gerçekçi, oniks heykel, lav ve altın detay' ve tam olarak olmasa da şanslı olana kadar birçok varyant turu üzerinde yineleyin. tam olarak herhangi bir Bastet heykeli olmadığı için hayal ettiğim gibi.

Görüntülerin kalitesi, sistemde dağıttığım görüntülerin türüne ve üslup referanslarına bağlı olarak da çılgınca değişiyordu. Ligne claire tarzında basit bir illüstrasyon , ardından Herge, Jean Giraud, atom stili ve Moebius'tan açıkça bahsedilmesi, hepsi anlaşılmazlık ve soğuklukla geri döndü, oysa daha önce hiç duymadığım tür konsept sanatçılarının tarzında sayısız fütürist portre gördüm. topluluk Discord kanalındaki diğer AI fısıldayanlar tarafından olağanüstü bir hassasiyetle oluşturuldu.

Kaçırılan denemeler. Komut istemleri: "bir karanfil çiçeğinin yakından görünümü, alacalı doku, canlı, yarı saydam ve opak, mozaik ve taşlardan yapılmış, gerçeküstü, taç yaprağı üzerinde sinek kuşu, heykel, heykel fotoğrafı, fotoğraf gerçek, hiper-gerçek, gerçeğe benzerlik, ayrıntılı doku" ve "tartışan iki leopar çizimi, herge, atomik stil, çiçekler, ipek şapkalar".

Midjourney denediğim tek yapay zeka değildi. Bir DALL-E 2 deneyi büyüsü vardı ve Stable Diffusion'ı yerel olarak kurmak için devam eden bir girişim vardı . Bunlar — ve Google'ın Imagen'i— tümü, doğal dil girdisinden görseller oluşturmak için makine öğrenimi modeli Difüzyonu kullanır. Girilen sözcükler, yalnızca sözcükleri değil, aynı zamanda birbirleriyle olan ilişkilerini de alan ve daha sonra görüntü oluşturma algoritmasını koşullandırmak için kullanılan vektörler üreten, dönüşüm adı verilen bir süreçte kodlanır. Difüzyon Modelinin devreye girdiği yer burasıdır. Eğitim verilerini (modelin üzerinde çalıştığı geniş görüntü kitaplıkları) alarak ve tamamen Gauss gürültüsü haline gelene kadar sürekli olarak gürültü ekleyerek ve ardından görüntü oluşturmak için süreci tersine çevirerek çalışır. . Herhangi bir özel görüntü oluşturma istemi için, bir saf gürültü bloğu ile başlar ve anlamsal olarak makul görüntülerin çıktısını almak için metin kodlaması tarafından belirlenen koşullar altında gürültüyü giderir.

Bununla birlikte, mevcut araçların çekiciliği, kişinin perde arkasında neler olup bittiğini anlaması gerekmemesi ve çılgın Twitter başlıklarında gördüğümüz o çarpıcı görüntüleri yaratmak için yalnızca yaratıcı duyarlılıklarına güvenmesidir. Sisteme beslenebilecek tüm farklı parametreleri anlamaya (kendim yolun yarısındayım) ve ayrıca bu anlamsal ilişkilerin metinsel olarak nasıl tanımlandığını denemeye ihtiyaç var. Mevcut AI'ların her birinin de güçlü ve zayıf yönleri vardır. Midjourney bana şu ana kadarki en iyi çıktıları verdi, ancak DALL-E bir görüntünün bir bölümünü silerek ve bu belirli bölümler için yeni istemler yazarak düzenleme yapmama izin veriyor. Ayrıca Mona Lisa'yı geniş bir panoramik görünüme genişletebilir. Imagen'in en fotogerçekçi olduğu, Midjourney'nin ise en sanatsal olduğu söyleniyor.

Şimdiye kadar, en iyi uygulamalar hakkında tavsiye vermek için bu konularda çok yeniyim ama işte yolculuğu başlatan ipuçlarıyla birlikte şimdiye kadar bana sağladığı garip vizyonlar. En iyi bilgi istemi sanatçılarından bazıları, meyvelerini ilk istemden itibaren günler veya aylar alır, bu nedenle bunların yalnızca başlangıç ​​noktaları olduğunu unutmayın. Ve bunun geleneksel illüstratörlerin yerini nasıl alabileceğine dair acil soruyu ele almak için - bir tür yaratıcı yönetmen olarak bu olasılığı kesinlikle görebiliyorum, ancak aynı zamanda, başlangıçta açıkladığım gibi, kesin veya tutarlı bir şey üretmek inanılmaz derecede zahmetli. Onları çoğunlukla yaratmaya başlamak için rüya malzemesi olarak görüyorum.

Şimdiye kadarki en felsefi çıktı. Komut istemi: 'dinozor gövdeli maymun, goril suratlı, rex gövdeli, tüylü, pençeli, parıldayan, yoğun gözler, karamsar, korkutucu, sisli, atmosferik, alacakaranlık, arka planda dağlar, tek renkli, doymamış, 40 mm lens, orta çekim, çılgın gerçekçi, fotoğraf, gerçek fotoğraf, hiper gerçekçi, vfx, king kong filmi tarzında'
Aklımdaki gibi olmasa da muhteşem. Komut istemi: "budha otoportresi, budizm, gautama, eldeki lotus çiçeği, zarif, sakin, 50 mm lens, fotoğraf, gerçek fotoğraf, hiper gerçekçi, lapis lazuli heykeli, altın detay, detaylı, girift"

İlham mı hissediyorsun? Diğer tasarım bloglarımıza dalın ve konuyu daha derinlemesine keşfedin.

Devamını oku

İlk olarak https://www.columbiaroad.com adresinde yayınlanmıştır .