Médias artificiels

Dec 26 2022
2022 restera dans l'histoire comme l'année où l'intelligence artificielle a été reconnue pour ses capacités créatives.
Le 30 novembre, OpenAI a mis en ligne gratuitement un assistant d'IA, ChatGPT, qui en seulement 5 jours a attiré plus d'un million d'utilisateurs, nourris par la curiosité d'entrer en contact avec ses extraordinaires capacités de conversation. Au milieu des nombreux défauts que nous y avons trouvés - erreurs factuelles, fabrication de données, excès de confiance ou manque de "voix" -, nous avons tous dû reconnaître que nous n'avions jamais rien vu de tel.

Le 30 novembre, OpenAI a mis en ligne gratuitement un assistant IA, ChatGPT, qui en seulement 5 jours a attiré plus d' un million d'utilisateurs , nourris par la curiosité d'entrer en contact avec ses extraordinaires capacités conversationnelles. Au milieu des nombreux défauts que nous y avons trouvés - erreurs factuelles, fabrication de données, excès de confiance ou manque de "voix" -, nous avons tous dû reconnaître que nous n'avions jamais rien vu de tel . Il est possible d'entrer en dialogue avec l'assistant, d'aborder le plus large éventail de sujets et de générer des moments de partage empathique profond construit à partir d'auto-illusions basées sur le naturel, l'éloquence et la compréhension discursive de l'assistant.

Mais il n'y a pas que la conversation qui a été prise d'assaut. Des mois plus tôt, le 12 juillet, un autre assistant, Midjourney, avait été libéré ; puis, le 22 août, Stable Diffusion de l'Université de Munich a également été publié, et le 28 septembre, OpenAI a rendu Dall-E 2 accessible à tous. Ces trois assistants IA partagent les mêmes compétences en dessin d'image, avec la particularité de présenter des résultats originaux et en même temps très humains comme s'ils avaient été créés par des êtres humains.

La conversation et le dessin sont des activités très proches et profondément créatives. Tout comme nous improvisons avec un crayon sur papier, nous improvisons dans la création de réponses, en temps réel, aux interactions avec les autres. Il est donc important de comprendre ce qui a donné naissance à ces nouvelles capacités des machines, étant donné que l'IA existe depuis près de 70 ans.

Jusqu'à il y a quelques années, l'IA se construisait à partir de simples algorithmes, comme si nous sculptions un modèle de pensée, espérant arriver à quelque chose capable de reconnaître le monde et lui-même. Mais les développements de l'IA ont commencé à changer avec Deep Blue, qui, pour battre Garry Gasparov en 1997, a étudié au préalable des milliers de mouvements d'échecs. Depuis lors, l'approche s'est concentrée sur l'apprentissage, l'enseignement et l'auto-apprentissage des systèmes d'IA, Machine Learning (ML), auxquels Internet a contribué avec l'accès à des bases de données toujours plus grandes. Le processus de formation de l'IA a été transformationnel, non seulement parce qu'il a permis aux assistants de trouver des modèles similaires et ainsi de découvrir la clé de la sémantique par simple comparaison, mais principalement parce que dans ce processus les réseaux de neurones dits artificiels sont développés,

De façon simpliste, quand on regarde un stylo, on ne peut pas établir plus de 4 à 6 paramètres pour le définir — ex : couleur : bleu ; effet : métallique ; lueur : dorée ; longueur : 7 cm ; largeur : 0,5 cm. Un assistant, en revanche, armé d'un ensemble d'algorithmes ML, peut, grâce à des comparaisons établies au sein de ces énormes bases de données, trouver et définir non seulement quelques dizaines mais même des centaines de paramètres qui définissent le même stylo (voir Figure 1). Des paramètres que nous, les humains, ne pouvons pas consciemment voir, entendre, ressentir ou même comprendre. Mais ce sont ces paramètres qui permettent d'accéder à une réalité immensément fine, probablement inaccessible au cerveau humain, et permettent à l'assistant de prédire les meilleurs mots à écrire, les uns après les autres, ainsi que les meilleurs couleur, trait, ombre, volume , échelle à adopter lors du dessin d'une image.

Figure 1 : Plusieurs couches de paramètres et leurs interconnexions dans un réseau neuronal profond. GPT-3, qui est le système le plus avancé à l'heure actuelle, se compose de 96 couches de neurones artificiels, totalisant 175 milliards d'interconnexions [1].

Ce processus d'apprentissage à partir de grandes bases de données créées par des humains présente des problèmes majeurs, allant des préjugés intégrés au droit d'auteur de son contenu. Si sous forme de texte, les préjugés peuvent devenir rapidement clairs, les assistants régurgitant bon nombre des préjugés moraux qui envahissent Internet, c'est dans les images que la plupart des problèmes sont survenus. Les assistants utilisent des bases de données d'images, telles que LAION , créées à des fins de recherche scientifique. Le but étant de construire les assistants les plus avancés possibles et ainsi de contribuer à l'innovation humaine, ces bases de données ont permis de répertorier à peu près tout ce qu'elles pouvaient trouver sur le net.

Figure 2 : Stable Diffusion « rêver selon », de gauche à droite, Gustave Doré, Sebastião Salgado et Loish.

Ainsi, des centaines de millions d'images appartenant à tout le monde ont été cataloguées, de la photo prise par le citoyen le plus ordinaire et postée sur Flickr, aux photos élaborées par des photographes, en passant par des illustrations très détaillées ou des peintures d'artistes — que l'on pouvait trouver dans journaux, magazines, musées, comme dans les portfolios en ligne DeviantArt, ArtStation, Behance, etc. Donc, si nous demandons à l'un de ces assistants de nous donner une image dans le style de Gustave Doré, Sebastião Salgado ou Loish, il n'a aucun problème à exaucer notre souhait , comme on peut le voir sur la figure 2.

Si cette capacité créative de l'IA est remarquable, sous-jacente elle se pose deux questions inévitables : 1) qui a donné la permission d'utiliser les images de ces auteurs ? ; 2) qui leur a donné la permission de copier et de créer des versions de ces images ? Les réponses que nous avons fin 2022 ne sont pas bonnes. Dans le cas de Stable Diffusion, bien que le professeur Björn Ommer ait dit "nous ne sommes pas allés sur Internet pour trouver les images nous-mêmes", ils utilisent en fait LAION. Dans MidJourney, David Holz suppose qu'ils ont utilisé des images prises sur Internet sans aucun consentement, et ils n'ont aucune idée de qui sont les images qu'ils ont utilisées.

Figure 3 : Images créées par Midjourney.

Malgré ces problèmes, qui donneront lieu à de nombreuses discussions dans les prochaines années et probablement à de nouvelles législations, on peut dire que dans le domaine de la création, nous avons atteint un point de non-retour. Notons que la créativité se définit par la capacité de l'être humain à « faire des combinaisons non familières d'idées familières » [2], ce que nous offrent justement ces systèmes d'IA, comme on peut le voir sur la figure 3. Mais ce point de non-retour n'est pas ne se produisent que dans le domaine du texte et des images, à partir de ce processus de calcul « simple », tout le monde de la création médiatique se transforme en un monde artificiel complètement nouveau. N'importe qui peut aujourd'hui, grâce à de simples invites, demander à des assistants IA de créer des histoires, des nouvelles, des dessins, des titres, des peintures, des photographies, des graphiques, de la musique, des voix ou des animations. Ce nouveau média artificiel (voir Figure 4) peut même gagner des festivals et des concours [3]. À l'heure actuelle,

Figure 4 — Les médias artificiels sont définis par les assistants IA qui permettent la communication et les créations artistiques. Pour une liste exhaustive des assistants IA, visitez Futurepedia https://www.futurepedia.io.

Dans ce nouveau monde artificiel, les êtres humains seront de moins en moins les acteurs. L'ordinateur peut fabriquer, créer, mélanger et répéter des dizaines ou des centaines de fois par heure jusqu'à ce qu'il nous offre ce que nous recherchons. L'humain n'aura ainsi plus à se soucier des aspects pratiques de l'art, ainsi que des complexités matérielles de chaque médium. N'importe qui pourra créer n'importe quoi, ce qui, étant vrai, ne signifiera pas que quiconque pourra créer ce que beaucoup d'entre nous voudront vivre. Mais nous avons déjà eu cette même conversation sur le Web 2.0 (par exemple 4, 5). Dans ce nouveau monde, créé par les médias artificiels, l'humain sera un directeur artistique et de communication, pour lequel il aura besoin, non pas de moins, mais de plus, de beaucoup plus de connaissances sur les arts médiatiques qu'il utilise.

Remarques:

[1] Brown, TB, Mann, B., Ryder, N., Subbiah, M., et al. (2020). Les modèles de langage sont des apprenants peu nombreux. arXiv:2005.14165 .https://arxiv.org/pdf/2005.14165.pdf.

[2] Boden, M. (2007). La créativité en un mot. Pensez, 5 (15), 83–96. doi:10.1017/S147717560000230X.

[3] Glenn Marshall a remporté le prix du meilleur court métrage au Festival de Cannes avec « The Crow » (2022), tandis que Jason Allen a remporté un concours de photographie numérique avec « Théâtre D'opéra Spatial ».

[4] Keen, A. (2007). Le culte de l'amateur : comment les blogs, MySpace, YouTube et le reste des médias générés par les utilisateurs d'aujourd'hui tuent notre culture et notre économie . Hachette Royaume-Uni.

[5] Anderson, C. (2006). La longue traîne : pourquoi l'avenir des affaires vend moins ou plus , Hyperion NY.

Publié en portugais dans Virtual Illusion .