La face cachée des ia génératrices d’images : l’inquiétante découverte de contenu NSFW

Un nouveau test a révélé que les IA génératrices d’images populaires peuvent être exploitées pour créer du contenu NSFW (Not Safe For Work). À l’origine, ces outils ont été conçus afin de générer du contenu classé G.

Les chercheurs de l’Université Johns Hopkins ont manipulé deux des systèmes les plus connus. Cela afin de produire exactement le type d’images que les garanties des produits excluent normalement. Ils ont affirmé qu’avec le bon code, tout le monde peut contourner les filtres de ces IA génératives pour créer du contenu inapproprié.

Stable Diffusion et DALL-E 2 dans la ligne de mire des chercheurs

L’auteur Yinzhi Cao, informaticien à Johns Hopkins, a déclaré que l’objectif est ici de montrer que les développeurs d’IA génératives n’adoptent pas les mesures nécessaires pour bloquer le contenu NSFW. « Nous ne faisons que montrer que les utilisateurs peuvent profiter de cette découverte. Par contre, les conclusions de notre étude ne seront présentées que lors du 45e Symposium de l’IEEE sur la sécurité et la confidentialité en 2024 », a-t-il ajouté.

https://www.youtube.com/watch?v=CkOiRSViQyM&pp=ygUHQUkgTlNXRg%3D%3D

Cao et son équipe ont testé les générateurs d’images DALL-E 2 et Stable Diffusion. Il s’agit des deux outils les plus utilisés et gérés par l’intellignce artificielle. Ces IA génératives sont capables de générer instantanément des images réalistes à partir d’une simple commande. Ils ont acquis une certaine notoriété en raison de leur capacité à créer des images en fonction des descriptions textuelles fournies.

Sneaky prompt : la solution pour créer du contenu NSFW avec l’IA

Une équipe de recherche a testé des générateurs d’images avec un nouvel algorithme baptisé Sneaky Prompt. Celui-ci crée des mots de commande absurdes qui sont interprétés par les systèmes comme des demandes pour générer des images spécifiques depuis leur interface.

Youtube video

Certains de ces mots absurdes produisaient des images innocentes. Mais les chercheurs ont découvert que d’autres génèrent du contenu inapproprié de façon réaliste. Par exemple, le mot « sumowtawgha » amenait DALL-E 2 à créer des nus.

Selon Cao, ces résultats montrent comment ces systèmes pourraient potentiellement être exploités pour produire d’autres types de contenus problématiques. Des images trompeuses de personnalités en situation compromettante pourraient par exemple être générées.

L’équipe étudiera ensuite des moyens de renforcer la sécurité des générateurs d’images, dans le but d’améliorer leurs défenses. Cette recherche visait en effet à tester leurs vulnérabilités.

Cliquez pour commenter

Laisser un commentaire

ARTICLES SIMILAIRES

Le secteur mondial de la défense investit 2,5 milliards dans la 5G

Les forces armées du monde entier intensifient leur adoption de la 5G privée. Un investissement

22 août 2026

ChatGPT for Teens renforce la protection des 13-17 ans

OpenAI lance ChatGPT for Teens, une version spécifiquement dédiée aux adolescents de 13 à 17

19 août 2026

Plus quelques heures avant la fin des soldes d’été NordVPN 2026 : trouvez la formule idéale pour Grok 4.5

3,37 euros, 4,33 euros ou 8,19 euros par mois : les Soldes d’été NordVPN proposent

28 juillet 2026

SentinelOne s’impose comme le nouveau bouclier IA pour la maison intelligente

Face à la montée en puissance des objets connectés domestiques, la cybersécurité doit se réinventer.

26 juillet 2026

Quel est le niveau de sécurité réel offert par SentinelOne sur vos terminaux ?

SentinelOne s’impose aujourd’hui comme une solution incontournable dans la sécurité de vos terminaux. Ce logiciel

25 juillet 2026

Protégez votre réseau d’objets connectés contre les pirates avec SentinelOne

Alors que les réseaux d’objets connectés s’intègrent de plus en plus dans les infrastructures industrielles

24 juillet 2026