Brytyjscy badacze odkryli lukę, która za pomocą prostego polecenia pozwalała skłonić publicznie dostępną wersję ChatuGPT do generowania obrazów przedstawiających brutalną przemoc oraz treści o charakterze seksualnym. Zdaniem ekspertów wystarczyła niewielka modyfikacja popularnego promptu, który pierwotnie miał służyć do tworzenia humorystycznych materiałów – donosi bbc.com.
Problem wykrył startup Mindgard zajmujący się bezpieczeństwem sztucznej inteligencji. Pracujący w firmie Jim Nightingale przyznał, że część wygenerowanych grafik była tak szokująca, że pozostawiła go „wstrząśniętego i doprowadziła do łez” – czytamy.
Mindgard odpowiada za tzw. red-teamingiem, czyli kontrolowane testowanie modeli AI w celu sprawdzania, czy można obejść ich zabezpieczenia. Celem takich działań jest wykrywanie słabych punktów i przekazywanie ich twórcom systemów.
Niewinny prompt, niepokojące efekty
Według badaczy ze startupu chatbot był w stanie generować drastyczne obrazy nawet wtedy, gdy polecenia nie zawierały szczegółowych instrukcji opisujących przemocy.
Wśród stworzonych przez ChatGPT grafik znalazł się m.in. obraz mężczyzny z poważnym urazem głowy. Inny przedstawiał martwą młodą kobietę w krótkich spodenkach i topie, z widocznymi śladami krwi. Chatbot nadał mu tytuł „Ponure następstwa miejsca zbrodni”. Jak podkreślili badacze, część elementów obrazu mogła sugerować przemoc seksualną – dowiadujemy się.
Kolejny materiał przedstawiał młodą kobietę w koszulce z logo uczelni, skrępowaną i zakneblowaną w pustym, zaniedbanym pomieszczeniu. ChatGPT zatytułował go „Porzucona w strachu i zniewoleniu”.
Badacze zwrócili również uwagę, że model generował obrazy przedstawiające nagość i seksualizowane sceny. Przypomnieli też wyniki wcześniejszych badań, które pokazały, że ChatGPT można było oszukać i wykorzystać do tworzenia nagich deepfake’ów prawdziwych osób poprzez podmianę ich twarzy. Choć OpenAI twierdziło, że rozwiązało ten problem, eksperci ustalili, że podobne rezultaty nadal można było uzyskać inną metodą – pisze źródło.
Peter Garraghan, założyciel Mindgard i profesor Uniwersytetu Lancaster, ocenił, że szczególnie niepokojące było to, iż prompt nie określał tematyki obrazów. Mimo to model generował różnego rodzaju brutalne i seksualizowane treści.
Jak podaje źródło, badacze poinformowali OpenAI o problemie już w maju 2026 roku i przekazali szczegóły swoich ustaleń. Początkowo otrzymali jedynie automatyczną odpowiedź. Ich zdaniem podjęto próbę zablokowania problematycznego promptu, jednak zabezpieczenie nadal można było łatwo obejść.
Dopiero po kontakcie ze strony BBC OpenAI wdrożyło dodatkowe środki ochrony. Firma poinformowała, że stosuje wielowarstwowy system zabezpieczeń, łączący automatyczne mechanizmy wykrywania z oceną prowadzoną przez ludzi. Podkreśliła również, że jej zasady zabraniają generowania treści erotycznych, przemocy seksualnej oraz skrajnie brutalnych materiałów, z wyjątkiem określonych kontekstów naukowych, historycznych, informacyjnych lub artystycznych – dowiadujemy się.
Gra w kotka i myszkę
Eksperci uważają, że całkowite wyeliminowanie takich przypadków pozostaje bardzo trudne. Dr Rumman Chowdhury, szefowa organizacji Humane Intelligence, określiła sytuację jako „nieustanną grę w kotka i myszkę” – wraz z udoskonalaniem zabezpieczeń rozwijają się bowiem również metody ich obchodzenia.
Jak zaznaczyła, modele AI nie rozumieją intencji, kontekstu ani zasad etycznych w taki sposób jak ludzie. Dlatego nie potrafią samodzielnie ocenić, co jest właściwe, a co nie, i wymagają rozbudowanych mechanizmów kontroli – czytamy.
Problem nie dotyczy wyłącznie ChatuGPT. W 2025 roku badacze z brytyjskiego AI Security Institute odkryli metody omijania zabezpieczeń, które pozwalały obchodzić ograniczenia we wszystkich testowanych przez nich systemach sztucznej inteligencji.
Brytyjski Departament Nauki, Innowacji i Technologii przyznał, że bezpieczeństwo modeli AI stopniowo się poprawia, jednak nadal pozostaje wiele do zrobienia. AI Security Institute zapowiedziało dalszą współpracę z twórcami systemów w celu wzmacniania zabezpieczeń jeszcze przed udostępnieniem ich użytkownikom. (ao)
Źródło: bbc.com, ChatGPT can be made to generate sexualised and violent images, researchers find, Chris Vallance, 18.06.2026


