Wojna algorytmów: teksty wygenerowane przez sztuczną inteligencję kontra detektory

Czasy, w których sztuczna inteligencja pozwalała na niemal bezkarne generowanie, tłumaczenie i przerabianie tekstów, powoli odchodzą do lamusa. Na scenę wkraczyły bowiem nowoczesne detektory AI, takie jak GPTZero i Pangram. Już na chwilę obecną potrafią z dużą dokładnością rozpoznawać teksty napisane przez człowieka, jak i te wygenerowane przez AI. GPTZero został wykorzystany do wstępnego testowania zamieszczanych prac na pięciu konferencjach z dziedziny informatyki i przez trzy uniwersytety. Konkurencyjny program- Pangram ujawnia, że ich narzędzie jest w stanie wykrywać treści wygenerowane przez AI z dokładnością 99,98% (!). W lipcu firma badawcza Epoch AI z San Francisco poinformowała, że w teście obejmującym 495 tekstów napisanych przez człowieka, Pangram nie wskazał ani jednego fałszywie pozytywnego wyniku.

Nie dziwi więc, naukowcy, wydawcy i instytucje akademickie błyskawicznie zaczęły korzystać z tego typu oprogramowania. Wstępne dane są szokujące. Dane zaprezentowane przez She,R.; 2026 wskazują, że jeden na osiem artykułów biomedycznych zawiera treści wygenerowane przez AI. 32% prac powstałych w południowokoreańskich laboratoriach i 26% prac z chińskich instytutów badawczych zawierało fragmenty wygenerowane przez AI, w porównaniu z 7,4% prac pochodzących z amerykańskich uczelni.

Dostęp do nowych technologii uruchomił masowe kontrole. W czerwcu organizatorzy prestiżowej konferencji informatycznej NeurIPS poinformowali, że po przeprowadzeniu kontroli z wykorzystaniem Pangram odrzucono 18% zgłoszonych prac.  Użytkownicy serwisu preprintów arXiv mogą już na chwilę obecną sprawdzać teksty naukowe za pomocą Pangram poprzez serwis alphaXiv, a University of Chicago poinformował o rozpoczęciu wykorzystywania detektora do analizy prac studentów. Pangram i GPTZero uruchomiły również narzędzia przeglądarkowe, które sprawdzają, czy tekst zamieszczony w mediach społecznościowych, na innych stronach internetowych oraz w Dokumentach Google został napisany przez AI.

Dla polskich naukowców szczególnie istotne jest to, że Pangram deklaruje bardzo niski odsetek fałszywych wskazań — 0,0041% w przypadku tekstów anglojęzycznych — a podobnie niskie wyniki uzyskano w ponad 100 językach. Co ważne, testy nie wykazały, aby narzędzie gorzej oceniało autorów, którzy nie posługują się angielskim jako językiem ojczystym. Jest to niezwykle ważne, ponieważ wcześniejsze detektory miały z tym problem i często mylnie oznaczały artykuły pisane przez autorów nieanglojęzycznych jako generowane przez AI.

Oczywiście, jak każde narzędzie, detektory mogą się mylić i nie są doskonałe. Imponująca zdolność tych narzędzi do wykrywania tekstów napisanych wyłącznie przez ludzi ma swoją cenę. Aby uniknąć oznaczania ludzkiego tekstu jako wygenerowanego przez AI, obie firmy akceptują większy odsetek wyników fałszywie ujemnych — czyli sytuacji, w których tekst wygenerowany przez AI zostaje błędnie uznany za napisany przez człowieka.

Istotne jest również na tym etapie, aby rozdzielić przypadki, w których tekst został w całości wygenerowany przez AI, od coraz powszechniejszego pisania wspomaganego przez AI. W miarę jak coraz więcej autorów doświadczyło oznaczania ich tekstów przez coraz bardziej zaawansowane oprogramowanie do analizy treści, stało się jasne, że największym wyzwaniem jest właśnie sposób postępowania z tekstami, przy których człowiek i AI współtworzą treść. Problem pojawia się na przykład wtedy, gdy człowiek sam pisze artykuł, a AI pomaga poprawić styl, edytuje, tłumaczy tekst lub przepisuje jego fragmenty. W takich przypadkach detektory mogą wskazywać bardzo wysoki udział treści wygenerowanych przez AI, nawet jeśli zasadnicza część tekstu została stworzona przez człowieka. Autorzy korzystający z AI wypowiedzieli się na łamach magazynu „Nature”, że przydatne byłoby wyraźne rozgraniczenie między wykorzystywaniem AI do dopracowywania i/lub redagowania manuskryptów napisanych przez człowieka, co uznawali za w większości akceptowalne, a generowaniem przez AI całego tekstu od podstaw, a następnie jego edytowaniem lub „humanizowaniem”.

Dlatego tak ważne jest, aby przy wysyłaniu artykułu do publikacji ujawnić wykorzystanie AI i jasno określić, do czego ograniczała się ta współpraca — czy do tłumaczenia, redakcji tekstu, jego pisania, czy też dopracowywania i udoskonalania języka. Taka transparentność pozwala redakcjom właściwie ocenić zakres wykorzystania AI i odróżnić tekst w całości wygenerowany przez sztuczną inteligencję od pracy, w której AI pełniło jedynie funkcję narzędzia wspomagającego autora. Może to również uchronić autorów przed sytuacją, w której ich wielomiesięczna, a niekiedy wieloletnia praca zostanie zakwestionowana lub odrzucona wyłącznie z powodu niejasności dotyczących wykorzystania AI.