Nieprawdziwe informacje miały zostać przedstawione w podsumowaniu wygenerowanym przez sztuczną inteligencję. Według doniesień, system AI mógł zaczerpnąć te fałszywe treści z Reddita — platformy społecznościowej pełniącej funkcję forum dyskusyjnego, podzielonego na tzw. subreddity, czyli społeczności skupione wokół określonych tematów. Użytkownicy jednego z nich – r/poisonai, mieli celowo rozpowszechniać dezinformujące treści.
– Użytkownicy Reddita zwyczajnie trollowali AI, wiedząc, że w pewnym momencie niektóre wątki mogą zacząć przenikać do dużych modeli językowych – powiedział dr Mateusz Łabuz.
Dlaczego AI „lubi” Reddita?
Reddit to jedna z najczęściej cytowanych domen przez główne modele sztucznej inteligencji. Potwierdzają to badania platformy analitycznej Peec AI z marca 2026 r., która wyróżniła forum na pierwszym miejscu.
Z kolei według agencji marketingowej The Digital Bloom, przytaczanie Reddita w niektórych modelach AI w 2025 r. wzrosły o ok. 450 proc.
Dr Łabuz wyróżnił 3 powody, dla których Reddit może być tak chętnie wykorzystywany przez sztuczną inteligencję. Pierwszy z nich dotyczy dużej liczby autentycznych i naturalnych wypowiedzi publikowanych na forum. Jak podkreślił, to właśnie na takich wypowiedziach AI uczy się, w jaki sposób najlepiej naśladować język.
Przeczytaj także na stronie PAP: AI powieliła fałszywą informację o śmierci Trumpa; naukowiec: modele uczą się z forów internetowych
W wielu kontekstach wypowiedzi brzmią dużo bardziej naturalnie, kiedy model posługuje się językiem z forów internetowych, a nie na przykład językiem encyklopedycznym albo książkowym – zaznaczył ekspert.
Drugi powód, dla którego modele AI korzystają z Reddita to – jak powiedział dr Łabuz – liczba komentarzy i ich zróżnicowanie. Z najnowszych danych forum wynika bowiem, że z serwisu korzysta 116 mln aktywnych użytkowników dziennie. To potężna baza danych, które AI uznaje za autentyczne. Na Reddicie działają społeczności poświęcone niemal wszystkiemu: programowaniu, medycynie, historii, motoryzacji, gotowaniu, podróżom, fotografii czy naprawom domowym. Dzięki temu platforma daje dostęp do praktycznej wiedzy, której często nie znajdziemy ani w podręcznikach, ani na tradycyjnych portalach.
Natomiast trzecią przyczyną, na którą wskazuje dr Łabuz, jest obecny na platformie system głosowania. Chodzi o to, że każdy wpis może zostać opatrzony upvote’m, czyli pozytywnym głosem uznającym dany wpis za pozytywny. Odwrotny wynik przynosi natomiast downvote.
AI na tym również może bazować, jeśli chodzi o swoje oceny wartości i autentyczności poszczególnych treści – dodał specjalista.
W lutym 2024 r. Reddit porozumiał się z Google w sprawie wykorzystania treści z platformy do trenowania modeli sztucznej inteligencji. Podobną umowę serwis zawarł także z OpenAI.
Ryzyko dezinformacji
Fora internetowe, takie jak choćby Reddit, ze względu na swoją autentyczność, wydają się idealnym materiałem do nauki modeli językowych. Dr Łabuz uczula jednak, że Reddit nie jest wolny od dezinformacji.
Jak wynika z opublikowanego w czerwcu br. badania naukowców z Uniwersytetu Cornell „Deep-research agents can be poisoned via user-generated content”, firmy mogą z łatwością umieszczać treści promocyjne na platformach takich jak Reddit, Quora czy Wikipedia w celu zmanipulowania wyników sztucznej inteligencji. „Pokazujemy, że niewielki fragment – zaledwie 13 słów – tekstu pobranego ze strony internetowej UGC, takiej jak Reddit, Wikipedia, Quora, Facebook itd., może sprawić, że agenci AI będą dość konsekwentnie generować treści spamowe/oszustwa” – powiedział portalowi 404 media jeden z autorów badania Hal Triedman. Jego zdaniem, wykonanie takich działań jest bardzo proste.
Dr Łabuz zapytany o ryzyko dezinformacji po cytowaniu przez AI wpisów z forum wskazał na zjawisko „LLM grooming”. Polega ono na bombardowaniu sieci bliźniaczo podobnymi do siebie treściami dezinformującymi w celu wpływania na wyniki sztucznej inteligencji.
Ze względu na potencjał dezinformacyjny modeli językowych państwa prowadzące operacje wpływu – takie jak Rosja czy Chiny – mogą wykorzystywać je do wzmacniania swoich narracji. Jak zauważa dr Łabuz, pierwsze sygnały takiego zjawiska już się pojawiają.
– Na przełomie 2024 i 2025 r. popularne modele językowe powielały nawet w 33 proc. narracje rosyjskiej sieci dezinformacyjnej „Prawda” – mówi, powołując się na badanie portalu NewsGuard i organizacji American Sunlight Project.
Firmy wykorzystują Reddit w walce o klienta
Na jeszcze inny problem uwagę zwraca na łamach portalu sprawdzamto.pl redaktor Marcin Tyc: „Reddit stał się nowym polem walki o odpowiedzi generowane przez sztuczną inteligencję”. „Niektóre firmy publikują na platformie pozornie zwyczajne wpisy i komentarze po to, by zostały wykorzystane przez chatboty jako źródło informacji” – wskazuje dziennikarz.
Zaznaczył również, że podejmowane są konkretne działania mające na celu walkę z takimi praktykami.
„Subreddit zdecydował o ograniczeniu publikacji postów dotyczących peptydów i hormonalnej terapii zastępczej do jednego cotygodniowego wątku. Reddit poinformował 404 Media, że stale rozwija narzędzia wykrywające manipulacje i spam. Rzecznik platformy podkreślił, że serwis wykorzystuje zarówno automatyczne systemy, jak i ręczną weryfikację treści oraz udostępnia moderatorom narzędzia pomagające identyfikować podejrzane konta” – czytamy.
Rozwój modeli językowych sprawia i ich coraz sprytniejsze sposoby na naukę sprawiają, ludzie chętniej traktują odpowiedzi AI jako wiarygodne źródło informacji. Zdaniem dr. Łabuza właśnie dlatego kluczowe staje się zachowanie krytycznego podejścia i samodzielna weryfikacja otrzymywanych treści. – A myślę, że mamy taką społeczną tendencję do tego, żeby uznawać, że to, co zostało wskazane przez model, jest prawdziwe i nie do zakwestionowania – podsumowuje ekspert.