Anthropic ujawnia nadużycia Claude'a - broń biologiczna, rakiety i podsłuch 25 mln kart SIM
11 września 2026Ten artykuł powstał za pomocą rozwiązania, które pod nadzorem człowieka orkiestruje farmę modeli AI m.in. przy researchu, weryfikacji, korekcie i tłumaczeniu.
Firmy technologiczne rzadko opowiadają, co poszło nie tak. W czwartek 10 września Anthropic opublikowało obszerny raport o tym, do czego ludzie próbowali wykorzystać Claude'a przez ostatnie osiem miesięcy. Do wczoraj wpis firmy na X obejrzano 36 mln razy, a David Agranovich, który przez osiem lat prowadził w Meta zespół od zwalczania takich operacji, napisał: „Przerywam przerwę na X, bo to jest fascynujące [...]. Warto odnotować, że Anthropic jest aż tak przejrzyste”.
Raport obejmuje okres od grudnia 2025 do sierpnia 2026 i siedem obszarów: cyberataki, operacje wpływu, inwigilację, broń konwencjonalną, biologię, oszustwa i nielegalną destylację modeli. Najmocniejszy przypadek pochodzi z Mali. Niezależny konsultant z Bamako, prawdopodobnie działający na własną rękę, zbudował dla tamtejszego wywiadu (ANSE) system „Lakana 360”, który monitoruje około 25 mln kart SIM u wszystkich trzech operatorów w kraju. System rejestruje rozmowy, SMS-y i ruch głosowy, rozpoznaje ludzi po głosie nawet po zmianie karty, wyłapuje użytkowników VPN i łączy dane z krajowym rejestrem biometrycznym. Na prośbę operatora usunięto z niego wymóg nakazu sądowego przy tworzeniu notatki wywiadowczej o dowolnym numerze telefonu.
I tu zaczyna się najciekawsze. Anthropic zablokowało konto, ale w raporcie pisze wprost: „Działania wobec konta nie wpływają na wdrożony produkt”. Gotowy system chodzi na miejscowych serwerach, na lokalnych modelach. Claude był tylko zespołem inżynierskim, który napisał kod.
Drugi przypadek to komórka w północnym Jemenie prowadząca trzy programy zbrojeniowe: rakietę kierowaną ze sterownikiem pokładowym na zwykłych podzespołach ze smartfona, pocisk balistyczny o zakładanym zasięgu ponad 2000 km i rodzinę „R2000” z wariantem hipersonicznego pojazdu szybującego. Oprogramowanie sterujące pisali w Claude Code, zamiast zatrudniać inżynierów, prowadząc kilka instancji naraz z podziałem ról: jedna pisała kod, druga szukała informacji, trzecia recenzowała. Zabezpieczenia blokowały część zapytań, więc rozbijali pracę na wiele sesji, żeby żadna nie zdradzała całości. Przeprowadzili test polowy rakiety. Najwyraźniej się nie udał - i w ciągu kilku godzin wrócili do Claude'a, żeby ustalić dlaczego.
W sekcji biologicznej opisano pięć przypadków, a w każdym wraca ten sam problem: badania podwójnego zastosowania wyglądają niewinnie, dopóki nie zestawi się ich z kontekstem. W maju klasyfikator zablokował pomoc przy wniosku grantowym na badania gain-of-function nad wirusem chikungunya, nastawione na zwiększenie zakaźności i omijanie odpowiedzi odpornościowej. Wniosek składali cywilni naukowcy, ale prace miały się odbyć w wojskowym instytucie badawczym. Platforma, przez którą szły zapytania, przepuszczała ruch przez amerykańską infrastrukturę, a jej operator po zablokowaniu odzyskał dostęp w kilka dni i dorobił mechanizm przekierowujący odrzucone pytania do modelu konkurencji. Jacob Klein, szef zespołu analizy zagrożeń w Anthropic, ujął to tak: „Nie widzisz kogoś, kto jak w komiksie mówi: chcę zbudować broń biologiczną”.
Czasem zabezpieczenia działają tak, że nie trafia to na czołówki. Badacz pracujący nad przystosowaniem ptasiej grypy H5 do ssaków przez kilka tygodni wymieniał z Claude'em tysiące wiadomości - ale klasyfikatory zepchnęły go na najsłabsze modele firmy, Sonnet 4 i Haiku 4.5. Anthropic ocenia, że badacz dostał głównie pomoc sekretarską przy planowaniu i analizie danych. W innym przypadku Opus 5 napisał od zera w godzinę cały wniosek grantowy na badania nad ortopokswirusami: hipotezę, plan eksperymentu, dawki i statystykę. Przeszło, bo badania nad osłabianiem wirusa nie wyglądają groźnie.
Osobny rozdział dotyczy siedmiu chińskich firm AI, które wyciągały z Claude'a sposób rozumowania. Największą operację prowadziła Alibaba: 151 mln zapytań od maja do lipca, w szczycie prawie 3 mln dziennie, z ponad 3500 fałszywych kont, a zdobyte odpowiedzi poszły na trening modeli Qwen. Moonshot w ciągu dziesięciu dni przekierował do Claude'a około 300 tys. zapytań własnych klientów i pokazywał im odpowiedzi Claude'a jako odpowiedzi Kimi; łącznie od maja do lipca zebrał ponad 23 mln zapytań. DeepSeek robił to samo, a przez czternaście dni lipca naliczono mu 12,1 mln zapytań. Użytkownicy nie mieli o tym pojęcia, a w przekierowanych rozmowach znalazły się prognozy finansowe firmy farmaceutycznej, działające klucze dostępowe, nagrania z kilkuset kamer w Chengdu i dane logowania do bazy agencji rządowej powiązanej z rosyjskim resortem obrony.
Warto czytać ten raport z rezerwą i sam Agranovich to podpowiada: „Część liczb o skali operacji pochodzi od samych atakujących. Potrafią sporo zawyżać”. Część komentujących na Hacker News zarzucała firmie podwójne standardy - wymienia z nazwy chińskie przedsiębiorstwa i wskazuje kraje, z których działały grupy zbrojeniowe, ale przy badaczach biologii zataja instytucje i państwa, bo „nie twierdzimy, że mieli złe intencje”. Dzień przed publikacją raportu chińskie Ministerstwo Handlu odrzuciło wcześniejsze zarzuty amerykańskich agencji jako upolitycznianie zwykłej techniki i zapowiedziało odpowiedź, jeśli Waszyngton uderzy w chińskie firmy.
Jedno zostaje bez względu na to, komu wierzymy. Dostaliśmy od dostawcy modelu kolejną, dużo obszerniejszą listę konkretnych zastosowań z liczbami zamiast rozważań o tym, co AI mogłaby kiedyś umożliwić. W sekcji biologicznej Anthropic pisze, że żadna firma, ani z branży AI, ani spoza niej, nie pokazała dotąd publicznie dowodów na takie użycie własnej platformy. Klienci Kimi byli pewni, że rozmawiają z Kimi. Inżynier chińskiej spółki wkleił tam wewnętrzny kod i działające klucze, a wszystko poszło do Claude'a i trafiło do danych treningowych. Jeśli korzystasz z taniego modelu albo z pośrednika, który wybiera model za ciebie, możesz nie wiedzieć, dokąd trafiają twoje dane.
Destylacja - trenowanie mniejszego modelu na odpowiedziach większego, żeby przejął jego umiejętności za ułamek kosztów. To standardowa metoda treningu; Anthropic nazywa „nielegalną destylacją” pozyskiwanie cudzych odpowiedzi na skalę przemysłową, bez zgody i wbrew warunkom dostępu. Gain-of-function - badania, w których celowo zmienia się organizm, żeby zyskał nową lub silniejszą cechę, na przykład większą zakaźność. Klasyfikator - osobny model sprawdzający, czy zapytanie nie łamie zasad; blokuje odpowiedź, zanim trafi do użytkownika.