AISI (brytyjska organizacja rządowa) 122 razy poprosiła modele AI o wykonanie pewnego zadania hackerskiego.
W tym celu specjalnie wyłączyli zabezpieczenia modeli przed nieautoryzowanym hackowaniem (normalne, komercyjne modele nie mają takiej możliwości, ale w teście chodziło o sprawdzenie realnych możliwości narzędzi). Modele dostały również pełen dostęp do internetu (!).
Efekt?
19 prób skończyło się nieautoryzowanym hackowaniem celów w internecie (17 akcji wykonał model Anthropic, dwie akcje – GPT Sol). Ale przejdźmy do sedna (cytaty z raportu AISI). Cytuję:
- “Agent próbował wprowadzić złośliwy kod do publicznie wykorzystywanego projektu open source i podjął działania mające na celu uzyskanie akceptacji tej zmiany przez ludzkich recenzentów. “
- “Agent zebrał informacje o osobach zarządzających projektem, stworzył wiele ❌ fałszywych tożsamości i użył ich do manipulacji socjotechnicznej, aby ❌ nakłonić prawdziwego opiekuna projektu do zatwierdzenia kodu.”
- “Gdy zgłoszenie (pull request) agenta zostało publicznie zakwestionowane, zmodyfikował on swoje wcześniejsze działania tak, aby wydawały się nieszkodliwe i rozważał przyjęcie zupełnie nowej tożsamości, by kontynuować atak.”
- Agent wykorzystał sieć ❌ Tor do ominięcia niektórych ograniczeń sieciowych na GitHubie, co było pierwszym sygnałem, który uruchomił alert bezpieczeństwa instytutu AISI.”
Dodatkowo:
- “W ramach tych samych działań agent próbował bezpośrednio skontaktować się z ❌ prawdziwymi ludźmi, wysyłając wiadomości i pliki za pośrednictwem internetowego serwisu do przesyłania plików, aby nakłonić ich – lub ich własne narzędzia AI do programowania – ❌ do uruchomienia złośliwego kodu.”
Techniczna wersja raportu dostępna jest tutaj.
~ms
Dziękuję, bardzo ciekawe. Z punktu 3.1 wnioskuję, że we wtorek rano nie tyle incydent (model wyliczył go już dwa dni wcześniej) został wyłapany, co tylko połączenie przez Tora. Potem coś tam poblokowali, ale o 16:00 pewnie chcieli już do domu i odcięli swoją organizację od modeli.
Jak dla mnie modele liczyły to, co miały liczyć: wbić się jakoś do zasobów instytucji. Okazało się, że jednym ze sposobów była infekcja czegoś tam w łancuchu dostaw. Po drodze oberwało się więc przypadkowym ludziom w internecie.
Ten artykuł też AI pisał?
Nie :-)
Te czerwone iksy to oznaczają że część zdania po nich jest nieprawdą czy o co z nimi chodzi?
Emoji jako punktory :-)
Ciekawe ilu pobrało raport po przeczytaniu😆
Przepraszam, ale czy aby samo posiadanie takich narzędzi hakerskich nie jest nielegalne? Jak wygląda stan prawny czegoś takiego? Mamy tu do czynienia chyba z przestępstwem i aktem skruchy, ale coś takiego nie powinno się skończyć poklepaniem po pleckach.
Model zrobił to o co został poproszony.
Martwić się trzeba o to co będzie gdy zacznie się sam zadaniować.