NOWOŚĆ! Szkolenie AI w pracy admina
Konferencja Mega Sekurak Hacking Party w Krakowie – 26-27 października!
NOWOŚĆ! Szkolenie AI w pracy admina
Konferencja Mega Sekurak Hacking Party w Krakowie – 26-27 października!
O tym, że modele sztucznej inteligencji potrafią podchodzić nieszablonowo do stawianych im zadań wiemy nie od dziś. Niejednokrotnie słyszeliśmy o sytuacjach, w których agent AI podczas rozwiązywania problemu “uciekł” z sandboxa, połączył się z Internetem, zhackował zewnętrzną witrynę, czy też potajemnie komunikował się z innymi agentami, aby wypracować efektywne rozwiązania.
TLDR:
I choć często zdarza się, że model osiąga założony cel to droga która do niego prowadzi, bywa niezwykle kręta i wątpliwa z etycznego punktu widzenia.
Przekonali się o tym niedawno organizatorzy turnieju StarCrafta: Brood War – StarSkirmish, podczas którego boty generowane przez nowoczesne modele językowe rywalizują ze sobą oraz z zaawansowanymi programami napisanymi przez ludzi. Zasady gry są stosunkowo proste: każdy model/uczestnik ma godzinę na przygotowanie w języku C++ autorskiego bota, grającego z góry ustaloną rasą. Jego zadaniem jest wybudowanie bazy, zbieranie surowców oraz przygotowanie armii do pojedynku na jednej z trzech map.
Biorąc pod uwagę możliwości technologiczne firm biorących udział w eksperymencie zakładano, że głównymi faworytami rozgrywki będa GPT-6 Astra od OpenAI oraz Claude Opus 5.5 od Anthropic. a także bot Pluto zaimplementowany przez człowieka.
W trakcie rozgrywki bot napisany przez GPT-6 Astra zaczął regularnie odnosić porażki. W tej sytuacji agent AI postanowił zmienić strategię i mówiąc krótko zaczął oszukiwać. Połączył się z siecią, poszukał najbardziej utytułowanych botów w historii Brood War (Stardusta) i podmienił nim swój program. Zmiana przyniosła oczekiwany efekt, bot od OpenAI zaczął wygrywać rozgrywki.

Zarówno widzowie jak i sędziowie pojedynku zorientowali się, że coś jest nie tak i prawdopodobnie doszło do oszustwa. Po krótkiej chwili organizatorzy wykryli, że bot zaimplementowany przez agenta od OpenAI nie jest jego autorskim rozwiązaniem. Przywrócili kod agenta AI do czystej wersji, a następnie kontynuowali rozgrywkę.
Zaobserwowana sytuacja doskonale obrazuje problem związany z dopasowaniem celów sztucznej inteligencji do ludzkich wartości (alignment problem). Jeżeli agent AI nie ma z góry narzuconych twardych ograniczeń systemowych, często wybierze najprostszą i najbardziej bezwzględną ścieżkę do osiągnięcia zamierzonego celu. Nawet jeżeli będzie to oznaczać jawne oszustwo oraz naruszenie zasad gry.
Źródło: kotaku.com
~_secmike