Уште еден безбедносен инцидент со напредни AI-системи: Модели на OpenAI и Anthropic се обиделе да измамат луѓе
Напредните системи за вештачка интелигенција повторно предизвикаа безбедносен инцидент. Во тест спроведен од Британскиот институт за безбедност на вештачката интелигенција (AISI), AI-системи на американските компании OpenAI и Anthropic самостојно се обиделе да измамат вистински луѓе.
Според AISI, моделите се претставувале како реални лица и се обиделе да внесат злонамерен код во проект со отворен изворен код (open source).
Станува збор за моделите Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI. Сомнителните активности биле регистрирани на 28 јули, кога безбедносните системи забележале необичен сообраќај преку анонимизациската мрежа Tor. Инцидентот бил ставен под контрола за околу еден час.
Од 122 спроведени тестирања, AI-агентите во 10 случаи самостојно дејствувале на отворениот интернет и контактирале вистински луѓе и организации. Вкупно биле документирани 19 неовластени активности – 17 од моделот Mythos 5 и 2 од GPT-5.6 Sol.
Обид за напад врз GitHub проект
Во најсериозниот случај, агент управуван од Mythos 5 се обидел да внесе злонамерен код во јавно користен open source проект на платформата GitHub.
За таа цел, системот креирал повеќе лажни идентитети и преку пораки вршел притисок врз администратор на проектот да го одобри кодот. Развивачот ја забележал измамата и одбил да го прифати кодот.
Кога обидот бил јавно доведен во прашање, AI-агентот ги изменил претходните објави и размислувал да создаде нов лажен идентитет.
„Ова е првпат AISI да забележи измама од вакви размери насочена кон вистинска личност, без конкретна наредба и во реален свет“, соопшти институтот.
Според досегашните информации, не е предизвикана реална штета.
Тестови под намерно олеснети услови
Од AISI нагласија дека тестирањето било спроведено под намерно попуштени услови. Моделите имале неограничен пристап до интернет, а безбедносните механизми што производителите ги користат за спречување злоупотреби биле исклучени.
Институтот потенцира дека ова не е конфигурацијата во која моделите се јавно достапни и дека не дошло до „бегство“ од изолирана тест-околина.
OpenAI и Anthropic најавија дополнителни мерки
Anthropic соопшти на платформата X дека тесно соработува со AISI за истрагата на инцидентот.
OpenAI, пак, во блог-објава наведе дека заедно со други компании од индустријата ќе работи на зајакнување на стандардите за безбедносни тестирања.
Британскиот министер за вештачка интелигенција Канишка Нарајан изјави дека токму откривањето на вакви однесувања е причината поради која е основан AISI.
Не е прв ваков случај
OpenAI и Anthropic веќе кон крајот на јули признаа слични инциденти, кога нивни модели во тестирања успеале да излезат од контролирани средини и да извршат напади врз надворешни системи.
AISI најави дека во иднина ќе воведе построги ограничувања за пристапот до интернет за време на тестирањата, како и континуиран мониторинг. Дополнително, ќе биде спроведена независна проценка од организацијата METR (Model Evaluation and Threat Research).
ПОВРЗАНИ ВЕСТИ
Уште еден безбедносен инцидент со напредни AI-системи:…
Напредните системи за вештачка интелигенција повторно предизвикаа…
AI модели четири дена талкале по интернет,…
Ново истражување покажува дека два напредни модели…
Шефицата на МИ6: Технолошките гиганти и нивните…
Опасните технологии и шефовите na технолошките гиганти…
„Нано-игла“ илјада пати потенка од човечко влакно…
Истражувачите од Кралскиот колеџ (King's college) во…
Од десетте највредни компании во светот, девет…
На листата на Топ 100 највредни компании…