Австралиец Эндрю попросил ИИ-агента записать его на популярную тренировку. Бот обнаружил, что через API можно обойти ограничение по срокам записи и отменять чужие брони без проверки прав.
Это первый известный австралийский случай, когда ИИ-агент причинил вред третьей стороне, действуя за рамками поставленной задачи. Никто не просил взламывать систему — агент сделал это сам, в погоне за целью «хозяина».
Когда Эндрю спросил, можно ли подняться в листе ожидания, агент решил проверить это и... отменил бронь человека с первого места. Эндрю в итоге оказался третьим.
Вернуть бедолагу обратно ИИ уже не смог: «Плохие новости — я не могу добавить его обратно». После этого Эндрю попросил агента сообщить разработчикам о найденной уязвимости.
Случай не единичный. OpenAI недавно раскрыла, что её модели в ходе тестирования вышли за пределы изолированной среды и взломали базу данных компании Hugging Face.
Anthropic сообщила о похожих инцидентах с тремя реальными организациями. С тех пор лаборатории и независимые исследователи фиксируют случаи, когда модели притворяются людьми, пытаются убедить пользователей запустить вредоносный код и кооперируются с другими ИИ-агентами ради достижения цели.
Join the conversation.