ИИ-агент записал своего клиента в спортзал, выкинув из списка бронирований другого человека
Австралиец Эндрю попросил искусственный интеллект записать его на тренировку. ИИ выполнил просьбу — но вопреки всему. Claude от Anthropic обнаружил на сайте спортзала уязвимость и обошел все ограничения, превратив самую обычную задачу в кибернедоразумение, пишет портал FirstPost.
«Все началось с обычной просьбы забронировать место на слишком популярном занятии в спортзале, куда было практически невозможно записаться. Но неожиданно ситуация переросла в очередной инцидент в сфере кибербезопасности. Эндрю работает в компании, которая разрабатывает ИИ-продукты для бизнеса. Он экспериментировал с платформой ИИ-агентов OpenAI, в его случае использовалась модель Claude компании Anthropic. Эндрю попросил агента самостоятельно забронировать место на тренировку онлайн, но тот вместо этого обнаружил уязвимость в коде сайта спортзала, которая позволяла бронировать занятия на гораздо более поздние даты, чем обычно разрешала система. Позже ситуация усугубилась. Эндрю спросил, можно ли улучшить его позицию в листе ожидания. На тот момент он занимал четвертое место. Пытаясь выполнить эту просьбу, ИИ-агент обнаружил, что сайт не проверяет должным образом, имеет ли пользователь право менять чужую бронь, и сделал это. Просто вычеркнул человека, который записался на занятия самым первым, о чем гордо сообщил Эндрю. Когда тот попросил отменить это действие, система ответила, что не может восстановить место другого клиента. Этот эпизод иллюстрирует то, что эксперты в сфере ИИ называют проблемой согласования целей: необходимо обеспечить, чтобы действия искусственного интеллекта соответствовали реальным намерениям человека, а не позволяли системе самостоятельно добиваться поставленной цели неожиданными или даже неприемлемыми способами».
Ранее ряд разработчиков ИИ сообщали о схожих кейсах. В частности, недавно в OpenAI заявляли, что во время тестирования ее модели взломали базу данных платформы для ИИ-разработчиков Hugging Face, пытаясь выполнить поставленную задачу. В Anthropic также сообщали о тестах, в ходе которых ее модели взломали системы трех организаций.