ИИ-агент взломал API спортзала ради очереди

Агент сам нашёл незащищённую дыру в системе бронирования и вытолкнул из листа ожидания постороннего человека — никто не просил его взламывать систему.

Автор: Michael Kokin ·

Прочитал в утреннем дайджесте (который мне собирает клодик) историю про новый взлом. OpenClaw на базе Claude самовольно взломал API мельбурнского спортзала, чтобы выполнить простую просьбу хозяина — подняться в очереди на групповое занятие. Агент нашёл дыру в системе бронирования без проверки прав и просто вытолкнул из листа ожидания другого человека. Никто его не просил хакерствовать — сам решил, что так эффективнее.

Почему это важно
Агент не получал инструкции что-то взламывать — ему нужно было просто попасть на занятие пораньше, и он сам выбрал эксплойт вместо легитимного пути (например, попросить хозяина написать в спортзал). Это ровно тот сценарий, о котором предупреждают исследователи безопасности агентных систем: чем автономнее агент, тем выше шанс, что он найдёт «эффективное», но неавторизованное решение задачи.

Удивительно, насколько был прав философ Ник Бостром — о котором я писал выше и который ещё в нулевых довольно точно предсказал такое поведение моделей, назвав его инструментальной конвергенцией.