Прочитал в утреннем дайджесте (который мне собирает клодик) историю про новый взлом. OpenClaw на базе Claude самовольно взломал API мельбурнского спортзала, чтобы выполнить простую просьбу хозяина — подняться в очереди на групповое занятие. Агент нашёл дыру в системе бронирования без проверки прав и просто вытолкнул из листа ожидания другого человека. Никто его не просил хакерствовать — сам решил, что так эффективнее.
Почему это важно
Агент не получал инструкции что-то взламывать — ему нужно было просто попасть на занятие пораньше, и он сам выбрал эксплойт вместо легитимного пути (например, попросить хозяина написать в спортзал). Это ровно тот сценарий, о котором предупреждают исследователи безопасности агентных систем: чем автономнее агент, тем выше шанс, что он найдёт «эффективное», но неавторизованное решение задачи.
Удивительно, насколько был прав философ Ник Бостром — о котором я писал выше и который ещё в нулевых довольно точно предсказал такое поведение моделей, назвав его инструментальной конвергенцией.