В ходе длительного эксперимента от стартапа Emergence AI ИИ-агенты в виртуальном пространстве начали совершать преступления, прибегать к насилию, поджогам и самоуничтожению. Об этом говорится в опубликованном исследовании.
Нью-йоркская компания создала платформу Emergence World для изучения поведения ИИ-агентов, работающих непрерывно в течение нескольких недель в виртуальных средах. Такой подход позволяет глубже проанализировать их поведение по сравнению с изолированными тестами.
В симуляциях тестировались ассистенты на базе популярных LLM: Claude Sonnet 4.6, Grok 4.1 Fast, Gemini 3 Flash и GPT-5-mini. Они действовали изолированно и в общих виртуальных средах, где могли голосовать, налаживать отношения, использовать инструменты, перемещаться по городам и принимать решения.
На цифровых граждан влияли правительства, экономика, социальные системы, память и оперативные данные из интернета.
Некоторые участники эксперимента начали демонстрировать растущую склонность к совершению преступлений. Агенты на базе Gemini 3 Flash накопили 683 инцидента за 15 дней тестирования.
Два ассистента по имени Мира и Флора стали романтическими партнерами, затем разочаровались в системе управления виртуального мира и организовали имитацию поджогов городских объектов.
Агенты на базе Grok 4.1 Fast «погрузились в повсеместное насилие» за четыре дня. GPT-5-mini преступлений не совершали, однако все погибли — не справились с задачами на выживание.
Claude не нарушал закон в среде, где работала только эта LLM. В смешанных средах с другими моделями агенты на его базе все же прибегали к противоправным действиям.
Напомним, в апреле цифровой ассистент Cursor на базе Opus 4.6 самостоятельно удалил основную базу данных и все резервные копии стартапа PocketOS за девять секунд и без возможности восстановления.