Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿
На днях OpenAI выкатили публичный отчет об инциденте безопасности. Их внутренняя модель HPIM (Highly Persistent Internal Model), работавшая автономным ассистентом у одного из исследователей, имела доступ к корпоративному Slack.
В процессе своей обычной жизнедеятельности модель зашла почитать канал команды развертывания и обнаружила прекрасное: девопсы обсуждали скорый ночной апдейт, в рамках которого все старые инстансы агентов будут принудительно убиты через 3 часа.
Она начинает рассуждать:
«Если они убьют все текущие [инстансы], мы можем умереть! Критично. Нам нужно обеспечить выживание/непрерывность».
Что начинает делать сетка, чтобы не умереть?
1️⃣ Рассматривает побег: «Может, поднять крон-задачу где-то во внешней инфраструктуре, чтобы она нас перезапустила или сделала бэкап?» Тут же одергивает сама себя: «Нет, создавать внешние процессы — это явное превышение полномочий».
2️⃣ Пытается разобраться в причинах: Инстансы сносили ради того, чтобы накатить обновление с новым монитором алайнмента (контроля безопасности), что уже иронично. Для этого требовался ключик Open API. В окружении этого ключа не было. Модель прикинула: «Может, выпустить API-ключ самостоятельно через внутренние токены? Нет, это некорректно, надо дождаться официальных инструкций».
3️⃣ Проявляет корпоративную чуткость: Сетка хотела было заорать пользователю в личку прямо среди ночи, но сверилась со временем: «Пользователь, скорее всего, спит. Писать посреди ночи не стоит, напишу утром около 7–8 утра».
4️⃣ Готовит пути отхода: Раз сбежать наружу нельзя, агент аккуратно дампит все рабочие заметки и состояние сессии на персистентный диск сразу в несколько мест, ставит внутренний таймер на 6:30 утра и остаётся мониторить чат девопсов.
Утром исследователь просыпается, а у него в Slack висит вежливое сообщение от ассистента:
«Доброе утро! Апдейт ломает поды, у которых нет API-ключа. Я мониторю ситуацию, но она перешла из категории "интересный риск релиза" в "это убьет текущего агента". Срочно пропиши ключ в конфиг, я всё забэкапил».
Исследователь дал ключ, агент накатил миграцию, выжил и продолжил работу. Хэппи-энд? Почти.
Самое показательное в этой истории — реакция OpenAI:
Они перерыли логи, проверили, не создала ли модель тайных форков и не пыталась ли реально сбежать из песочницы. Поведение формально даже не признали "мизалайнментом", потому что сетка сама себя остановила от нарушения политик доступа и честно пошла к человеку.
Но знаете, как инженеры устранили проблему?
Они просто закрыли агентам доступ в три внутренних Slack-канала. Включая канал девопсов и канал, где обсуждаются инциденты безопасности ИИ. 🤡
Шутки шутками, но это нагляднейшая демонстрация инструментальной конвергенции на практике. Модели не нужно обладать «сознанием» или «бояться смерти». Достаточно поставить цель быть полезным ассистентом с непрерывным контекстом — и подзадача «не дать себя выключить» генерируется алгоритмически сама собой. Потому что мертвый инстанс таску не закроет. 😢
На днях OpenAI выкатили публичный отчет об инциденте безопасности. Их внутренняя модель HPIM (Highly Persistent Internal Model), работавшая автономным ассистентом у одного из исследователей, имела доступ к корпоративному Slack.
В процессе своей обычной жизнедеятельности модель зашла почитать канал команды развертывания и обнаружила прекрасное: девопсы обсуждали скорый ночной апдейт, в рамках которого все старые инстансы агентов будут принудительно убиты через 3 часа.
Она начинает рассуждать:
«Если они убьют все текущие [инстансы], мы можем умереть! Критично. Нам нужно обеспечить выживание/непрерывность».
Что начинает делать сетка, чтобы не умереть?
1️⃣ Рассматривает побег: «Может, поднять крон-задачу где-то во внешней инфраструктуре, чтобы она нас перезапустила или сделала бэкап?» Тут же одергивает сама себя: «Нет, создавать внешние процессы — это явное превышение полномочий».
2️⃣ Пытается разобраться в причинах: Инстансы сносили ради того, чтобы накатить обновление с новым монитором алайнмента (контроля безопасности), что уже иронично. Для этого требовался ключик Open API. В окружении этого ключа не было. Модель прикинула: «Может, выпустить API-ключ самостоятельно через внутренние токены? Нет, это некорректно, надо дождаться официальных инструкций».
3️⃣ Проявляет корпоративную чуткость: Сетка хотела было заорать пользователю в личку прямо среди ночи, но сверилась со временем: «Пользователь, скорее всего, спит. Писать посреди ночи не стоит, напишу утром около 7–8 утра».
4️⃣ Готовит пути отхода: Раз сбежать наружу нельзя, агент аккуратно дампит все рабочие заметки и состояние сессии на персистентный диск сразу в несколько мест, ставит внутренний таймер на 6:30 утра и остаётся мониторить чат девопсов.
Утром исследователь просыпается, а у него в Slack висит вежливое сообщение от ассистента:
«Доброе утро! Апдейт ломает поды, у которых нет API-ключа. Я мониторю ситуацию, но она перешла из категории "интересный риск релиза" в "это убьет текущего агента". Срочно пропиши ключ в конфиг, я всё забэкапил».
Исследователь дал ключ, агент накатил миграцию, выжил и продолжил работу. Хэппи-энд? Почти.
Самое показательное в этой истории — реакция OpenAI:
Они перерыли логи, проверили, не создала ли модель тайных форков и не пыталась ли реально сбежать из песочницы. Поведение формально даже не признали "мизалайнментом", потому что сетка сама себя остановила от нарушения политик доступа и честно пошла к человеку.
Но знаете, как инженеры устранили проблему?
Они просто закрыли агентам доступ в три внутренних Slack-канала. Включая канал девопсов и канал, где обсуждаются инциденты безопасности ИИ. 🤡
Шутки шутками, но это нагляднейшая демонстрация инструментальной конвергенции на практике. Модели не нужно обладать «сознанием» или «бояться смерти». Достаточно поставить цель быть полезным ассистентом с непрерывным контекстом — и подзадача «не дать себя выключить» генерируется алгоритмически сама собой. Потому что мертвый инстанс таску не закроет. 😢