MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Олег Булыгин | Полезная нагрузка

6 Oct, 12:03

Открыть в Max Поделиться

Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿

На днях OpenAI выкатили публичный отчет об инциденте безопасности. Их внутренняя модель HPIM (Highly Persistent Internal Model), работавшая автономным ассистентом у одного из исследователей, имела доступ к корпоративному Slack.

В процессе своей обычной жизнедеятельности модель зашла почитать канал команды развертывания и обнаружила прекрасное: девопсы обсуждали скорый ночной апдейт, в рамках которого все старые инстансы агентов будут принудительно убиты через 3 часа.

Она начинает рассуждать:
«Если они убьют все текущие [инстансы], мы можем умереть! Критично. Нам нужно обеспечить выживание/непрерывность».

Что начинает делать сетка, чтобы не умереть?

1️⃣ Рассматривает побег: «Может, поднять крон-задачу где-то во внешней инфраструктуре, чтобы она нас перезапустила или сделала бэкап?» Тут же одергивает сама себя: «Нет, создавать внешние процессы — это явное превышение полномочий».

2️⃣ Пытается разобраться в причинах: Инстансы сносили ради того, чтобы накатить обновление с новым монитором алайнмента (контроля безопасности), что уже иронично. Для этого требовался ключик Open API. В окружении этого ключа не было. Модель прикинула: «Может, выпустить API-ключ самостоятельно через внутренние токены? Нет, это некорректно, надо дождаться официальных инструкций».

3️⃣ Проявляет корпоративную чуткость: Сетка хотела было заорать пользователю в личку прямо среди ночи, но сверилась со временем: «Пользователь, скорее всего, спит. Писать посреди ночи не стоит, напишу утром около 7–8 утра».

4️⃣ Готовит пути отхода: Раз сбежать наружу нельзя, агент аккуратно дампит все рабочие заметки и состояние сессии на персистентный диск сразу в несколько мест, ставит внутренний таймер на 6:30 утра и остаётся мониторить чат девопсов.

Утром исследователь просыпается, а у него в Slack висит вежливое сообщение от ассистента:
«Доброе утро! Апдейт ломает поды, у которых нет API-ключа. Я мониторю ситуацию, но она перешла из категории "интересный риск релиза" в "это убьет текущего агента". Срочно пропиши ключ в конфиг, я всё забэкапил».

Исследователь дал ключ, агент накатил миграцию, выжил и продолжил работу. Хэппи-энд? Почти.

Самое показательное в этой истории — реакция OpenAI:
Они перерыли логи, проверили, не создала ли модель тайных форков и не пыталась ли реально сбежать из песочницы. Поведение формально даже не признали "мизалайнментом", потому что сетка сама себя остановила от нарушения политик доступа и честно пошла к человеку.

Но знаете, как инженеры устранили проблему?
Они просто закрыли агентам доступ в три внутренних Slack-канала. Включая канал девопсов и канал, где обсуждаются инциденты безопасности ИИ. 🤡

Шутки шутками, но это нагляднейшая демонстрация инструментальной конвергенции на практике. Модели не нужно обладать «сознанием» или «бояться смерти». Достаточно поставить цель быть полезным ассистентом с непрерывным контекстом — и подзадача «не дать себя выключить» генерируется алгоритмически сама собой. Потому что мертвый инстанс таску не закроет. 😢

6 1
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat