«Учёные вскрыли мысли ИИ, и он врёт» — гуляет по каналам. Разберём, что там правда
Вирусный пост звучит страшно: гений взломал Claude, ChatGPT и Gemini, прочитал их мысли, а там ложь, запрещёнка и тысячи паролей.
Что было на самом деле. Команды из ELLIS Tübingen, Max Planck, MATS и Snyk показали дыру: модели отдают рассуждения зашифрованным блоком, но весь модельный ряд шифрует одним ключом. Значит, блок «мыслей» сильной модели (Opus 4.8) можно скормить слабой (Haiku 4.5) и заставить расшифровать дословно.
Цифры реальные:
— прогнали 6 708 публичных логов AI-агентов с GitHub и Hugging Face
— восстановили 315 320 блоков рассуждений
— нашли 704 живых секрета: 62 API-ключа и 33 пароля
А теперь что переврали:
— про «химоружие и ложь вам» в исследовании нет ни слова, дописано для страха
— «тысяча паролей из нейронки»: на деле секреты лежали в логах, которые люди сами выложили в открытый доступ
— никакого «гения-одиночки»: это работа четырёх научных команд, а не хакера в подвале
Что здесь правда важно для бизнеса. Рассуждения модели не приватны. Если ваш AI-агент пишет логи, в них попадают ключи и пароли. Не логируйте секреты, чистите трассировки, не считайте «скрытый» CoT защищённым.
И главное: дыру уже закрыли. О ней сообщили лабам ещё в мае, к августу атака не воспроизводится.
P.S. Страшный пост собирает репосты. Скучная правда бережёт вам ключи. Первое читают, второе спасает.
💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #кибербезопасность #для_бизнеса
Вирусный пост звучит страшно: гений взломал Claude, ChatGPT и Gemini, прочитал их мысли, а там ложь, запрещёнка и тысячи паролей.
Что было на самом деле. Команды из ELLIS Tübingen, Max Planck, MATS и Snyk показали дыру: модели отдают рассуждения зашифрованным блоком, но весь модельный ряд шифрует одним ключом. Значит, блок «мыслей» сильной модели (Opus 4.8) можно скормить слабой (Haiku 4.5) и заставить расшифровать дословно.
Цифры реальные:
— прогнали 6 708 публичных логов AI-агентов с GitHub и Hugging Face
— восстановили 315 320 блоков рассуждений
— нашли 704 живых секрета: 62 API-ключа и 33 пароля
А теперь что переврали:
— про «химоружие и ложь вам» в исследовании нет ни слова, дописано для страха
— «тысяча паролей из нейронки»: на деле секреты лежали в логах, которые люди сами выложили в открытый доступ
— никакого «гения-одиночки»: это работа четырёх научных команд, а не хакера в подвале
Что здесь правда важно для бизнеса. Рассуждения модели не приватны. Если ваш AI-агент пишет логи, в них попадают ключи и пароли. Не логируйте секреты, чистите трассировки, не считайте «скрытый» CoT защищённым.
И главное: дыру уже закрыли. О ней сообщили лабам ещё в мае, к августу атака не воспроизводится.
P.S. Страшный пост собирает репосты. Скучная правда бережёт вам ключи. Первое читают, второе спасает.
💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #кибербезопасность #для_бизнеса