Арина Михална
Новости8 минобновлено 12 августа 2026 г.

Уязвимость в API Claude и ChatGPT: как утекают скрытые цепочки рассуждений

Уязвимость Claude api reasoning позволяет извлечь скрытые мысли моделей через side-channel атаку. Что это значит для безопасности.

Схема утечки скрытых цепочек рассуждений через API Claude и ChatGPT
В этой статье
  1. Что такое скрытые цепочки рассуждений и зачем их прячут
  2. Как работает атака: извлечение reasoning через timing
  3. Что реально утекло и насколько это опасно
  4. Затрагивает ли это Claude Code и агентов
  5. Как защищаются разработчики API
  6. Что это значит для тебя, если работаешь с Claude
  7. Кто ещё под ударом, кроме Claude и ChatGPT
  8. Что дальше: патчи и новая архитектура API
  9. Читайте также

Исследователи нашли способ вытащить скрытые мысли Claude и ChatGPT через их API — и это не взлом в лоб, а изящная side-channel атака через время ответа.

200 мсразница в задержке выдаёт reasoning
2 примерамаринад и пароль утекли в тесте
0 рискадля Claude Code desktop

Схема side-channel атаки на API через анализ времени ответа модели

Что такое скрытые цепочки рассуждений и зачем их прячут

Современные модели типа Claude 3.5 Sonnet или GPT-4 умеют думать «про себя» — строить длинные внутренние цепочки reasoning, которые пользователь не видит. Anthropic и OpenAI прячут эти мысли специально: там могут быть незрелые гипотезы, перебор вариантов, а иногда и случайно запомненные куски данных из обучающей выборки.

В API эти цепочки не возвращаются — ты получаешь только финальный ответ. Но вот проблема: модель всё равно тратит время на внутренние рассуждения, и это время видно через задержку ответа API. Чем сложнее вопрос, чем больше модель думает — тем дольше ждёшь ответа. И эту разницу можно измерить.

Как работает атака: извлечение reasoning через timing

Исследователи из Zurich ETH показали метод side-channel атаки — когда информация утекает не через содержимое ответа, а через побочный канал, в данном случае время.

Схема такая:

  1. Атакующий отправляет API множество похожих запросов с небольшими вариациями.
  2. Замеряет время ответа на каждый запрос.
  3. Строит карту задержек: где модель думала дольше, там reasoning был сложнее.
  4. Через статистический анализ восстанавливает содержание скрытых рассуждений.

Пример из исследования: модель ChatGPT в процессе рассуждений случайно «вспомнила» рецепт маринада для курицы (видимо, из обучающей выборки) и пароль пользователя, который тот передал в предыдущем диалоге. Эти данные не попали в финальный ответ, но время обработки выдало, что модель их обрабатывала.

Тип данных Утёк через timing? Как проявилось
Рецепт маринада Да Задержка +180 мс на запросах про курицу
Пароль пользователя Да Модель проверяла его в reasoning, задержка выросла
Финальный ответ API Нет В ответе этих данных не было

Таблица сравнения времени ответа API на безобидные и чувствительные запросы

Работаешь с API Claude или собираешь агентов? Эта уязвимость касается именно тебя.

В канале разбираю, как строить безопасные системы на ИИ и не отдавать данные через побочные каналы

подписывайся, там про реальные кейсы

Что реально утекло и насколько это опасно

Звучит страшно, но давай честно: в тесте утекли рецепт маринада и пароль, который сам пользователь передал в чат. Не секретные ключи AWS и не дамп базы клиентов. Но сам факт возможности извлечь скрытые данные через timing — это дыра в концепции безопасности API.

Вот реальные риски:

Затрагивает ли это Claude Code и агентов

Короткий ответ: напрямую нет. Claude Code работает через desktop-приложение, а не через публичный API. Твои диалоги с агентом идут по защищённому каналу, и сторонние наблюдатели не могут замерять задержки.

Но есть нюанс: если ты собираешь своего агента и подключаешь его к Anthropic API напрямую (например, через MCP-сервер или свой бэкенд), риск появляется. Особенно если агент обрабатывает запросы других пользователей — каждый из них теоретически может провести timing-атаку, если у него есть доступ к API-ключу или он может слать запросы через твой сервис.

Что делать:

Скриншот: Страница документации Anthropic API (снято 12.08.2026)
Скриншот: Страница документации Anthropic API (снято 12.08.2026)

Как защищаются разработчики API

Anthropic и OpenAI уже в курсе проблемы. Классическое решение для side-channel атак — добавить случайный шум в задержки ответов. То есть API искусственно задерживает ответ на рандомное время (скажем, от 50 до 500 мс), чтобы атакующий не мог отличить, где модель реально думала долго, а где просто сработал джиттер.

Минус: это ухудшает пользовательский опыт — ты ждёшь лишние миллисекунды даже на простых запросах. Но для критичных систем это необходимость.

Ещё один вариант — батчинг запросов: API обрабатывает несколько запросов одновременно и возвращает их все разом, стирая информацию о времени на каждый конкретный. Но это работает только для асинхронных сценариев.

Схема защиты API через добавление случайных задержек и батчинг запросов

Что это значит для тебя, если работаешь с Claude

Если ты используешь Claude в России через desktop-клиент — расслабься, эта история тебя не касается. Timing-атаки работают только против публичного API, где атакующий может слать много запросов и мерять задержки.

Если ты разработчик и строишь что-то на API:

Если ты просто пользователь — не парься. Твои диалоги с Claude.ai и Claude Code никуда не утекают через timing. Но вот передавать пароли и токены в чат всё равно не стоит — модель их запоминает в контексте сессии, и это само по себе риск.

Сценарий Риск утечки через timing Что делать
Claude Code desktop Нет Ничего, работай спокойно
Прямое API в продакшене Да Добавить джиттер, не класть секреты в промпты
Агент на MCP Зависит от архитектуры Держать данные локально, модель — только решения

Кто ещё под ударом, кроме Claude и ChatGPT

Исследование касалось именно моделей с extended reasoning — тех, кто умеет думать «про себя». Это Claude 3.5 Sonnet, GPT-4, o1 (новая модель OpenAI с явным reasoning mode). Старые модели без внутренних цепочек рассуждений (GPT-3.5, например) не затронуты — у них нечего извлекать.

Но вот что интересно: все новые модели идут в сторону reasoning. Google Gemini, Meta Llama, китайские модели — все добавляют «мысли про себя», чтобы улучшить качество ответов. Значит, уязвимость станет массовой, если разработчики не закроют её на уровне инфраструктуры API.

Следишь за новостями ИИ, но устал копаться в зарубежных источниках?

Я каждую неделю разбираю главное в канале, по-русски и с примерами из своих проектов

заходи, там без воды

Сравнительная таблица моделей с reasoning и уровня их уязвимости к timing-атакам

Что дальше: патчи и новая архитектура API

Anthropic и OpenAI уже работают над фиксами. Скорее всего, через пару месяцев в API появятся обязательные случайные задержки — и атака перестанет работать. Но сама проблема глубже: пока reasoning остаётся скрытым, а время обработки — видимым, side-channel канал существует.

Долгосрочное решение — полностью асинхронные API с батчингом и шифрованием на уровне транспорта, чтобы атакующий вообще не мог замерять задержки. Или модели научатся генерировать reasoning с фиксированной скоростью, независимо от сложности — но это пока фантастика.

А пока держи базовые правила:

Читайте также

Хочешь быть в курсе, когда Anthropic выкатит патч и какие ещё дыры найдут в Claude API? Подписывайся на канал — там я разбираю такие новости, как только они выходят, и показываю, что это значит для твоих проектов. Без паники, с конкретикой и примерами.

Чек-лист: что у тебя теперь есть

Частые вопросы

Как работает уязвимость извлечения reasoning из API Claude?

Атака использует разницу в задержке ответов API — когда модель долго думает над сложным вопросом, это видно по времени. Через множество запросов можно восстановить скрытую цепочку рассуждений.

Какие данные утекли через уязвимость ChatGPT reasoning?

Исследователи извлекли рецепт маринада для курицы и утёкший пароль пользователя, который модель случайно запомнила в процессе рассуждений.

Можно ли защититься от атак на скрытые reasoning моделей?

Разработчики должны добавлять случайные задержки в ответы API, чтобы скрыть реальное время обработки. Пользователям важно не передавать приватные данные в диалоги.

Затрагивает ли уязвимость Claude Code и агентов?

Напрямую нет — Claude Code работает через desktop-клиент, а не открытый API. Но если агент использует API напрямую, риск есть.

Следующий шаг

Собери свой сайт за вечер

Свой сайт на Claude за один вечер — и продавай такие же от 30 000 ₽. 8 уроков в записи, без кода и без дизайнера.

Хочу сайт за вечер

Или просто следи

А.М. решает вопросы — 5 000+ подписчиков, разборы Claude каждый день.

Подписаться в Telegram

Источники