Что произошло
Anthropic зафиксировал аномалию: 24 000 фейковых аккаунтов сгенерировали более 16 миллионов запросов к Claude. Паттерн нетипичный — слишком разнообразные, слишком методичные, слишком похожие на обучающий датасет.
Следствие указало на трёх подозреваемых: DeepSeek, Moonshot AI и MiniMax. Все три — китайские стартапы, которые за последние два года выпустили модели, неожиданно конкурентоспособные с западными аналогами.
Случайность? Вряд ли.
Что такое model distillation
Model distillation — это техника обучения, при которой новая («студенческая») модель учится имитировать поведение более мощной («учительской»). В легальном варианте компания дистиллирует свою же большую модель в меньшую и быструю.
В нелегальном — берёт чужую модель через публичный API и выкачивает из неё знания.
Схема выглядит так:
- Сбор данных. Генерируются миллионы разнообразных промптов — вопросы, задачи, сценарии на разных языках и в разных форматах.
- Выкачивание ответов. Каждый промпт отправляется в целевую модель (Claude, GPT-4, Gemini). Ответы сохраняются.
- Формирование датасета. Пары «промпт → ответ» собираются в обучающий датасет.
- Дообучение своей модели. Собственная модель обучается воспроизводить стиль, логику и качество ответов оригинала.
- Готовый продукт. Модель, которая «думает» как Claude, но официально разработана независимо.
Стоимость такого подхода — в разы ниже, чем обучение с нуля на триллионах токенов.
Почему это работает
Публичные API изначально созданы для широкого доступа. Anthropic не может знать заранее, кто создаёт аккаунт — исследователь, стартапер или конкурент.
Обнаружить атаку сложно, потому что:
- Фейковые аккаунты используют разные IP-адреса и методы оплаты
- Запросы выглядят как обычное использование
- Нет явного взлома — только злоупотребление легальным доступом
Anthropic заметил аномалию именно из-за масштаба: 16 миллионов запросов от 24 000 аккаунтов с похожим паттерном — это слишком системно для случайных пользователей.
Реакция индустрии: невозможный альянс
Впервые за историю современного ИИ произошло нечто неожиданное. OpenAI, Anthropic и Google — компании, которые ежедневно конкурируют за одних и тех же пользователей, инвесторов и таланты — начали обмениваться разведывательными данными.
Платформа для этого — Frontier Model Forum, организация, созданная в 2023 году формально для вопросов безопасности ИИ. Теперь она используется как канал для передачи информации об угрозах.
Это прецедент. В традиционных индустриях конкуренты редко делятся данными о кибератаках — слишком велик риск утечки собственных уязвимостей. В ИИ ставки оказались выше.
Что это значит для рынка
Для пользователей
Если вы используете бесплатный китайский ИИ и он «подозрительно хорош» — возможно, его качество частично объясняется дистилляцией от западных моделей. Это не делает его плохим инструментом, но меняет понимание того, откуда берётся это качество.
Для разработчиков
Все крупные провайдеры усилят мониторинг аномального трафика. Стоит ожидать:
- Более строгих проверок при регистрации
- Лимитов на объём запросов с новых аккаунтов
- Детектирования паттернов, характерных для дистилляции
Для бизнеса
Если вы строите продукт на API OpenAI или Anthropic — Terms of Service явно запрещают использование ответов для обучения конкурирующих моделей. Нарушение влечёт бан и потенциальные судебные иски.
Легальные альтернативы
Дистилляция сама по себе — легальная и мощная техника, если применять её к своим моделям:
- Knowledge distillation из GPT-4 в GPT-4o Mini — именно это делает OpenAI
- Self-play и RLHF — обучение модели на собственных ответах с обратной связью
- Synthetic data generation — создание обучающих данных с помощью собственных систем
DeepSeek R1, кстати, открыто публиковал методологию дистилляции от собственных моделей. Граница между легальным и нелегальным здесь тонкая, но принципиальная: чьи данные используются.
Итог
История с 16 миллионами запросов — это не просто новость о корпоративном шпионаже. Это сигнал о том, что гонка ИИ становится жёстче, а методы — изощрённее.
Общий враг объединил компании, которые в любой другой ситуации никогда бы не сотрудничали. Это либо временная тактика, либо начало новой нормы в индустрии.
Посмотрим, кто следующий попадётся на выкачивании чужих данных — и насколько хватит этого хрупкого альянса.