GPT-5.6: что изменится для бизнеса после анонса OpenAI
OpenAI анонсировала семейство GPT-5.6 — три модели с разным соотношением цены и мощности, принципиально новым режимом работы через субагентов и заявленной скоростью генерации 750 токенов в секунду. Разбираем, что это означает для компаний, которые уже работают с OpenAI API или планируют строить продукты на базе LLM.
Три модели: выбирайте под задачу
GPT-5.6 — не одна модель, а семейство:
- Terra — средняя модель, сопоставимая по качеству с GPT-5.5, но примерно вдвое дешевле. Для генерации контента, RAG-систем, классификации и автоматизированных ответов — выбор по умолчанию.
- Sol — флагман. Новый режим max (+15) для задач, где нужна максимальная точность рассуждений. Режим ultra — работа через субагентов, которые выполняют подзадачи параллельно и специализированно.
- Лёгкая модель — для высокочастотных, стоимостно чувствительных сценариев.
Почему 750 токенов в секунду — это не просто «быстрее»
Sol будет работать на чипах Cerebras с целевой скоростью 750 т/с — против нынешних 100–150 т/с. Для бизнеса это означает три вещи.
Первое — агентные воркфлоу, которые сейчас занимают минуты, будут выполняться за секунды. Это напрямую влияет на UX продуктов.
Второе — интерактивные LLM-приложения становятся практически синхронными. Чат-боты, голосовые агенты, ассистенты в реальном времени — всё это теперь технически реализуемо без задержек.
Третье — экономика агентных цепочек улучшается пропорционально: при биллинге по токенам более высокая скорость снижает стоимость длинных воркфлоу в расчёте на единицу времени.
Пока Cerebras-инфраструктура доступна только партнёрам — широкий запуск после наращивания мощностей.
Что изменилось в ценах: пересчитайте кэш
Конкретное изменение, которое нужно учесть в unit-экономике:
- Кэширование (запись) подорожало на 25% — OpenAI выровняла цены с Anthropic.
- Кэширование (чтение) — скидка 90% сохранена.
Если ваш продукт использует тяжёлые системные промпты, RAG с частыми обновлениями или длинный контекст диалога — изменение заметно скажется на счёте. Проверьте долю кэш-записи в общем объёме токенов за последний месяц.
Режим ultra: мультиагентность из коробки
Rежим ultra у Sol — это не просто расширенное рассуждение. Модель может порождать субагентов для параллельного выполнения подзадач, выходя за ограничения одного агентного цикла.
Практически это означает, что задачи уровня «проанализируй массив документов и сделай сводку» или «найди уязвимости в коде и предложи патчи» теперь решаются нативно, без самописной оркестрации. Это прямое следствие для команд, которые сейчас строят агентные продукты на n8n, LangGraph или собственных фреймворках.
Итог
GPT-5.6 — эволюционный релиз с несколькими точечными, но важными изменениями. Для большинства бизнесов главные действия простые: перейти на Terra для массовых задач (вдвое дешевле), пересчитать стоимость кэш-записи и следить за доступностью Sol ultra. Для тех, кто строит сложные агентные продукты — режим ultra и Cerebras-скорость меняют то, что вообще становится возможным.