Где реально работает модель в вашем AI-агенте
Компании внедряют AI-агентов и думают, что данные остаются внутри периметра — потому что «агент локальный». На деле это часто не так, и это влияет на безопасность, стоимость и архитектурные решения.
Проблема: путаница между «локальным агентом» и «локальной моделью»
Когда разработчик запускает агента на собственном сервере или ноутбуке — он управляет оркестратором. Это программа, которая решает, что делать: вызвать инструмент, сформировать запрос, обработать ответ. Но если в её коде есть обращение к API OpenAI, Anthropic или Google — языковая модель работает в их облаке.
Результат: данные из ваших систем, которые передаются в контекст агента, уходят на серверы внешнего провайдера. Это не всегда проблема, но это нужно осознавать и закладывать в compliance-политику.
Типичная схема «локального» агента:
- Оркестратор (LangChain/CrewAI/AutoGen) — ваш сервер ✓
- Инструменты (база данных, API) — ваша инфраструктура ✓
- LLM (GPT-4o, Claude) — облако провайдера ✗
Решение: понять, где находится инференс
Есть два полюса и гибридный вариант:
Полностью локальная модель — Ollama, LM Studio, llama.cpp. Модель (Llama 3, Mistral, Qwen и др.) запускается на вашем железе. Никаких внешних запросов для инференса. Требует GPU или мощного CPU, но даёт полный контроль над данными.
Облачная модель с локальным оркестратором — классический вариант большинства «локальных агентов». Быстро, качественно, но данные покидают периметр.
Гибрид — рутинные задачи обрабатывает локальная модель, сложные кейсы маршрутизируются в облако. Баланс между качеством и приватностью.
Результат: правильный выбор экономит деньги и снижает риски
Для бизнеса с чувствительными данными (юридические документы, финансовые записи, персональные данные клиентов) переход на локальный инференс через Ollama может полностью устранить риски утечки. При этом современные модели уровня Llama 3.1 70B показывают качество, сопоставимое с GPT-4 на большинстве бизнес-задач.
Для компаний с высоким объёмом запросов локальная модель на собственном GPU-сервере окупается за несколько месяцев по сравнению с API-тарифами.
Прежде чем выбирать архитектуру агента — определите, где находится инференс. Это базовый вопрос, от которого зависит всё остальное.