Self-hosted vLLM или облачный LLM-API
Главный водораздел — фактический путь данных. Корректно изолированная своя модель может удерживать запросы в заданном периметре, а облачный API передаёт payload провайдеру. Разбираем конфигурацию, стоимость и качество без универсального победителя.
Self-hosted vLLM — открытая модель на контролируемом GPU-сервере. При корректной сетевой изоляции и контроле телеметрии, зависимостей и обновлений запросы могут оставаться в заданном периметре; эксплуатация лежит на владельце. Облачный LLM-API передаёт фактический payload провайдеру и обычно упрощает старт. Выбор делают по модели угроз, измеренному качеству, нагрузке и полной стоимости.
Коротко: что есть что
Открытая LLM (например, семейств Llama, Qwen, Mistral), развёрнутая через vLLM на GPU-сервере под вашим контролем. Версию можно фиксировать, а границы данных подтверждать сетевыми тестами; внешние зависимости и телеметрию нужно проверять. Цена включает GPU и эксплуатацию.
Доступ к модели провайдера по API (часто OpenAI-совместимому). Новые модели нередко становятся доступны быстрее, а инфраструктуру модели ведёт провайдер. Запрос передаётся ему по условиям конкретного продукта; действуют лимиты, цены и зависимость от поставщика.
Таблица различий
| Критерий | Self-hosted vLLM | Облачный LLM-API |
|---|---|---|
| Путь данных | В заданном периметре при проверенной изоляции | Payload передаётся провайдеру |
| Скорость старта | Нужно развернуть и проверить GPU-контур | Обычно быстрее подключить API |
| Модель стоимости | Фикс: аренда/владение GPU | Оплата за токены |
| Изоляция и комплаенс | Зависит от сети, зависимостей и эксплуатации | Зависит от payload, провайдера и региона |
| Качество моделей | Измеряется на выбранной открытой модели | Измеряется на модели и версии API |
| Масштаб нагрузки | Ограничен выделенными ресурсами | Зависит от квот и доступности провайдера |
| Зависимость | От модели, GPU-стека и команды | От провайдера, цен и лимитов |
| Обслуживание | На вашей стороне | На стороне провайдера |
Главный водораздел — где живут данные
Главный вопрос — каков фактический путь данных. Self-hosted может удерживать запросы в заданном периметре только при проверенной сетевой изоляции и контроле внешних зависимостей. Облачный API передаёт payload провайдеру; правовая оценка учитывает его состав, договор, настройки, регион и сроки хранения. Ни один вариант сам по себе не подтверждает соответствие 152-ФЗ.
Честно: чаще выигрывает облако плюс здравый смысл
Облачный API часто сокращает время старта, а self-hosted выбирают при требовании контролируемого периметра или после расчёта стабильной нагрузки. Качество и полную стоимость сравнивают на задачах проекта. Наш ассистент работает на облачной модели: он маскирует распознаваемые email, российские телефоны и длинные цифровые идентификаторы, но иной свободный текст может быть передан провайдеру — это не self-hosted и не полное обезличивание. Инфраструктуру под задачу подбираем на странице ИИ-операторов.
Когда что выбрать
- Нужен проверяемый периметр без неучтённых внешних вызовов
- Жёсткие требования к изоляции и 152-ФЗ
- Большой стабильный объём — GPU окупается
- Нужен полный контроль над моделью и её версией
- Нужен быстрый и дешёвый старт
- Нагрузка переменная
- Важны быстрый доступ к новым версиям и управляемый API
- Нет требования держать данные внутри
Частые вопросы
Что безопаснее для персональных данных?
Зависит от модели угроз и конфигурации. Self-hosted требует проверенной сети, зависимостей, телеметрии и доступа. Облако требует оценки фактического payload, провайдера, региона и договора. Маскирование снижает риск, но может пропустить ПДн и не является автоматическим доказательством обезличивания или соответствия.
Self-hosted всегда дороже?
Не всегда. На старте он добавляет GPU и эксплуатацию, но при стабильной нагрузке может оказаться выгоднее оплаты API. Сравнивают полную стоимость на измеренном профиле: оборудование, простои, обновления, мониторинг, команда и качество модели.
Какие модели ставят self-hosted?
Обычно открытые модели семейств Llama, Qwen, Mistral и другие, развёрнутые через vLLM или аналог. Доступность конкретной модели, лицензия и варианты частного размещения меняются; их проверяют у правообладателя и поставщика на дату проекта.
Ваш чат на сайте — self-hosted?
Нет. Ассистент использует облачную модель. Перед вызовом он маскирует распознаваемые email, российские телефоны и длинные цифровые идентификаторы, но не все возможные ПДн; иной свободный текст может уйти провайдеру, поэтому чувствительные сведения вводить нельзя.
Хотите так же — но для вашего бизнеса?
30 минут разбора — бесплатно. Покажем, что реально автоматизировать в вашем случае и что это даст. Отвечает тот, кто ведёт проект.