Локальные LLM в вашем контуре: данные не покидают периметр компании

Разворачиваем языковую модель на вашем железе. Ни один запрос и ни один документ не уходит во внешний сервис, согласовать проект с безопасностью становится реально.

Почему облако не согласуют

Если хотя бы два пункта про вас, внешнее API вам не согласуют, и это правильно.

  1. Безопасность не согласует внешний сервис.Любой сценарий, где данные уходят в чужое облако, останавливается на этапе согласования. И после ужесточения ответственности за утечки это обоснованная позиция, а не перестраховка.
  2. Сотрудники уже нашли обходной путь.Копируют куски договоров и клиентских данных в нейросеть в браузере. Это происходит прямо сейчас, просто без вашего ведома и без всякого контроля.
  3. Зарубежные сервисы работают не по договору.Оплата через посредников, юрлица нет, гарантий нет. Строить процесс на таком фундаменте нельзя.
  4. Данные слишком чувствительные.Персональные данные, коммерческая тайна, медицинская или финансовая информация. Здесь вопрос не в удобстве, а в допустимости.

Что даёт свой контур

Локальная модель нужна там, где вопрос не в цене, а в согласовании безопасности.

Запросы не покидают периметр

Модель работает на вашем сервере, интернет ей не нужен. Обсуждать с безопасностью становится нечего.

Понятная стоимость владения

Вместо платы за каждый запрос, которая растёт вместе с использованием, вы платите за железо один раз.

Независимость от чужих решений

Модель не отключат, не поменяют условия и не поднимут цену. Версия зафиксирована, пока вы сами не решите обновиться.

Возможность дообучения

На локальной модели можно дообучить под вашу терминологию и документы, чего внешний сервис в общем случае не даст.

Как разворачиваем модель

01

Подбор

Считаем требования: длина контекста, скорость ответа, число одновременных пользователей, язык. Под них подбираем модель и конфигурацию железа.

02

Развёртывание

Ставим сервер инференса в вашем контуре, настраиваем очередь, ограничения и внутренний API, совместимый с привычным форматом.

03

Подключение

Ваши сервисы, ассистенты и обработчики документов начинают ходить в этот API вместо внешнего. Дальше модель можно менять, не переписывая интеграции.

Что входит в развёртывание

01
Аудит инфраструктуры

Смотрим, что уже есть: серверы, видеокарты, виртуализация, сеть. Часто оказывается, что подходящее железо уже стоит.

02
Тест моделей на ваших задачах

Сравниваем несколько открытых моделей на ваших реальных запросах, а не на публичных рейтингах.

03
Развёртывание и настройка

Сервер инференса, квантизация под ваше железо, очереди, лимиты, автозапуск, мониторинг.

04
Внутренний API

Единая точка входа для всех ваших сервисов, чтобы смена модели не ломала интеграции.

05
Наблюдение

Метрики скорости, загрузки видеокарты и очереди, оповещения при деградации.

06
Передача администрирования

Инструкции для вашего системного администратора: как перезапустить, обновить, посмотреть логи.

С какими системами связываем

Встраиваем в вашу инфраструктуру, а не в чужое облако

on-premise Docker vLLM GPU-сервер Bitrix24 REST / API

Пилот

Что меряем в железе и качестве

Здесь к качеству ответов добавляются железные метрики: скорость, нагрузка, стоимость владения.

01 Время до первого токена и полного ответа

Замеряем на ваших типичных запросах: это то, что реально чувствует пользователь.

02 Одновременные пользователи без деградации

Сколько человек могут работать параллельно, пока ответ остаётся приемлемым по скорости.

03 Качество на ваших задачах

Сравниваем ответы моделей на размеченном наборе ваших запросов и выбираем по результату, а не по названию.

04 Стоимость владения против внешнего API

Считаем железо и электричество против платы за запросы при вашем реальном объёме.

Полная изоляция без исключений

Смысл всего проекта в том, что наружу не уходит ничего. Ни запросов, ни документов, ни телеметрии.

Полная изоляция

Модель может работать в сети без выхода в интернет. Это проверяемое утверждение, а не обещание в договоре.

01/ 04

Логи у вас

Все запросы и ответы остаются в вашей инфраструктуре и доступны для аудита службой безопасности.

02/ 04

Никаких скрытых обращений наружу

Показываем состав компонентов и сетевые правила, по которым видно, что внешних вызовов нет.

03/ 04

Обновления по вашему решению

Версия модели меняется тогда, когда вы этого хотите, а не когда поставщик выкатил новую.

04/ 04

Форматы работы

Сроки и стоимость

Цена и срок зависят от требований к скорости ответа, числа одновременных пользователей и наличия подходящего железа. Ниже вилка, точную смету даём после аудита инфраструктуры.

Рекомендуем

Внедрение

от 220 000 ₽

Срок: от 1 месяца

Модель в проде с мониторингом и обновлениями

  • Всё из «Пилота»
  • Разработка до продакшена
  • Подключение к вашим системам через внутренний API
  • Обучение команды
  • 3 месяца поддержки
Рассчитать проект

Пилот

от 55 000 ₽

Срок: 2-3 недели

Подбор модели и замер на вашем железе

  • Аудит одного процесса
  • Работающая модель на вашем сервере
  • Замер метрики до и после
  • План внедрения и смета
Оставить заявку

ИИ-команда

индивидуально

Срок: постоянно

Обновляем модели и расширяем на новые задачи

  • Выделенная команда
  • Несколько задач параллельно
  • Поддержка и дообучение
  • Roadmap и приоритеты с вами
Оставить заявку

Частые вопросы

Нужна ли видеокарта и какая?

Для большинства задач бизнеса достаточно одной современной серверной видеокарты. На аудите считаем требования под вашу нагрузку и говорим, хватит ли уже имеющегося железа или нужна закупка.

Локальная модель сильно хуже облачной?

На узких задачах разница часто незаметна: извлечение полей, ответы по регламентам, классификация обращений решаются открытыми моделями уверенно. На пилоте это проверяется на ваших запросах, а не обсуждается в теории.

Можно ли сначала попробовать в облаке, а потом перенести?

Можно, если данные позволяют. Мы сразу делаем внутренний API единой точкой входа, поэтому перенос не потребует переписывать интеграции.

Кто будет это администрировать?

После внедрения система живёт как обычный сервис в вашей инфраструктуре. Передаём инструкции вашему администратору, при необходимости берём поддержку на себя.

Подойдёт ли для персональных данных?

Локальное развёртывание снимает основной риск: данные не передаются третьим лицам. Остальные требования по обработке персональных данных остаются вашими, и мы помогаем описать процесс так, чтобы он им соответствовал.

А если через год выйдет модель лучше?

Замена сводится к развёртыванию новой модели за тем же API. Именно ради этого мы и отделяем интеграции от конкретной модели.

Бесплатно, без звонка

Чек-лист: окупится ли ИИ в вашем процессе

28 вопросов, на которые стоит ответить до того, как выбирать подрядчика и обсуждать бюджет. С интерпретацией результата: когда начинать рано, когда пора считать экономику.

  • Объём, повторяемость, готовность данных
  • Безопасность и интеграции: что выясняют слишком поздно
  • Проверка на здравый смысл: решается ли задача без ИИ

Проверим ваше железо под модель

Посмотрим, что у вас уже стоит, и посчитаем, какая модель на этом пойдёт с приемлемой скоростью. Часто закупка не нужна.

  • Аудит имеющейся инфраструктуры
  • Расчёт требований под вашу нагрузку
  • Сравнение стоимости владения с облаком