Запросы не покидают периметр
Модель работает на вашем сервере, интернет ей не нужен. Обсуждать с безопасностью становится нечего.
Разворачиваем языковую модель на вашем железе. Ни один запрос и ни один документ не уходит во внешний сервис, согласовать проект с безопасностью становится реально.
Если хотя бы два пункта про вас, внешнее API вам не согласуют, и это правильно.
Локальная модель нужна там, где вопрос не в цене, а в согласовании безопасности.
Модель работает на вашем сервере, интернет ей не нужен. Обсуждать с безопасностью становится нечего.
Вместо платы за каждый запрос, которая растёт вместе с использованием, вы платите за железо один раз.
Модель не отключат, не поменяют условия и не поднимут цену. Версия зафиксирована, пока вы сами не решите обновиться.
На локальной модели можно дообучить под вашу терминологию и документы, чего внешний сервис в общем случае не даст.
Считаем требования: длина контекста, скорость ответа, число одновременных пользователей, язык. Под них подбираем модель и конфигурацию железа.
Ставим сервер инференса в вашем контуре, настраиваем очередь, ограничения и внутренний API, совместимый с привычным форматом.
Ваши сервисы, ассистенты и обработчики документов начинают ходить в этот API вместо внешнего. Дальше модель можно менять, не переписывая интеграции.
Смотрим, что уже есть: серверы, видеокарты, виртуализация, сеть. Часто оказывается, что подходящее железо уже стоит.
Сравниваем несколько открытых моделей на ваших реальных запросах, а не на публичных рейтингах.
Сервер инференса, квантизация под ваше железо, очереди, лимиты, автозапуск, мониторинг.
Единая точка входа для всех ваших сервисов, чтобы смена модели не ломала интеграции.
Метрики скорости, загрузки видеокарты и очереди, оповещения при деградации.
Инструкции для вашего системного администратора: как перезапустить, обновить, посмотреть логи.
Встраиваем в вашу инфраструктуру, а не в чужое облако
Пилот
Здесь к качеству ответов добавляются железные метрики: скорость, нагрузка, стоимость владения.
Замеряем на ваших типичных запросах: это то, что реально чувствует пользователь.
Сколько человек могут работать параллельно, пока ответ остаётся приемлемым по скорости.
Сравниваем ответы моделей на размеченном наборе ваших запросов и выбираем по результату, а не по названию.
Считаем железо и электричество против платы за запросы при вашем реальном объёме.
Смысл всего проекта в том, что наружу не уходит ничего. Ни запросов, ни документов, ни телеметрии.
Модель может работать в сети без выхода в интернет. Это проверяемое утверждение, а не обещание в договоре.
01/ 04Все запросы и ответы остаются в вашей инфраструктуре и доступны для аудита службой безопасности.
02/ 04Показываем состав компонентов и сетевые правила, по которым видно, что внешних вызовов нет.
03/ 04Версия модели меняется тогда, когда вы этого хотите, а не когда поставщик выкатил новую.
04/ 04Форматы работы
Цена и срок зависят от требований к скорости ответа, числа одновременных пользователей и наличия подходящего железа. Ниже вилка, точную смету даём после аудита инфраструктуры.
от 220 000 ₽
Срок: от 1 месяца
Модель в проде с мониторингом и обновлениями
от 55 000 ₽
Срок: 2-3 недели
Подбор модели и замер на вашем железе
индивидуально
Срок: постоянно
Обновляем модели и расширяем на новые задачи
Для большинства задач бизнеса достаточно одной современной серверной видеокарты. На аудите считаем требования под вашу нагрузку и говорим, хватит ли уже имеющегося железа или нужна закупка.
На узких задачах разница часто незаметна: извлечение полей, ответы по регламентам, классификация обращений решаются открытыми моделями уверенно. На пилоте это проверяется на ваших запросах, а не обсуждается в теории.
Можно, если данные позволяют. Мы сразу делаем внутренний API единой точкой входа, поэтому перенос не потребует переписывать интеграции.
После внедрения система живёт как обычный сервис в вашей инфраструктуре. Передаём инструкции вашему администратору, при необходимости берём поддержку на себя.
Локальное развёртывание снимает основной риск: данные не передаются третьим лицам. Остальные требования по обработке персональных данных остаются вашими, и мы помогаем описать процесс так, чтобы он им соответствовал.
Замена сводится к развёртыванию новой модели за тем же API. Именно ради этого мы и отделяем интеграции от конкретной модели.
Бесплатно, без звонка
28 вопросов, на которые стоит ответить до того, как выбирать подрядчика и обсуждать бюджет. С интерпретацией результата: когда начинать рано, когда пора считать экономику.
Посмотрим, что у вас уже стоит, и посчитаем, какая модель на этом пойдёт с приемлемой скоростью. Часто закупка не нужна.