МАЙПЛ: Локальные AI‑модели
Компактные модели под одну задачу — разворачиваются у вас
Каждая модель обучена под одну работу: JSON, обращения, код, медицина, договоры, отчётность. Помещается на одну GPU в вашей сети и отвечает через OpenAI-совместимый API.
Шесть моделей — шесть задач
Выберите модель под свою операцию. Все шесть работают на общем рантайме и одном API.
МАЙПЛ JSON
Документы и свободный текст — в JSON строго по вашей схеме. Ограниченное декодирование исключает битый вывод.
МАЙПЛ Классификатор
Намерение, тональность и категории по вашему закрытому справочнику — за миллисекунды, прямо в потоке запросов.
МАЙПЛ Код
Генерация кода, который компилируется и проходит ваши тесты до ответа. Каждый ответ приходит вместе с пройденными тестами.
МАЙПЛ Медицина
Диагнозы, препараты, дозировки и коды МКБ-10 из клинических записей. Персональные данные не покидают учреждение.
МАЙПЛ Юрист
Ключевые условия и риски из договоров со ссылкой на точную формулировку. Документ не выходит за периметр.
МАЙПЛ Финансы
Показатели из отчётности, выписок и презентаций — вплоть до сносок, с указанием источника у каждого числа.
Какую задачу решает
Универсальная модель на узкой задаче
Большая модель умеет всё понемногу, а на конкретной операции работает медленнее, отвечает менее стабильно и плохо поддаётся тестированию.
Данные уходят в чужое облако
Договоры, медицинские записи, отчётность и исходный код оказываются у внешнего провайдера — с этим не согласится ни служба безопасности, ни юристы.
Счёт растёт вместе с объёмом
Оплата за токены превращает каждый новый документ в новую строку расходов. Бюджет невозможно спланировать заранее.
Что общего у всех моделей
Один стек обслуживания, один путь развёртывания и один API. Вторая модель не добавляет инфраструктуре новых сущностей.
On-premise, VPC или закрытый контур
Инференс идёт внутри вашей сети — на своих серверах, в частном облаке или в изолированном контуре без выхода в интернет. Облака поставщика в цепочке запроса нет, телеметрия наружу не отправляется.
OpenAI-совместимый API
Модели обслуживаются через vLLM и отвечают по REST в формате OpenAI. Код, который уже работает с OpenAI-клиентом, переключается сменой адреса.
Docker Compose или Helm
Каждая модель поставляется контейнером. Развёртывание — Docker Compose для одного сервера или Helm-чарт для Kubernetes.
Одна GPU на модель
От 16 ГБ видеопамяти для классификатора до 48 ГБ для кода, медицины и права. Железо стандартное — такое ваша команда уже умеет закупать.
Дообучение LoRA на ваших данных
Обычно достаточно нескольких сотен размеченных примеров из вашего процесса, чтобы заметно сдвинуть качество. Задания на дообучение входят в редакцию Enterprise.
Годовая лицензия без оплаты за токены
Лицензия на модель фиксированная и зависит от масштаба развёртывания, а не от объёма запросов. Рост нагрузки меняет только счёт за железо.
Стенд оценки в каждом контейнере
Вместе с моделью поставляется eval-стенд и отложенные тестовые наборы. Точность, задержку и пропускную способность вы меряете сами — на своих данных и своём железе.
Веса остаются у вас
После запуска модель работает без участия поставщика: runbook, обучение операторов и 90 дней сопровождения — дальше эксплуатация полностью на вашей стороне.
Арендовать универсала или владеть специалистом
На узкой задаче небольшая модель быстрее, стабильнее и проще в тестировании, чем универсальная, которая делает ту же работу.
Одна узкая задача — сделанная как следует
Каждая модель обучена под одну операцию и больше ни под что. На этой операции узкая модель выигрывает у общей: быстрее, предсказуемее, легче проверить.
Достаточно компактна, чтобы ей владеть
Любая модель помещается на одну стандартную GPU, поэтому всё семейство работает на железе, которое вы уже умеете покупать и обслуживать.
Данные не выходят из сети
Для компаний, работающих по 152-ФЗ, это снимает главный вопрос: персональные данные обрабатываются внутри вашего периметра, без передачи внешнему провайдеру.
Скучно в эксплуатации — и это плюс
Один рантайм vLLM, один API, Docker или Helm. Тот же стек, что у Люмена и Notetaker, — намеренно.
Меряем на ваших данных, а не в публичных рейтингах
Цифры, по которым принимается решение о запуске, получаются на ваших примерах и вашем железе и попадают в пилотное соглашение письменно.
Без гонки за рейтингами
Публичные рейтинги награждают универсальность, а наши модели узкие намеренно. Сравнений с флагманскими моделями не публикуем: единственный значимый тест — ваша задача.
Стенд оценки идёт вместе с моделью
В каждом контейнере — eval-стенд и отложенные тестовые наборы. Направьте его на свои примеры и получите точность, задержку и пропускную способность на своём оборудовании.
Пороги — в договоре
На пилоте фиксируем целевые метрики на ваших данных. Решение о промышленном запуске принимается по этим цифрам, а не по впечатлению от демонстрации.
Фиксированная годовая лицензия
Лицензия оформляется на каждую модель и зависит от масштаба развёртывания. Стоимость считаем после демо, когда понятен объём.
0 ₽ за токен, место и запрос
Инференс идёт на вашей GPU, поэтому использование ничего не стоит сверх лицензии. Объём влияет на железо, а не на платёж нам.
Одна лицензия на модель в год
Включает обновления, патчи безопасности и стенд оценки на весь срок лицензии.
Скидка за несколько моделей
Модели работают на общем стеке, поэтому комплект из нескольких моделей дешевле и не добавляет операционной нагрузки.
Кому подходят локальные модели
Компаниям с потоком документов
Счета, заявки, анкеты, письма и отчёты, из которых нужно стабильно доставать поля в учётную систему без ручного ввода.
Медицине, праву и финансам
Там, где документы нельзя отправлять во внешнее облако: медицинская и адвокатская тайна, персональные данные, инсайдерская информация.
Контактным центрам и поддержке
Маршрутизация обращений, тональность и категории в реальном времени на десятках тысяч запросов.
Командам разработки
Генерация кода рядом с репозиторием: проприетарный код не уходит к внешнему провайдеру.
Как проходит внедрение
Три шага — и в конце веса остаются у вас. После запуска ничего не зависит от нашего участия.
- 01
Звонок-знакомство
30 минутБез слайдов: ваша задача, формат данных и требования безопасности. Если модель не подходит под задачу — скажем об этом на звонке.
- 02
Пилот в вашем контуре
по плану пилотаРазворачиваем контейнер на тестовом стенде в вашем VPC или на собственных серверах — на том же стеке, что Люмен и Notetaker. Стенд оценки прогоняет модель на ваших данных, цифры фиксируются в пилотном соглашении.
- 03
Промышленный запуск
90 дней сопровожденияПередаём runbook, обучаем операторов и 90 дней остаёмся на связи. Дальше модель эксплуатируете вы — без зависимости от поставщика.
Частые вопросы
На конкретной операции — извлечь поля, присвоить категорию, найти риск в договоре — небольшая специализированная модель работает быстрее, отвечает стабильнее и проще тестируется. К тому же она помещается на одну GPU и разворачивается у вас, а не арендуется у внешнего провайдера.
Модели разворачиваются в вашем контуре: на своих серверах, в частном облаке или в изолированной сети без выхода в интернет. Облака поставщика в цепочке запроса нет, телеметрия не отправляется. Для обработки персональных данных по 152-ФЗ это значит, что они не покидают ваш периметр.
Любой модели хватает одной GPU. Классификатору — 16 ГБ (класс T4 и выше), JSON и Финансам — 24 ГБ (класс L4 или A10), Коду, Медицине и Юристу — 48 ГБ (класс L40S или A6000). Перед пилотом сверяем сайзинг с вашим реальным трафиком.
Фиксированная годовая лицензия на каждую модель, размер зависит от масштаба развёртывания, а не от числа запросов. Оплаты за токены, рабочие места и запросы нет. В лицензию входят обновления, патчи безопасности и стенд оценки; за несколько моделей — скидка. Точную стоимость называем после демо.
Принесите около сотни реальных примеров из своего процесса. Прогоним модель на них при вас, встроенный стенд посчитает результат. На пилоте целевые метрики на ваших данных записываются в соглашение, и решение о запуске принимается по ним.
Это проверяется на пилоте, а не обещается заранее: стенд оценки прогоняет модель на ваших документах и показывает точность на них. Если качества не хватает, модель дообучается методом LoRA — обычно достаточно нескольких сотен размеченных примеров из вашего процесса.
Веса модели, контейнеры, runbook и обученные операторы. После 90 дней сопровождения модель работает без нашего участия. Лицензия продлевается ежегодно и включает обновления и патчи безопасности.
Принесите сто реальных примеров
Прогоним модель на них при вас: стенд оценки посчитает результат, и решение вы примете по цифрам, а не по презентации.