6 МОДЕЛЕЙ · ОДНА GPU · ВАШ КОНТУР

МАЙПЛ: Локальные AI‑модели

Компактные модели под одну задачу — разворачиваются у вас

Каждая модель обучена под одну работу: JSON, обращения, код, медицина, договоры, отчётность. Помещается на одну GPU в вашей сети и отвечает через OpenAI-совместимый API.

Шесть моделей — шесть задач

Выберите модель под свою операцию. Все шесть работают на общем рантайме и одном API.

01

МАЙПЛ JSON

Документы и свободный текст — в JSON строго по вашей схеме. Ограниченное декодирование исключает битый вывод.

99,8% прохождения схемы
1× GPU 24 ГБПодробнее
02

МАЙПЛ Классификатор

Намерение, тональность и категории по вашему закрытому справочнику — за миллисекунды, прямо в потоке запросов.

10 000+ запросов/с
1× GPU 16 ГБПодробнее
03

МАЙПЛ Код

Генерация кода, который компилируется и проходит ваши тесты до ответа. Каждый ответ приходит вместе с пройденными тестами.

Python · TypeScript · Go · Rust
1× GPU 48 ГБПодробнее
04

МАЙПЛ Медицина

Диагнозы, препараты, дозировки и коды МКБ-10 из клинических записей. Персональные данные не покидают учреждение.

Обезличивание до записи в логи
1× GPU 48 ГБПодробнее
05

МАЙПЛ Юрист

Ключевые условия и риски из договоров со ссылкой на точную формулировку. Документ не выходит за периметр.

Ссылка на пункт в каждом флаге
1× GPU 48 ГБПодробнее
06

МАЙПЛ Финансы

Показатели из отчётности, выписок и презентаций — вплоть до сносок, с указанием источника у каждого числа.

Извлечение 99%+
1× GPU 24 ГБПодробнее

Какую задачу решает

Универсальная модель на узкой задаче

Большая модель умеет всё понемногу, а на конкретной операции работает медленнее, отвечает менее стабильно и плохо поддаётся тестированию.

Данные уходят в чужое облако

Договоры, медицинские записи, отчётность и исходный код оказываются у внешнего провайдера — с этим не согласится ни служба безопасности, ни юристы.

Счёт растёт вместе с объёмом

Оплата за токены превращает каждый новый документ в новую строку расходов. Бюджет невозможно спланировать заранее.

Что общего у всех моделей

Один стек обслуживания, один путь развёртывания и один API. Вторая модель не добавляет инфраструктуре новых сущностей.

01

On-premise, VPC или закрытый контур

Инференс идёт внутри вашей сети — на своих серверах, в частном облаке или в изолированном контуре без выхода в интернет. Облака поставщика в цепочке запроса нет, телеметрия наружу не отправляется.

02

OpenAI-совместимый API

Модели обслуживаются через vLLM и отвечают по REST в формате OpenAI. Код, который уже работает с OpenAI-клиентом, переключается сменой адреса.

03

Docker Compose или Helm

Каждая модель поставляется контейнером. Развёртывание — Docker Compose для одного сервера или Helm-чарт для Kubernetes.

04

Одна GPU на модель

От 16 ГБ видеопамяти для классификатора до 48 ГБ для кода, медицины и права. Железо стандартное — такое ваша команда уже умеет закупать.

05

Дообучение LoRA на ваших данных

Обычно достаточно нескольких сотен размеченных примеров из вашего процесса, чтобы заметно сдвинуть качество. Задания на дообучение входят в редакцию Enterprise.

06

Годовая лицензия без оплаты за токены

Лицензия на модель фиксированная и зависит от масштаба развёртывания, а не от объёма запросов. Рост нагрузки меняет только счёт за железо.

07

Стенд оценки в каждом контейнере

Вместе с моделью поставляется eval-стенд и отложенные тестовые наборы. Точность, задержку и пропускную способность вы меряете сами — на своих данных и своём железе.

08

Веса остаются у вас

После запуска модель работает без участия поставщика: runbook, обучение операторов и 90 дней сопровождения — дальше эксплуатация полностью на вашей стороне.

Арендовать универсала или владеть специалистом

На узкой задаче небольшая модель быстрее, стабильнее и проще в тестировании, чем универсальная, которая делает ту же работу.

Одна узкая задача — сделанная как следует

Каждая модель обучена под одну операцию и больше ни под что. На этой операции узкая модель выигрывает у общей: быстрее, предсказуемее, легче проверить.

Достаточно компактна, чтобы ей владеть

Любая модель помещается на одну стандартную GPU, поэтому всё семейство работает на железе, которое вы уже умеете покупать и обслуживать.

Данные не выходят из сети

Для компаний, работающих по 152-ФЗ, это снимает главный вопрос: персональные данные обрабатываются внутри вашего периметра, без передачи внешнему провайдеру.

Скучно в эксплуатации — и это плюс

Один рантайм vLLM, один API, Docker или Helm. Тот же стек, что у Люмена и Notetaker, — намеренно.

Меряем на ваших данных, а не в публичных рейтингах

Цифры, по которым принимается решение о запуске, получаются на ваших примерах и вашем железе и попадают в пилотное соглашение письменно.

Без гонки за рейтингами

Публичные рейтинги награждают универсальность, а наши модели узкие намеренно. Сравнений с флагманскими моделями не публикуем: единственный значимый тест — ваша задача.

Стенд оценки идёт вместе с моделью

В каждом контейнере — eval-стенд и отложенные тестовые наборы. Направьте его на свои примеры и получите точность, задержку и пропускную способность на своём оборудовании.

Пороги — в договоре

На пилоте фиксируем целевые метрики на ваших данных. Решение о промышленном запуске принимается по этим цифрам, а не по впечатлению от демонстрации.

Фиксированная годовая лицензия

Лицензия оформляется на каждую модель и зависит от масштаба развёртывания. Стоимость считаем после демо, когда понятен объём.

0 ₽ за токен, место и запрос

Инференс идёт на вашей GPU, поэтому использование ничего не стоит сверх лицензии. Объём влияет на железо, а не на платёж нам.

Одна лицензия на модель в год

Включает обновления, патчи безопасности и стенд оценки на весь срок лицензии.

Скидка за несколько моделей

Модели работают на общем стеке, поэтому комплект из нескольких моделей дешевле и не добавляет операционной нагрузки.

Кому подходят локальные модели

Компаниям с потоком документов

Счета, заявки, анкеты, письма и отчёты, из которых нужно стабильно доставать поля в учётную систему без ручного ввода.

Медицине, праву и финансам

Там, где документы нельзя отправлять во внешнее облако: медицинская и адвокатская тайна, персональные данные, инсайдерская информация.

Контактным центрам и поддержке

Маршрутизация обращений, тональность и категории в реальном времени на десятках тысяч запросов.

Командам разработки

Генерация кода рядом с репозиторием: проприетарный код не уходит к внешнему провайдеру.

Как проходит внедрение

Три шага — и в конце веса остаются у вас. После запуска ничего не зависит от нашего участия.

  1. Звонок-знакомство

    30 минут

    Без слайдов: ваша задача, формат данных и требования безопасности. Если модель не подходит под задачу — скажем об этом на звонке.

  2. Пилот в вашем контуре

    по плану пилота

    Разворачиваем контейнер на тестовом стенде в вашем VPC или на собственных серверах — на том же стеке, что Люмен и Notetaker. Стенд оценки прогоняет модель на ваших данных, цифры фиксируются в пилотном соглашении.

  3. Промышленный запуск

    90 дней сопровождения

    Передаём runbook, обучаем операторов и 90 дней остаёмся на связи. Дальше модель эксплуатируете вы — без зависимости от поставщика.

Частые вопросы

На конкретной операции — извлечь поля, присвоить категорию, найти риск в договоре — небольшая специализированная модель работает быстрее, отвечает стабильнее и проще тестируется. К тому же она помещается на одну GPU и разворачивается у вас, а не арендуется у внешнего провайдера.

На том же стеке

Принесите сто реальных примеров

Прогоним модель на них при вас: стенд оценки посчитает результат, и решение вы примете по цифрам, а не по презентации.

+7 (999) 229-36-79

Рассылка

Подпишитесь на нашу рассылку
ArdaМинцифры РоссииСделано в России
Услуги по разработке сайтов и Telegram-ботов оказывает ИП Акерман Д.И., ИНН 591907265805, ОГРНИП 321595800025080. Бренд «МАЙПЛ» принадлежит ООО «МАЙПЛ» — иные услуги оказываются ООО.