МАЙПЛ Классификатор
Разметка в масштабе — прямо в потоке запросов
Модель присваивает намерение, тональность и категорию по справочнику, который вы фиксируете заранее: 12 мс по медиане и больше 10 000 запросов в секунду на одном узле. Достаточно быстрая, чтобы стоять в цепочке обработки каждого запроса, и работает в вашем контуре — трафик никуда не уходит.
Задача модели
Присвоить каждому тексту метки из вашего закрытого справочника — намерение, тональность, категорию — и вернуть откалиброванную уверенность, по которой можно маршрутизировать.
На входе
- ·Обращения в поддержку, сообщения чатов, отзывы, события
- ·До 8K токенов на запрос — объём обращения или сообщения, а не книги
- ·Справочник меток, зафиксированный заранее
На выходе
- ·Метки только из вашего справочника — никакого свободного текста
- ·Откалиброванная уверенность по каждой метке
- ·Ответ за миллисекунды — без очереди на отдельном сервисе
Одна задача — сделанная по спецификации
Всё ниже модель делает сама: без обёрток, без циклов повторных запросов и без обращения к модели побольше, когда застряла.
Ваш справочник — закрытый
Метки берутся только из заданного вами набора, никогда не из свободного текста. Нет дрейфа и новых категорий, внезапно появившихся в продакшене.
10 000+ запросов в секунду
Устойчиво на одном узле, батчинг берёт на себя рантайм. Рассчитано на очереди обращений, маршрутизацию чатов и потоки событий.
Уверенность, по которой можно маршрутизировать
Оценки откалиброваны: 0,97 означает 0,97. Спорные случаи уходят в очередь к человеку по правилу в одну строку.
Дообучается на ваших метках
Нескольких сотен исправленных примеров обычно достаточно. Задание на дообучение отрабатывает за ночь на той же GPU.
Характеристики
Цифры, которые нужны для планирования мощностей. Перед пилотом сайзинг сверяется с вашим трафиком, и показатели записываются в соглашение.
- Контекст
- 8K токеновРассчитан на обращения, сообщения и отзывы, а не на тексты книжного объёма.
- Задержка
- 12 мс, медианаМедиана, batch 1, эталонное развёртывание на одной GPU. Замер разработчика — встроенный стенд воспроизводит его на вашем железе.
- Пропускная способность
- 10 000+ запросов/сУстойчиво на одном узле, батчинг выполняет рантайм.
- Железо
- 1× GPU 16 ГБКласс T4 или выше. Сайзинг проверяем до пилота.
- Интерфейс
- OpenAI-совместимый RESTОбслуживается vLLM. Код, написанный под OpenAI-клиент, подключается без переписывания.
- Развёртывание
- Docker Compose или HelmВаши серверы, частное облако (VPC) или изолированный контур без интернета.
- Дообучение
- LoRA на ваших данныхЗадания на дообучение входят в редакцию Enterprise. Обычно хватает нескольких сотен размеченных примеров из вашего процесса.
- Оплата
- Годовая лицензияБез оплаты за токены, запросы и рабочие места. Размер лицензии зависит от масштаба развёртывания.
Где применяется
Сценарии, где разметка нужна на каждом запросе и за миллисекунды.
Маршрутизация обращений в поддержке
Каждое обращение из почты, чата или формы получает тему и срочность и сразу попадает в нужную очередь — без ручной сортировки первой линией.
- ·Категории строго из вашего справочника
- ·Низкая уверенность — в очередь к оператору
- ·Скорость, достаточная для работы в реальном времени
Тональность отзывов и упоминаний
Отзывы с маркетплейсов, из карт и соцсетей размечаются по тональности и теме, чтобы негатив не терялся среди тысяч сообщений.
- ·Единая разметка по всем источникам
- ·Метрики по темам вместо ручной выборки
- ·Дообучение на исправленных примерах за ночь
Намерения в чат-ботах и IVR
Определение намерения клиента в диалоге, чтобы бот или сценарий переключался на нужную ветку, а сложные случаи шли к человеку.
- ·Ответ за 12 мс по медиане
- ·Никаких новых меток, о которых не знает сценарий
- ·Трафик диалогов не покидает контур
Потоки событий
Разметка событий из систем мониторинга, заявок и логов для алертинга и аналитики на больших объёмах.
- ·10 000+ запросов в секунду на одном узле
- ·Откалиброванная уверенность для порогов
- ·Одна GPU класса T4
Пример запроса и ответа
Иллюстрация формата. Имя модели и названия меток условные — справочник задаёте вы.
{
"model": "maipl-classify",
"messages": [
{ "role": "user", "content": "Возврат за заказ 5521 так и не пришёл, жду вторую неделю" }
]
}{
"intent": { "label": "refund_status", "confidence": 0.97 },
"sentiment": { "label": "negative", "confidence": 0.94 },
"category": { "label": "Возвраты", "confidence": 0.96 }
}От первого звонка до промышленной эксплуатации
Три шага без переписывания вашего кода. В конце веса модели остаются у вас.
- 01
Звонок-знакомство
30 минутБез слайдов: задача, формат данных и требования безопасности. Если эта модель вам не подходит — скажем прямо на звонке.
- 02
Пилот в вашем контуре
по плану пилотаКонтейнер разворачивается на тестовом стенде в вашем VPC или на собственных серверах — на том же стеке, что Люмен и Notetaker. Стенд оценки прогоняет модель на ваших данных, цифры попадают в пилотное соглашение.
- 03
Промышленный запуск
90 дней сопровожденияRunbook, обучение операторов и 90 дней сопровождения. После этого модель эксплуатируете вы, без зависимости от поставщика.
Частые вопросы
Нет. Метки выбираются только из набора, который вы задали заранее. Свободного текста в ответе не бывает, поэтому в продакшене не появляются новые категории и разметка не дрейфует.
Оценка отражает реальную вероятность: 0,97 означает 0,97. На неё можно опираться в правилах маршрутизации — например, отправлять всё ниже порога в очередь к оператору одной строкой логики.
На одном узле модель устойчиво обрабатывает больше 10 000 запросов в секунду, медианная задержка — 12 мс. Перед пилотом сверяем сайзинг с вашим реальным трафиком и фиксируем цифры в соглашении.
Короткие и средние: обращения, сообщения, отзывы, события — до 8K токенов на запрос. Для длинных документов лучше подходят МАЙПЛ JSON или профильные модели.
Исправьте разметку в спорных примерах: нескольких сотен исправлений обычно достаточно. Задание на дообучение методом LoRA отрабатывает за ночь на той же GPU. Качество на ваших текстах, в том числе русскоязычных, измеряет стенд оценки на пилоте.
Одна GPU с 16 ГБ видеопамяти — класс T4 или выше.
Ещё пять моделей на этом рантайме
Тот же стек обслуживания, тот же путь развёртывания и один API — вторая модель не добавляет инфраструктуре новых сущностей.
МАЙПЛ JSON
Структурированный вывод строго по схеме
Подробнее →МАЙПЛ Код
Код, который компилируется и проходит тесты
Подробнее →МАЙПЛ Медицина
Извлечение данных из клинических записей
Подробнее →МАЙПЛ Юрист
Ключевые условия и риски в договорах
Подробнее →МАЙПЛ Финансы
Показатели из отчётности и презентаций
Подробнее →Принесите сто реальных примеров
Прогоним модель на них при вас: стенд оценки посчитает результат, и решение вы примете по цифрам, а не по презентации.