Вебторика

AI-агент поддержки с поиском по базе знаний

Отвечает по корпоративной базе знаний со ссылками на источник. Сложные обращения передаёт оператору.

SaaS и digitalТиповой срок: 3–4 месяцаNDA
Проекты под NDA. Обезличенно: тип задачи, подход, диапазон результата. Названия клиентов и точные цифры не раскрываются.

Контекст

SaaS-платформа или сервис с большой базой знаний (статьи, исторические обращения). Первая линия поддержки перегружена типовыми вопросами.

Проблема

Первая линия не справляется с потоком: время ответа — часы, оценка клиентов падает, клиенты уходят. Большинство вопросов — типовые, на них уходит большая часть времени.

Ограничения

  • Приватный контур — данные не должны уходить наружу
  • Точность ответов не ниже 90%
  • Интеграция со службой поддержки и мессенджерами
  • Эскалация на человека при неуверенности модели
  • Соответствие 152-ФЗ: без персональных данных в запросах

Подход

AI-поиск: документы и исторические обращения индексируются в векторной базе данных. Агент ищет релевантные фрагменты, формирует ответ со ссылками. Если уверенность ниже порога — эскалирует на человека. Языковая модель — на своих серверах в контуре клиента.

Архитектура

Индексация

Модули сбора к источникам → нарезка на фрагменты с перекрытием → векторы → база данных.

AI-поиск

LangChain, гибридный поиск (BM25 + вектор), второй проход ранжирования.

Модель

Llama или Mistral на GPU в контуре клиента, vLLM для генерации ответов.

Эскалация

Если уверенность ниже порога — обращение передаётся оператору с историей диалога.

Аналитика

Панель качества: точность, доля эскалаций, топ-вопросы, оценка клиентов.

Ход работ

  1. 1

    Подготовка данных

    Выгрузка статей и обращений, очистка от персональных данных, согласование таксономии.

  2. 2

    Ядро поиска

    Индексация, гибридный поиск, переранжирование. Офлайн-оценка на отложенных вопросах.

  3. 3

    Интеграции

    Служба поддержки, мессенджеры. Эскалация на человека. Пилот на части трафика.

  4. 4

    Обучение и раскатка

    Донастройка запросов к модели на реальных ответах, расширение на весь трафик.

Типичные результаты

40%
Разгрузка поддержки
90%+
Точность ответов на отложенной выборке
секунды
Время ответа
большинство
типовых обращений без человека

Нагрузка на первую линию упала на 40–55%, точность ответов — 90%+, время ответа — секунды вместо часов.

Технологический стек

LangChainpgvectorLlama / MistralvLLMPythonZendesk API

Другие проекты

Оценка за 1 рабочий день

Стоимость и план реализации — по заявке.