Внедрять ИИ-ассистентов в бизнес-процессы сейчас модно. Но корпоративный чат-бот, который не знает ваших регламентов и прайс-листов, — это просто игрушка. Он будет отвечать общими фразами, а на вопрос «Как оформить заявку на отпуск?» выдаст что-то про отпускные в Трудовом кодексе. Чтобы ассистент реально экономил время сотрудников и клиентов, его нужно подключить к базе знаний компании. Сделать это можно за несколько дней, если следовать определённому порядку. В этой статье я расскажу, как мы в вебпоиск.рф подходим к подобным задачам, и дам пошаговую инструкцию.
Автор: Григорий Федотов, основатель студии · Обновлено: 09.09.2026
По сути, это процесс, в ходе которого языковая модель получает доступ к вашим корпоративным данным — документам, инструкциям, FAQ, статьям внутренней базы — и может использовать их при генерации ответов.
Есть два принципиально разных подхода.
Вы берёте поисковик, например Elasticsearch или даже обычный полнотекстовый поиск в вашей CMS, и прикручиваете к нему интерфейс на основе LLM. Когда пользователь задаёт вопрос, система ищет релевантные документы по ключевым словам, а затем передаёт их в языковую модель, которая «пересказывает» найденное естественным языком.
Плюс — простота реализации. Минус — низкое качество поиска: модель не понимает синонимы, контекст, и если в документе нет точного совпадения по словам запроса, ответ будет плохим.
Здесь используется векторное представление текста. Документы базы нарезаются на куски (чанки), каждый превращается в числовой вектор с помощью модели эмбеддингов. При запросе вектор запроса сравнивается с векторами чанков, находятся самые близкие по смыслу, и они отдаются модели для генерации ответа.
RAG — это стандарт индустрии на 2025 год. Так работают и «умные» поисковики, и корпоративные ассистенты в крупных компаниях. Качество ответов заметно выше, а скорость достаточна для реального времени.
На практике в большинстве коммерческих систем используется гибрид: RAG + классический полнотекстовый поиск для подстраховки. Но для старта можно обойтись и одним RAG.
Форматов много, но важно понимать: ИИ-ассистент не «понимает» PDF-файл как человек. Он работает с текстом. Поэтому всё, что вы подключаете, должно быть предварительно переведено в простой текст.
Вот типичный список источников.
Это любые docx, pdf, txt, md. Часто в компаниях это регламенты, должностные инструкции, маркетинговые описания, техническая документация.
Если у вас есть Confluence, Notion, Битрикс24, внутренний портал на WordPress — оттуда можно выгрузить страницы через API или вручную. В Confluence, например, есть готовые плагины для экспорта в PDF, а из Notion можно выгрузить в Markdown.
SQL-базы, Excel-файлы, Google Sheets. Прямое подключение к базе данных встречается реже, обычно таблицы экспортируют в JSON или CSV, а затем обрабатывают.
Если вы хотите обучить ассистента на историях успешных ответов поддержки, придётся экспортировать письма или чаты из вашей CRM. Это сложнее: там много лишнего, личных данных, требуется очистка.
Изображения, видео, аудио, если только вы не используете мультимодальные модели (и то с ограничениями). Сканы документов тоже сначала нужно распознать через OCR.
Главное правило: чем чище и структурированнее данные, тем лучше. Если в вашей базе знания разрозненные файлы с устаревшей информацией и дублями, ассистент будет выдавать ошибки. Перед подключением проведите ревизию.
Допустим, у вас уже есть база знаний: куча папок, несколько гугл-дисков, архив почты. Готовить её к подключению нужно в три этапа.
Скопируйте все релевантные документы в отдельную директорию. Если у вас несколько источников, сведите их в единую структуру: например, папки по отделам или по типам контента.
Определите кворум: какие документы действительно нужны? Не тащите в базу всё подряд. Например, старые версии инструкций создадут путаницу.
Удалите из текстов приветствия, подписи, бегущие строки, комментарии, скрытые слайды. Многие документы содержат информацию, не относящуюся к существу: логотипы, даты изменений, служебные пометки. Всё это надо вычистить, потому что модель не различает, где важное, а где служебное — она впитает весь текст.
Важно убрать устаревшие факты. Если у вас изменилось юрлицо или телефон, старые данные в базе приведут к ошибкам в ответах.
Лучше всего — Markdown или обычный текст. Конвертируйте все docx в md, pdf в текст. Для этого используйте утилиты конвертации или сервисы. На выходе у вас должна быть папка с десятками или сотнями текстовых файлов.
Продумайте структуру: разбейте большие документы на логические части. Для RAG оптимальный размер чанка — 500–1000 токенов (примерно 200–500 слов). Это позволяет системе точнее находить нужный фрагмент, чем при скармливании документа целиком.
На практике мы в вебпоиск.рф обычно нарезаем документы по смысловым блокам: если это инструкция, то по разделам, если справочник — то по страницам. Полуавтоматическая нарезка получается после конвертации в HTML и парсинга по тегам заголовков.
Когда данные готовы, пора выбирать, на чём будет работать ассистент. Есть три пути.
Множество сервисов уже умеют подключать вашу базу знаний через загрузку документов. Вы просто заливаете файлы, система сама создаёт векторный индекс, и вы получаете ссылку на чат-бота для интеграции на сайт или в мессенджер. Примеры: варианты на базе OpenAI с ассистентами, сервисы вроде Qwen и GigaChat для бизнеса.
Плюсы: быстро и не требует программистов. Минусы: стоимость, ограниченные возможности кастомизации и иногда проблемы с безопасностью — данные хранятся на серверах провайдера.
Вы берёте LangChain или LlamaIndex, подключаетесь к OpenAI API, российской YandexGPT или локальной модели через Ollama, запускаете скрипты для индексации и получаете свой чат-бот. Это гибкий путь, подходит для средних и крупных компаний, где есть свои разработчики.
Разворачиваете у себя модель (например, на базе open-source Llama, Mistral) и векторную базу (Qdrant, FAISS, pgvector). Всё хранится и работает на ваших серверах. Максимальный контроль, безопасность, но нужны мощные GPU и компетенции.
Я не буду лепить тут рейтинг, потому что он меняется каждый квартал. Вместо этого — таблица сравнения, которая поможет выбрать направление.
| Критерий | SaaS-платформа | Сборка на Python | Локальное решение |
|---|---|---|---|
| Скорость внедрения | От 1 дня до недели | От 2 до 6 недель | От 1 до 3 месяцев |
| Стоимость | От подписки на пользователя | Облачные API + разработка | Высокие затраты на железо |
| Безопасность | Зависит от провайдера | Средняя | Максимальная |
| Кастомизация | Ограничена настройками | Высокая | Максимальная |
| Необходимые компетенции | Нет | Python, знания ML | Сильный ML-инжиниринг |
Здесь я дам общий алгоритм, который сработает на любой платформе. Конкретные команды приводить не буду — они сильно зависят от выбранного инструмента, а задача статьи — показать логику действий.
Установите и настройте векторную базу. Вариант для небольших данных — FAISS (библиотека от Facebook), для промышленного использования — Qdrant, Weaviate, Pinecone. Если используете готовый фреймворк вроде LangChain, там есть интеграции со всеми популярными базами.
Напишите или настройте загрузчик, который читает все файлы из вашей папки, нарезает их на чанки и для каждого вычисляет вектор эмбеддинга. В LangChain есть готовые загрузчики для PDF, Word, Markdown и куча трансформеров для нарезки.
Для эмбеддингов обычно используют модель text-embedding-ada-002 (коммерческая, от OpenAI) или её открытые аналоги (например, squad_model). Важно, чтобы модель эмбеддингов соответствовала. Если документы на русском, берите модель, обученную на русском, или мультиязычную.
Выберите языковую модель: для генерации ответов лучше всего подходят GPT-4-class, YandexGPT, GigaChat или локальные Llama 3. Не используйте старые модели, которые не понимают контекст, иначе ответы будут плохими.
Когда пользователь задаёт вопрос, система должна:
Это называется RAG-цепочкой. В LangChain такой сценарий реализуется через класс RetrievalQA или создаётся через LCEL (LangChain Expression Language).
Осталось дать пользователям доступ. Это может быть:
Мы часто выбираем веб-виджет на сайт, потому что это универсально и не требует от сотрудников ставить новые приложения. Но если у вас весь офис сидит в Slack — делайте бота для Slack.
Из своей практики и того, что мы видим у клиентов, могу выделить несколько граблей, о которые спотыкаются почти все.
Ассистент в этом случае может отвечать, цитируя устаревшие или противоречивые документы. Никакой магии: модель не «знает», какой из конфликтующих ответов правильный. Она даст тот, который чаще встречается в базе. Поэтому чистите базу прежде всего.
Если чанки слишком большие, поиск менее точен. Если слишком маленькие — модель не видит контекст. Например, если в чанке одно предложение, смысл ответа может быть потерян. Оптимальный размер — абзац или заголовок + абзац.
Многие забывают настроить системный промпт. Если его нет, модель может отвечать не на основе вашей базы, а из своих общих знаний, либо отвечать слишком развёрнуто, что замедляет время ответа. В промпте нужно явно указать: «Ты — ассистент компании X. Отвечай кратко на русском, строго по данным из контекста. Если в контексте нет ответа, скажи, что не знаешь. Не выдумывай информацию».
Собрать вопросы разработчиков — это не то. Нужны вопросы реальных пользователей. Наши клиенты, которые впервые внедряют ассистентов, часто удивляются, что их сотрудники спрашивают совсем не то, что ожидали. Поэтому собирайте вопросы с пилотной группы и гоняйте на них ассистента до старта.
Модель эмбеддингов определяет, как семантически близки тексты. Если она слабая, ассистент будет плохо понимать запросы и находить не те фрагменты. Используйте проверенные модели, например, ada-002 или русскоязычные аналоги типа rubert-based. На компьютере с CPU можно развернуть и локальную, но качество будет ниже.
Просто «запустить» ассистента недостаточно. Нужно убедиться, что он отвечает правильно. Субъективной оценки «ну вроде нормально» мало, используйте метрики.
Заведите тестовый набор из 50–100 вопросов, которые реально задают ваши сотрудники или клиенты. Для каждого вопроса подготовьте эталонный ответ.
Считайте, как часто ассистент отвечает полностью корректно (без фактических ошибок). Стремитесь к 80–90% точности. Если ниже — значит, либо база неполная, либо поиск не работает.
На все ли вопросы ассистент находит то, что нужно в вашей базе? Если на треть вопросов он отвечает «не знаю», хотя ответ есть, нужно улучшать индексацию или нарезку.
Это разновидность полноты. Полезно отслеживать, на какие вопросы ассистент «отказывается» отвечать, и адаптировать промпт или добавлять данные.
Для корпоративного чат-бота приемлемо 2–5 секунд, но лучше стремиться к 1–2 секундам. Если медленнее — снижайте количество передаваемых в модель чанков или оптимизируйте запросы к векторной базе.
Косвенная метрика эффективности: стало ли меньше вопросов к живым специалистам и уменьшилось ли время на закрытие тикетов. Замеряйте это до и после внедрения.
Перед запуском пройдитесь по списку, чтобы не упустить детали.
Когда вы пройдёте чек-лист, ассистент готов к запуску. Но важно понимать: внедрение ИИ — это не одноразовая акция, а постоянный процесс. Ваши данные меняются: выходят новые инструкции, меняются цены, появляются продукты. Если база знаний не будет обновляться, ассистент начнёт устаревать.
Поэтому ещё до запуска решите, кто и как будет поддерживать базу. Это либо отдельный сотрудник, который периодически загружает новые документы и запускает переиндексацию, либо автоматизация через подключение к источникам.
На практике мы советуем клиентам выделять время на поддержку: еженедельную проверку вопросов и ответов, на которые ассистент отвечал плохо, и корректировку базы. Тогда ассистент будет приносить пользу долго, а не превратится в очередной «пилотный проект», который забросили через месяц.
Если вы хотите, чтобы ИИ-ассистент действительно работал на вашей базе знаний, но сомневаетесь, с чего начать, — просто начните с малого. Возьмите отдел, где много типовых вопросов, например, службу поддержки или HR. Подготовьте их документацию и подключите к какому-нибудь готовому сервису. Посмотрите, как это работает, а потом уже масштабируйте на остальную компанию и переходите на более продвинутые решения.
Удачи в автоматизации.
Основных способов три: использовать готовые SaaS-платформы (например, корпоративные порталы с встроенным ИИ), подключить API языковой модели через RAG-фреймворки (LangChain, LlamaIndex), или собрать полностью своё решение с векторной базой данных и fine-tuning. Выбор зависит от бюджета, объёма данных и требуемого уровня контроля.
ИИ-ассистент может работать с текстовыми документами (docx, pdf, txt), таблицами (xlsx), презентациями (pptx), а также с веб-страницами или экспортом из корпоративных систем (Confluence, Notion). Главное — чтобы данные были структурируемы: перед загрузкой их приводят к единому текстовому виду, очищают от графики и дублей.
RAG (Retrieval-Augmented Generation) — это подход, при котором языковая модель перед генерацией ответа осуществляет поиск по вашей базе знаний, извлекает релевантные фрагменты и формирует ответ на их основе. Это позволяет ассистенту опираться на актуальные данные компании, а не только на общие знания, зашитые в модель, и избегать устаревших или выдуманных ответов.
Если у вас уже есть база знаний и вы используете готовую платформу, настройка может занять от одного дня до недели. Создание собственного решения с RAG и интеграцией через API — это обычно от двух недель до нескольких месяцев, включая подготовку данных, разработку и тестирование. Точные сроки зависят от сложности и качества данных.
Соберите тестовый набор из типовых вопросов сотрудников и эталонных ответов. Запустите вопросы на ассистенте и сравните его ответы с эталоном по критериям: полнота (не пропущены ли детали), точность (нет ли фактических ошибок) и соответствие тону компании. Полезно также дать поработать 3–5 сотрудникам «в бою» и собрать их обратную связь.
Оставьте контакт — пришлём расчёт и предложим решение под вашу задачу. Ни к чему не обязывает.
Без навязчивых звонков · Смета бесплатно · Оплата поэтапно по договору
или позвоните: +7 (495) 487-44-70