База знаний с ИИ отвечает сотруднику словами и даёт ссылку на документ, из которого ответ взят. Человек спрашивает «сколько дней отпуска положено после года работы» и получает не список из сорока файлов, а готовую формулировку и адрес источника, чтобы проверить. Технология под этим называется RAG: система сначала находит подходящие куски документов, потом языковая модель складывает из них ответ. Разбор механики лежит отдельно - что такое RAG, здесь я к теории больше не возвращаюсь.
Работает такая база ровно настолько, насколько актуальны документы внутри неё. Система умеет найти регламент, но не умеет знать, что его отменили полгода назад: она честно покажет отменённый, сотрудник сделает по нему и формально будет прав. Дальше - что получает сотрудник на выходе, когда хватит готовой платформы и когда нужно своё решение, из чего база складывается и кто держит её в рабочем состоянии после запуска.
Что именно получает сотрудник
Спрашивают там, где человек и так сидит: в корпоративном чате, в Telegram, на внутреннем портале. Форма привычная, обычный чат-бот, только отвечает он по вашим документам, а не по интернету.
Ответ такой системы устроен по трём правилам, и по ним же её проще всего проверять на демо.
Он словами, а не списком ссылок. Обычный поиск отдаёт файлы и оставляет чтение человеку. Здесь сотрудник получает формулировку на три предложения по существу вопроса.
Он со ссылкой на исходный документ. Ответ без источника бесполезен: проверить его нельзя, а верить на слово в вопросах про деньги, сроки и договоры никто не станет. Ссылка на конкретный файл и раздел - обязательное требование, а не приятная опция.
Его может не быть. «В документах нет ответа на этот вопрос» - штатный ответ, а не сбой. Система, которая отвечает всегда, начинает сочинять там, где данных нет. Система, которая умеет отказываться, экономит сотруднику время и репутацию.
Чего виртуальный ассистент не даст, стоит сказать сразу. Модель хорошо угадывает общее и плохо знает частное: категорию по названию контрагента она назовёт, а какой из двух одинаковых платежей относился к вашему проекту - нет, потому что это известно только вам и нигде не записано. Она забывает предыдущий разговор, если память не сделана отдельно. И она выдумывает итоговые суммы, если ей позволить считать: складывать числа должна система, а не языковая модель.
Готовая платформа или своё решение
Готовые платформы существуют, и в половине случаев их достаточно. Minerva Knowledge, Teamly, Just AI и другие продукты этого класса закрывают понятную ситуацию: документы уже собраны в одном месте, лежат в текстовом виде, доступ у всех примерно одинаковый. Подписка, загрузка файлов, работающий поиск через неделю. Я эти платформы не продаю и рейтингов по ним не составляю - в топе выдачи их и так десяток.
Своё решение нужно там, где картина не складывается.
| Признак вашей ситуации | Хватит платформы | Нужно своё решение |
|---|---|---|
| Где лежат документы | Вики или общий диск, одно место | Пять систем сразу: диск, почта, чаты, 1С, CRM |
| Форматы | Тексты, таблицы, презентации | Сканы, PDF со сложной вёрсткой, чертежи |
| Источник ответа | Всё нужное есть в файлах | Часть ответа живёт в базе 1С или CRM, а не в документе |
| Доступ | Общий для всех сотрудников | Роли, коммерческая тайна, закрытый контур без интернета |
| Что нужно от ответа | Ответ словами | Ответ и действие: создать заявку, обновить статус, уведомить |
| Кому принадлежит разметка знаний | Достаточно, что она у вендора | Смысловой слой должен остаться у компании |
Последняя строка выглядит самой скучной и решает больше остальных. Компания, которая отдаёт смысловой слой тому вендору, у кого в этом квартале удобнее интерфейс, через три года обнаруживает набор локальных удобств и ни одной цельной картины собственных знаний. Правила, связи, пометки «этот регламент отменяет тот» - это и есть актив, и лежать он должен там, где вы им управляете.
Честная граница такая: на коробке экономится время, на своём решении сохраняется контроль. Если документы в порядке и собраны в одном месте, начинать со своей разработки незачем. Порядок работ, сроки и деньги для собственного решения разобраны отдельно - внедрение RAG в компании, там же список того, что придётся подготовить от документов до старта.
Из чего складывается база
Где живут знания сейчас
Обычная картина перед запуском: часть знаний в корпоративной вики, часть на общем диске в папках с именами вроде «Регламенты_финал_2», часть в почтовых переписках, часть в чатах, остальное в головах трёх сотрудников, к которым ходят спрашивать. Последняя часть самая большая и нигде не записана.
Толк появляется, когда всё это читает один источник правды, а не пять систем по очереди. Пока знания разложены по пяти хранилищам, каждый ответ приходится собирать вручную, и никакой поиск этого за вас не сделает. Побочный эффект неприятный: чтобы бизнес стал полезен модели, его сначала нужно превратить в текст, который можно читать и дописывать. Это работа людей, и она делается один раз, зато честно.
Что делать со сканами и таблицами
Часть документов до всякого поиска надо превратить в текст. Сканы приказов, накладные, договоры в PDF с колонками и подписями, таблицы со сложной шапкой - всё это для системы поначалу картинки. Отдельный слой распознавания раскладывает такие файлы на структуру: заголовки, разделы, ячейки таблицы. Как устроена эта часть, я показывал на примере инструмента, который умеет превратить сложные PDF в структурированные данные.
Проверять качество распознавания нужно до запуска базы, а не после. Таблица, у которой съехали строки, даст уверенный и неправильный ответ, и заметит это только тот, кто знает исходник.
Чего в базе быть не должно
Не всё, что лежит на диске, стоит индексировать. Персональные данные сотрудников и клиентов, кадровые документы, договоры с ценами и условиями, переписка по спорным ситуациям - либо не попадают в базу вовсе, либо закрываются правами на уровне источника. Отдельно смотрятся требования 152-ФЗ: персональные данные накладывают ограничения и на хранение, и на то, куда уходит запрос при обращении к модели.
Правило простое: документ, утечка которого станет проблемой, в общий индекс не кладётся, даже если очень удобно.
Кто держит базу актуальной
Это главный вопрос всей затеи, и ни одна платформа на него не отвечает, потому что ответ не в софте. Внутренний поиск по знаниям зарастает мусором, если базу регулярно не чистить: документация растёт, старое никто не удаляет, и через год система уверенно цитирует то, что давно отменили.
Работает одно правило: у каждого раздела базы есть человек, а не отдел. «Отвечает бухгалтерия» означает, что не отвечает никто.
| Роль | За что отвечает | Как часто |
|---|---|---|
| Владелец раздела | Актуальность документов своего направления, пометка «отменено» на старых версиях | Раз в месяц, плюс сразу после изменения регламента |
| Редактор базы | Единый формат, дата и владелец у каждого документа, удаление дублей | Раз в неделю, полчаса |
| ИТ или подрядчик | Работа поиска, подключение источников, права доступа, разбор жалоб на ответы | Постоянно, по обращениям |
| Руководитель направления | Решение по спорным редакциям: какая версия правильная | По мере появления споров |
| Никто | Через полгода база отвечает по отменённым документам, сотрудники возвращаются к вопросам в чат, проект считается неудачным | - |
Практическая часть короткая. У каждого документа проставляются дата и владелец - без них система не отличит редакцию от редакции. Спорные версии решает человек из третьей строки таблицы, а не порядок файлов в папке. Устаревшее лучше удалять, чем оставлять «на всякий случай»: в одном публичном разборе из набора правил, накопленных против ошибок модели, выбросили около 60 процентов, и качество ответов от этого выросло.
Есть режим отказа пострашнее устаревших файлов. Если системе разрешить самой дописывать в базу выжимки и заметки, одна неудачная сводка становится «правдой», на которую опирается следующий ответ, потом ещё один. Разбирать такое приходится вручную и долго. Поэтому запись в базу знаний остаётся за человеком, а автоматизация бизнес-процессов вокруг неё - это регламент обновления и напоминания владельцам разделов, а не право модели править источник.
Кто именно закрывает третью строку, зависит от того, есть ли в компании свои разработчики. Если нет - это внешний подрядчик, и объём работ описан там же, где разработка ассистента на заказ.
Права доступа: кто что видит
Доступ раздаётся по ролям, а не общим включателем «всем сотрудникам». Права проверяются на стороне системы-источника: если у человека нет доступа к папке на диске, он не должен получить ответ по её содержимому, и решает это не поиск, а сама папка.
Когда документ найден, но человеку недоступен, честнее показать факт существования без содержания: «ответ есть в документе, к которому у вас нет доступа, обратитесь к владельцу раздела». Молчание в такой ситуации хуже - сотрудник решит, что документа нет, и пойдёт делать по-своему.
Инструкцией в промпте это не решается. Просьба к модели «не показывай зарплаты» работает ровно до первого сотрудника, который догадается переформулировать вопрос. Закрытые данные и опасные действия закрываются архитектурой: чего в индексе нет, то и не найдётся.
Как понять, что она работает
Мерить надо исход, а не активность. Число вопросов в день и объём загруженных документов ничего не говорят о пользе.
На любой базе считаются три вещи: доля вопросов, на которые нашёлся ответ со ссылкой; доля ответов, с которыми сотрудник согласился, то есть не пошёл искать дальше; число вопросов, которые после ответа системы всё равно ушли живому человеку. Последняя цифра самая честная и самая неприятная, поэтому её обычно и не считают.
Порог провала называется прямо: если проверять ответ дольше, чем найти документ самому, база не работает. Тогда сотрудники тихо возвращаются к привычке спрашивать в чате, а система остаётся формально работающей и никому не нужной.
Ещё одно наблюдение из практики стоит держать в голове. В публичном сравнении инструментов памяти для ИИ-систем победила обычная вики из текстовых файлов, а не продукты со сложной архитектурой. Сложность сама по себе преимуществом не бывает, и если задача закрывается наведением порядка в папках, начинать надо с этого.
Кому это не нужно
Три ситуации, в которых я отговариваю.
Документов десяток, и все они помещаются в один файл. Поиск по одному файлу делает Ctrl+F, платить за это отдельно незачем.
Ответ на любой вопрос даёт один человек, и он не перегружен. База знаний заменяет очередь к эксперту, а не самого эксперта. Пока очереди нет, менять нечего.
Знания меняются каждый день и живут в системе, а не в документах: остатки на складе, статусы заказов, графики смен. Здесь нужен доступ к системе и ответ из неё, а не поиск по файлам. Задача решаемая, но это другой проект.
Частые вопросы
Чем это отличается от обычного поиска по документам?
Обычный поиск отдаёт файлы: сорок совпадений, дальше читайте сами. Здесь приходит ответ на вопрос и ссылка на документ, из которого он взят. Разница видна на объёме: когда документов сотни и половина из них в сканах, обычный поиск не помогает вовсе. Оговорка честная: если у вас один файл на двадцать страниц, разницы не будет никакой.
Откуда система знает, какой документ актуален?
Не знает. Знает человек, который проставил у документа дату и владельца, а на старой версии пометку «отменено». Система работает с тем, что ей дали: найдёт и действующий регламент, и отменённый, и покажет оба с одинаковой уверенностью. Поэтому раздел про ответственных за актуальность в этой статье длиннее, чем раздел про технологию.
Что будет, если она ответит неправильно?
Ответ всегда идёт со ссылкой на источник, поэтому ошибку видно за один клик: открыли документ, сверили. Причина ошибки обычно не в модели, а в документах - две редакции регламента противоречат друг другу, и система процитировала ту, что нашлась. Такие случаи полезны: они показывают, где в базе беспорядок, о котором до запуска никто не знал.
Сотрудники увидят то, что им не положено?
Только если права настроены плохо. Проверка идёт на стороне системы-источника: нет доступа к папке - нет ответа по её содержимому. Часть документов в индекс не попадает вовсе, и это отдельное решение при запуске: кадровые дела, персональные данные, договоры с условиями. По персональным данным дополнительно действуют требования 152-ФЗ. Инструкцией в промпте эта задача не закрывается ни при каком качестве формулировки.
Нам хватит готовой платформы?
В большинстве случаев да, и говорю я это как подрядчик, который платформы не продаёт. Если документы собраны в одном месте, лежат текстом и доступ у всех примерно одинаковый - берите коробку, это быстрее и дешевле. Своё решение оправдано, когда источников несколько, часть данных живёт в 1С и CRM, документы в сканах или контур закрытый. Развилка целиком - в таблице выше.
Сколько времени занимает и сколько стоит?
Зависит от состояния документов, числа источников и того, нужны ли действия в системах помимо ответов. Порядок работ, сроки и цена разобраны на отдельной странице - внедрение RAG в компании. Здесь сумм нет намеренно: называть цифру до разбора того, что у вас лежит в папках, было бы угадыванием.
Что дальше
Начинать стоит не с выбора платформы, а с ответа на два вопроса: где сейчас лежат знания и кто будет отвечать за их актуальность. Если ответа на второй нет, любая система через полгода станет складом отменённых документов.
Разобрать это можно на бесплатном разборе: 30 минут, смотрим, что у вас за документы и какие вопросы к ним задают, называю, где ИИ-поиск даст результат, а где хватит порядка в папках. Написать можно в Telegram или на почту hi@za-ai.ru.