Гайд

База знаний для ИИ-бота в Telegram: чем её кормить (2026)

Восемь типов источников, сколько стоит приём каждого и почему, что происходит между загрузкой и первым ответом и почему список пробелов важнее загрузки.

AdminHub

Коротко. База знаний отвечает ровно настолько, насколько в ней есть ответ, и ни словом дальше, — но это только половина того, на что опирается ассистент; вторая половина это живые данные вашего магазина. AdminHub принимает восемь видов источников — от обхода сайта до голосовой заметки — и берёт за каждый по-разному, потому что работа разная: 5 кредитов за вставленный текст, 30 за PDF, 5 за каждую начатую минуту аудио, ноль за CSV, который у вас уже есть. Всё, что вытащил ИИ, ждёт проверки перед включением. А хорошей база будет через полгода не из-за загрузки, а из-за списка пробелов, куда автоматически падает каждая передача диалога человеку.

Почти любая статья про «обучи бота на своих данных» заканчивается одним и тем же: загрузите файл, дождитесь полоски, бот теперь знает. Ровно на этом лёгкая половина и заканчивается.

У базы есть честное свойство, которого не видно на экране загрузки: вопросы, которые она не покрывает, невидимы. Вы находите их не в базе, а в тот момент, когда клиент спросил и в ответ не пришло ничего полезного. Поэтому статья — про саму базу: чем её кормить, что происходит с материалом внутри и почему незакрытые вопросы дороже закрытых. Одно стоит знать до старта: база — не единственный источник ассистента. Статус заказа, трек, записи клиента, каталог и часы работы читаются живьём из вашего магазина, и записи под них не нужны. Про то, как ассистент ведёт себя в живом диалоге, есть отдельный разбор — ИИ-поддержка клиентов в Telegram.

Восемь вещей, которыми её можно кормить

ИсточникДля чегоЦена приёма
СайтОбходит до 10 страниц одного домена15 кредитов
Вставленный текстПравила, которые копируются одним куском5 кредитов
CSVПары, которые у вас уже записаныбесплатно
PDFИнструкции, условия, спецификации30 кредитов
DOCXТо же самое, но в Word30 кредитов
Видео с YouTubeРазбор, который вы один раз записали10 кредитов
Голосовой файлОтветы, которые живут только у вас в голове5 кредитов за начатую минуту
Ручная записьТот самый ответ, который вы перепечатываетебесплатно

CSV и ручные записи бесплатны, потому что ничего не генерируется — пары уже написаны. Всё остальное прогоняется через модель, которая читает материал и вытаскивает из него пары вопрос-ответ; за этот проход вы и платите.

Приём страниц Notion написан, но не включён: он требует отдельной интеграции, которая пока не подключена, и плитка появляется в приложении только вместе с ней. До тех пор выгрузите страницу и вставьте её текстом.

Потолки одинаковы для всех источников: обход идёт максимум по 10 страницам, любой единичный приём читает около 30 000 токенов и останавливается, PDF и DOCX ограничены 10 МБ, голос — 25 МБ и 30 минутами. Инструкция на 400 страниц целиком не влезет — и не должна, потому что нужных клиенту страниц там от силы шесть.

Цены разные, потому что работа разная

Это не прайс с тарифами, а форма самой работы, которая проступает наружу.

Вставленный текст — 5 кредитов и обычно несколько сотен слов. PDF — 30, и не потому, что документы премиальные, а потому что документ способен занять весь входной потолок. Проход извлечения тот же самый, а текста в него заходит в десятки раз больше.

Голос — единственный источник с ценой по длительности, 5 кредитов за каждую начатую минуту, потому что это единственный случай, когда до чтения нужен целый лишний шаг: запись сначала расшифровывается, а стоимость расшифровки зависит от длины и больше ни от чего. Десять минут голоса — 50 кредитов; то же содержимое, вставленное текстом, — 5. Это не штраф за разговор, а цена дополнительного шага.

YouTube стоит 10 — посередине: аудио не обрабатывается вовсе, опубликованная расшифровка забирается как текст, но расшифровки длинные. Сайт стоит 15, потому что добавляет внешний обход до всякого извлечения.

На бесплатном тарифе — один источник и 30 кредитов в месяц — один PDF съедает месяц целиком. Если ваши ответы где-то уже записаны, CSV стоит ноль. Загрузить каталог на 100 страниц просто потому, что этот файл лежал на рабочем столе, — самый дорогой способ получить те же шесть ответов.

Что происходит между загрузкой и первым ответом

Извлечение. Материал читается и превращается в пары вопрос-ответ, каждая помечается как общий вопрос, описание товара, правило или прочее. Это перевод, а не копия: документ на 40 страниц вполне может дать одиннадцать пар.

Проверка. Всё, что вытащил ИИ, приходит неактивным и ложится в очередь на проверку — до вашего одобрения оно никому не отвечает. Единственное исключение — CSV, на том основании, что эти пары написали вы сами.

Дедупликация. Пары, чей вопрос уже есть, тихо отбрасываются на входе. Отдельно поиск дублей показывает уже живые записи, схожие по смыслу на 0,85 и выше, — тех самых близнецов, которых точное совпадение не ловит: одно и то же правило доставки, приехавшее дважды в разных формулировках.

Индексация. Одобренные записи встают в очередь на векторизацию, и воркер разбирает её пачками каждые 15 секунд. Именно этот шаг заставляет поиск работать по смыслу, а не по словам, и на любом языке: «когда придёт» находит запись про доставку, где такой фразы нет вовсе, а вопрос на одном языке находит запись, написанную на другом.

Подбор. Когда клиент пишет, перед моделью кладут 5 ближайших записей, а не всю базу. Если человек посреди диалога сменил тему, ассистент может сделать ещё один точечный поиск и добрать до 5 записей.

Отсюда два следствия. Пишите записи так, чтобы каждая держалась сама: ответ, который понятен только рядом с соседним, часто приедет без соседа. И большая база не значит хорошая: среди 300 расплывчатых записей нужным пяти всплыть труднее, чем среди 60 точных.

Чему в базе делать нечего

Самая дорогая ошибка здесь — не плохая загрузка, а попытка записать то, что ассистент и так умеет посмотреть.

Статус заказа, состояние оплаты, способ доставки, трек-номер, история заказов клиента, его ближайшие записи, свободные слоты под услугу, что сейчас есть в каталоге и какие у вас часы работы — всё это читается живьём из вашего магазина в момент вопроса. Запись «заказ 312 уедет в пятницу» протухает, как только пятница прошла. Ассистент умеет ещё отменить запись и принять просьбу перезвонить — и то, и другое только после того, как клиент нажмёт подтверждение; в базу для этого тоже ничего писать не нужно.

Значит, база отрабатывает своё на всём, чего карточка удержать не может: срок возврата и исключения из него, как на самом деле устроена доставка, что будет, если посылку не забрали, чем два похожих товара отличаются, сохраняется ли гарантия при перепродаже.

Список пробелов — то, что накапливается

Вот механизм, до которого статьи в жанре «загрузил и готово» не доходят. Когда ассистент не может уверенно ответить по базе, он не импровизирует. Он передаёт диалог человеку — и записывает строку в список пробелов. Каждая передача, автоматически, в одном месте.

Что именно в этой строке, зависит от точки контакта: из чата в боте это короткая пометка самого ассистента о том, почему он сдался, не длиннее 200 символов; из чата Telegram Business — само сообщение клиента. В любом случае список читают ради повторов, а не ради отдельных формулировок.

Этот список — единственная честная карта того, чего базе не хватает, потому что пишут его реальные клиентские вопросы, а не ваши догадки о них. Никто заранее не угадает, что будут спрашивать, сохраняется ли гарантия при перепродаже. Но когда тема всплывает в пробелах третий раз, вы точно знаете, куда её дописать.

Недостающий ответ можно попросить набросать у ИИ — за 2 кредита. Он читает то, что уже есть в базе, и предлагает пару, опирающуюся на этот материал; вы одобряете или правите её перед публикацией. Когда материала на ответ не хватает, возвращается явное «здесь недостаточно» с причиной, а не выдумка.

То есть настоящий цикл такой: выкатить неполную базу, дать клиентам упереться в её края, закрыть те пробелы, которые повторяются. Месяц такой работы даёт базу, собранную под ваших реальных клиентов, а не под ваше представление о них.

Что извлечение отказывается записывать

Не-ответы отбрасываются сразу: «зависит от ваших пожеланий», «уточняйте у менеджера», «обсуждается индивидуально». Это текст, а не информация, и база из такого рождает ассистента, который звучит услужливо и не решает ничего.

Факты с коротким сроком годности пропускаются намеренно — конкретные цены, даты, наличие на сегодня. Они меняются, а база вместе с ними не меняется, и уверенно названная неверная цена вредит сильнее, чем отсутствие ответа.

И ничего, чего в материале нет буквально, записью не станет. Скормите рекламную страницу без фактов — получите очень мало пар или ноль. Это не сбой: на странице просто не было ничего, что можно сообщить клиенту.

Где это перестаёт быть подходящим инструментом

  • Это поиск, а не суждение. Ассистент читает ваши документы и карточки вашего магазина. Спросите то, где нужно суждение, а не поиск, — правильный исход это передача человеку, а не ответ.
  • Нет материала — нет ответа. Если факт нигде не записан и его нет ни в одной карточке, его не создаст ни один тип источника. Честно признать пробел — верное поведение, для этого список пробелов и существует.
  • Живые переговоры и спорные случаи требуют человека. Скидки, жалобы, всё, где ответ зависит от того, кто именно спрашивает.
  • Регулируемые темы — юридические, медицинские, финансовые. Их держите на ручном режиме осознанно. Приблизительный ответ там это риск, а не удобство.
  • Заброшенная база стареет. Источники не перечитывают себя сами: пересинхронизация — это кнопка, и она стоит тех же кредитов заново.

Что сделать сейчас

  • Начните с того, что уже написано. CSV бесплатен и включается сразу, без очереди на проверку.
  • Не записывайте то, что магазин уже знает. Статус заказа, трек, записи, слоты, часы работы и каталог читаются живьём.
  • Загрузите один источник, а не все сразу. Качество извлечения проще оценить на маленькой партии.
  • Читайте очередь проверки. Отклонить половину — нормальный, здоровый результат.
  • Смотрите пробелы раз в неделю. Этот список и есть ваш контент-план, написанный теми, кому вы продаёте.

Как ассистент пользуется этой базой в диалоге — вторая половина картины: ИИ-поддержка клиентов в Telegram. Продуктовый взгляд — на странице ИИ-поддержки; а если клиентских вопросов пока нет, начните с как продавать в Telegram.

Что обычно спрашивают

Чем можно наполнить базу знаний, кроме текстового файла?
Источников восемь: обход сайта, вставленный текст, CSV с готовыми парами вопрос-ответ, PDF, DOCX, видео на YouTube, голосовая запись и записи, которые вы вводите руками.
Почему приём PDF стоит дороже, чем вставка текста?
Потому что работа разная. Вставленный текст — это 5 кредитов и обычно несколько сотен слов, а PDF или DOCX — 30, потому что документ способен занять весь потолок в 30 000 токенов. Голос стоит 5 кредитов за каждую начатую минуту, ведь аудио сначала нужно расшифровать. CSV с готовыми парами не стоит ничего: модель по нему не работает.
Извлечённые ответы сразу начинают отвечать клиентам?
Нет. Всё, что вытащил ИИ, попадает в очередь на проверку и лежит неактивным, пока вы не одобрите. Единственное исключение — CSV: эти пары включаются сразу, потому что вы написали их сами.
Что происходит, когда клиент спрашивает то, чего в базе нет?
Ассистент не выдумывает. Он передаёт диалог человеку, а в список пробелов падает строка, чтобы вы видели, где база заканчивается, и закрыли это. Из чата в боте эта строка — короткая пометка самого ассистента о том, почему он сдался; в Telegram Business там сохраняется само сообщение клиента.
Нужна ли запись под каждый вопрос, даже про статус заказа?
Нет, и это самая частая лишняя работа. Живые данные магазина ассистент читает сам: статус заказа и трек, заказы и записи клиента, каталог, свободные слоты, часы работы. База нужна для того, чего нет ни в одной карточке: правила возврата, как устроена доставка, чем один товар отличается от другого.