Гайд

База знань для ШІ-бота в Telegram: чим її годувати (2026)

Вісім типів джерел, скільки коштує приймання кожного і чому, що відбувається між завантаженням і першою відповіддю та чому список прогалин важливіший.

AdminHub

Коротко. База знань відповідає рівно настільки, наскільки в ній є відповідь, і ні словом далі, — але це лише половина того, на що спирається асистент; друга половина це живі дані вашого магазину. AdminHub приймає вісім видів джерел — від обходу сайту до голосової нотатки — і бере за кожен по-різному, бо робота різна: 5 кредитів за вставлений текст, 30 за PDF, 5 за кожну розпочату хвилину аудіо, нуль за CSV, який у вас уже є. Усе, що витягнув ШІ, чекає перевірки перед увімкненням. А доброю база стане через півроку не через завантаження, а через список прогалин, куди автоматично падає кожна передача діалогу людині.

Майже будь-яка стаття про «навчи бота на своїх даних» закінчується однаково: завантажте файл, дочекайтеся смужки, бот тепер знає. Саме на цьому легка половина і завершується.

У бази є чесна властивість, якої не видно на екрані завантаження: питання, які вона не покриває, невидимі. Ви знаходите їх не в базі, а тієї миті, коли клієнт спитав і у відповідь не прийшло нічого корисного. Тому ця стаття — про саму базу: чим її годувати, що відбувається з матеріалом усередині і чому незакриті питання дорожчі за закриті. Одне варто знати до старту: база — не єдине джерело асистента. Статус замовлення, накладна, записи клієнта, каталог і години роботи читаються наживо з вашого магазину, і записи під них не потрібні. Про те, як асистент поводиться в живому діалозі, є окремий розбір — ШІ-підтримка клієнтів у Telegram.

Вісім речей, якими її можна годувати

ДжерелоДля чогоЦіна приймання
СайтОбходить до 10 сторінок одного домену15 кредитів
Вставлений текстПравила, які копіюються одним шматком5 кредитів
CSVПари, які у вас уже записанібезкоштовно
PDFІнструкції, умови, специфікації30 кредитів
DOCXТе саме, але у Word30 кредитів
Відео з YouTubeРозбір, який ви одного разу записали10 кредитів
Голосовий файлВідповіді, що живуть лише у вашій голові5 кредитів за розпочату хвилину
Ручний записТа сама відповідь, яку ви передруковуєтебезкоштовно

CSV і ручні записи безкоштовні, бо нічого не генерується — пари вже написані. Усе інше проганяється крізь модель, яка читає матеріал і витягає з нього пари питання-відповідь; саме за цей прохід ви й платите.

Приймання сторінок Notion написане, але не увімкнене: воно потребує окремої інтеграції, яка поки не підключена, і плитка з’являється в застосунку лише разом із нею. До того часу вивантажте сторінку і вставте її текстом.

Стелі однакові для всіх джерел: обхід іде щонайбільше по 10 сторінках, будь-яке одиничне приймання читає близько 30 000 токенів і зупиняється, PDF і DOCX обмежені 10 МБ, голос — 25 МБ і 30 хвилинами. Інструкція на 400 сторінок цілком не влізе — і не мусить, бо потрібних клієнтові сторінок там щонайбільше шість.

Ціни різні, бо робота різна

Це не прайс із тарифами, а форма самої роботи, що проступає назовні.

Вставлений текст — 5 кредитів і зазвичай кілька сотень слів. PDF — 30, і не тому, що документи преміальні, а тому що документ здатен зайняти всю вхідну стелю. Прохід витягання той самий, а тексту в нього заходить у десятки разів більше.

Голос — єдине джерело з ціною за тривалістю, 5 кредитів за кожну розпочату хвилину, бо це єдиний випадок, коли до читання потрібен цілий зайвий крок: запис спершу розшифровується, а вартість розшифрування залежить від довжини й більше ні від чого. Десять хвилин голосу — 50 кредитів; той самий зміст, вставлений текстом, — 5. Це не штраф за розмову, а ціна додаткового кроку.

YouTube коштує 10 — посередині: аудіо не обробляється зовсім, опублікована розшифровка забирається як текст, але розшифровки довгі. Сайт коштує 15, бо додає зовнішній обхід до будь-якого витягання.

На безкоштовному тарифі — одне джерело і 30 кредитів на місяць — один PDF з’їдає місяць цілком. Якщо ваші відповіді десь уже записані, CSV коштує нуль. Завантажити каталог на 100 сторінок лише тому, що цей файл лежав на робочому столі, — найдорожчий спосіб дістати ті самі шість відповідей.

Що відбувається між завантаженням і першою відповіддю

Витягання. Матеріал читається і перетворюється на пари питання-відповідь, кожна позначається як загальне питання, опис товару, правило або інше. Це переклад, а не копія: документ на 40 сторінок цілком може дати одинадцять пар.

Перевірка. Усе, що витягнув ШІ, приходить неактивним і лягає в чергу на перевірку — до вашого схвалення воно нікому не відповідає. Єдиний виняток — CSV, на тій підставі, що ці пари написали ви самі.

Дедуплікація. Пари, чиє питання вже є, тихо відкидаються на вході. Окремо пошук дублів показує вже живі записи, схожі за змістом на 0,85 і вище, — тих самих близнюків, яких точний збіг не ловить: одне й те саме правило доставки, що приїхало двічі в різних формулюваннях.

Індексація. Схвалені записи стають у чергу на векторизацію, і воркер розбирає її пачками кожні 15 секунд. Саме цей крок змушує пошук працювати за змістом, а не за словами, і будь-якою мовою: «коли прийде» знаходить запис про доставку, де такої фрази немає взагалі, а питання однією мовою знаходить запис, написаний іншою.

Добір. Коли клієнт пише, перед моделлю кладуть 5 найближчих записів, а не всю базу. Якщо людина посеред діалогу змінила тему, асистент може зробити ще один точковий пошук і добрати до 5 записів.

Звідси два наслідки. Пишіть записи так, щоб кожна трималася сама: відповідь, зрозуміла лише поряд із сусідньою, часто приїде без сусідки. І велика база не означає добра: серед 300 розпливчастих записів потрібним п’ятьом виринути важче, ніж серед 60 точних.

Чому в базі не місце

Найдорожча помилка тут — не погане завантаження, а спроба записати те, що асистент і так уміє подивитися.

Статус замовлення, стан оплати, спосіб доставки, номер накладної, історія замовлень клієнта, його найближчі записи, вільні слоти під послугу, що зараз є в каталозі і які у вас години роботи — усе це читається наживо з вашого магазину в мить питання. Запис «замовлення 312 поїде в п’ятницю» протухає, щойно п’ятниця минула. Асистент уміє ще скасувати запис і прийняти прохання передзвонити — і те, і те лише після того, як клієнт натисне підтвердження; у базу для цього теж нічого писати не треба.

Отже, база відпрацьовує своє на всьому, чого картка втримати не може: термін повернення і винятки з нього, як насправді влаштована доставка, що буде, якщо посилку не забрали, чим два схожі товари відрізняються, чи зберігається гарантія при перепродажу.

Список прогалин — те, що накопичується

Ось механізм, до якого статті в жанрі «завантажив і готово» не доходять. Коли асистент не може впевнено відповісти за базою, він не імпровізує. Він передає діалог людині — і записує рядок до списку прогалин. Кожна передача, автоматично, в одному місці.

Що саме в цьому рядку, залежить від точки контакту: із чату в боті це коротка позначка самого асистента про те, чому він здався, не довша за 200 символів; із чату Telegram Business — саме повідомлення клієнта. У будь-якому разі список читають заради повторів, а не заради окремих формулювань.

Цей список — єдина чесна мапа того, чого базі бракує, бо пишуть його справжні клієнтські питання, а не ваші здогади про них. Ніхто заздалегідь не вгадає, що питатимуть, чи зберігається гарантія при перепродажу. Але коли тема виринає у прогалинах утретє, ви точно знаєте, куди її дописати.

Відсутню відповідь можна попросити накидати у ШІ — за 2 кредити. Він читає те, що вже є в базі, і пропонує пару, що спирається на цей матеріал; ви схвалюєте або правите її перед публікацією. Коли матеріалу на відповідь бракує, повертається явне «тут недостатньо» з причиною, а не вигадка.

Тобто справжній цикл такий: викотити неповну базу, дати клієнтам упертися в її краї, закрити ті прогалини, що повторюються. Місяць такої роботи дає базу, зібрану під ваших реальних клієнтів, а не під ваше уявлення про них.

Що витягання відмовляється записувати

Не-відповіді відкидаються одразу: «залежить від ваших побажань», «уточнюйте в менеджера», «обговорюється індивідуально». Це текст, а не інформація, і база з такого народжує асистента, який звучить люб’язно і не вирішує нічого.

Факти з коротким терміном придатності пропускаються навмисно — конкретні ціни, дати, наявність на сьогодні. Вони змінюються, а база разом із ними не змінюється, і впевнено названа хибна ціна шкодить сильніше, ніж відсутність відповіді.

І нічого, чого в матеріалі немає буквально, записом не стане. Згодуйте рекламну сторінку без фактів — отримаєте дуже мало пар або нуль. Це не збій: на сторінці просто не було нічого, що можна повідомити клієнтові.

Де це перестає бути придатним інструментом

  • Це пошук, а не судження. Асистент читає ваші документи і картки вашого магазину. Спитайте те, де потрібне судження, а не пошук, — правильний результат це передача людині, а не відповідь.
  • Немає матеріалу — немає відповіді. Якщо факт ніде не записаний і його немає в жодній картці, його не створить жоден тип джерела. Чесно визнати прогалину — правильна поведінка, для цього список прогалин і існує.
  • Живі перемовини та спірні випадки потребують людини. Знижки, скарги, все, де відповідь залежить від того, хто саме питає.
  • Регульовані теми — юридичні, медичні, фінансові. Їх тримайте на ручному режимі свідомо. Приблизна відповідь там це ризик, а не зручність.
  • Занедбана база старіє. Джерела не перечитують себе самі: пересинхронізація — це кнопка, і вона коштує тих самих кредитів наново.

Що зробити зараз

  • Почніть із того, що вже написано. CSV безкоштовний і вмикається одразу, без черги на перевірку.
  • Не записуйте те, що магазин уже знає. Статус замовлення, накладна, записи, слоти, години роботи і каталог читаються наживо.
  • Завантажте одне джерело, а не всі одразу. Якість витягання простіше оцінити на маленькій партії.
  • Читайте чергу перевірки. Відхилити половину — нормальний, здоровий результат.
  • Дивіться прогалини раз на тиждень. Цей список і є ваш контент-план, написаний тими, кому ви продаєте.

Як асистент користується цією базою в діалозі — друга половина картини: ШІ-підтримка клієнтів у Telegram. Продуктовий погляд — на сторінці ШІ-підтримки; а якщо клієнтських питань поки немає, почніть із як продавати в Telegram.

Що зазвичай запитують

Чим можна наповнити базу знань, окрім текстового файлу?
Джерел вісім: обхід сайту, вставлений текст, CSV з готовими парами питання-відповідь, PDF, DOCX, відео на YouTube, голосовий запис і записи, які ви вводите руками.
Чому приймання PDF коштує дорожче, ніж вставка тексту?
Бо робота різна. Вставлений текст — це 5 кредитів і зазвичай кілька сотень слів, а PDF чи DOCX — 30, бо документ здатен зайняти всю стелю у 30 000 токенів. Голос коштує 5 кредитів за кожну розпочату хвилину, адже аудіо спершу треба розшифрувати. CSV з готовими парами не коштує нічого: модель по ньому не працює.
Витягнуті відповіді одразу починають відповідати клієнтам?
Ні. Усе, що витягнув ШІ, потрапляє в чергу на перевірку і лежить неактивним, доки ви не схвалите. Єдиний виняток — CSV: ці пари вмикаються одразу, бо ви написали їх самі.
Що відбувається, коли клієнт питає те, чого в базі немає?
Асистент не вигадує. Він передає діалог людині, а до списку прогалин падає рядок, щоб ви бачили, де база закінчується, і закрили це. Із чату в боті цей рядок — коротка позначка самого асистента про те, чому він здався; у Telegram Business там зберігається саме повідомлення клієнта.
Чи потрібен запис під кожне питання, навіть про статус замовлення?
Ні, і це найчастіша зайва робота. Живі дані магазину асистент читає сам: статус замовлення і накладну, замовлення та записи клієнта, каталог, вільні слоти, години роботи. База потрібна для того, чого немає в жодній картці: правила повернення, як влаштована доставка, чим один товар відрізняється від іншого.