Источники данных
Источники данных
Источник — это документ, файл, страница или внешний URL, по которому Sensei отвечает на вопросы. У одного пространства может быть несколько источников разного типа: при поиске учитываются все одновременно, ответ цитирует конкретные фрагменты.
Поддерживаемые типы
| Тип | Когда подходит |
|---|---|
| Yandex Wiki | Корпоративная wiki. Подключается через OAuth — Sensei видит только разрешённые странички. |
| Локальный файл (TXT / MD / DOCX / PDF / XLSX / CSV) | Документация, регламенты, выгрузки Q&A. Файл загружается через UI и хранится в Sensei. |
| Внешний URL (HTML-страница / текст / таблица) | Публично доступная страница на вашем сайте, корпоративный FAQ, экспорт из стороннего сервиса. |
| Google Drive (Sheet / Doc / PDF / XLSX / DOCX / CSV / TXT / MD) | Файлы, лежащие на корпоративном Google-аккаунте. Выбор файла — через стандартный Google Picker. |
Внутри одного пространства источники можно комбинировать: например, основная wiki + таблица с историей обращений.
Yandex Wiki
Требуется привязать подключение к организации:
- Администрирование → Подключения → Новое подключение.
- Выберите «Подключиться через Яндекс» — пройдёте стандартный OAuth-flow.
- Sensei сохранит refresh-токен и будет автоматически продлевать доступ; токен зашифрован в БД.
При добавлении wiki-источника укажите подключение и (опционально) префикс пути в wiki — Sensei проиндексирует только страницы под этим префиксом.
Локальные файлы
При создании источника типа Локальный файл UI откроет загрузку. Поддерживаются:
- TXT / MD — индексируются как один документ с разбивкой на чанки.
- DOCX — текст вытягивается из тела документа (без сносок и колонтитулов).
- PDF — текстовый слой; OCR не выполняется (отсканированные документы без распознанного текста не подходят).
- XLSX / CSV — табличные источники с явным указанием колонки вопроса и ответа. Полезно для FAQ-таблиц и истории обращений.
Файл хранится в Sensei; его можно повторно скачать или удалить через UI.
Внешние URL
Один URL = один индексируемый «документ». Поддерживаются три подтипа:
- HTML-страница — Sensei вырезает шапку/футер/навигацию и оставляет основное содержимое (
<main>/<article>/<body>). - URL с обычным текстом — markdown, txt и подобные форматы.
- URL с таблицей — XLSX/CSV, лежащий по публичному URL.
Доступны только публичные URL (без авторизации); SPA-страницы без серверного рендера не индексируются.
Google Drive
- Создайте подключение Google через Администрирование → Подключения.
- При добавлении источника откроется стандартный Google Picker — выберите конкретный файл.
- Sensei получит доступ только к выбранному файлу через scope
drive.file.
Поддерживаются Google Sheet / Doc и обычные xlsx, docx, pdf, txt, md, csv размером до 10 МБ.
Расписание синхронизации
Для каждого источника задаётся расписание автообновления:
- Выключено — только ручной запуск кнопкой «🔄 Синхр.».
- Каждый час, каждые 6 часов, ежедневно 03:00 UTC.
- Custom-cron — пятипольный POSIX cron в UTC.
Sensei умеет дельта-синхронизацию: при следующем обновлении источник пересчитывается только если изменился (по ETag / Last-Modified или хешу содержимого). Без изменений индекс не трогается — экономия времени и места.
Настройки поиска per-источник
На карточке источника можно задать промпт-пресет — стиль формирования ответа. Например, для wiki — «общий ответ из документации», для таблицы тикетов — «короткий ответ как в техподдержке». Подробно: Промпт-пресеты.
Что ещё посмотреть
- Режимы ответа — как комбинируются результаты нескольких источников.
- С чего начать — короткий путь от регистрации до первого ответа.
- Частые вопросы — лимиты, конфиденциальность, удаление.