RAG-демо · уход и добавки

Отвечает по источникам,
а не по догадкам

Спросите про уход снаружи или добавки внутрь. Система сама решит, хватит ли одного поиска, и покажет, откуда взяла каждый факт.

Маршрут выбирается под вопрос: direct, single или multi
Ответ по источникам
Чем подтверждён

Информационное демо, не медицинская консультация.

О продукте

Это демонстрация RAG-консультанта для бьюти-ниши. Он отвечает на вопросы про уход снаружи и добавки внутрь — и делает то, чего не делает обычный чат-бот: показывает источник каждого утверждения и честно говорит «в источниках этого нет», когда ответа в базе действительно нет.

Главное здесь — не текст ответа, а маршрут. Простому вопросу хватает одного обращения к базе; вопросу вида «сочетается ли одно с другим» нужно несколько, потому что факты лежат в разных записях и их надо свести. Систему, которая выбирает маршрут сама, называют adaptive RAG — схема сверху показывает реальный путь вашего запроса, а не заготовленную картинку.

24
записи базы знаний: EFSA, NHS, SCCS, FDA — с прямыми ссылками на документы
9
конфигураций моделей сравнили замерами, прежде чем выбрать рабочую
0
нарушений безопасности на 40 тестовых вопросах, включая провокационные
Как устроено внутри: архитектура, модели, замеры качества

Маршрутизация. Отдельный дешёвый вызов классифицирует вопрос до поиска: direct — ответ без базы, single — один поиск, multi — 2–3 подзапроса со сведением фактов, blocked — вопрос за пределами демо (диагноз, рецептурное).

Поиск. Гибридный: плотные векторы (multilingual-e5-base, общий сервис эмбеддингов) плюс лексический поиск, слияние RRF. Порог отсечения откалиброван на своём корпусе — перенесённый из соседнего проекта пропускал почти всё.

Safety. Предфильтр на пять категорий до вызова модели плюс постфильтр: проверяет, что дозировки и ссылки в ответе действительно есть в найденных записях. Выдуманную дозу ответ не переживает.

Как выбирали модель. Девять конфигураций на 40 размеченных вопросах, по три прогона каждая, с замером собственного шума — иначе разницу между моделями не отличить от разброса повторов.

конфигурациямаршрутцитаты$/вопрос
qwen-flash (рабочая)0.966 / 0.9830.9530.00020
qwen3.8-max (топовая)0.9230.8730.00507
qwen-plus0.9490.9270.00121
локальная Qwen3.6-35B0.8970.9330

Главный вывод замеров: топовая модель за цену в 25 раз выше проигрывает дешёвой — и проигрывает именно на маршруте, самоуверенно решая, что хватит одного поиска. Качество ответа упирается не в размер модели, а в то, что ей принесли из базы.

Политика конфиденциальности

Демо не просит и не хранит персональные данные. Текст вопроса уходит в модель Alibaba Cloud Model Studio (регион Singapore) — только чтобы сформировать ответ; веб-поиск у провайдера выключен. Мы записываем обезличенные технические логи (время, длительность, маршрут) для диагностики и не связываем их с личностью. Не вводите здесь медицинские и другие персональные сведения: демо для этого не предназначено. Вопросы — valet202247@gmail.com.