Проблема
Бренды уже сейчас формируют спрос через ответы ChatGPT, Perplexity и Яндекс Нейро. Но измерить это нельзя «вручную»: LLM недетерминирована — спросите десять раз, получите десять разных ответов. Классические SEO-метрики позиций здесь не работают: нужна новая методология и новые метрики.
Что я сделал
Спроектировал 4-этапный пайплайн — каждый этап решает свою часть недетерминированности:
- Discovery. Авто-генерация семантического ядра вопросов к LLM и автоопределение конкурентов бренда — без ручного составления списков.
- Harvest. Асинхронная массовая отправка промптов в LLM: каждый вопрос задаётся N раз, чтобы получить распределение, а не случайный одиночный ответ.
- Calibration. Нормализация сырых ответов: кластеризация написаний брендов (опечатки, транслит), смысловая кластеризация тем.
- Judge & Analytics. Разбор ответов второй моделью (LLM-as-a-Judge) с приведением к строгой схеме — из свободного текста получаются верифицируемые метрики.
Метрики продукта: Share of Voice (доля упоминаний), Demand Reach (охват на спросе), Battle Matrix (топ-бренды × смысловые категории), Sentiment (−1…+1) и флаг «нейросеть рекомендует».
Результаты
- PRD v1.0 MVP защищён; реализация подтверждена — пайплайн строится в продакшн-инфраструктуре.
- Методология пережила главный тест: расхождение итераций LLM перестало быть шумом и стало измеримой дисперсией.
- Архитектура переиспользуется в GenAI-аналитике платформы — ядро сбора и калибровки общее.
Чему научился
- LLM-as-a-Judge — не «магия ИИ оценивает ИИ», а схема валидации: строгий формат на выходе, контрольные выборки, ручная разметка для сверки.
- Недетерминированность — не баг, а предмет измерения: один ответ бесполезен, распределение — продукт.
- В RnD-продукте честный статус «на этапе внедрения» дороже ретуши: доверие к аналитике — главный актив.
Стек: Qwen3 (inference), judge-модель для валидации и приведения к схеме, асинхронные очереди сборов.