AI Brand Visibility Tracker

Как измерить упоминания бренда в LLM, если один и тот же вопрос нейросеть каждый раз отвечает по-разному? Спроектировал продукт с честной статистикой: N итераций на запрос, калибровка написаний и LLM-as-a-Judge для разбора ответов.

Роль
Автор PRD v1.0, продуктовая архитектура
Статус
На этапе внедрения — говорю честно
Модели
Qwen3 (inference) · judge-модель для валидации
Тип
RnD → MVP

Проблема

Бренды уже сейчас формируют спрос через ответы ChatGPT, Perplexity и Яндекс Нейро. Но измерить это нельзя «вручную»: LLM недетерминирована — спросите десять раз, получите десять разных ответов. Классические SEO-метрики позиций здесь не работают: нужна новая методология и новые метрики.

Что я сделал

Спроектировал 4-этапный пайплайн — каждый этап решает свою часть недетерминированности:

  • Discovery. Авто-генерация семантического ядра вопросов к LLM и автоопределение конкурентов бренда — без ручного составления списков.
  • Harvest. Асинхронная массовая отправка промптов в LLM: каждый вопрос задаётся N раз, чтобы получить распределение, а не случайный одиночный ответ.
  • Calibration. Нормализация сырых ответов: кластеризация написаний брендов (опечатки, транслит), смысловая кластеризация тем.
  • Judge & Analytics. Разбор ответов второй моделью (LLM-as-a-Judge) с приведением к строгой схеме — из свободного текста получаются верифицируемые метрики.

Метрики продукта: Share of Voice (доля упоминаний), Demand Reach (охват на спросе), Battle Matrix (топ-бренды × смысловые категории), Sentiment (−1…+1) и флаг «нейросеть рекомендует».

Результаты

  • PRD v1.0 MVP защищён; реализация подтверждена — пайплайн строится в продакшн-инфраструктуре.
  • Методология пережила главный тест: расхождение итераций LLM перестало быть шумом и стало измеримой дисперсией.
  • Архитектура переиспользуется в GenAI-аналитике платформы — ядро сбора и калибровки общее.

Чему научился

  • LLM-as-a-Judge — не «магия ИИ оценивает ИИ», а схема валидации: строгий формат на выходе, контрольные выборки, ручная разметка для сверки.
  • Недетерминированность — не баг, а предмет измерения: один ответ бесполезен, распределение — продукт.
  • В RnD-продукте честный статус «на этапе внедрения» дороже ретуши: доверие к аналитике — главный актив.

Стек: Qwen3 (inference), judge-модель для валидации и приведения к схеме, асинхронные очереди сборов.