Проблема
Службам мониторинга репутации и SEO-командам нужно понимать тональность тысяч страниц: позитив, негатив, нейтрально. Ручная разметка не масштабируется, а объёмы растут. Задача — классика NLP: бинарно-знаковая оценка тональности на потоке документов.
Что я сделал
- Управлял продуктом на стыке ролей Project Manager и Product Manager: от постановки ML-задачи до интеграции результатов в рабочие процессы.
- Выстроил цикл «модель → разметка → дообучение»: точность модели подтверждалась контрольными выборками, а не ощущениями.
- Довёл продукт до промышленной эксплуатации: потоковая обработка URL как сервис, а не разовый эксперимент.
Результаты
- 20 000+ URL в месяц обрабатывается автоматически.
- Точность ~80% — уровень, при котором разметка людей остаётся только для спорных случаев.
- Запуск состоялся в 2024 году — за год до массового LLM-хайпа: это был осознанный ML-продукт, а не «прикрутили нейросетку».
Чему научился
- Экономика ML-продукта решает всё: точность 80% с автоматизацией 100% потока выгоднее 95% точности с ручной проверкой половины.
- «Классический» ML и LLM — это один континуум: понимание первого делает зрелым во втором. От SERAM до GenAI-аналитики — одна траектория.
- Продуктом NLP делает не модель, а конвейер качества: выборки, контроль, дообучение.
Стек: NLP, sentiment-классификация, потоковая обработка документов.