Автор статьи на Хабре прогнал запросы через несколько языковых моделей, чтобы посчитать долю негативных ответов о конкретной компании. Из 358 ответов негативными оказались три — это 0,8%. Цифра выглядела спокойной, и автор чуть не отправил её в отчёт без дополнительной проверки. При разборе выяснилось, что все три негативных ответа относились к другой компании.

Ошибка возникла на этапе разметки тональности: формально метрика была посчитана верно, но содержательно не отражала отношение моделей к изначально выбранной организации. Для аналитики репутации и мониторинга бренда такой сбой легко проходит незамеченным, если не сверять выборки вручную.

Практический вывод — перед публикацией отчётов по тональности ИИ стоит проверять не только итоговый процент, но и сами негативные ответы. Автоматическая разметка без выборочного чтения может дать уверенную, но неверную картину.