Загрузка
Загружаем соревнования
Администратор немалоизвестного Telegram-канала готовил очередной урок по кластеризации. Чтобы ученики могли не только читать теорию, но и страдать на практике, он сгенерировал датасет, содержащий ровно 8 хорошо определённых кластеров, и собирался провести по нему небольшое соревнование.
Однако о готовящемся соревновании узнал администратор @vsosh_ai_gym. Испугавшись появления конкурента, он тайно получил доступ к датасету и решил его испортить. Что именно он сделал с данными — неизвестно. На все вопросы подозреваемый отвечает, что «просто немного улучшил feature engineering».
Известно лишь следующее:
KMeans(n_clusters=8), применённые непосредственно к предоставленным данным, работают подозрительно плохо.Администратор канала сохранил список объектов, но не успел сохранить их исходные метки.
Ваша задача — восстановить принадлежность каждого объекта к одному из восьми исходных кластеров. Нумерация кластеров произвольна.
В train.csv находятся id и 50 числовых признаков feature_00–feature_49. Данные содержат 3200 объектов. Для каждого id из входной таблицы укажите номер кластера в CSV с колонками id,cluster. Каждый объект должен встретиться ровно один раз; используйте ровно 8 разных меток. Образец — sample_submission.csv.
Решения оцениваются по adjusted Rand index (ARI). Метрика сравнивает разбиения без привязки к номерам кластеров: перестановка номеров не меняет результат. Чем выше ARI, тем лучше.
P. S. Сам подозреваемый утверждает, что все восемь кластеров по-прежнему находятся прямо перед вами. Нужно лишь правильно на них посмотреть.