Загрузка
Загружаем соревнования
Сон, телефон, соцсети, кофе, физическая активность и количество уведомлений могут влиять на то, насколько человек чувствует себя уставшим.
Ваша задача — построить модель искусственного интеллекта, которая по характеристикам пользователя предсказывает его уровень умственной усталости.
Целевая переменная — mental_fatigue_score.
Чем точнее ваша модель предсказывает уровень умственной усталости, тем выше вы окажетесь в рейтинге.
Вам предоставлены следующие файлы:
train.csv — обучающая выборка. Содержит признаки пользователей и целевую колонку mental_fatigue_score.test.csv — тестовая выборка. Содержит признаки пользователей, но mental_fatigue_score в ней скрыт.sample_submission.csv — пример правильного формата файла с предсказаниями.baseline.ipynb — простой стартовый пример решения.Колонка | Что означает |
|---|---|
| Уникальный идентификатор пользователя |
| Возраст пользователя |
| Пол пользователя |
| Род занятий |
| Среднее время перед экраном в день, часов |
| Использование телефона перед сном, минут |
| Продолжительность сна, часов |
| Оценка качества сна |
| Количество чашек кофеина в день |
| Физическая активность, минут в день |
| Количество получаемых уведомлений в день |
| Уровень стресса |
| Уровень умственной усталости — целевая переменная |
💡
user_id— это только идентификатор пользователя. Не используйте его как обычный признак для обучения модели.
Основная метрика соревнования — MAE (Mean Absolute Error).
MAE — это средняя абсолютная ошибка модели. Она показывает, насколько в среднем предсказания отличаются от настоящих значений.
Формула:
MAE = сумма |настоящее значение − предсказание| / количество предсказаний
Или в математической записи:
MAE = (1 / N) × Σ |yᵢ − ŷᵢ|
где:
N — количество объектов;yᵢ — настоящее значение mental_fatigue_score;ŷᵢ — предсказанное значение.Чем меньше MAE, тем лучше модель.
Например, если ваша модель получила:
MAE = 0.75
это означает, что в среднем её предсказание отличается от настоящего значения примерно на 0.75 балла.
Тестовая часть разделена на две части: Public и Private, примерно 50 на 50.
Public — открытая часть тестовой выборки. Во время соревнования именно по ней рассчитывается видимый score в рейтинге.
Private — скрытая финальная часть тестовой выборки. Во время соревнования её результаты не показываются.
После окончания соревнования итоговый результат участников будет рассчитан именно на Private.
Такое разделение нужно, чтобы участники не подгоняли свои решения только под видимую часть теста.
🏆 Хорошая модель должна не запоминать данные, а уметь делать точные предсказания для новых пользователей.
Перед обучением модели внимательно изучите данные.
В датасете есть разные типы признаков:
age, sleep_duration_hours, daily_screen_time_hours;gender и occupation.Попробуйте самостоятельно выяснить:
Для исследования данных можно использовать таблицы, графики и корреляции.
🔎 Не спешите выбирать самую сложную модель. Иногда правильная подготовка данных и хороший анализ дают больший прирост качества, чем сложный алгоритм.
Файл с предсказаниями должен содержать две колонки:
user_id — идентификатор пользователя из test.csv;mental_fatigue_score — предсказанный уровень умственной усталости.Пример:
user_id,mental_fatigue_score
0,4.52
1,3.17
2,6.81
3,5.24