Загрузка
Загружаем соревнования
В этом соревновании вам предстоит оценить стоимость домов по их характеристикам. Здесь важна не только модель, но и качество работы с данными: таблица специально содержит пропуски, выбросы, дубликаты и небольшие нарушения формата.
Главный вопрос соревнования:
насколько хорошо ваша модель обобщает информацию о доме и сохраняет качество на новых, немного «неидеальных» данных?
Постройте регрессионную модель, которая предсказывает price для объектов из test.csv.
train.csv содержит признаки и правильные значения price;test.csv содержит те же признаки, но без price;id и price.Основная метрика соревнования — MSE (mean squared error, средняя квадратичная ошибка). Чем меньше значение, тем лучше результат.
Формула:
Большие ошибки получают больший штраф, поэтому выбросы особенно важны.
Файл | Назначение |
|---|---|
| обучающая выборка с колонкой |
| тестовая выборка без |
| шаблон отправки |
| простой воспроизводимый baseline |
В sample_submission.csv сохранены правильные имена колонок и порядок строк. Используйте его как основу для собственной отправки.
Ожидаемый формат:
id,price
1728,492745.42
2951,412065.97id должен соответствовать объектам из test.csv, а price должен быть числовым и заполненным для каждой строки.
В таблице есть идентификатор, целевая переменная, характеристики домов и адресные признаки:
id);date);price);sqft_living, sqft_lot);bedrooms, bathrooms);floors, sqft_above, sqft_basement);condition);yr_built, yr_renovated);city, statezip, street);country);waterfront, view);irrelevant_code);living_area_m2, lot_area_acres).Не каждый столбец одинаково полезен. Часть признаков может дублировать друг друга или добавлять шум.
Начните с baseline.ipynb или собственного скрипта. Для первого решения достаточно:
train.csv и test.csv;submission.csv с колонками id и price.Сильное решение — это не обязательно самая сложная модель. Обычно выигрывает аккуратный процесс:
Удачи в соревновании и внимательного взгляда на данные: здесь качество подготовки — уже половина модели.