В этом разделе описаны все доступные файлы и структура данных. Соревнование включает в себя 5 файлов, часть из которых содержит тренировочные данные и метки (train.json, ytrain.csv), а часть – тестовые (test.json, ytest.csv). Также приложен пример сабмита (sample_submission.csv). Ниже приведено краткое описание каждого файла.
1. train.json
- Формат: JSON
- Содержит тренировочные диалоги. Ключи верхнего уровня – это идентификаторы диалогов (dialog_id). Для каждого диалога хранится массив реплик (message), каждая из которых содержит:
- text — текст сообщения
- message — номер реплики
- participant_index — индекс участника диалога (0 или 1)
- Используется совместно с ytrain.csv, где указано, кто является ботом.
2. ytrain.csv
- Формат: CSV
- Содержит метки (is_bot) для каждого участника диалога в train.json.
- Столбцы:
- dialog_id — идентификатор диалога (совпадает с ключом в train.json)
- participant_index — индекс участника (0 или 1)
- is_bot — метка (0 = человек, 1 = бот)
3. test.json
- Формат: JSON
- Аналогична структуре train.json, но содержит тестовые диалоги без меток. Ключи верхнего уровня – это dialog_id. Каждому диалогу соответствует список реплик с text, message и participant_index.
- Используется совместно с ytest.csv.
4. ytest.csv
- Формат: CSV
- Содержит идентификаторы и participant_index для тестовых записей, чтобы связать каждую запись test.json с полем ID, по которому нужно сделать предсказание.
- Столбцы:
- dialog_id — идентификатор диалога
- participant_index — индекс участника
- ID — комбинированное поле (dialog_id_participantIndex), которое используется в сабмите
5. sample_submission.csv
- Формат: CSV
- Пример правильного оформления файла сабмита, содержит столбцы:
- ID — идентификатор в формате dialog_id_participantIndex
- is_bot — пример вероятности (или скалярной оценки), что участник является ботом
- Для итогового сабмита вам нужно заполнить колонку is_bot своими предсказаниями.
Обратите внимание, что для формата предсказаний в соревновании требуется вывести вероятность, а не бинарную метку (подробности – в разделе Evaluation).