Собесов

DataLearn ML-101: Кодирование категориальных фичей

ML / Data ScienceFeature engineeringСредняяMiddle

Условие

В датасете есть категориальные фичи разной природы:

  • city — 5000 уникальных значений;
  • device_type — 4 значения (mobile/tablet/desktop/tv);
  • user_segment — 10 значений с порядком (S → M → L → XL);
  • product_id — 1М уникальных;
  • referrer_domain — 50К уникальных, длинный хвост.

Выберите способ кодирования для каждой фичи под (а) логистическую регрессию; (б) градиентный бустинг (CatBoost/LightGBM). Объясните выбор и риски.

Хочешь увидеть разбор?

Зарегистрируйся бесплатно — откроется развёрнутое решение этой задачи и ещё 4 на выбор.

Зарегистрироваться и увидеть разбор
Уже есть аккаунт? Войти