Содержание
После каждого соревнования, читая описание решений, смотрите — что вы не сделали, что можно было сделать лучше, что вы упустили, ну или где вы конкретно лажанулись, как у меня случилось в Toxic. Шел достаточно хорошо, в подбрюшье золота, а на private улетел вниз на 1500 позиций. Обидно до слез… но успокоился, нашел ошибку, написал пост в слаке — и выучил урок. В том, что будет описано дальше, нет никакого know-how, все техники, методы и приемы — очевидны и предсказуемы, но это не умаляет их эффективности. По крайней мере, следуя им, автору удалось взять плашку Kaggle Competition Master за полгода и три соревнования в соло режиме и, на момент написания данной статьи, входить в top-200 мирового рейтинга Kaggle.

Kaggle— популярная платформа для соревнований по Data Science от Google. Ядра Kaggle – это, по сути, ноутбуки Jupyter в браузере. Изучение и чтение кода других Kagglers – это отличный способ изучить новые методы и оставаться вовлеченными в сообщество. Kaggle – это онлайн-сообщество Data Scientist’ов и специалистов по машинному обучению .
Для этого в правом верхнем углу наживаем кнопку Save version. После того, как блокнот сохранится, нажимаем на цифру возле этой кнопки. Теперь с помощью ансамбля решающих деревьев обучим нашу модель, сделаем предсказание для тестовой выборки и сохраним платформа Kaggle для новичка результат. Ансамбль решающих деревьев называется Random Forest. Заключается в том, чтобы обучить несколько алгоритмов и усреднять их предсказания. При таком количестве данных даже визуально можно оценить качество предсказанных данных.
Kaggle для начинающего дата-сайентиста: соревноваться нельзя учиться
Глядя на графики работы вашей модели, можно понять, как ее выходной результат зависит от различных признаков. Существует несколько подходов к призовым местам в соревнованиях Kaggle – все зависит от вашей цели. Первые два – это к онструирование признаков и нейронные сети. Разработка функций дает шанс, если вы понимаете данные изнутри, начиная с построения гистограмм.
Ну, еще раз — задача данного этапа наработать базу решений, методов и подходов. Чтобы в следующем соревновании вы не тратили время, а сразу сказали — ага, тут может зайти mean target encoding, и кстати, у меня и правильный код для этого через фолды в фолдах есть. Помнится тогда заходил ансамбль через scipy.optimize, а кстати у меня и код уже готов. Да, еще про python для тех, кто не программист — не бойтесь его. Ваша задача понять основные структуры кода и базовую суть языка, чтобы разобраться в чужих кернелах и написать свои библиотеки. В Сети много хороших курсов для начинающих, возможно в комментариях подскажут где именно.

Были такие расчеты, которые занимали до пяти дней, и ошибка в них могла бы стоить дорого. Такой способ усреднения был выбран потому, что F-мера принимает высокие значения, только когда обе метрики принимают высокие значения. Иными словами, если хотя бы одна из двух метрик близка к 0, F-мера тоже будет близка к 0. Это свойство не выполняется, например, для среднего арифметического из точности и полноты. В нашем примере, алгоритм выдал правильные ответы для комментариев 1,2,3,5, т.е. Для примера будет рассматривать задачу предсказания токсичности комментариев.
В статье есть две ссылки — на описание решения и код. Я узнал о конкурсе от своей подруги Иры Иваненко— она и предложила сформировать команду. Нам обоим было очень интересно узнать, как мы себя можем показать в соревновании такого уровня.
А значит, не нужно разворачивать свой проект с нуля, собирать и очищать данные. Сосредоточьтесь на поиске лучшего решения и исследовании алгоритмов. Вы можете загрузить дополнительные наборы данных со своего компьютера, из соревнований kaggle или из общедоступных ядер других Kagglers в свое ядро. Со дня основания и по сей день основная цель Kaggle — дать возможность организациям устроить конкурс на лучшие модели и алгоритмы.
Страница компании Kaggle в Википедии
Но, скорее всего, вы получите советы и поддержку опытных дата-сайентистов. На практике в Data Science для большинства задач (исследовательский анализ, очистка данных, A/B-тестирование, классические алгоритмы) уже есть проверенные решения и фреймворки. Каждый раз выдумывать что-то сложное и новое не требуется.

Datasets – различные наборы данных, с которыми можно поиграться. Kaggle – площадка, объединяющая соревновательную систему по исследованию данных, образовательный ресурс по искусственному интеллекту и машинному обучению, а также соцсеть специалистов в указанных областях. Наборы данных Kaggle — лучшее место для поиска, изучения и анализа открытых данных. Вы можете найти много разных интересных наборов данных типов и размеров, которые вы можете скачать бесплатно и отточить свои навыки. Вы можете искать соревнования по kaggle по категориям, и я покажу вам, как получить список «начинающих» соревнований для новичков, которые всегда доступны и не имеют срока . Эти простые проверки часто помогали мне в создании лучших моделей в реальных задачах и в Kaggle.
Метрики качества классификации
Место, где можно задавать вопросы и получать советы от тысяч ученых-исследователей в сообществе Kaggle. Научные конкурсыособые проблемы, которые являются более экспериментальными, чем показанные проблемы конкуренции. Они обычно не предлагают призы или баллы из-за их экспериментального характера. Kaggle Kernels — облачная среда разработки по типу Jupyter Notebook и является аналогом Google Colab.
Также курс отличается тем, что он проходит в действительно живом сообществе. Недавно (1 октября) стартовала новая сессия прекрасного курса по DS/ML (очень рекомендую в качестве начального курса всем, кто хочет, как это теперь называется, “войти” в DS). И, как обычно, после окончания любого курса у выпускников возникает вопрос — а где теперь получить практический опыт, чтобы закрепить пока еще сырые теоретические знания. Если вы зададите этот вопрос на любом профильном форуме, то ответ, скорее всего, будет один — иди решай Kaggle. Kaggle — это да, но с чего начать и как наиболее эффективно использовать эту платформу для прокачки практических навыков?
Главная польза — от двух домашних заданий, где надо проявить смекалку и побить бейзлайны в этих соревнованиях. Сам процесс занимает некоторое время, определяемое количеством эпох обучения, заданным при конструировании нейронной сети. На каждой эпохе обучения на экран будут выводиться (при заданном параметре verbose) значения loss и err (значение функции потерь и ошибка).
- Ядра Kaggle — это, по сути, ноутбуки Jupyter в браузере.
- Сосредоточьтесь на поиске лучшего решения и исследовании алгоритмов.
- Также курс отличается тем, что он проходит в действительно живом сообществе.
- Там загруженные результаты оцениваются на количество правильных прогнозов, и вы попадаете в лидерборд, где все участники соревнования ранжируются в зависимости от набранных очков.
- Соревнования привлекают тысячи команд со всего мира.
- Со дня основания и по сей день основная цель Kaggle — дать возможность организациям устроить конкурс на лучшие модели и алгоритмы.
@yorko и компания (~ 60 чел.) демонстрируют, что классные навыки можно получить и вне стен университета и даже абсолютно бесплатно. Основная идея курса — оптимальное сочетание теории и практики. Нельзя не отметить соревновательную природу курса — ведется общий рейтинг студентов, что сильно мотивирует.
Yandex DataSphere – в отличие от GC это платный блокнот, в котором тарифицируется фактическое время вычислений. При регистрации на пробный период (60 дней) выдается грант в размере 4000 ₽ для резидентов РФ и 50 $ для нерезидентов РФ. Особенности использования сервиса можно изучить в документации.
Построение моделей
С featexp требуется 15 минут, чтобы посмотреть на графики, и это определенно стоит того. Затем он вычисляет среднее значение цели в каждом бине и отображает его на рисунке слева. Из графика следует, что у клиентов с высокими отрицательными значениями https://deveducation.com/ для DAYS_BIRTH (с большим возрастом) более низкие ставки. Это имеет смысл, поскольку молодые люди обычно чаще просрочивают платежи. Эти графики помогают нам понять, что свойство может сказать о клиентах и как это повлияет на модель.
Kaggle в Instagram
Участвовать в соревнованиях Kaggle весело и захватывающе! За последние пару лет я разработал несколько простых способов создания более совершенных моделей машинного обучения. Эти простые, но мощные методы помогли мне попасть в топ 2% соревнования Instacart Market Basket Analysis, и я также использую их вне Kaggle. Автор честно признается, что не очень умеет в картинки.
Kaggle для начинающих: начало работы
Соревнование ASHRAE стало для меня издевательством над собой. После 12 лет работы в области разработки математических моделей для решения задач планирования и прогнозирования на оптовом рынке электроэнергии и мощности России я думала о себе высоко. За плечами несколько крупных успешно реализованных проектов, кандидатская диссертация в области математического моделирования, высокая зарплата, популярный блог, впечатляющая научная цитируемость и т.д. Kaggle, дочерняя компания Google LLC, представляет собой онлайн-сообщество специалистов по обработке данных и практиков машинного обучения. Kaggle — система организации конкурсов по исследованию данных, а также социальная сеть специалистов по обработке данных и машинному обучению.
Несколько советов по соревнованиям Kaggle
Там загруженные результаты оцениваются на количество правильных прогнозов, и вы попадаете в лидерборд, где все участники соревнования ранжируются в зависимости от набранных очков. “Ответом” является выходное значение, которое должен выдать алгоритм в результате своей работы, т.е. К этой группе, например, можно отнести задачи классификации и регрессии. Kaggle также поддерживает общедоступные наборы данных и рабочие места Kaggle для проектов машинного обучения и науки о данных.
Бывают и вовсе курьезные случаи, когда организаторы допускают ошибки в подготовке соревнований. Иногда оказывается, что в данных есть «утечка» , например какой-то признак «из будущего», в котором уже кроется требуемый ответ. Скажем, организаторы хотят научиться прогнозировать стоимость акций, но по ошибке убирают из данных акции обанкротившихся компаний. Очевидно, что обученные на таких выборках модели не будут применимы в реальной жизни, потому что они не умеют прогнозировать возможное банкротство компаний в обозримом будущем. Этот пример — классическая иллюстрация «ошибки выжившего», но, конечно, встречаются и более изощренные.
К сожалению (или к счастью) не могу оценить качество таких курсов, поэтому ссылок в статье не привожу. Форум он и на Kaggle форум, народ пишет, обсуждает и делится идеями. Два года назад Kaggle был приобретен компанией Google, так что неудивительно, что “под капотом” данный функционал использует Google Cloud Engine. Нет, как решать задачу — понятно, какие алгоритмы применять — тоже понятно, но вот код пишется очень тяжело, с поминутным заходом на хелп sklearn / pandas, и т.д. Почему так — нет наработанных пайплайнов и ощущения кода “на кончиках пальцев”. Курс mlcourse.ai — одна из масштабных активностей сообщества OpenDataScience.