14734
Люблю высокие технологии и кушать. Добро пожаловать, если в сферу твоих интересов тоже входят математика, DL, NLP, программирование на Python, или тебе просто любопытно, о чем на досуге размышляют люди, занимающиеся разработкой и исследованиями в ML.
#ml #masters #cv #refit
Читаю книги Тима Мастерса "Data Mining Algorithms in C++" и "Assessing and Improving Prediction and Classification". Он не классический МЛ-щик, мне кажется, до всего дошёл сам, порой его идеи очень глубоки.
"The importance of consistent performance is often ignored, with average performance being the focal point instead. However, in most cases, a model that performs fairly well across the majority of training cases will ultimately outperform a model that performs fabulously most of the time but occasionally fails catastrophically. Properly designed training sets and optimization criteria can take consistency into account."
А ведь и правда, ну кто смотрит на разброс метрик по фолдам CV? Да никто. Даже в процедурах модуля model_selection (GridSearchCV итд) по умолчанию берутся просто среднеарифметические метрики по тестовым кускам. А ведь постоянство метрик может быть очень важным качеством в реальных приложениях. Наверное, лучшим подходом будет при сравнении моделек от средних значений метрик отнимать их стандартное отклонение (с неким коэффициентом, например, делённое на 2). В sklearn это можно сделать, если передать в процедуру model_selection кастомный refit.