Задачи DS - Собеседования, Соревнования, ШАД (@zadachi_ds) — Telegram-канал | Telegram Dialogs
Telegram Dialogs — логотип
Все каналы
Задачи DS - Собеседования, Соревнования, ШАД

Задачи DS - Собеседования, Соревнования, ШАД

@zadachi_ds

8.1K подписчиков карьера 💬 Комментарии открыты

Чат: @zadachi_ds_chat Реклама: @menshe_treh

Последние публикации

Задачи DS - Собеседования, Соревнования, ШАД
03.07.2026 14:50 · 👁 683
Что нужно знать, чтобы пройти ML-собеседование в 2026 году Продолжаем серию открытых вебинаров 😎 В это воскресенье разберём, как сейчас выглядит путь начинающего ML-специалиста: чего ждут от джунов и стажеров, как устроены технические отборы и как строить карьеру в 2026 году. Поговорим о том, почему ML - это не только обучить модель в ноутбуке. На собеседовании будет livecoding, метрики, классические модели, переобучение, умение выбрать решение и объяснить его. На вебинаре: ➡️ соберём карту ML-собеседования: из чего складывается подготовка ➡️ разберём главные ошибки новичков ➡️ решим ML-кейсы с реальных собеседований, покажем, какое решение ожидают от вас ▶️Бонус — обсудим карьерную часть: резюме, пет проекты, отклики на вакансии Ведущий вебинара — ML-инженер WB. У вас будет возможность задать вопросы тому, кто сам проводит собеседования и узнать, на что обращают внимание при найме! 5 июля воскресенье, 12:00 (мск) Ссылку пришлём позже сюда и в бот @Postupashkianalitycsbot
Задачи DS - Собеседования, Соревнования, ШАД
26.06.2026 13:16 · 👁 3.2K
Всем привет! Сегодня хочется поговорить про важную тему, а именно - стат. значимость. Почти на каждом собеседовании в бигтех спрашивают данную тему и ожидают услышать с одной стороны четкий математический рассказ, с другой стороны развернуть все в сторону прикладную: как это использовать в проде? Представим такую задачу: у тебя есть две модели машинного обучения, первую ты обучал месяц назад на каких-то данных, а за месяц набралось еще данных, появились новые подходы и ты обучил новую версию модели. На валидационной выборке, которая строго не входила в трейн модели выдали абстрактный скор качества: 0.95 для версии прошлого месяца 0.98 для версии текущего месяца. Как можно ответить на вопрос: стоит ли катить модель в прод при прочих равных (вес, скорость инференса и тд)? Вариант 1: можно провести кросс валидацию и замериться не на одной выборке, а на фолдах, причем чтоб размер фолда был репрезентативен и немал. Вариант 2: применить стат. тесты. Рассмотрим пример оффлайн стат. теста на примере нашей задачи. Конкретно для этой задачи подходит бутстрапированный метод, потому что распределение лосса функции заведомо неизвестно (обычно в мат стате к требуются условия на нормальность и т.д). Сформируем гипотезы: H_0 (нулевая гипотеза) - новая модель не стат. значимо отличается от старой H_1 (альтернативная гипотеза) - новая модель лучше старой. 0. Возьмем нашу валидационную выборку. 1. Насэмплим валидационных примеров в количестве меньшем кол-ва валидационной выборке. 2. Замерим какие-то показатели качества на каждом нашем элементе подвыборки для модели A (новой) и модели B (старой) и вычтем одно из другого. Например для ревордов оценки аспекта качества текста: for i: D_b[i]=reward_model_a_i - reward_model_b_i 3. Считаем среднее разностей на подвыборке. Сохраняем в наш массив средних разностей по подвыборкам: D[i] = D_mean_b 4. Повторяем для большого кол-ва подвыборок с возвратом. Окей, мы получили какие то статистики, что дальше? Теперь сортируем наш массив средних разностей по возрастанию и берем уровень значимости=0.05. Считаем нижнюю границу, как lower_bound(B × 0.025)=B_min и верхнюю как upper_bound(B×0.975)=B_max. Если B_min>0, то с вероятностью 95% истинное среднее разности больше 0. Отвергаем H0, катим новую модель. Иначе, мы не можем отвергнуть H0 и выкатку ставим под сомнение. После сверки на этом этапе можно уже к онлайн тесту перейти - АБ тесту. Их обычно по разному проводят, но алгоритм такой - берем выборку людей с новой моделью и со старой моделью, выборки не пересекаем. И считаем важные для бизнеса метрики, а потом сравниваем, реально ли стало лучше? На самом деле, существует много еще других стат. тестов - тест Стьюдента (различаются ли средние значения двух групп?), тест хи-квадрат (есть ли статистическая связь между двумя категориальными переменными?), тест Колмогорова-Смирнова (соответствует ли распределение выборки эталонному или совпадают ли распределения двух выборок?), и т.д. Если еще чего интересное из тестов вы встречали в проде, поделитесь в комментах 😉. Всем хорошей пятницы! @zadachi_ds
Чат поддержки
Ответим здесь же, обычно быстро
Здравствуйте! Напишите ваш вопрос — оператор ответит в этом чате.