Н
Нескучный Data Science
17.07.2026 12:58 · 👁 899
🔥 Как прошёл офлайн-бранч ODS Moscow × Нескучный Data Science
🧠 Начали с доклада Альберта про то, как в Avito обучают собственную LLM.
Это не история про «взяли открытую модель и немного дообучили», а полноценный процесс: выбор базовой модели, собственный токенизатор, адаптация на данных Avito, SFT и дальнейшее обучение с помощью RL.
Для SFT собрали больше 800 тысяч примеров: открытые датасеты, синтетические данные, олимпиадные задачи, внутренние бизнес-кейсы и диалоги пользователей с большими моделями.
На этапе RL отдельно развивают несколько навыков модели: решение математических задач, следование сложным инструкциям и корректный вызов инструментов. Причём для каждого навыка нужен свой автоматически проверяемый reward.
В математике система извлекает финальный ответ и проверяет его эквивалентность правильному. В instruction following — смотрит, выполнила ли модель все заданные ограничения. В function calling — проверяет название инструмента, аргументы и их значения.
Отдельно поговорили про инфраструктуру. Для моделей на 8B параметров можно относительно быстро запускать эксперименты и проверять гипотезы. Но при переходе к большим MoE-моделям главным вызовом становятся масштабирование, распределение модели по GPU, батчинг, инференс и offloading.
👨🔬 После продуктовых LLM резко переключились на химию.
Константин начал с важной мысли: химическая информация — это не один универсальный тип данных. Одну и ту же молекулу можно представить текстом, строкой SMILES, двумерным графом, трёхмерной структурой или структурой, которая изменяется во времени. И под каждое представление нужны свои методы и модели.
Поговорили о том, почему даже на фоне сложных нейросетевых архитектур связка Morgan fingerprints + XGBoost всё ещё остаётся очень сильным базовым решением для многих задач с химическими данными.
Затем перешли к геометрическим графовым нейронным сетям. Они учитывают расположение атомов и позволяют предсказывать свойства молекул в десятки раз быстрее традиционных DFT-расчётов.
Отдельно разобрали нейронные потенциалы и delta-ML. Идея в том, чтобы не выполнять каждый раз дорогой квантово-химический расчёт полностью: часть свойства можно посчитать более дешёвым методом, а нейросети поручить предсказать необходимую поправку.
Дошли и до LLM с агентами. Здесь пока всё не так магически, как иногда выглядит в заголовках: модели могут по-разному отвечать на один и тот же вопрос в зависимости от того, передали им обычное название соединения, IUPAC или SMILES. А некоторые агенты, которые должны самостоятельно запускать вычислительные эксперименты, пока скорее напоминают roadmap, чем полностью автономного исследователя.
Зато роботизация лабораторий уже вполне реальна: специализированные платформы, роборуки, автоматическое проведение серий экспериментов и превращение обычного оборудования в high-throughput-системы.
🎬 После двух технических докладов разговор с Денисом про ИИ в кино оказался очень кстати 😅
Обсудили, где новые инструменты уже помогают при работе с контентом, какие процессы способны ускорить, где вызывают сопротивление и в каких задачах пока остаются скорее экспериментом.
Но, как обычно, самое ценное происходило не только во время выступлений. После докладов продолжили обсуждать услышанное за завтраком, задавать вопросы, спорить, знакомиться и делиться своими кейсами.
Спасибо Альберту, Константину и Денису за содержательные выступления, ODS Moscow — за очередную совместную встречу, МИРА бистро — за пространство, а всем, кто пришёл, — за вопросы и атмосферу.
Формат «бранч + несколько докладов» точно будем повторять.
Поэтому уже начинаем собирать темы для следующего бранч-митапа. Если вам есть о чём рассказать — про рабочий кейс, исследование, неожиданный эксперимент, применение ИИ в своей индустрии или даже неудачу, из которой можно сделать полезные выводы, — присылайте тему доклада и пару предложений о себе в комментарии или личные сообщения.
P.S. Будем учиться фотографироваться до того, как все разошлись 😅
Н
Нескучный Data Science
09.07.2026 13:38 · 👁 3.4K
🔥 ODS Moscow × Нескучный Data Science: офлайн-бранч в эту субботу
В эту субботу снова собираемся на офлайн-бранч вместе с ODS Moscow.
Раньше наши бранчи проходили совсем без программы: просто встречались, ели и разговаривали про ИИ, data science и рабочие истории. В этот раз хотим сохранить этот живой формат, но добавить несколько докладов — чтобы было от чего оттолкнуться в обсуждении и куда глубже копнуть.
На позапрошлом бранче мы обсуждали, зачем Avito вообще обучать свою LLM. Тогда тема вызвала много вопросов, и я предложил Альберту рассказать об этом подробнее — уже не на уровне «а зачем», а на уровне технических деталей.
Альберт Акопян
LLM research engineer Avito | ex. Alfa Bank | MIPT & YSDA alumni
«Как мы в Avito делаем RL для нашей LLM»
Поговорим про то, как выглядит RL для LLM внутри большого продукта: какие задачи этим решают, как это связано с качеством модели и что вообще приходится учитывать, когда LLM живёт не в демке, а в реальном сервисе.
На прошлом бранче у нас была очень живая дискуссия про применение ИИ в медицине. В этот раз продолжим смотреть на ИИ в науке, но уже со стороны химии.
Ушенин Константин
ведущий научный сотрудник AIRI | кандидат физ-мат наук | препод в УрФУ и ТГУ | ex. Академия наук РФ | автор канала «эйай фор сайенс» — @not_only_llm
«Применение ИИ в химии»
Константин расскажет, как ИИ применяется в химии: где он действительно помогает исследователям, какие задачи уже можно решать с помощью моделей и как это выглядит не в хайповых заголовках, а ближе к реальной научной практике.
А ещё мне не хочется, чтобы наши бранчи превращались исключительно в разговоры про работу, метрики и продакшен. Это полезно, но иногда получается слишком душно 😅
Поэтому я позвал Дениса рассказать про ИИ в кино. Если вы давно читаете канал, возможно, помните, что он помогал вытаскивать книжный сериал «Дата Сапиенс», а сейчас сам активно начинает применять ИИ в жизни и творческих проектах.
Ну и, конечно, у нас будет шанс разведать, что произойдёт в следующем сезоне одного из сериалов с его участием. Скажу честно: у меня пока не получилось 😅
Денис Бузин
актёр театра и кино | выпускник ВГИК | основатель бренда одежды CNSTRCTR | снимался в «Универ. 15 лет спустя», «Кузя. Путь к успеху», «Полицейский с YouTube», «Солдаты», «Полярный»
«Как использует ИИ индустрия кино в РФ»
Обсудим, как ИИ уже используется в киноиндустрии: где он помогает, где вызывает сопротивление, какие задачи действительно закрывает, а где пока остаётся игрушкой.
📆 Когда: суббота, 11 июля
🕛 Время: 12:00
📍 Место: МИРА бистро, Тверская ул., 16, стр. 1
Вход со стороны метро «Тверская» / «Пушкинская»
Бронь на имя Александр ODS.
Ставьте 👍, если планируете прийти — будет полезно понимать примерное количество людей. Буду рад увидеться!
Н
Нескучный Data Science
01.07.2026 13:19 · 👁 3.5K
Оффер на Senior Data Science роль за 1 неделю — реально? 🚀
Да. Авито запускает Fast Track — ускоренный отбор для Senior и Senior+ Data Science специалистов. Одна неделя на все технические этапы и финал → оффер в классифайд №1 в мире по количеству пользователей.
📅 Основные этапы — 20–26 июля. Регистрация по ссылке открыта до 15 июля, 23:59 МСК.
Как проходит:
🟣 До 15 июля — заявка + HR-скрининг
🟣 До 24 июля — техническая секция (ML-теория + Python)
🟣 25 июля — ML System Design
🟣 26 июля — финал
🟣 До 28 июля — оффер
Преимущества фаст-трека:
🟣 Быстрый отбор и совмещённые этапы
🟣 Все даты известны заранее
🟣 Возможность оценить свои скилы — результат закрепляется на год
Кого ждут:
🟣 От 4 лет опыта в крупных российских и международных IT, BigTech и FinTech компаниях
🟣 Полный цикл разработки моделей — от ресёрча до выкатки в прод
🟣 От 1 года самостоятельного лидирования проекта, автономность и инициативность
Команды на выбор: антифрод и модерация, монетизация и реклама, поиск и рекомендации, вертикальные DS-команды.
⏳ Регистрация — до 15 июля. Успей оставить заявку. Рекрутеры проведут тебя через все этапы за рекордно быстрые сроки!
Н
Нескучный Data Science
27.06.2026 13:40 · 👁 3.8K
🧠 Что интересного было в AI/DS за неделю
Сделал обзор топ постов, которые сам прочитал за эту неделю. Буду выпускать такой обзор раз в неделю.
На этой неделе лучше всего зацепили темы про AI-инструменты для разработки, роль AI-инженера, ML в реальном бизнесе и выход IT-продуктов на внешние рынки.
🛠 AI coding tools: контекст важнее красивой демки [1], [2]
В обсуждении Cursor, Codex и Claude Code главная мысль такая: в длинных задачах решает не только модель, а то, как инструмент держит контекст, переживает сжатие истории и не теряет цель в автономной работе.
Это хороший сдвиг в разговоре про AI coding. Уже недостаточно спросить “какая модель умнее”. Нужно смотреть, какая среда лучше помогает довести задачу до конца.
🧑💻 Хороший AI-инженер: не тот, кто просто сделал модель [1]
Сильный тезис про роль AI-инженера: разработка моделей постепенно становится commodity. Готовых LLM, пайплайнов и туториалов уже много.
Настоящая ценность всё чаще в другом: сформулировать гипотезу, выбрать метрики, поставить эксперимент, довести до деплоя и потом следить за качеством.
Короче, хороший AI-инженер всё больше похож на владельца результата, а не на человека, который “прикрутил нейронку”.
🏢 ML в бизнесе ломается не только об accuracy [1]
Отличный кейс про recommendation/search bias из корпоративной жизни.
Самый интересный тип bias там не из учебника, а из реальности: “уважаемый человек попросил”. Даже хорошая модель может начать вредить продукту, если поверх неё начинают вручную проталкивать внутренние приоритеты.
Это напоминание, что ML-система в бизнесе живёт не в вакууме. Ей нужны продуктовые границы, доверие пользователей и защита от организационного шума.
🌍 Российские IT-продукты всё активнее смотрят наружу [1], [2], [3]
Заметная линия недели: как IT-проектам выходить за пределы локального рынка.
Темы очень практичные: платежи, язык, поддержка, SEO, органический трафик, упаковка продукта. Общий вывод простой: иногда следующий рост даёт не новая фича, а способность продать уже работающий продукт на другом рынке.
💭 Мой вывод недели:
AI-инструменты становятся мощнее, но выигрывает не тот, кто просто подключил модель. Выигрывает тот, кто умеет держать контекст, формулировать задачу, измерять эффект и доводить систему до результата.
🎯 Теперь хочу расширить список источников.
Если читаете адекватные каналы про AI, DS, ML, разработку, продукты или IT-бизнес — скиньте их в комментарии.
Н
Нескучный Data Science
26.06.2026 20:03 · 👁 3.6K
Всем привет!
🌇 В эту субботу дата бранч!
📆 Когда: Суббота (27 июня)
🕖 Время: 12:00
📍Место: Mira Bistro (Тверская ул., 16, стр. 1) Вход со стороны м. Тверская/Пушкинская
Бронь на имя Александр ODS
Ставь 👍 если придешь
ODS Moscow