Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
30.08.2026 12:00 · 👁 536
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
29.08.2026 12:02 · 👁 849
🤩 Бесплатный курс по Visual GenAI: от DDPM до 3D
В одном репозитории собрали полноценный graduate-level курс по современной генерации изображений, видео и 3D.
Внутри:
🤩 DDPM, Score Matching, SDE/ODE;
🤩 Flow Matching и DPM-Solver;
🤩 Consistency Models, MeanFlow и генерация за несколько шагов;
🤩 авторегрессионная генерация изображений и видео;
🤩 ускорение diffusion-моделей: caching, sparse attention, quantization;
🤩 мультимодальная генерация, ControlNet, IP-Adapter;
🤩 3D и multi-view diffusion.
К каждой теме — англоязычные слайды + записи лекций и семинаров на русском, а ещё 7 практических домашних заданий в Jupyter Notebook: от обучения Flow Matching до AR video diffusion.
🔗 GitHub
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
28.08.2026 10:05 · 👁 1K
🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели
Свежая работа MIT по machine unlearning обнаружила интересный эффект: с ростом обучающего датасета связь между отдельными примерами и поведением модели становится менее очевидной.
На практике это означает:
— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель;
— становится сложнее определить, какие данные повлияли на конкретный ответ;
— «право на забвение» технически становится сложнее реализовать для больших моделей.
Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
27.08.2026 11:00 · 👁 1.2K
📄 Docling — мощный инструмент для разбора документов под задачи Data Science
Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.
Он не просто конвертирует файлы — он понимает структуру документов.
Работает «plug-and-play» с:
— LangChain
— LlamaIndex
— Haystack
— CrewAI
Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.
🔗 Ссылка на проект
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
26.08.2026 15:36 · 👁 1.3K
📊 Matplotlib под рукой: всё главное для графиков и анализа
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
25.08.2026 11:00 · 👁 1.4K
🐼 Pandas Cookbook: учимся анализу данных
Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.
🔗 Начать обучение
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
24.08.2026 15:05 · 👁 1.4K
🗂 Большая подборка шпаргалок по ML и DS
Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
24.08.2026 09:01 · 👁 1.4K
🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени
В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.
В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».
🔗 Читать статью
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
22.08.2026 18:49 · 👁 1.4K
🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла
Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.
Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)
💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.
📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст
Б
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
19.08.2026 16:20 · 👁 1.5K
🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.
🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану
Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.
🔵 Что AI-агенты уже успели сломать в проде
Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.
🔵 Когда агент начинает социально инженерить людей
AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.
🔵 Safety drift: как агент постепенно уходит не туда
Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.
💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.
🏃♀️ Proglib Academy