Машиннное обучение | Наука о данных Библиотека (@machinelearning_books) — Telegram-канал | Telegram Dialogs
Telegram Dialogs — логотип
Все каналы
Машиннное обучение | Наука о данных Библиотека

Машиннное обучение | Наука о данных Библиотека

@machinelearning_books

16.9K подписчиков технологии

админ - @workakkk @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 № 5037635661

Последние публикации

Машиннное обучение | Наука о данных Библиотека
26.08.2026 07:02 · 👁 695
🔥 Prime Agent выпустили технический отчёт "Prime Agent: A Self-Improving RLM Harness" В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок. Один из самых интересных экспериментов - Factorio: - 7 дней непрерывной траектории на Sonnet 5 - 23,4 млн output tokens - завершено 24 из 196 технологий - ещё 71% прогресса до следующей технологии - 633 запущенных subagents - максимум 7 агентов работали одновременно Отчёт: https://arxiv.org/abs/2608.23552
Машиннное обучение | Наука о данных Библиотека
25.08.2026 15:01 · 👁 925
🤯 Локальные AI-модели становятся пугающе мощными Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки. Модель всего на 27 млрд параметров, которую можно запускать локально. Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры. Теперь open-source модели начинают конкурировать с лидерами рынка прямо на своём железе. Alibaba с серией Qwen 27B закрепилась в отдельном классе размеров и сейчас выглядит практически без конкурентов. https://x.com/arena/status/2091920512796725272
Машиннное обучение | Наука о данных Библиотека
25.08.2026 10:05 · 👁 800
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы? Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага. Учёные проверили агентов на задачах из открытых научных репозиториев: * публичные тесты можно использовать для итераций; * скрытые тесты показывают, действительно ли проблема решена. Результат удивляет: Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%. Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы. 📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? https://arxiv.org/abs/2608.19799
Машиннное обучение | Наука о данных Библиотека
23.08.2026 14:48 · 👁 1.1K
У Microsoft вышла очень показательная работа про надёжность AI-агентов. Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз. Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%. И есть ещё более неприятная часть. В 4 из 5 неудачных запусков агент: — вежливо завершал работу — вызывал инструмент записи в базу — сообщал, что всё выполнено Но состояние базы показывало обратное. То есть по финальному ответу агента проблема вообще могла быть незаметна. Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows. Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе. Очень правильная метрика для production-агентов: не «смог ли он сделать это хотя бы раз», а **«делает ли он это стабильно при повторных запусках».** Paper: https://arxiv.org/abs/2608.19741 “One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
Машиннное обучение | Наука о данных Библиотека
23.08.2026 10:11 · 👁 865
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку Окружение решает больше, чем кажется. Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: https://t.me/+90Z5TAyfuNU5YmRi Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_ci Java: t.me/javatg JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: https://t.me/+S4hinvO3QI43ZjNi Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Машиннное обучение | Наука о данных Библиотека
19.08.2026 12:28 · 👁 4K
Бесплатная книга по performance engineering В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе. Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций. Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно. Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой. Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы. А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее. Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором. en.algorithmica.org/hpc/complexity/ @machinelearning_books
Машиннное обучение | Наука о данных Библиотека
18.08.2026 09:46 · 👁 1.4K
🔥 Год production-трафика показал: быстрый LLM-serving начинается не со scheduler, а с понимания поведения пользователей Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину. Пользователь часто возвращается к той же модели с растущим контекстом. Если следующий запрос попадёт на тот же GPU, уже вычисленную часть prompt можно переиспользовать. А обычный load balancer, который просто равномерно раскидывает запросы между GPU, может уничтожить эту cache locality. Нужно одновременно учитывать: * историю запросов; * affinity к модели и prompt prefix; * состояние cache; * изменение traffic pattern со временем. Авторы также подчёркивают, что production workload нельзя считать статичным: популярность моделей и структура запросов меняются на горизонте месяцев. Paper: A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing arXiv: 2608.13573
Машиннное обучение | Наука о данных Библиотека
15.08.2026 11:12 · 👁 1.5K
⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию. Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов. Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента. https://github.com/justxor/Harness_ru
Машиннное обучение | Наука о данных Библиотека
13.08.2026 13:56 · 👁 1.4K
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов. Разбирают: * почему сильные агенты всё равно проваливают задачи; * как сохранять контекст между длинными сессиями; * зачем нужны AGENTS.md, feature_list.json и progress-файлы; * как не дать агенту объявить задачу завершённой слишком рано; * как встроить тестирование, observability и контроль в сам harness. Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic. Главная идея очень правильная: не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее. И да - есть русская версия. https://walkinglabs.github.io/learn-harness-engineering/ru/
Машиннное обучение | Наука о данных Библиотека
11.08.2026 13:25 · 👁 1.7K
🧠 Любишь ложиться поздно? Исследования действительно находили связь между «совами» и более высокими результатами когнитивных тестов, но всё не так просто. В работе 2009 года исследователи проанализировали данные более 10 тысяч человек и обнаружили: участники с более высокими результатами тестов интеллекта в детстве чаще становились взрослыми, которые позже ложатся и позже встают. Авторы объясняли это через гипотезу «эволюционно новых предпочтений»: ночная активность была необычна для наших предков, поэтому люди с более высоким интеллектом якобы легче адаптируются к нестандартным режимам. Но сами исследователи подчёркивали — эффект был небольшим, а работа показывала корреляцию, а не причинность. Интересно, что более новое исследование Imperial College London на данных более 26 тысяч человек тоже обнаружило лучшие когнитивные показатели у вечерних и промежуточных хронотипов по сравнению с «жаворонками». При этом исследователи отдельно отмечали важность нормальной продолжительности сна. Так что формула «ложись в 2 ночи - станешь умнее» не работает. Правильнее так: высокий IQ и поздний хронотип иногда встречаются вместе, но недосып умнее точно не делает. #Science #Sleep #IQ #Research #Psychology sciencedirect.com/science/article/abs/pii/S0191886909002177
Чат поддержки
Ответим здесь же, обычно быстро
Здравствуйте! Напишите ваш вопрос — оператор ответит в этом чате.