М
Машиннное обучение | Наука о данных Библиотека
26.08.2026 07:02 · 👁 695
🔥 Prime Agent выпустили технический отчёт
"Prime Agent: A Self-Improving RLM Harness"
В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок.
Один из самых интересных экспериментов - Factorio:
- 7 дней непрерывной траектории на Sonnet 5
- 23,4 млн output tokens
- завершено 24 из 196 технологий
- ещё 71% прогресса до следующей технологии
- 633 запущенных subagents
- максимум 7 агентов работали одновременно
Отчёт:
https://arxiv.org/abs/2608.23552
М
Машиннное обучение | Наука о данных Библиотека
25.08.2026 15:01 · 👁 925
🤯 Локальные AI-модели становятся пугающе мощными
Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки.
Модель всего на 27 млрд параметров, которую можно запускать локально.
Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры.
Теперь open-source модели начинают конкурировать с лидерами рынка прямо на своём железе.
Alibaba с серией Qwen 27B закрепилась в отдельном классе размеров и сейчас выглядит практически без конкурентов.
https://x.com/arena/status/2091920512796725272
М
Машиннное обучение | Наука о данных Библиотека
25.08.2026 10:05 · 👁 800
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?
Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.
Учёные проверили агентов на задачах из открытых научных репозиториев:
* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.
Результат удивляет:
Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.
Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.
📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799
М
Машиннное обучение | Наука о данных Библиотека
23.08.2026 14:48 · 👁 1.1K
У Microsoft вышла очень показательная работа про надёжность AI-агентов.
Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.
Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.
И есть ещё более неприятная часть.
В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено
Но состояние базы показывало обратное.
То есть по финальному ответу агента проблема вообще могла быть незаметна.
Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows.
Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе.
Очень правильная метрика для production-агентов:
не «смог ли он сделать это хотя бы раз», а
**«делает ли он это стабильно при повторных запусках».**
Paper:
https://arxiv.org/abs/2608.19741
“One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
М
Машиннное обучение | Наука о данных Библиотека
23.08.2026 10:11 · 👁 865
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: https://t.me/+S4hinvO3QI43ZjNi
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
М
Машиннное обучение | Наука о данных Библиотека
19.08.2026 12:28 · 👁 4K
Бесплатная книга по performance engineering
В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе.
Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций.
Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно.
Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой.
Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы.
А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее.
Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором.
en.algorithmica.org/hpc/complexity/
@machinelearning_books
М
Машиннное обучение | Наука о данных Библиотека
18.08.2026 09:46 · 👁 1.4K
🔥 Год production-трафика показал: быстрый LLM-serving начинается не со scheduler, а с понимания поведения пользователей
Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину.
Пользователь часто возвращается к той же модели с растущим контекстом. Если следующий запрос попадёт на тот же GPU, уже вычисленную часть prompt можно переиспользовать.
А обычный load balancer, который просто равномерно раскидывает запросы между GPU, может уничтожить эту cache locality.
Нужно одновременно учитывать:
* историю запросов;
* affinity к модели и prompt prefix;
* состояние cache;
* изменение traffic pattern со временем.
Авторы также подчёркивают, что production workload нельзя считать статичным: популярность моделей и структура запросов меняются на горизонте месяцев.
Paper: A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
arXiv: 2608.13573
М
Машиннное обучение | Наука о данных Библиотека
15.08.2026 11:12 · 👁 1.5K
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
М
Машиннное обучение | Наука о данных Библиотека
13.08.2026 13:56 · 👁 1.4K
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны AGENTS.md, feature_list.json и progress-файлы;
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
М
Машиннное обучение | Наука о данных Библиотека
11.08.2026 13:25 · 👁 1.7K
🧠 Любишь ложиться поздно? Исследования действительно находили связь между «совами» и более высокими результатами когнитивных тестов, но всё не так просто.
В работе 2009 года исследователи проанализировали данные более 10 тысяч человек и обнаружили: участники с более высокими результатами тестов интеллекта в детстве чаще становились взрослыми, которые позже ложатся и позже встают.
Авторы объясняли это через гипотезу «эволюционно новых предпочтений»: ночная активность была необычна для наших предков, поэтому люди с более высоким интеллектом якобы легче адаптируются к нестандартным режимам. Но сами исследователи подчёркивали — эффект был небольшим, а работа показывала корреляцию, а не причинность.
Интересно, что более новое исследование Imperial College London на данных более 26 тысяч человек тоже обнаружило лучшие когнитивные показатели у вечерних и промежуточных хронотипов по сравнению с «жаворонками». При этом исследователи отдельно отмечали важность нормальной продолжительности сна.
Так что формула «ложись в 2 ночи - станешь умнее» не работает.
Правильнее так: высокий IQ и поздний хронотип иногда встречаются вместе, но недосып умнее точно не делает.
#Science #Sleep #IQ #Research #Psychology
sciencedirect.com/science/article/abs/pii/S0191886909002177