Reliable ML (@reliable_ml) — Telegram-канал | Telegram Dialogs
Telegram Dialogs — логотип
Все каналы
Reliable ML

Reliable ML

@reliable_ml

6.6K подписчиков технологии 💬 Комментарии открыты

Reliable ML - фреймворк о том, как управлять внедрением и развитием аналитики и data science/machine learning/AI, чтобы результат был применим в бизнес-процессах и приносил компании финансовую пользу. Admin: @irina_goloshchapova @promsoft

Последние публикации

Reliable ML
15.07.2026 19:24 · 👁 1.2K
LLM Evaluation как задача Causal Inference #1 Первая заметка серии, посвященной современным методам оценки качества систем искусственного интеллекта. Когда мы создаем сложные системы на основе LLM, нам приходится принимать много решений - о данных, способах дообучения моделей, архитектурах, контексте, инструментах и проч. Измеряем качество работы нашего пайплайна и улучшаем его. В статье Causal Methods for LLM Development and Evaluation предлагается использовать Causal Inference для оценки влияния наших решений на качество системы. Утверждения вроде "семантический чанкинг улучшает качество ответов RAG" - причинно-следственные. Т.е. мы утверждаем, что: 1) есть улучшение качества RAG 2) причина этого улучшения - смена схемы разбиения на чанки 3) имеющиеся данные позволяют подтвердить существование влияния и оценить его величину. Например, разработчики часто оценивают систему на основании логов (истории запросов). Но логи в общем случае не являются результатом рандомизированного эксперимента, а зависят от конфигурации системы, обратной связи от людей и ИИ, политик развертывания и т.д., подвержены выборочному смещению, дрейфу распределений и шуму в метках. Во время разработки составные части системы (модели, пользователи и выполняемые задачи) подстраиваются друг под друга (коадаптируются). Это увеличивает разрыв между прошлыми наблюдениями и тем, что мы увидим в проде. Непонятно, что повлияло на метрики - наши доработки, конфаундеры или просто шум оценки. Например, если система маршрутизации запросов отправляет более сложные вопросы дорогой модели, а простые - дешевой модели, наивный анализ логов может привести нас к выводу, что дорогая модель работает хуже, потому что в ее ответах больше ошибок. В causal Inference подходе мы учтем сложность запроса как конфаундер и уберем смещение матчингом или взвешиванием. Causal Inference предоставляет матаппарат и фреймворк для оценки эффекта, позволяет адресно работать с источниками дисперсии в оценке, более эффективно использовать имеющиеся данные, обеспечивает устойчивость и статистическую достоверность результата. Два ключевых момента в причинно-следственном анализе: идентифицируемость identifiability и оцениваемость estimability, проще говоря - позволяют ли наши данные и наши предположения о процессе генерации выявить и надежно оценить причинно-следственную связь. В статье разбираются типичные компоненты LLM-пайплайнов - претрейн, алайнмент, роутинг, RAG, мультиагентные системы и так далее. Приведены примеры подходов, которые могут сработать, и направления для дальнейших исследований. Фундаментальная проблема причинно-следственного вывода - невозможность наблюдать две версии системы одновременно (с воздействием и без него). LLM пайплайн - редкий случай, когда это почти возможно: один и тот же запрос прогоняется через две версии системы. Проблема не исчезает полностью (недетерминизм генерации, поведение пользователей), но возможность параллельного прогона пайплайна здорово упрощает офлайн-оценку. Строго и методично применяя доступные нам техники Causal Inference, можно построить эффективную и практичную систему оценки. Этим мы и займемся в следующих постах серии. Ваш @Reliable ML #reliable_ml #causal_inference #llm_evaluation
Reliable ML
14.07.2026 09:51 · 👁 1.6K
Ура, доклады с Датафеста! Секция ReliableML Датафеста доступна на сайте ods.ai https://ods.ai/tracks/df26-reliable-ml Секция DataStrategy с докладом Ирины тоже доступна https://ods.ai/tracks/df26-data-strategy Ваш @Reliable ML #reliable_ml #datafest #дождались
Чат поддержки
Ответим здесь же, обычно быстро
Здравствуйте! Напишите ваш вопрос — оператор ответит в этом чате.