Reliable ML
15.07.2026 19:24 · 👁 1.2K
LLM Evaluation как задача Causal Inference #1
Первая заметка серии, посвященной современным методам оценки качества систем искусственного интеллекта.
Когда мы создаем сложные системы на основе LLM, нам приходится принимать много решений - о данных, способах дообучения моделей, архитектурах, контексте, инструментах и проч. Измеряем качество работы нашего пайплайна и улучшаем его.
В статье Causal Methods for LLM Development and Evaluation предлагается использовать Causal Inference для оценки влияния наших решений на качество системы.
Утверждения вроде "семантический чанкинг улучшает качество ответов RAG" - причинно-следственные. Т.е. мы утверждаем, что:
1) есть улучшение качества RAG
2) причина этого улучшения - смена схемы разбиения на чанки
3) имеющиеся данные позволяют подтвердить существование влияния и оценить его величину.
Например, разработчики часто оценивают систему на основании логов (истории запросов). Но логи в общем случае не являются результатом рандомизированного эксперимента, а зависят от конфигурации системы, обратной связи от людей и ИИ, политик развертывания и т.д., подвержены выборочному смещению, дрейфу распределений и шуму в метках.
Во время разработки составные части системы (модели, пользователи и выполняемые задачи) подстраиваются друг под друга (коадаптируются). Это увеличивает разрыв между прошлыми наблюдениями и тем, что мы увидим в проде. Непонятно, что повлияло на метрики - наши доработки, конфаундеры или просто шум оценки.
Например, если система маршрутизации запросов отправляет более сложные вопросы дорогой модели, а простые - дешевой модели, наивный анализ логов может привести нас к выводу, что дорогая модель работает хуже, потому что в ее ответах больше ошибок. В causal Inference подходе мы учтем сложность запроса как конфаундер и уберем смещение матчингом или взвешиванием.
Causal Inference предоставляет матаппарат и фреймворк для оценки эффекта, позволяет адресно работать с источниками дисперсии в оценке, более эффективно использовать имеющиеся данные, обеспечивает устойчивость и статистическую достоверность результата.
Два ключевых момента в причинно-следственном анализе: идентифицируемость identifiability и оцениваемость estimability, проще говоря - позволяют ли наши данные и наши предположения о процессе генерации выявить и надежно оценить причинно-следственную связь.
В статье разбираются типичные компоненты LLM-пайплайнов - претрейн, алайнмент, роутинг, RAG, мультиагентные системы и так далее. Приведены примеры подходов, которые могут сработать, и направления для дальнейших исследований.
Фундаментальная проблема причинно-следственного вывода - невозможность наблюдать две версии системы одновременно (с воздействием и без него). LLM пайплайн - редкий случай, когда это почти возможно: один и тот же запрос прогоняется через две версии системы. Проблема не исчезает полностью (недетерминизм генерации, поведение пользователей), но возможность параллельного прогона пайплайна здорово упрощает офлайн-оценку. Строго и методично применяя доступные нам техники Causal Inference, можно построить эффективную и практичную систему оценки.
Этим мы и займемся в следующих постах серии.
Ваш @Reliable ML
#reliable_ml #causal_inference #llm_evaluation