MLечный путь (@mlpathway) — Telegram-чат | Telegram Dialogs
Все каналы
MLечный путь

MLечный путь

@mlpathway

4.4K участников технологии 💬 Комментарии открыты

Сообщество ML и MLOps инженеров. Тут обсуждается: 🔹production ML; 🔹статьи, инструменты и технологии; 🔹опыт участников и лучшие практики. 🗓📢 #MLечный_путь ⚖️ Правила в закрепе. 📬 @anton_chunaev

Последние публикации

MLечный путь
21.07.2026 09:20
Можно посмотреть в направлении теории систем массового обслуживания. Там всегда ограниченное количество обрабатывающих узлов и большой поток запросов на обслуживание. По умолчанию, там 2 глобальных приоритета: относительный и абсолютный. На примере кассы: 🔸относительный: я вижу очередь, у меня наивысший относительный приоритет, я подхожу и встаю в очередь сразу за тем, кого обслуживают сейчас; 🔸абсолютный: я вижу очередь, у меня наивысший абсолютный приоритет, я подхожу, отметаю покупки того, кого обсуживают сейчас, и кассир начинает новый чек для меня. И в том, и в другом случае нескончаемый поток повышенных приоритетов блокирует обработку прочих запросов на обслуживание. Чтобы гарантировать SLA нужно перераспределять запросы на обслуживание по разным обрабатывающим узлам. Если дропать чьи-то запросы, то это нарушение SLA. Как бы я сделал: 🔹независимые очереди для всех уровней приоритетов; 🔹несколько обрабатывающих узлов (в идеале для каждой очереди свой); 🔹чем ниже приоритет, тем длинней время обработки в SLA; 🔹чтобы не раздувать инфру - умный роутинг запросов по вычислительным блокам исходя из оставшегося времени обработки в SLA.
MLечный путь
21.07.2026 08:24 · 👁 557
В среду стартует хакатон по мини-аппам: https://archestra.ai/apps-hackathon Можно открыть Archestra, навайбкодить в ней какое-нибудь смешное приложение и выйграть $1000 и наш мерч :) Присоединяйтесь!
MLечный путь
21.07.2026 08:24
Кому интересно, подключайтесь, порог входа небольшой )
MLечный путь
20.07.2026 20:29
Да, напрашиваются давно уже, ибо железо денег стоит, надо минимизировать простой, но при этом гарантировать sla. Вот разные пулы ресурсов не то, хочется все же на одном деплое обслуживать разных потребителей, чтобы не поднимать лишние реплики. Ну или я неправильно тебя понял.
MLечный путь
20.07.2026 20:22
И до вас очереди на бэке докатились? В основном видел 2 или 3 приоритета для запросов. Каждый со своим sla. Гарантию sla можно обеспечить за счёт разных пулов ресурсов под приоритеты.
MLечный путь
20.07.2026 20:05
Наставник ;) пролетало мимо https://github.com/kschweiger/fast-priority , но сам пока не щупал
MLечный путь
20.07.2026 19:53
Спасибо. Интересно про детали, наверняка какие-то вещи отстреливают. Например неприоритетный запрос может навечно застрять в очереди, если все время приоритетные клиенты приходят и будет очередь копиться, её надо как-то очищать и возвращать 429/503
MLечный путь
20.07.2026 19:33
Начните с очередей в движке, если этого недостаточно, следующий простой шаг это litellm перед инференсом. А дальше уже много деталей, коротко не ответить
MLечный путь
20.07.2026 19:19
Всем привет! Кто какие механизмы для организации приоритетных/неприоритетных очередей использует? Используете очереди в инференс движке (vLLM, triton), или используете LLM-гейтвей для этой задачи? Какие плюсы/минусы/подводные камни успели собрать? Чего хочу добиться: - настроить надёжный механизм приоритезации запросов для коммунальных ллмок, чтобы критичные запросы исполнялись первыми.
MLечный путь
20.07.2026 06:25
Коллеги, всем привет! Вот уже год как мы варим RAGU - библиотеку для построения эффективных GraphRAG-пайплайнов мечты. За это время мы успели: 1) выступить на Сибирском ДатаФесте (ютуб, вквидео); 2) получить первый приз gitverse, cloud.ru и хабра в номинации "AI-инновации"; 3) апробировать некоторые наработки из RAGU на соревновании SemEval 2026 Task 8 и занять там первое место; 4) победить на конкурсе Yandex Open Source в треке "Искусственный интеллект". И, конечно, всё это время мы развивали RAGU, добавляя туда новые фичи и удаляя оттуда старые баги 😊 А вот недавно мы собрались с силами и написали статью про RAGU, про его внутреннее устройство, особенности и про его комплексное сравнение с другими GraphRAG-пайплайнами по критериям как точности, так и вычислительной эффективности. Дело в том, что мы пытаемся делать такие решения, которые можно разворачивать у себя за разумные эксплуатационные затраты, без необходимости закупить 100500 GPU класса H200. Соответственно, в пайплайне построения графа знаний мы сделали упор на две вещи: 1) многошаговый харнесс, позволяющий строить граф знаний последовательно и с самопроверкой; 2) использование малых LLM в пайплайне (на примере моей любимой Meno-Lite, но необязательно - какой-нибудь небольшой квен или gpt-oss-20b тоже пойдёт). Саму статью про RAGU мы номинировали на Huggingface Daily Papers: https://huggingface.co/papers/2607.11683 Если вам понравилось наше RAGU и вы хотите нас поддержать, то мы будем очень благодарны за голоса на Daily Papers в течение сегодняшнего дня и за звёздочки на гитхабе в любое время 🥰
Чат поддержки
Ответим здесь же, обычно быстро
Здравствуйте! Напишите ваш вопрос — оператор ответит в этом чате.