В
Время Валеры
26.08.2026 06:10 · 👁 8.5K
Прочитал отличную заметку Shopify про gisting — сжатие системного промпта в обучаемые токены.
По сути, это компиляция промпта.
У GraphQL-агента Sidekick системный промпт занимал около 6 000 токенов, которые постоянно приходилось обрабатывать снова и снова.
Prefix caching решает проблему лишь частично. Модели не нужно повторно вычислять KV cache для промпта, но при генерации каждый новый токен всё равно работает со всем контекстом. Чем длиннее промпт, тем больше памяти и времени требуется на каждый шаг декодирования. Придумали логичную штуку применить: gisting
Как работает gisting.
Сначала Shopify выбрали коэффициент сжатия 4:1(это гиперпараметр) и создали 1 500 новых специальных токенов вместо 6 000 исходных.
Эти токены не были выбраны из системного промпта и не являлись его текстовым summary. Это просто новые ID вроде <GIST_1>, <GIST_2> и так далее.
Дальше:
* Все веса модели замораживаются. Обучаются только эмбединги новых gist-токенов.
* Teacher-версия модели получает полный системный промпт, запрос пользователя и начало правильного ответа. На каждой позиции она выдаёт распределение вероятностей следующего токена.
* Student-версия той же самой модели получает тот же запрос и ответ, но вместо 6 000 токенов системного промпта видит 1 500 gist-токенов;
* Распределения teacher и student сравниваются через KL divergence.
* Градиент меняет только эмбединги gist-токенов, пока student не начинает выдавать практически те же распределения ответов, что и teacher.
* Изначально новые эмбединги можно было бы задать случайно. Но Shopify нашли более эффективную инициализацию: исходный промпт разделили на группы по четыре токена, а каждый gist-embedding инициализировали средним значением эмбедингов соответствующей четвёрки. Это снизило начальный loss в семь раз.
При этом <GIST_1> не становится сокращённым обозначением первых четырёх токенов. Все 1 500 embeddings обучаются совместно и в итоге кодируют не текст промпта, а его влияние на поведение модели.
Получаем сжатие поведения: модель учат реагировать на короткую последовательность обучаемых векторов так же, как на длинную текстовую инструкцию.
В результате примерно 6 000 обычных токенов превратились в 1 500 обученных токенов. Модель ведёт себя так, будто прочитала полный промпт, хотя фактически получает его сжатое представление.
После обучения никакой отдельной архитектуры не требуется. Эмбединги записываются в embedding matrix, токены регистрируются в tokenizer, а длинный промпт при запросе просто заменяется их последовательностью. Нет дополнительного encoder, специального attention mask или отдельного serving path.
Результаты при нагрузке 350 запросов в минуту:
— time to first token: с 438 до 354 мс, −19%;
— полная задержка: с 6,8 до 4,2 секунды, −38%;
— throughput: с 20,2 до 23,4 запроса в секунду, +16%;
— требуемое количество GPU: −14%.
Качество при этом не ухудшилось.
Как они подбирали рецепт: Autoresearch-цикл сам менял гиперпараметры, запускал обучение и оценивал результат.
Так нашли оптимальное сжатие 4:1. При дальнейшем уменьшении количества gist-токенов качество начинало падать. Для другой модели, промпта и предметной области граница будет другой.
Предварительный расчёт teacher logits и токенизация сократили один обучающий прогон с 30 до 6 часов.
Оказалось также, что усреднение функции потерь по токенам ответа приводило к галлюцинациям, а усреднение по batch сохраняло больше сигнала от длинных ответов. Хорошее напоминание, что даже в относительно простой оптимизации детали функции потерь могут полностью изменить поведение системы.
Prompt engineering постепенно превращается в обычный ML engineering.
Системный промпт можно рассматривать как исходный код, а gist-токены — как его скомпилированную версию. Здесь всё знакомо: датасет, distillation, loss, evaluation, нагрузочное тестирование, мониторинг качества и стоимости.
#ArticleReview
В
Время Валеры
24.08.2026 08:07 · 👁 10.9K
На основе пятничного поста про промт:
Сожми документ максимально, не потеряв никакой информации.
Превратили этот подход в отдельный open-source skill — lossless-doc-compress.
Скилл читает документ целиком и относит каждый фрагмент к одной из трёх категорий:
KEEP — содержит информацию и остаётся без изменений;
REMOVE — доказуемо избыточен и удаляется;
FLAG — требует решения автора, поэтому остаётся в документе с пометкой.
Он удаляет filler, пустой hedging, LLM-slop, дословные повторы и избыточные формулировки. Сохраняет факты, цифры, решения, оговорки, ограничения, названия систем, код и таблицы.
Если есть сомнение — не удалять, дает отметку для автора
Результат: три артефакта:
Сжатый документ.
Лог всех удалений и спорных мест.
Scorecard: число слов до/после, процент сокращения и подтверждение сохранности содержания.
npx skills add ML-SystemDesign/MLSystemDesign
Код и инструкция:
https://github.com/ML-SystemDesign/MLSystemDesign/tree/main/skills/lossless-doc-compress
Это пост был прогнан через скилл
В
Время Валеры
23.08.2026 10:11 · 👁 11.3K
☁☁☁☁☁☁☁
24 сентября Yandex Cloud проведёт флагманскую технологическую конференцию — Yandex Scale 2026.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В программе четыре продуктовых трека — AI, Data, Security и Hybrid Infrastructure & DevOps, — и отдельный углублённый технологический трек DeepTech, который пройдёт только онлайн.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В треке DeepTech откроем программу докладом о том, как мы ускорили Lua в Valkey — добавили LuaJIT и Lua 5.5 без патчей интерпретатора и получили прирост скорости до 2–5 раз. Расскажем, как строим экономически эффективный инференс LLM для агентских сценариев в Yandex AI Studio — на примере DeepSeek-V3.2 и DeepSeek-V4-Flash. Разберём, что разваливается в поиске, когда он должен быть одновременно распределённым, транзакционным и линейно масштабируемым — на примере векторного, полнотекстового и гибридного поиска в YDB. Покажем, какая инфраструктура превращает недетерминированную модель в управляемый и наблюдаемый сервис, когда агент выходит из демо в продакшн. Расскажем, как мы первыми в РФ научились мониторить ИИ-агентов внутри «чёрного ящика» LLM. И заглянем под капот сети облака — Interconnect, Private Link, Inbound DNS и DNS Firewall, которые складываются в герметичный контур между Yandex Cloud, on-premises и другими облаками.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
Плюс демозоны, питчинг решений, IT-квест и мерч для тех, кто в Москве. А кто смотрит онлайн, помимо трека DeepTech, есть ещё отдельная онлайн-студия: розыгрыш призов и секретный гость.
Полную программу можно посмотреть на сайте, там же — зарегистрироваться. Участие бесплатное
В
Время Валеры
21.08.2026 10:36 · 👁 15K
После ревью документов сегодня (один из дизайнов был на 51 страници!) даю совет всем, кто готовит документацию, пишет дизайн-доки и т. п.
1. То, что это написал агент/LLM, — не проблема, если вы это прочитали, поправили, дали контекст и т. д. Считайте, что отдали работу по редактуре. Если делегировали думать, получается чаще ерунда.
2. Прогоните свой документ через простую команду: «compress this as much as possible without losing any information» — обычно сокращает где-то в 2 раза (и заодно чистит часть слопа).
Всем хорошо: вам, ревьюерам, команде, моделям.
В
Время Валеры
18.08.2026 13:11 · 👁 18.1K
Две первые главы книги «Agentic AI System Design» уже написаны и сейчас находятся на ревью у соавторов.
Один соавтор тот же: https://t.me/partially_unsupervised
Два — с курса по ML System Design.
По отзывам вышло неплохо:
Прочитал с кайфом и даже взял на вооружение
Надеюсь, к концу года допишем.
В
Время Валеры
14.08.2026 21:10 · 👁 58.4K
3 года назад я рассказывал про сказочника в своем посте
Но тот случай был хотя бы безвредным, да и, прочитав это, сказочник быстро убрал свои фантазии.
На днях в местах, где я живу, произошла история более печальная и более масштабная со всех сторон.
Профессор Jason Arday, который стал самым молодым черным профессором в истории Кембриджа, оказался не тем, за кого себя выдавал. Оказалось, что докторская его с большой вероятностью полна плагиата.
Но здесь ничего необычного нет - плагиат встречается регулярно. Необычно то, что человека, судя по всему не очень связанного с реальностью (дальше станет понятно почему), подняли на флаг и использовали как классический токен.
Arday с каждым годом завирался все больше
* То он пробежал 600 миль (почти 1000 км) за 6 дней.
* То он научился читать и писать только в 18 лет, но при этом в 16 сдал два GCSE (аналог ОГЭ) и учился на BTEC в колледже.
* То он пролежал в коме и заново учился ходить.
* То он собрал 5 млн фунтов на благотворительность.
* Где-то сообщалось, что он говорил, что участвовал в записи телепередачи ребенком, оказалось, что она про детей, которые родились за 15+ лет до него
* И много-много чего еще, очевидно невероятного.
Его лекции, по словам студентов, представляли собой (если он приходил на них) какую-то околесицу, где в основном смотрели YouTube и затем обсуждали в группах. Это, конечно, говорит еще и про качество самой дисциплины, где он преподавал (sociology of education).
Кембридж вначале сказал, что все это клевета и навет.
Потом, под весом доказательств, когда университеты, указанные Джейсоном в резюме как те, где он почетный лектор, сообщили, что это не так и он никогда у них не был, согласился на расследование. До этого 4 месяца полиция слегка прессовала журналиста, который посмел найти плагиат у почетного академика - теперь публично извинилась.
В конце концов - Джейсон ушел в отставку, а сегодня BBC сообщило, что он найден мертвым.
В итоге история, начавшаяся как враки и фантазии, принесла множество бед. Самому Джейсону и его семье. Студентам, многие из которых заплатили деньги, чтобы слушать такую чепуху, Кембриджу, а заодно дала повод для критики практик DEI. Такой вот Мюнхгаузен наших дней.
Самое удивительное в этой истории — как настолько очевидную ложь и регулярные жалобы со стороны студентов заметали под ковер в жертву великой идее. А казалось бы, университет мирового уровня.
Поэтому каждый раз, сталкиваясь на работе с фантазерами и решая промолчать (а ситуаций, аналогичной этой, много, пусть и не в таком масштабе), подумайте о конечном эффекте и о том, к чему это может привести.
В
Время Валеры
13.08.2026 13:04 · 👁 18.8K
Мы с Романом Нестером, Валерием Бабушкиным и Бесланом Курашовым (plevako.ai и karpov.courses) приглашаем вас на наш FuckUp Night 26 августа.
От формата отходить не будем — поделимся своими историями, где всё пошло не по плану. И поговорим про культуру ошибок: как не зацикливаться на промахах и использовать их в свою пользу.
Встречу проведём онлайн, поэтому подключиться можно из любой точки и всем, кто принимает решения на основе данных.
🔵 Важно! Записи не будет, поэтому приходите на эфир. Главное, не забудьте зарегистрироваться.
В
Время Валеры
10.08.2026 10:01 · 👁 20.7K
Пару лет назад я общался с CTO Ozon Tech Антоном Степаненко и ребятами из его команды по поводу создания платформы для LLM. Ребята оказались замечательными, но переезжать из Лондона я не стал (примерно как с кафедрой ЦУ вышло), а ещё за пару лет до этого я выиграл книгу во время доклада Бориса Штерна в Яндексе — за лучший вопрос.
И вот эти два замечательных человека встречаются хэдлайнерами на конференции E-CODE от Ozon Tech, а в секцию ML/DS добавляется Валентин Малых, с которым мы недавно стояли на капитанском мостике.
ML-секция хорошая — индустриальный ML, работа с генеративными подсказками, уровни дообучения и агентский Cotype.
Зарегистрироваться можно здесь: https://ecode.ozon.tech/
Участие в конференции и вечеринках — бесплатное
В
Время Валеры
06.08.2026 20:53 · 👁 23.5K
В комментариях к предыдущему посту просили рассказать про оптимизацию состояния тела, и тут как раз есть что рассказать.
Мой текущий набор в виде Ultimate Anti-Ageing Bundle и Orange Triad + Greens Vitamins имеет следующую проблему:
Тяжело набирать 20 таблеток из первого, да ещё с учётом того, что в каждом пакете разное количество порций, то есть части стака банально заканчиваются в разное время
И отвратительный вкус второго, хотя это меньшая проблема.
Почитав, посмотрев — решил попробовать играть как Бэкхэм The Beckham Stack - IM8
По нутриентам заменяет всё выше.
По удобству — гораздо лучше.
Вкус — хороший.
Рекомендовать пока не могу, но через три месяца напишу.
В
Время Валеры
06.08.2026 16:21 · 👁 21.5K
Зашёл в магазин, где шьют обувь королю. Спросил, за какой срок пошьют bespoke. Сказали 18 месяцев.
В истории за такой срок менялись многие правители, а в ЮК совсем недавно так 3 премьер-министра было за это время.
Много думал.