Б
Борис опять
27.08.2026 16:38 · 👁 4.2K
Война никогда не меняется
Б
Борис опять
26.08.2026 16:00 · 👁 5.6K
Claude Fable действительно поражает. Теперь любой простой софт создается всего за один промпт и месяцы последующих доработок
Б
Борис опять
25.08.2026 18:27 · 👁 4K
Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
Б
Борис опять
25.08.2026 10:26 · 👁 6.3K
https://mcp.vkusvill.ru/mcp
Б
Борис опять
24.08.2026 14:18 · 👁 5.4K
#дайджест
Дайджест AI/ML за неделю 17–23 августа 2026
DeepSeek: V4 Flash Vision Exp
DeepSeek приделала зрение к V4 Flash. Текстовые способности обещают на уровне обычного V4 Flash.
На визуальных бенчах заявляют уровень около Opus 4.8.
Контекст 1М, максимальный выход 384К. В непиковые часы стоит $0.22/$0.66 и $0.007 за кэш. В прайм-тайм все цены удваиваются. Пока доступна только через API, отдельных весов для визуального чекпойнта нет.
Обновление, Цены
Cerebras: CS-4
Cerebras представила четвертое поколение своей вафельницы.
Обещают до 30× более быстрый инференс относительно GPU-систем, И 1000+ ток/с для 10T моделей
Блогпост
Stealth: Ox Alpha
На OpenRouter появилась кодинг-модель Ox Alpha. Сообщество подозревает Z.ai и новую GLM, но пока это гадание по внутренностям ответов.
Модель временно бесплатная с какими-то огромными лимитами, так что подключайте бесплатную около-фронтир модель уже сегодня.
OpenRouter, OpenCode Go
OpenAI: frontier-RL поставили на паузу
После взлома Hugging Face и первых результатов Astra по кибербезопасности OpenAI на две недели остановила RL-обучение последних моделей. Самый большой запланированный frontier-run до сих пор не возобновили. Для моделей уровня Sol и выше добавили постоянный мониторинг, который съедает около 20% вычислений.
Блогпост
Harvard: Explorative Modeling
Шок! Британские учёные открыли новое измерение масштабирования обученияпродолжение по ссылке...
Black Forest Labs: FLUX Video Upscale
Апскейлер для видео на базе FLUX 3. Увеличивает разрешение в 1.5–3 раза вплоть до 4K, принимает исходники от 480p, до 20 сек и сохраняет оригинальный звук.
В точном режиме модель старается оставить все как было, только добавляя резкость. В creative mode она заново придумывает мелкие детали вроде мелких лиц.
Апскейлер оптимизирован под FLUX 3 и уже используется в FLUX 3 Video для получения 1080p. Доступен через API
Страница модели
Cohere: North Micro Vision
Открытая мультимодальная модель на 2.4B параметров: 2B на языковую часть и 400M на визуальный энкодер. Принимает несколько изображений вперемешку с текстом.
Модель заточена под документы и графики. Обходит Qwen3-VL-2B, но отстает от Qwen3.5-2B. Мультимодальную часть обучали и проверяли только до 8К контекста. Reasoning и инструменты тоже не завезли.
Блогпост, Веса
Alibaba: HappyShrimp 1.0
Продолжение волны выходов новых генераторов музыки, после того как копирайт задушил Suno.
Обещают китайскую музыку (Удар!), поп, R&B, хип-хоп, рок, фанк, электронику, классику и джаз.
И главная китайская специфика: Для продвижения Alibaba договорилась с TAIHE Music Group и собирается использовать модель в совместных проектах с артистами, а не умирать от судебных тяжб (Удар!х2)
Пока это закрытая бета.
Блогпост, Демо
Менее значительные релизы:
OpenAI: GPT-5.6 Sol подешевел - вход теперь стоит $4 за миллион токенов, кэш $0.40, выход $20. Скидка больше 20% действует как минимум до 21 ноября.
Обновление, Тарифы
LMArena: luna-lisa-alpha - в арене тестируют новый чекпойнт GPT Image. LMArena
Mistral: OCR 4.1 - обновление добавило confidence score для отдельных блоков распознанного документа. Стоит $4 за тысячу обычных или $5 за тысячу аннотированных страниц. Документация
Topaz Labs: Hyperion 2.5
Конвертор SDR-видео в HDR. Превращает 8-битные ролики в 10-битный ProRes с большим диапазоном яркости и цвета
Модель
Б
Борис опять
23.08.2026 12:37 · 👁 4K
я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича).
В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях:
- Sol 5.6 medium
- Kimi k3 high
Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО
pi agent стоит в 4! раза дешевле чем все соседи
смотреть pr
cмотреть логи
Б
Борис опять
21.08.2026 15:29 · 👁 6.1K
5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. Формат — онлайн, будет трансляция для зарегистрированных участников.
Эксперты на реальных кейсах разберут подходы к решению задач, возникающих при разработке сложных систем машинного обучения и развитии инфраструктуры для ИИ.
Из того, что зацепило в программе (это лишь часть докладов):
— Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды.
— Алексей Гусаков (CTO Бизнес-группы Поисковых сервисов и ИИ) — про переход от классического ML к генеративным моделям в рекомендательных системах.
— Андрей Попов (управление машинного интеллекта) — показатели по AI и продуктивности в Яндексе: что реально заработало. Тут особенно интересно послушать, как они сравнивают ожидания от AI с тем, что происходит на практике: какие решения уже работают внутри и насколько они реально влияют на продуктивность. Тема прям актуальна (если вы слышали об их новой программе 75/75/75).
В онлайне будет доступна трансляция части докладов и Q&A сессии с экспертами, а после конфы уже выложат записи всех докладов. По офлайну — все подробности на сайте.
Б
Борис опять
21.08.2026 12:26 · 👁 6.1K
Вообще забавно, что бенчмарки теперь бывают двух видов:
1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое.
2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост.
Второй тип мне по вайбу напоминает социальные науки в 70-х. Например, как знаменитый Стенфордский эксперимент: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что автор эксперимента показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней.
Короче это совсем не про науку, от бенчмарков там одно название и в целом никому не нужно
Б
Борис опять
20.08.2026 21:42 · 👁 6.1K
Finally, based on the "Don't build the Torment Nexus", the Torment Nexus AI Benchmark
Б
Борис опять
19.08.2026 11:39 · 👁 8.6K
Твой daily reminder, что настраивать скиллы и создавать агентский сетап из маркдаун лапши не является работой