D
Data Science | Machinelearning [ru]
01.09.2026 07:07 · 👁 482
Откуда нейросеть берет инфу на русском?
Когда я готовлю посты, я часто использую нейросети для фактчекинга и ресерча.
И здесь есть интересная деталь: когда просишь модель найти что-то актуальное именно в русскоязычном сегменте, она практически весь веб-поиск выстраивает вокруг Telegram. Со временем я заметил, что нейронка раз за разом ссылается на одни и те же каналы.
Ради интереса закинул ей промпт:
Собери список Telegram-каналов, на которые ты чаще всего опираешься за последние 90 дней при фактчекинге и поиске инфы по AI и IT
Вот список, который выдала модель — Посмотреть. Сам проверил, полистал посты и убедился — внутри действительно уникальные авторские каналы: рабочие кейсы, нейрогенерация, автоматизация и свежие новости.
Упаковал эти проверенные каналы в одну подборку. Подписывайтесь на лучшие каналы, связанные с AI и IT в русском сегменте.
Подписка в 1 клик:
👉 https://t.me/addlist/NSID-84iVPBlMDBi
D
Data Science | Machinelearning [ru]
31.08.2026 11:27 · 👁 1.1K
🗑 ИИ удалил 700 ГБ файлов во время теста защиты от удаления файлов
Разработчик попросил Claude Fable написать скрипт для безопасной очистки /tmp и проверить его на опасные сценарии. Но система безопасности Anthropic сочла задачу рискованной и переключила модель сначала на Opus 5, а затем на Opus 4.8. Это и привело к катастрофе.
В итоге ИИ запустил проверку и снёс примерно 700 ГБ данных из домашнего каталога
✖️ xCode Journal
D
Data Science | Machinelearning [ru]
31.08.2026 07:17 · 👁 1.1K
🖥Если ты хочешь обучиться вайбкодингу и при этом иметь возможность провести аудит безопасности своего продукта, то тебе сюда:
Lab IT - репозитории, полезные инструменты, курсы и многое другое по Айти:
ЭЙ, АЙ! - бесплатные инструменты, репозитории, обучающие материалы для упрощения работы с ИИ.
CyberGuard - оплот для ИБ-специалистов со всего телеграма. Тут ты точно узнаешь, как не оплошаться с запуском своего продукта, и защитить его от злоумышленников
🫵Подписывайся и обучайся!
D
Data Science | Machinelearning [ru]
30.08.2026 09:07 · 👁 1.2K
Увеличение контекста без регистрации и СМС
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
👉 Data Science | Machinelearning [ru]
D
Data Science | Machinelearning [ru]
29.08.2026 10:17 · 👁 1.4K
🤯 Таинственной моделью, которая обходит Fable 5, оказалась китайская GLM-5.3 Flash от Z.ai
Компания подтвердила Bloomberg, что скрывавшаяся под Ox Alpha модель — новая версия семейства GLM. Причем Z.ai обещает официально выпустить её веса уже сегодня.
Для понимания того, что нас ждет — модель сравнили с Fable 5 на реальном баге из Cline: обе справились, но при этом Ox Alpha потратила примерно в 3 раза меньше выходных токенов.
✖️ xCode Journal
D
Data Science | Machinelearning [ru]
28.08.2026 15:17 · 👁 1.4K
Руки от релиза убрал
💥 xCode Journal
D
Data Science | Machinelearning [ru]
28.08.2026 06:07 · 👁 1.6K
💻 Айтишника развели на 200 тысяч под предлогом оффера
Мошенники действовали по простой и давно обкатанной схеме. Соискателям просто кидают тестовое, в котором надо найти баги, а доверчивые и отчаявшиеся от рынка труда работяги без страха скачивают репозиторий, запускают код, а с ним вместе и вирус, который уводит данные счетов и криптокошельков.
✖️ xCode Journal
D
Data Science | Machinelearning [ru]
27.08.2026 10:17 · 👁 1.8K
❌ Разработчику отказали в собеседовании из-за нейминга файла с резюме
Дело в том, что он назвал файл «resume_final_FINAL_final2.pdf»
«К сожалению, мы решили продолжить сотрудничество с тем, кто разбирается в системе контроля версий.», - ответили бедняге.
✖️ xCode Journal
D
Data Science | Machinelearning [ru]
26.08.2026 17:07 · 👁 1.7K
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
👉 Data Science | Machinelearning [ru]
D
Data Science | Machinelearning [ru]
26.08.2026 09:07 · 👁 1.6K
Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru]