4255
❤️☠️🤗 идейная миграция небытия
Минусы?
Мистраль: жабовиноублюдская багетомакаронная гулагокартельная макроноублюдия
Русские: паролимпиада
(После поста удалите этот текст, деньги придут на указанный счёт)
Halo: почти год моей работы в White Circle теперь в опенсорсе
Почти год я веду в White Circle разработку Halo - фреймворка для тренировки LLM, на котором мы учим все свои модели. Внутри он работал давно как замена Мегатрона, но до публичного релиза пришлось догнать transformers, TRL и vLLM, добавить модели и упростить адопшен - образы, CLI, документация. Подробный блогпост - на сайте White Circle (https://whitecircle.com/research/halo).
Если вы файнтюните открытые модели, то наверняка упирались в: модель уже не лезет в TRL и обычный FSDP, но связываться с Megatron и конвертацией чекпоинтов еще рано или просто не хочется. С MoE все еще хуже, без Expert Parallelism их по большому счету не потренировать. Halo добавляет EP, Context, Tensor и Expert-Tensor Parallelism прямо поверх обычных классов HuggingFace: на вход HF модель, на выходе HF модель. Новое MoE семейство подключается оберткой меньше 140 строк (у Megatron-Bridge на то же самое уходит 600-1900), сейчас их 15.
Немного цифр, все на B300, воспроизводимы из репо:
- 2.3-2.8x throughput относительно стокового TRL на gpt-oss-20b при тех же кернелах, loss совпадает в пределах ~1%.
- Gemma 4 26B-A4B на 2 GPU: 7.2k tok/s против 3.2-5.0k у NeMo AutoModel, Axolotl, Megatron Bridge, MS-SWIFT и Unsloth.
- Оптимизатор целиком в bf16 со стохастическим округлением: 120 GB состояния вместо 240 для 20B.
Все это првоерялось на реальных кластерах B300/B200/H200/H100 а топология заложена вплоть до NVL72: невалидные раскладки отбрасываются еще на этапе конфига. Запускается через torchrun, accelerate или halo CLI, в репо есть рецепты под SLURM, SkyPilot, RunPod и Nomad. Большая часть года ушла на то, чтобы все это не разваливалось на всех комбинациях моделей и параллелизмов - тестов в репозитории больше, чем кода. При этом работать будет также и на современных консьюмерских GPU.
Отдельная моя гордость - Async RL. vLLM или SGLang живут в отдельном контейнере, роллауты идут асинхронно через Ray, веса уезжают по NCCL (по EFA 53-80 GB/s, gpt-oss-120b обновляется за 3-4 секунды), а генерации во время синка не обрываются. Внутри routing replay, importance sampling с масками, обучение на токенах, которые насэмплил движок, и 11 встроенных сред - от code contests и SWE до тулов через MCP. По механикам это сопоставимо с verl и Miles, только на HF-моделях и без Megatron.
Для студентов и тех, кто только начинает, Halo, мне кажется, хорошая точка входа. Все запускается из одного docker-образа: halo launch sft config.yaml, а QLoRA Qwen3-4B занимает 7.9 GB и должна работать на 3090/4090. Документации больше 170 страниц, отдельно советую прочитать лекцию GPU Training Theory: база того как работают такие фреймворки, почему эксперты в MoE упираются в память, а не в compute, и почему в EP-шаге 88% времени - это all-to-all. Там же честно написано, что не помогает и что тихо ломает, например TF32 по умолчанию в NGC-образе, портящий RoPE после 2048 токенов.
Выложили и модель - GLM-4.7-Flash-Coder, 30B MoE под агентские скаффолды: SFT на 7.8k успешных траекторий GLM-5.1, на SWE-rebench-V2 pass@1 вырос с 33.2% до 41.7%, а модель сама научилась вызывать тулы параллельно. Она уже слегка устарела, но как гайд по агентскому SFT актуальна.
Код мы пишем с агентными скаффолдами и сильными моделями вроде Claude Fable и Opus, репозиторий под это спроектирован. Контрибьт приветствуется, но через фильтр: сначала issue и approve мейнтейнера, потом PR. Главное правило - понимать свой код: с AI писать можно, но это нужно раскрыть, а тесты должны падать, когда ломается поведение.
Дальше больше: Pipeline Parallelism (все уже в коде, но докатим после полных тестов) и серия блогов про тренировку, например про async RL для code contests. Лицензия Apache 2.0.
P.S. Если помните такую вещь как SMPO из времен Vikhr, то он теперь тоже живет там, но уже с EP и CP и улучшениями.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base/blob/main/README_en.md
Удивительно но Yandex релизнул модели адекватнее с точки зрения претрена и архитектуры чем все европейские лабы (включая купленный Nvidia poolside)
Но без покупки энвов видимо sft и rl заводить сложно, поэтому пока только base. Выглядит очень хорошо в сравнении с тем что было не от китайцев.
Мне же не поверят что мне не платили да?
seed dance 2.5 это... это вообще возможно?
Читать полностью…
Бумажные участки в Москве переписали
1) под ЛДПР чтобы их не обогнали новолюди
2) под ср немного чтобы они прошли
Забавно что у jev есть такой llmный positional bias
Читать полностью…
Зал «Сеть»: расписание и вопросы спикерам 🦾
Под этим постом можно задать вопросы спикерам зала «Сеть». Оставляйте их в комментариях и добавляйте хэштег нужного спикера.
🟢 13:20-13:55 — Ouroboros: что внутри агента, обошедшего Codex, Claude Code и Cursor, Антон Разжигаев
#Разжигаев_вопрос
🟢 14:50-15:25 — От градиентного бустинга к Deep Ranker: опыт перехода в ранжировании без слёз, Андрей Белобородов
#Белобородов_вопрос
🟢 15:30-16:05 — NEEDLE: открытый бенчмарк движков для веб-поиска, Илья Гусев
#Гусев_вопрос
🟢 17:10-17:45 — Evals для LLM-систем: от вайбчека к метрикам для агентов и LLM-продуктов, Алексей Степин
#Степин_вопрос
🟢 17:50-18:25 — LLM-матрёшки: от исследовательского метода к рабочей технологии, Артём Федоров
#Федоров_вопрос
Подписывайтесь:
➡ @Practical_ML_Conf
https://arena.ai/blog/coding-agents-harness-tax
Читать полностью…
35б +- так же или лучше
мб стоит учить на данных не 7 летней давности с длинной 256 токенов тогда gpqa и прочее будет хорошо себя чустовать
но если серьезно это очень круто, челы повесили свои же ллмки оптимизировать себя же
Читать полностью…
Typesafe: pnewed 💨
Jev: liberated 🫡
Я обучил MLP поверх qwen 4b и оно работает буквально как та хайповая модель из твитера
https://huggingface.co/AlexWortega/openjev
X репостите в тви пж
Всем привет!
Обучил адаптер который заменяет Квен-4б на младшего брата Квен-0.6б
в Клейн-4б
https://huggingface.co/AiArtLab/qwen3-0.6b-4b-adapter
Qwen3-0.6B text encoder adapter for FLUX.2-klein-4B
Replace klein's 4B text encoder with a 0.6B one — 7.5 GB VRAM and ~0.3 s/step less.
Те можно разгрузить немного рам и сэкономить бакс-другой на инференсе
Устал как скотина нет сил описывать как я не спал всю ночь дипсик пиная
Вроде неплохо вышло - к моему удивлению даже текст немного тащит в 6 раз меньшая модель. Комфи тоже сгенерил
Может ломаться на редких сложных токенах - все таки я ГПУ-бомж
По качеству +/- как в базе где то лучше где то хуже - без чудес
Открыл интернет там ну все как обычно
Читать полностью…
Слава богу у нас есть такие замечательные компании которые спасут нас от апокалипсиса.
Читать полностью…
К другим новостям французского фронтира, в связи с невозможностью регистрации la chaton fat, Mistral выкитили лучшую модель из возможных - glm5.3 (ей три месяца)
Читать полностью…
Грок обновили и он... Прям неплох?
Тут правда нюанс что грок примерно как китайские модели - цифры большие, капабилити не очень
https://x.ai/news/grok-4-7
🌸AI Research Preference Model🌸
#nlp #про_nlp #nlp_papers
Сегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: нет). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”.
🌸TL;DR
Главная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять.
Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может выучить паттерны лучших практик МЛ, чтобы использовать эту информацию для попарного сравнения экспериментов, какой будет более перспективным.
Рассматриваются два варианта:
Inference-only RPM анализирует планы, код и результаты предыдущих экспериментов только при помощи рассуждений LLM.
Agentic RPM дополнительно проводит дешёвые пилотные эксперименты: запускает сокращённое обучение (5 минут, 30 минут, 4 часа), проверяет код и использует полученные метрики для выбора.
🌸Агент
RPM встроена в исследовательского агента AIRA-dojo. На каждом шаге агент генерирует 15 вариантов продолжения, после чего RPM проводит попарное сравнение и отправляет на полноценный запуск только победителя.
🌸Данные
Эксперименты проведены на 20 задачах AIRS-Bench, охватывающих языковое моделирование, математику, биоинформатику и временные ряды. Каждому запуску предоставлялись 24 часа на одной H200 GPU.
🌸Основные результаты
обычный AIRA-dojo: 0,684 среднего нормализованного балла;
с Inference-only RPM: 0,711;
с Agentic RPM: 0,729;
теоретически достижимый результат: 0,748.
Обе RPM достигают результата обычного 24-часового агента примерно за 15 часов, то есть требуют примерно в 1,5 раза меньше вычислений. Кроме того, были получены новые SOTA:
94,1% на WinoGrande против прежнего агентного SOTA 90,4%;
95,7% на SVAMP против опубликованного человеческого SOTA 94,2%.
🌸Главный вывод статьи:
прогресс исследовательских агентов зависит не только от способности генерировать хорошие идеи, но и от умения выбирать, какие идеи заслуживают дорогой экспериментальной проверки. Дополнительные вычисления выгодно тратить не только на генерацию решений, но и на их предварительный отбор, основанный на предсказуемых и верифицируемых сигналах.
Сигнала от мини-версии эксперимента, с первых 5 минут, бывает вполне достаточно!
Проверено на одном скаффолде, но для всех tree-search подходов такой апгрейд должен сработать.
🟣Arxiv https://arxiv.org/abs/2608.13940
🟣Alpharxiv https://www.alphaxiv.org/abs/2608.13940
спасибо @nadlskom за нормальный ui и @akhaliq за домен
твитер
мнение примерно такое:
- примерно миллиард компаний делает классификацию на gpt terra/gemeni flash и тд
- сделать модель которой из апи можно сунуть "такие опции, такие ответы, сmon do something"
- я думаю что внутри *** A < 10b или по русски - сколько то тотально и 10b активных
- я не думаю что внутри есть сложные алгоритмы, но явно есть хорошие данные - модель отлично справляется с вайбчеком на "умность"
- PR охуенный 12/10
- опенсурсных клонов будет много, я свой сделал буквально за три промпта пока давился ужасной пиццей (не кушайте дьяволу в лондоне это лютый скам)
- все опенсурсные клоны в среднем говно будут + нормально сервить надо
Если вы ещё не проголосовали то завтра будет самое время сходить на iditena.org
Читать полностью…
Сегодня буду рассказывать про NEEDLE на Practical ML Conf. Там же Антон (@abstractDL) прямо сейчас рассказывает про Ouroboros.
Программа: https://pmlconf.yandex.ru/2026/program
Стрим: https://www.youtube.com/watch?v=8IWLBsQU7qE
🌱 Alfa Connectome ML Competition 🌱
Началось новое соревнование по машинному обучению от Wunder Fund.
Задача: Вы будете изучать исторические торговые данные для двух связанных инструментов. Нужно создать модель, которая предсказывает индикаторы движения цены одного из них по информации об ордербуке, сделках и кое-чем еще.
По сути, классическая работа кванта. Вы будете работать с реальными биржевыми данными.
Когда: 11 сентября — 15 ноября
Призовой фонд: $13,600
Победители получат денежные призы, приглашение побеседовать в Wunder Fund, а главное — большое интеллектуальное удовольствие. Сам Wunder Fund с 2014 года занимается высокочастотным трейдингом с дневным оборотом более $10 млрд.
>> Участвовать
го сходим накидаем голосов против единой россии? заебали уже
Читать полностью…
https://z.ai/blog/glm-built-its-inference-infrastructure
two fun facts:
- every model lab doing it
- there is no safety lab who actualy care about RSI evaluation
Поймали инопланетяне русского, француза и немца, заперли каждого в замкнутую 2 на 2 метра, выдали каждому доступ к Codex, GPT Sol и GPT Astra и сказали:
– Кто за день придумает с этими нейросетями то, что нас удивит, того отпустим, а остальных на опыты отправим!
Через день заходят к французу. Тот сидит посреди комнаты, а Codex пишет код, GPT Sol сочиняет к нему документацию в стихах, а GPT Astra переводит всё это на двенадцать языков, включая инопланетный.
– Что ж, француз, ты нас удивил! Если те двое ничего не придумали, мы тебя отпустим!
Заходят к немцу. У того все три модели работают в идеальном агентном пайплайне: Codex пишет, Sol ревьюит, Astra гоняет тесты, покрытие сто процентов, ни одного упавшего билда. А сам немец при этом отбивает чечётку.
– Ну, немец, удивил! Сейчас посмотрим, что там русский придумал, и отпустим тебя!
Инопланетянин заходит к русскому. Через минуту выходит весь обалдевший:
– Нет, ребята, вы проиграли. У него в кодексе сейчас квен и опус
Знаешь, как правильно настраивать поиск в Qdrant?
На старте с Qdrant всё просто: несколько строк кода, коллекция, векторы, поиск. Получил результаты и думаешь: а что тут вообще ещё настраивать?
Вопросы возникают, когда хочется больше, чем поиск, который «как-то» работает.
Как устроен HNSW под капотом и как его настраивать? Как изменить топологию графа, чтобы точки одного тенанта образовывали плотные «острова»? Как это влияет на скорость поиска и память? Что происходит при росте коллекции? Зачем нужны ColBERT и MaxSim и как MUVERA позволяет сохранить точность без потери скорости? Как настроить мультитенантность и не превратить систему в тысячи коллекций?
Мы сделали курс из 12 лекций с теорией и практикой. В каждом разделе есть примеры и готовые паттерны кода, которые можно использовать в своих проектах.
Для подписчиков LOVE. DEATH. TRANSFORMERS промокод LDT2026 даёт скидку 30%.
Самое время записаться на курс Qdrant:от основ до готовой поисковой системы на Stepik.
Я обучил очень простой переводчик мозга мухи который позволяет ей управлять microduck, так что теперь можно дать мухе РОБОТИЗИРОВАННОЕ тело
https://huggingface.co/spaces/AlexWortega/flywire-microduck
https://x.com/justALEXWORTEGA/status/2099441563134758962?s=20
🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
Выкладываем в open source первую модель GigaChat с полноценным рассуждением. В основе — 432B-A28B MoE. После SFT мы обучили с помощью online RL шесть экспертов по разным направлениям: от математики и кода до агентов, диалога и следования инструкциям. Затем собрали их в одну модель через on-policy distillation: ученик генерирует ответ сам, а эксперт нужного домена оценивает каждый его токен, так что ничего из выученного в RL не теряется.
Что получилось по сравнению с GigaChat 3.5 Instant:
🔘SWE-Verified: 43 → 65
🔘AIME-2026: 67 → 92
🔘IFBench: 44 → 77
Рассуждения заметно усилили кодовые и базовые агентные навыки: модель вышла в паритет с сильнейшими открытыми и закрытыми моделями в следовании инструкциям, структурированной генерации и поиске информации в длинном контексте. При этом на сложной математике она тратит на 37% меньше токенов, чем конкуренты: высокие результаты не обязательно требуют более длинных рассуждений.
На внутренних корзинах в юридическом домене — экзамен по российскому праву, ответы по документам — модель показала себя лучшей среди доступных open source моделей. Также модель хорошо разговаривает на русском, имеет высокие показатели на внутренних и внешних аренах, обгоняя другие русскоязычные нейросети, в первую очередь за счёт фактической точности ответов.
Что интересного в обучении:
— Обучали модель на большом числе сред, а также сами построили 55 уникальных сред с проверяемым результатом, 12 тысяч задач, часть полностью на русском.
— Агент для кода учился внутри настоящих harness.
— Curriculum, который перед каждой стадией убирает уже освоенные задачи и позволяет сократить затраты на инференс вдвое.
— Нативный FP8 на всех этапах.
Подробнее о конвейере обучения, наградах и граблях, на которые мы наступили, — в статье на Хабре.
➡ Хабр: статья
➡ Hugging Face: fp8 | bf16
➡ GitVerse: репозиторий