265
Что-то на непонятном Для связи: @lvlinfinite
смерть в нищете близка🤩🤩, поэтому разгребаем коммишки по тихоньку🤩
первый на очереди:
отличный мойщик посуды🤩, кодер в кодировании🤩🤩Читать полностью…
GLM-4.7-Flash выложили
https://huggingface.co/zai-org/GLM-4.7-Flash
Трейн на тесте ?
LTX-2 - open weight 4K/50fps видео с аудио от Lightricks
Lightricks, компания, стоящая за одним из первых "контент-заводов" LTX-Studio ещё до того, как эти заводы заполонили Твиттер, сделала интересный пивот. Чуваки выпустили в опенсорс видеомодель LTX-2, первая версия которой, лежала в основе их реактора.
Модель занимает не самое высокое 23-е место на LM видео арене, но главное здесь не это. LTX-2 — первая полностью открытая модель, которая умеет генерить нативное 4K видео при 50 FPS с синхронизированным аудио (диалоги, музыка, SFX) длиной до 20 секунд.
В основе LTX-2 лежит единый асимметричный двухпоточный трансформер для совместной генерации аудио и видео через кросс-атенш.
Модель на 19B (14 для видео и 5 для аудио) спроектирована для запуска на потребительских GPU. В опенсорс выложены не только веса, но и пайплайны для инференса и код для тренировки. Кроме того из коробки LTX-2 квантована в NVFP8 (на 30% меньше, до 2х раз быстрее) и оптимизирована под экосистему NVIDIA, а ComfyUI поддерживает её с первого дня.
Не совсем понятно, как этот релиз сочетается с их основной бизнес-моделью. И если раньше их амбициозное желание создать свою модель было понятно, то зачем выкладывать её в опенсорс — совсем неясно. Ведь умельцы из ComfyUI уже повторили тот же LTX Studio у себя в Comfy и n8n на других моделях.
Техрепорт
GitHub
Hugging Face
Попробовать
@ai_newz
Всех поздравляю с наступающим. Нас уже больше 200 человек. Это небольшая цифра, но здесь собрались самый лучшие люди (это вы, подписчики). Пусть в новом году у вас будет меньше дедлайнов, меньше задач а зарплаты выше. Отмечайте так, чтобы завтра было стыдно но хорошо. С НГ !
Читать полностью…
doom на микроволновке? а как насчет llm на z80 процессоре?
Типа прикиньте, это процессор из 1976 на котором запускается 40kb бинарник с моделью на несколько тысяч параметров, обученная отвечать только "OK, WHY, R U?, MAYBE, AM I"
А еще вся арифметика целочисленная + веса квантуются в 2бит. А еще эту модель можно запустить на железе которое на момент событий 1 сезона "Stranger Things" было устаревшим
code
Бета релиз Borealis 5b - 4b
qwen + whisper + сделали плагин для vllm + теперь оно работает с инструкциям и может решать задачи qa, cls, summarize, json mode
Это тестовый релиз, не финальный, я хочу собрать что не работает и как вы пользуетесь
Модель на hf
nanoGPT от Андрея Карпаты стала первой в мире LLM, обученной и запущенной в космосе
Мы уже несколько раз рассказывали вам о стартапе Starcloud. Они занимаются строительством космо-датацентров и к 2030 году планируют вынести на орбиту аж 5 гигаватт железа.
В начале ноября они запустили в космос первую в истории видеокарту H100 – на спутнике размером с холодильник.
Сначала сообщалось, что на ней планируется тюнить Gemma, но сегодня Starcloud рассказали, что вместо этого обучили целую модель с нуля!
Они взяли nano-GPT – минималистичную реализацию GPT на PyTorch от Андрея Карпаты, – обучили ее на полном собрании сочинений Шекспира и успешно запустили инференс! Gemma, кстати, тоже запускали, но только предзагруженную.
https://huggingface.co/deepseek-ai/DeepSeek-V3.2
Говорят на уровне GPT-5
https://huggingface.co/deepseek-ai/DeepSeek-V3.2/resolve/main/assets/paper.pdf
HuggingFace релизнули замечательную свежую книгу про обучение LLM
200+ страниц, 7 больших глав. Содержание примерно следующее:
– Архитектуры, их особенности и оптимизация гиперпараметров
– Работа с данными
– Предобучение и какие в нем есть подводные камни
– Пост-трейнинг: все современные подходы и как их применять
– Инфраструктура, как ее правильно строить и оптимизировать
По сути, это готовое хардовое пособие по тому, как с нуля обучить и захостить LLM.
Написано все на довольно простом английском и читается легко + есть куча схем и примеров. В общем, выглядит годно.
huggingface.co/spaces/HuggingFaceTB/smol-training-playbook
Это победа! 🤩
Микроконтроллер распаян, компоненты драйвера двигателя тоже ( паять SMD компоненты - то ещё удовольствие... ). Прошивка залита, двигатель управляется, а это значит, что схема спроектирована правильно. Полторы недели работы были не напрасными. Завтра постараюсь рассказать подробнее, что я задумал.
Vistral-24B-Instruct
Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный энкодер, убрана мультимодальность. Сохранена стандартная архитектура MistralForCausalLM без изменений в базовой структуре модели.
🔗 Карточка модели: https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct
🔗 GGUF (скоро): https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct-GGUF
⚖️ Лицензия: apache-2.0
Сайт: https://vikhr.org
Донаты: Здесь
👥 Авторы: @LakoMoorDev @nlpwanderer
https://github.com/xai-org/x-algorithm
Зачем я заставил клод код с помощью manim визализировать алгоритм работы твиттера - вопрос интересный. еще интереснее что делал я это целиком с телефона
https://wedlm.github.io
Очередная убийца классического LLM?
https://arxiv.org/pdf/2512.22737
Запускаем получается llm на gameboy
У него тоже модифицированный z80
Был найден ресурс по Digital Signals с красивыми визуалицациями.
Есть примеры на Python и интерактивные графики.
Время ботать 🍷
(или как минимум позалипать)
https://brianmcfee.net/dstbook-site/
Limit Order Book, он же стакан — механизм биржи, объединяющий покупателей с продавцами.
Исходя из названия, он собирает в себе лимитные заявки. У каждого ордера есть такие параметры как:
- side — всё просто, покупка или продажа.
- quantity — количество актива в заявке.
- price — очевидно, цена.
Про Time in Force и скрытые ордера чуть позже.
Когда мы хотим купить какой-то актив здесь и сейчас, мы отправляем market order на биржу, где её matching engine исполняет его, сопоставив с лимитными ордерами.
Приоритетность исполнения одних лимитных ордеров перед другими зависит от логики конкретного matching engine, но есть некоторые общие правила:
- Price–Time Priority — сначала метчим ордера с лучшей ценой, но если несколько стоят по одной цене, то из них выбирается тот, который был выставлен раньше.
- Price–Pro-Rata Priority — исполняем по лучшей цене, но если на этой цене стоит несколько крупных ордеров, то метчим их пропорционально их объёму.
- Size–Time Priority — на одинаковой цене между ордером с большим объёмом и выставленным ранее выберем тот, у кого больший объём.
- Visibility Priority — Visible > Iceberg > Hidden.
Про видимость ордеров:
- Visible — просто ордера, полностью видны всем участникам рынка.
- Iceberg — ордера, видимые в стакане лишь частично. Когда их заданная видимая часть исполняется, биржа обновляет ордер с новой видимой частью, которая будет максимум заданного в параметрах ордера размера, пока он не исполнится полностью. При обновлении ордер может терять приоритет по времени.
- Hidden — в ордербуке не видны, но трейды по ним исполняются. Можно заметить в виде сделок, которые прошли по непойми откуда взявшейся цене между best ask / best bid.
Time in Force:
- GTC (Good Till Cancelled) — ордер остаётся в стакане, пока его полностью не исполнят или пока пользователь не отменит его.
- IOC (Immediate Or Cancel) — ордер должен быть исполнен немедленно хотя бы частично; всё неисполненное сразу отменяется. Забирает ликвидность, но в отличие от простого Market ордера ставит ограничение на цену, а не просто исполняется по доступной цене.
- FOK (Fill Or Kill) — жёсткая версия IOC. Ордер должен быть исполнен полностью и сразу; если это невозможно — он отменяется полностью.
Поправляйте, может где ошибся
Парень сделал в браузере полноценный автодиф на WebGPU.
Выглядит прикольно, понравилось то что визуализировали обучение. Можно посмотреть как вообще происходит обучение.
https://github.com/vinhowe/piston
https://sequence.toys/
https://github.com/huggingface/transformers/pull/42498/files
Хмм... новый Vistral ?
DOOM
Знаете в чем плюс заниматся не особо нужной ерундой?(ресерчем чего либо вокруг русских бенчей которые никому не интересно оптимайзить)
Можно наблюдать как прирстают модели на математике, при этом на физике прирост между поколениями всего несколько процентов. Причем если смотреть на ошибки там именно не понимание какие законы/формулы считать, а не численные.
Ну и gemeni3pro клево поскелйилась по токенам, хоть и гонится прям ОЧЕНЬ долго и дорого, но результаты на матемтике того стоят. А вот решит ли она jew problem будет известно позже
А и теперь у нас есть папир, мы даже свозили его на воркшоп EMNLP, спасибо рекламе в этом канале за возможность оплачивать эвалы моделей
Paper
LB
Годноту ловите
https://habr.com/ru/articles/963338/
HF книжка по megatron, fsdp и прочему для обучения реально больших моделей
Читать полностью…
Qwen3-Next 80B-A3B
C того момента как она вышла, уже вышла Doubao, Step3, Qwen3-235B, DeepSeek V3.2 и я за пивом
- Hybrid Architecture: Gated DeltaNet + Gated Att - вариция на тему RNN + не везде а только 75% cлоев и 25% cлоев обычный attention
- 3b активных параметров при 80 тотал
- Используют QK postnorm по аналогии с DIT для улучшения стабильности
- MTP как в deepseek
- Показывают бОльшую скорость префила и декода чем соседи по метрикам (это если что qwen 30bA3 и qwen 32b)
blog
Таймлайн у нас... Интересный.
Короче Sama дали PhD в mbzuai
Спасибо Артёму за инсайты!