lakomoordev | Unsorted

Telegram-канал lakomoordev - LakoMoor

265

Что-то на непонятном Для связи: @lvlinfinite

Subscribe to a channel

LakoMoor

смерть в нищете близка🤩🤩, поэтому разгребаем коммишки по тихоньку🤩

первый на очереди:

отличный мойщик посуды🤩, кодер в кодировании🤩🤩

Читать полностью…

LakoMoor

GLM-4.7-Flash выложили

https://huggingface.co/zai-org/GLM-4.7-Flash

Трейн на тесте ?

Читать полностью…

LakoMoor

LTX-2 - open weight 4K/50fps видео с аудио от Lightricks

Lightricks, компания, стоящая за одним из первых "контент-заводов" LTX-Studio ещё до того, как эти заводы заполонили Твиттер, сделала интересный пивот. Чуваки выпустили в опенсорс видеомодель LTX-2, первая версия которой, лежала в основе их реактора.

Модель занимает не самое высокое 23-е место на LM видео арене, но главное здесь не это. LTX-2 — первая полностью открытая модель, которая умеет генерить нативное 4K видео при 50 FPS с синхронизированным аудио (диалоги, музыка, SFX) длиной до 20 секунд.

В основе LTX-2 лежит единый асимметричный двухпоточный трансформер для совместной генерации аудио и видео через кросс-атенш.

Модель на 19B (14 для видео и 5 для аудио) спроектирована для запуска на потребительских GPU. В опенсорс выложены не только веса, но и пайплайны для инференса и код для тренировки. Кроме того из коробки LTX-2 квантована в NVFP8 (на 30% меньше, до 2х раз быстрее) и оптимизирована под экосистему NVIDIA, а ComfyUI поддерживает её с первого дня.

Не совсем понятно, как этот релиз сочетается с их основной бизнес-моделью. И если раньше их амбициозное желание создать свою модель было понятно, то зачем выкладывать её в опенсорс — совсем неясно. Ведь умельцы из ComfyUI уже повторили тот же LTX Studio у себя в Comfy и n8n на других моделях.

Техрепорт
GitHub
Hugging Face
Попробовать

@ai_newz

Читать полностью…

LakoMoor

❗️Американцы применили перцептроны

Читать полностью…

LakoMoor

Всех поздравляю с наступающим. Нас уже больше 200 человек. Это небольшая цифра, но здесь собрались самый лучшие люди (это вы, подписчики). Пусть в новом году у вас будет меньше дедлайнов, меньше задач а зарплаты выше. Отмечайте так, чтобы завтра было стыдно но хорошо. С НГ !

Читать полностью…

LakoMoor

doom на микроволновке? а как насчет llm на z80 процессоре?

Типа прикиньте, это процессор из 1976 на котором запускается 40kb бинарник с моделью на несколько тысяч параметров, обученная отвечать только "OK, WHY, R U?, MAYBE, AM I"

А еще вся арифметика целочисленная + веса квантуются в 2бит. А еще эту модель можно запустить на железе которое на момент событий 1 сезона "Stranger Things" было устаревшим

code

Читать полностью…

LakoMoor

Бета релиз Borealis 5b - 4b

qwen + whisper + сделали плагин для vllm + теперь оно работает с инструкциям и может решать задачи qa, cls, summarize, json mode

Это тестовый релиз, не финальный, я хочу собрать что не работает и как вы пользуетесь

Модель на hf

Читать полностью…

LakoMoor

nanoGPT от Андрея Карпаты стала первой в мире LLM, обученной и запущенной в космосе

Мы уже несколько раз рассказывали вам о стартапе Starcloud. Они занимаются строительством космо-датацентров и к 2030 году планируют вынести на орбиту аж 5 гигаватт железа.

В начале ноября они запустили в космос первую в истории видеокарту H100 – на спутнике размером с холодильник.

Сначала сообщалось, что на ней планируется тюнить Gemma, но сегодня Starcloud рассказали, что вместо этого обучили целую модель с нуля!

Они взяли nano-GPT – минималистичную реализацию GPT на PyTorch от Андрея Карпаты, – обучили ее на полном собрании сочинений Шекспира и успешно запустили инференс! Gemma, кстати, тоже запускали, но только предзагруженную.

Читать полностью…

LakoMoor

Вот и вышел Ministral

Читать полностью…

LakoMoor

Она будет в покемонов играть ?

Читать полностью…

LakoMoor

https://huggingface.co/deepseek-ai/DeepSeek-V3.2

Говорят на уровне GPT-5

https://huggingface.co/deepseek-ai/DeepSeek-V3.2/resolve/main/assets/paper.pdf

Читать полностью…

LakoMoor

Ксюша довезла постер!

Читать полностью…

LakoMoor

HuggingFace релизнули замечательную свежую книгу про обучение LLM

200+ страниц, 7 больших глав. Содержание примерно следующее:

– Архитектуры, их особенности и оптимизация гиперпараметров
– Работа с данными
– Предобучение и какие в нем есть подводные камни
– Пост-трейнинг: все современные подходы и как их применять
– Инфраструктура, как ее правильно строить и оптимизировать

По сути, это готовое хардовое пособие по тому, как с нуля обучить и захостить LLM.

Написано все на довольно простом английском и читается легко + есть куча схем и примеров. В общем, выглядит годно.

huggingface.co/spaces/HuggingFaceTB/smol-training-playbook

Читать полностью…

LakoMoor

Это победа! 🤩
Микроконтроллер распаян, компоненты драйвера двигателя тоже ( паять SMD компоненты - то ещё удовольствие... ). Прошивка залита, двигатель управляется, а это значит, что схема спроектирована правильно. Полторы недели работы были не напрасными. Завтра постараюсь рассказать подробнее, что я задумал.

Читать полностью…

LakoMoor

Vistral-24B-Instruct

Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный энкодер, убрана мультимодальность. Сохранена стандартная архитектура MistralForCausalLM без изменений в базовой структуре модели.

🔗 Карточка модели: https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct
🔗 GGUF (скоро): https://huggingface.co/Vikhrmodels/Vistral-24B-Instruct-GGUF
⚖️ Лицензия: apache-2.0

Сайт: https://vikhr.org
Донаты: Здесь

👥 Авторы: @LakoMoorDev @nlpwanderer

Читать полностью…

LakoMoor

https://github.com/xai-org/x-algorithm

Зачем я заставил клод код с помощью manim визализировать алгоритм работы твиттера - вопрос интересный. еще интереснее что делал я это целиком с телефона

Читать полностью…

LakoMoor

https://wedlm.github.io

Очередная убийца классического LLM?

https://arxiv.org/pdf/2512.22737

Читать полностью…

LakoMoor

Угостите одинокого админа капучинкой

Читать полностью…

LakoMoor

Нейрослоп добрался до конструктора

Читать полностью…

LakoMoor

Запускаем получается llm на gameboy

У него тоже модифицированный z80

Читать полностью…

LakoMoor

БЛЯТЬ, ЗАЧЕМ МНЕ ЭТО ПРИСЛАЛИ

ОСУЖДАЮ

Читать полностью…

LakoMoor

Был найден ресурс по Digital Signals с красивыми визуалицациями.

Есть примеры на Python и интерактивные графики.

Время ботать 🍷
(или как минимум позалипать)

https://brianmcfee.net/dstbook-site/

Читать полностью…

LakoMoor

Limit Order Book, он же стакан — механизм биржи, объединяющий покупателей с продавцами.

Исходя из названия, он собирает в себе лимитные заявки. У каждого ордера есть такие параметры как:
- side — всё просто, покупка или продажа.
- quantity — количество актива в заявке.
- price — очевидно, цена.
Про Time in Force и скрытые ордера чуть позже.

Когда мы хотим купить какой-то актив здесь и сейчас, мы отправляем market order на биржу, где её matching engine исполняет его, сопоставив с лимитными ордерами.

Приоритетность исполнения одних лимитных ордеров перед другими зависит от логики конкретного matching engine, но есть некоторые общие правила:
- Price–Time Priority — сначала метчим ордера с лучшей ценой, но если несколько стоят по одной цене, то из них выбирается тот, который был выставлен раньше.
- Price–Pro-Rata Priority — исполняем по лучшей цене, но если на этой цене стоит несколько крупных ордеров, то метчим их пропорционально их объёму.
- Size–Time Priority — на одинаковой цене между ордером с большим объёмом и выставленным ранее выберем тот, у кого больший объём.
- Visibility Priority — Visible > Iceberg > Hidden.

Про видимость ордеров:
- Visible — просто ордера, полностью видны всем участникам рынка.
- Iceberg — ордера, видимые в стакане лишь частично. Когда их заданная видимая часть исполняется, биржа обновляет ордер с новой видимой частью, которая будет максимум заданного в параметрах ордера размера, пока он не исполнится полностью. При обновлении ордер может терять приоритет по времени.
- Hidden — в ордербуке не видны, но трейды по ним исполняются. Можно заметить в виде сделок, которые прошли по непойми откуда взявшейся цене между best ask / best bid.

Time in Force:
- GTC (Good Till Cancelled) — ордер остаётся в стакане, пока его полностью не исполнят или пока пользователь не отменит его.
- IOC (Immediate Or Cancel) — ордер должен быть исполнен немедленно хотя бы частично; всё неисполненное сразу отменяется. Забирает ликвидность, но в отличие от простого Market ордера ставит ограничение на цену, а не просто исполняется по доступной цене.
- FOK (Fill Or Kill) — жёсткая версия IOC. Ордер должен быть исполнен полностью и сразу; если это невозможно — он отменяется полностью.

Поправляйте, может где ошибся

Читать полностью…

LakoMoor

Парень сделал в браузере полноценный автодиф на WebGPU.

Выглядит прикольно, понравилось то что визуализировали обучение. Можно посмотреть как вообще происходит обучение.

https://github.com/vinhowe/piston
https://sequence.toys/

Читать полностью…

LakoMoor

https://github.com/huggingface/transformers/pull/42498/files

Хмм... новый Vistral ?

Читать полностью…

LakoMoor

DOOM

Знаете в чем плюс заниматся не особо нужной ерундой?(ресерчем чего либо вокруг русских бенчей которые никому не интересно оптимайзить)

Можно наблюдать как прирстают модели на математике, при этом на физике прирост между поколениями всего несколько процентов. Причем если смотреть на ошибки там именно не понимание какие законы/формулы считать, а не численные.

Ну и gemeni3pro клево поскелйилась по токенам, хоть и гонится прям ОЧЕНЬ долго и дорого, но результаты на матемтике того стоят. А вот решит ли она jew problem будет известно позже

А и теперь у нас есть папир, мы даже свозили его на воркшоп EMNLP, спасибо рекламе в этом канале за возможность оплачивать эвалы моделей
Paper
LB

Читать полностью…

LakoMoor

Годноту ловите
https://habr.com/ru/articles/963338/

Читать полностью…

LakoMoor

HF книжка по megatron, fsdp и прочему для обучения реально больших моделей

Читать полностью…

LakoMoor

Qwen3-Next 80B-A3B

C того момента как она вышла, уже вышла Doubao, Step3, Qwen3-235B, DeepSeek V3.2 и я за пивом

- Hybrid Architecture: Gated DeltaNet + Gated Att - вариция на тему RNN + не везде а только 75% cлоев и 25% cлоев обычный attention
- 3b активных параметров при 80 тотал
- Используют QK postnorm по аналогии с DIT для улучшения стабильности
- MTP как в deepseek
- Показывают бОльшую скорость префила и декода чем соседи по метрикам (это если что qwen 30bA3 и qwen 32b)


blog

Читать полностью…

LakoMoor

Таймлайн у нас... Интересный.
Короче Sama дали PhD в mbzuai


Спасибо Артёму за инсайты!

Читать полностью…
Subscribe to a channel