1321
Математика, физика, дата сайнс. Основное правило - вежливое и уважительное общение. @sberlogabig основной канал @sberlogabio биоинформатика, биология @sberlogatalkclub за жизнь
Ну эльфы КРОВИ так что вопрос дискуссионный 🧐💚
Читать полностью…
Абсолютный мозг по Аристотелю (отсылочка к диогену vs платону)
Читать полностью…
📆 Что обсуждалось вчера 17.01.2026
Теория о горячих кровях и интеллекте (1 сообщений)
#dailysummary | ⭐️ поддержать команду
сегодня делал доклад у нас на мини-конференции, вдруг кому пригодятся слайды (там максимально не-технично тк для физиков)
Читать полностью…
Хорошо украденное - можно назвать придуманным
Читать полностью…
Как Эндрю Ын помогает учёным с ИИ-ревью 💃
Если вы рисерчер или студент, который пишет научные работы, то наверняка знаете, что процесс ревью — это не просто долго, а прямо-таки мучительно долго. Подготовить статью, отправить в журнал, ждать рецензий месяцами, а иногда и дольше... И вот, наконец, вы получаете обратную связь, но она не всегда полезная. Что если бы существовал инструмент, который помог бы вам заранее понять, что может не понравиться ревьюерам?
Эндрю Ын и его команда разработали ИИ-ревьюера, который помогает исследователям и студентам улучшить свои работы перед отправкой в журнал. Такой инструмент может сэкономить вам не только время, но и нервы. Ведь если обычное ревью может занимать недели или даже месяцы, то ИИ оценит вашу работу за несколько минут.
Как это работает? 😮💨
Система была обучена на реальных ревью с конференции ICLR 2025, что гарантирует её практическую ценность. Оценки качества происходили с использованием корреляции Спирмена, где чем выше значение, тем ближе результаты ИИ к человеческим оценкам. В итоге, корреляция между ИИ и реальным рецензентом составила 0.42, что, как ни странно, не так уж и плохо. Для сравнения, корреляция между двумя людьми-ревьюерами в среднем тоже около 0.41. Так что, да, ИИ может дать вам весьма точный прогноз, чем ревьюеры могут быть недовольны.
Особенность системы в том, что она использует atXiv для ревью, а значит, она особенно полезна для статей в области ИТ и ИИ, которые часто публикуются на этой платформе.
Цикл обратной связи в научных кругах порой затягивается на полгода, и это, согласитесь, слишком долго. В таких условиях скорость и качество обратной связи — это то, что нужно каждому исследователю. А ИИ-ревьюер как раз и может помочь вам избежать затянутых циклов и получить полезные замечания ещё до того, как ваша работа попадёт в руки журнала.
📆 Что обсуждалось вчера 21.11.2025
Поиск сотрудников на частичную занятость (1 сообщений)
Разработка пет проекта на Unreal 5 (1 сообщений)
#dailysummary | ⭐️ поддержать команду
📆 Что обсуждалось вчера 20.11.2025
Обсуждение методов обучения моделей и оптимизации (6 сообщений)
Обсуждение предстоящего вебинара по математике и ML (1 сообщений)
Французские слова и их значения (1 сообщений)
#dailysummary | ⭐️ поддержать команду
🌸Суп из LLM: смешиваем разные чекпоинты для лучшего результата🌸
#nlp #nlp_papers
TL;DR
Мы с коллегами из FAIR представляем новый метод работы с LLM: разные чекпоинты на этапе файнтюнинга можно усреднять между собой с разными коэффициентами — и результат будет лучше, чем у отдельно взятых чекпоинтов. Можно даже пойти на HuggingFace и усреднять разные чекпоинты одной архитектуры!
Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance
🟣Что такое суп из моделей?
Вообще говоря, разные техники усреднения моделей — это совсем не новость. Вот тут очень подробно расписаны методы: модели можно усреднять на этапах предобучения для более гладкого графика, и даже можно стакать между собой до получения непонятных франкенштейнов.
Супинг — это метод послойного усреднения весов моделей одной архитектуры.
Мы применили усреднение к этапу постобучения (SFT, PPO...и прочее): берем разные чекпоинты с немного разными результатами и способностями, выбираем бенчмарки, под которые нужно оптимизировать способности модели, и автоматически подбираем оптимальные веса для усреднения. Результат выходит лучше, чем отдельные модели, и при этом не приводит к регрессу других способностей модели, как было бы, если бы мы напрямую таргетировали одну способность/бенчмарк.
Таким образом мы сделали из нескольких чекпоинтов SOTA на бенчмарке tool calling — BFCL.
Если компьюта у вас мало, то можно пойти еще дальше — и вообще ничего не обучать самому, а только выбирать готовые чекпоинты с HF, усреднять их ансамбли и измерять качество.
Модели, конечно, должны быть из одной архитектуры и одного претрейна.
Мы сделали так с моделями LLama 3 70B и 8B — и метод вполне рабочий!
🌸Готовим батин суп из моделей:
— измерьте ваши чекпоинты в процессе файнтюна и проанализируйте, если некоторые способности плохо сочетаются, антикоррелированы — нам это подходит, будем искать коэффициенты, чтобы их замерджить
— можно набрать разных чекпоинтов из опенсорса (для вязкости) — например, файнтюны LLama, — с математикой, разными языками, ризонингом, и все это тоже замерджить.
— чтобы обои не отклеивались: не надо мерджить модели на разных этапах, модели без алайнмента с чекпоинтами с алайнментом и тд, результат не предсказуем.
— если делаете так, всегда потом пишите об этом на чекпоинте. Иначе придут люди из mechanistic interpretability и ничего не поймут.
— готово! вы восхитительны
🟣Статья: https://arxiv.org/abs/2511.13254
🟣Github: https://github.com/facebookresearch/llm_souping
🟣HuggingFace papers: https://huggingface.co/papers/2511.13254
💡 DeepSeek выложили новый open-source проект — LPLB.
Это экспериментальный балансировщик нагрузки для моделей Mixture-of-Experts (MoE).
В репозитории описано, как система:
• динамически перераспределяет экспертов, опираясь на статистику нагрузки;
• создаёт реплики с учётом топологии кластера;
• решает оптимальное распределение токенов по экспертам через LP-решатель, работающий прямо на GPU (cuSolverDx + cuBLASDx);
• использует метрики загрузки, полученные вручную, через torch.distributed или через буферы Deep-EP.
Гайд показывает, как может выглядеть умный и точный балансировщик для больших MoE-архитектур.
GitHub: https://github.com/deepseek-ai/LPLB
ai_machinelearning_big_data
#DeepSeek #LPLB #MoE #AIInfrastructure #OpenSource
Буквально берут 10 млн партий из Lichess, дедуплицируют позиции, скармливают их Stockfish и смотрят на его оценку вероятности выиграть из нее (с лимитом 50 мс на позицию), это у них данные для оценки позиций. Потом точно так же оценку Stockfish на парах (позиция, допустимый ход) для формирования policy, тоже с лимитом 50 мс. Как они сами это формулируют, "дистиллируют Stockfish" на нейросети и изучают, при какой архитектуре и каком размере получается хорошо (ответ: большая сетка может хорошо генерализировать оценки стокфиша).
То есть сильный domain knowledge, переведенный в большую сетку, все еще не так силен, как альфа-зиро подход с MCTS, но уже сильнее голого альфа-зиро.
Чего, по-моему, в статье не хватает, так это сравнения со стокфишем и альфа-зиро с другими параметрами (число моделирований у АЗ и время на подумать у СФ).
Насчёт наших дел
Это точно
И ещё есть момент что когда нам надо решить конкретный кубик мы можем тюнить Бедлмана именно в его окрестности
И дополнительно юзать бим серч
Ведь у нас уже есть путь , который решает
Если он не оптимальный, то есть какой-то конкретный шаг который не оптимален первым если он близко к собранном состоянию это легко поймать
Хуже всего если у нас самый первый шаг идёт не туда . Но с этим тоже можно бороться, тупым способом, стартовать из всех соседей подряд
Но у них очень-очень хорошие данные для обучения! Они набрали много позиций из игр и оценили их через Stockfish 16, который сильнее их всех и имеет как domain-specific knowledge внутри, так и обширный поиск. Это еще один аргумент в пользу того, чтобы сначала учить модель на блужданиях, а потом следующее поколение моделей учить на комбинации блужданий и результатов бимсерча (оценка = минимум из позиции в блуждании и длины бимсерча из этой позиции). Это очень небыстро в плане изготовления данных для обучения, но может дать большой прирост точности.
Читать полностью…
ну объяснённая шутка уже не такая смешная
Читать полностью…
📆 Что обсуждалось вчера 16.01.2026
Доклад на мини-конференции и слайды (1 сообщений)
#dailysummary | ⭐️ поддержать команду
📆 Что обсуждалось вчера 13.01.2026
Опыт работы с телеграм ботами (1 сообщений)
Ссылка на интерактивный веб-проект (1 сообщений)
Настроение и общение в чате (1 сообщений)
Уровень навыков в программировании (1 сообщений)
#dailysummary | ⭐️ поддержать команду
вопрос не в тему
знакомый спрашивает - нет ли у кого опыта работы с телеграм ботами ?
Проблема в том что корреляция с LLM рецензентом не несет в себе ценности ;))
Читать полностью…
https://www.kaggle.com/competitions/cayleypy-ihes-cube/leaderboard
Сабмиты с разными ширинами лучей и дополнительные с повторами 4 раза -
дают примерное представление как влияет ширина луча и повторы
Ребят, я делаю пет проект уже долго достаточно. Стек: Unreal 5, c++, также, много математики и физики. Это проект определённой симуляции. К нему нездоровый интерес возникает у всех. Хочу найти человека, который смог бы помочь закрыть проект до определённого уровня. Сам уже 5 лет работаю в области computer vision. Как вы думаете, где можно такого человека найти? У меня вокруг одни сеньоры, которым все лень)
Если коротко, то я создаю большую дифференцируемую физическую систему, которая по движением объектов сама выходит законы физики
8 французских слов, которых мне не хватает в русском.
🤩Fond de l’air—дословно «дно воздуха». Описывает погоду, когда на улице светит солнце, и вроде можно одеться легко, а самом деле — холодно до дрожи. Сейчас актуально! ❄️
🤩L’esprit d’escalier— чувство, когда после разговора понимаешь, как нужно было ответить. Дословно «остроумие на лестнице». Мама моего отчима говорила «умен на лестнице», видимо пошло из дореволюционной России.
🤩Retrouvailles—радость, испытываемая от встречи, после долгой разлуки. Не только относительно людей, но и возвращения в любимое место.
🤩Baise-en-ville—зубная щетка, дезодорант, трусы итд., все, что вы берете, когда решили провести ночь у бойфренда или девушки.
🤩Seigneur-terraces – люди, которые занимают столик в кафе, заказывают кофе, и просиживают до самого вечера, со счетом на 2€.
🤩Savoir-être – «умение жить и общаться», знать, как себя достойно вести и что ответить, в зависимости от ситуации и окружения.
🤩Yaourter – от слова «йогурт». Петь песню на неизвестном тебе языке с плохо знакомыми словами, заменяя их на созвучное, но бессмысленное мычание.
🤩Chantepleurer – петь и плакать одновременно. Лучший пример: как Жак Брель исполняет «Ne me Quitte Pas». #смешноеофранцузском
Продолжать? Наберём 500 👍?
Вообще хорошо иметь MOE , но не очень ясно как оценивать модели
Читать полностью…
Уважаемые коллеги, обсуждение новостей Math&ML + "Связь эргодической теории и теории мартингалов. Обобщение подходов" состоится 23 ноября в 20:00 (Мск). Кто хочет присоединиться, ссылка:
https://vk.com/call/join/poMS28Na7Z9jtXsinLqXVrxJgY98mR-9dcAWUgWqG4g
Подробности: /channel/RubikMathDev
Ссылка с номером встречи:
Идёт с паролем и пригодится, если нужно записать на бумаге или сказать вслух
https://vk.com/call/556-577-44 (Пароль для входа: A6UUHV)
Я бы предположил, что чем дальше от старта, тем больше вероятность неоптимального шага. По идее, это не очень страшно, потому что мы же все равно все пути отслеживаем, так что даже если поначалу казавшийся оптимальным (с т.з. оценок модели) путь на самом деле не оптимальный, другой все равно доберется до старта раньше. Мы могли, конечно, какой-то на самом деле оптимальный путь в начале отсечь из-за ограничений ширины луча, если оценки неудачные.
Насчет старта из всех соседей — ну в некотором смысле это и происходит, мы же первым шагом в бимсерче ровно в них и отходим. Мы можем отойти по соседям или соседям соседей и так далее и оттуда по отдельности стартовать, но это то же самое, что разветвить луч и каждую ветку отдельно обсчитывать (и будет много дублирований, потому что оценки моделей все равно примерно в одно сторону будут толкать). Наверное, можно, пожертвовав временем, получить выигрыш в качестве оценки, но он скорее всего будет мал по сравнению с увеличением затрат. Но зато такое улучшение очень легко сделать и не надо ничего сложного придумывать!
Это ты хорошо заметил
Я вот только не очень понимаю, что именно они берут за данные для обучения ?
хотя они проигрывают системе с серчем (обычный альфаго)
Читать полностью…