sberlogasci | Unsorted

Telegram-канал sberlogasci - (sci)Berloga Science

1321

Математика, физика, дата сайнс. Основное правило - вежливое и уважительное общение. @sberlogabig основной канал @sberlogabio биоинформатика, биология @sberlogatalkclub за жизнь

Subscribe to a channel

(sci)Berloga Science

Свеженький натюрморт. Мужской. На любителя.
Холст на мдф, масло 30х40 см.

Читать полностью…

(sci)Berloga Science

«Ночной город», 2025
Масло, холст 40х30 см.

Читать полностью…

(sci)Berloga Science

И еще несколько работ. Завершил начатый в мае на пленэре этюд «Вечер в Парке Горького», написал картину «Солнечное утро в октябре», сделал быстрый этюд с розами и эустомой «26», в студии почти завершил натюрморт на красном.

Читать полностью…

(sci)Berloga Science

Завершил небольшой осенний этюд про физалис и гортензию. Масло, холст на мдф, 20х30 см.

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 02.02.2026

Методы обучения моделей с использованием RL и педагогических подходов - обсуждение динамического обучения (2 сообщений)
Представление модели aGenome и интервью с разработчиками - обсуждение новой модели предсказания биохимических сигналов (1 сообщений)
Переосмысление процессов предобучения и файнтюнинга моделей - использование обучающих данных (1 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

Ещё одна работа на близкую тему. Здесь не самодистилляция, а использование умного учителя для переписывания обучающих данных низкого качества. Но по сути очень похоже на предыдущую работу (/channel/gonzo_ML/4687) — заменяем SFT на RL, причём делаем это так, что появляется плавная интерполяция между этими двумя режимами — начинаем с клонирования хороших примеров, постепенно переходим на улучшение собственных роллаутов.

Все эти работы последних дней любопытны тем, что переосмысливают процесс предобучения и файнтюнинга, он становится более активным и динамическим и в большей степени RL. Это интересный движ, я ожидаю его усиление.

Self-Improving Pretraining: using post-trained models to pretrain better models

Ellen Xiaoqing Tan, Shehzaad Dhuliawala, Jing Xu, Ping Yu, Sainbayar Sukhbaatar, Jason Weston, Olga Golovneva
Статья: https://arxiv.org/abs/2601.21343
Ревью: https://arxiviq.substack.com/p/self-improving-pretraining-using

# TL;DR

ЧТО сделали: Авторы предлагают Self-Improving Pretraining — метод, заменяющий стандартное предсказание следующего токена на онлайн-цикл обучения с подкреплением (RL) прямо на этапе предобучения. Вместо пассивного поглощения "сырых" корпусов текста, модель использует сильного "учителя" (post-trained модель), который на лету переписывает низкокачественные данные и оценивает генерации самой модели-ученика. В итоге модель учится на отфильтрованном, качественном сигнале, состоящем из "переписанных" текстов и её собственных лучших роллаутов.

ПОЧЕМУ это важно: Подход ломает догму о том, что alignment (безопасность, фактология) — это забота исключительно этапа пост-тренировки (SFT/RLHF). Интегрируя обучение на предпочтениях (preference learning) в сам субстрат предобучения, метод не даёт модели "запечь" в веса токсичность или галлюцинации из сырых данных. Показано, что модели могут учиться быть безопасными даже на небезопасных данных, если целевая функция активно уводит их от грязи. Прирост win rate составляет до 86.3% по сравнению с базовыми методами.

Подробнее: /channel/gonzo_ML_podcasts/2300

Читать полностью…

(sci)Berloga Science

Сижу кручу
https://prism.openai.com/

Читать полностью…

(sci)Berloga Science

Несколько месяцев назад мы на этом канале разбирали препринт aGenome. А сегодня полноценная статья вышла в Nature!


Для тех, кто не знаком - это модель, которая предсказывает тысячи биохимических и транскрипционных сигналов по последовательности ДНК.

Одновременно вышло интервью от разработчиков:

https://youtu.be/V8lhUqKqzUc?si=0MeT6Wc-nydRT24q

Для меня самые интересные - последние 5 мин, где они обсуждают планы на будущее.

П. С. Из интервью: у топовой команды гугла ушло около 2 лет на разработку этой модели

Читать полностью…

(sci)Berloga Science

Когда-то давно, во времена учебы в ШАДе, нам читали интенсив по основам архитектуры GPU и разработки на CUDA. Обещали рассказать, как устроены видеокарты и почему они эффективны для машинного обучения. Я тогда дальше model.to('cuda:0') в этом вопросе ничего не знал, поэтому с интересом записался.

Лекции читали разработчики из Nvidia. Да, это было такое время, когда у компании был Московский офис и они периодически нанимали DL-инженеров, а иногда и стажеров (марафон технических раундов и глубоких вопросов на понимание, чтобы побороться за 2 стажерские позиции).

Курс, по моему мнению, получился ужасным. Материал стремительно усложнялся без какой-либо оглядки на аудиторию и тот факт, что ко второй лекции половина слушателей уже отвалилась. Я потерял суть происходящего уже минуте на 20-30 первой лекции, в момент когда термины вида SM, warp schedulers, cuda cores заполняли каждый слайд, а повествование превратилось во внутренний митап для инженеров Nvidia.

Худо-бедно интенсив я закрыл, решая задачи методом проб и ошибок. От курса в голове не осталось почти ничего. Разве что боязнь копаться в деталях работы с GPU.

Позже, уже в 2022-2023 году, модели перестали влазить в память одной ГПУ и нужно было учиться паралелить, оценивать эффективность инфраструктуры в поисках ответа на вопрос: а почему все так медленно? are we compute bound or communication bound? Снова я столкнулся с GPU акселераторами лицом к лицу. Документации от Nvidia было не очень много, так что неподготовленному читателю входить было не просто. Но дело двигалось тем же путем проб и ошибок и общением с коллегами по работе.

А хороших гайдов на понимание все еще не было. Мне кажется их и сейчас не очень много. ( Как и специалистов в этой области. Performance Engineer крайне актуальная роль в области DL на ближайшие годы)

Недавно наткнулся на "книгу" от ребят из DeepMind, они проделали невероятную методологическую работу. И выпустили онлайн-учебник How to Scale Your Model. Центральный предмет книги о том, как учить трансформеры на больших кластерах, арифметику моделей (откуда набегает так много гигабайтов памяти, чтобы сделать один forward pass) и что такое TPU/GPU. К каждой главе идет еще набор квизов, чтобы посчитать что-нибудь руками.

Крайне Рекомендую!

https://jax-ml.github.io/scaling-book/

Читать полностью…

(sci)Berloga Science

Исследователи из NVIDIA предложили замену GRPO на новый GDPO, лучше работающий с множественными наградами.

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov
Статья: https://arxiv.org/abs/2601.05242
Код: https://github.com/NVlabs/GDPO
Ревью: https://arxiviq.substack.com/p/gdpo-group-reward-decoupled-normalization

# TL;DR

ЧТО сделали: Выявили критический недостаток в популярном методе GRPO (https://arxiv.org/abs/2402.03300) при обучении с несколькими наградами. Авторы из NVIDIA предлагают GDPO — метод, меняющий порядок действий: вместо суммирования наград перед нормализацией, GDPO сначала нормализует каждый сигнал (например, за корректность, формат, краткость) независимо внутри группы, и только потом агрегирует их.

ПОЧЕМУ это важно: Это устраняет «коллапс сигнала награды», когда разные комбинации сырых баллов дают одинаковые оценки преимущества (advantage), из-за чего модель перестаёт различать качество выполнения отдельных подзадач. GDPO позволяет стабильно обучать модели (уровня DeepSeek-R1 или Qwen2.5) в сложных сценариях, требующих одновременного соблюдения жесткого формата, лимита токенов и правильности рассуждений — там, где обычный GRPO часто сходится к субоптимальным решениям.

Подробнее: /channel/gonzo_ML_podcasts/2058

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 29.01.2026

Обсуждение видео на YouTube (1 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 22.01.2026

Обсуждение изображений и задач GPT (3 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 20.01.2026

Поиск товаров в несетевых магазинах (2 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

ищите в несетевых магазинах

Читать полностью…

(sci)Berloga Science

Эх, в первом приближении, высшие эльфы не хотели отказываться от магии и сделали релокацию с Калимдора в Азерот, а потом блонд эльфы после падения сильвермуна не захотели снижать градус неадеквата и присосались к скверне, не знаю что там в новом лоре)

Читать полностью…

(sci)Berloga Science

«А голову ты дома не забыл?», 2025
Масло, холст на мдф, 24х18 см.

Читать полностью…

(sci)Berloga Science

Еще немножко впечатлений от ушедшей осени. В кадре все те же герои - физалис и гортензия. А с ними - апельсины и лимоны с корзинкой). Масло, холст, 40х50 см.

Читать полностью…

(sci)Berloga Science

Всем привет! Делюсь тем, что сделал за прошедшие две недели.
Занимался изучением работ двух художников-импрессионистов: современного из США (Kim English) и испанского, творившего на рубеже 19/20 веков (Joaquin Sorolla). Сделал копии их двух работ: «Spring studies» и «Pescadora Valenciana». Масло, холст на мдф, 18х24 см.

Читать полностью…

(sci)Berloga Science

В жизни наступают моменты, когда творчество ищет новые формы выражения. Для меня такой формой в последние годы стала живопись. И сейчас я понимаю, что пришло время полностью сосредоточиться на ней.

Поэтому я честно хочу сообщить вам, что в ближайшие годы я не буду создавать новые деревянные домики и игрушки.

С сегодняшнего дня этот канал будет полностью посвящен живописи. Для меня это большой и важный шаг. Очень надеюсь, что вы останетесь со мной в этом начинании, даже если сменится материал и техника. Ведь суть - желание делиться красотой - останется прежней.

Спасибо вам за каждый добрый комментарий и за вашу поддержку!

Читать полностью…

(sci)Berloga Science

OpenAI релизнули Prism – Overleaf на ИИ-спидах

Это единая среда для написания научных (и не только) работ. По сути, облачный LaTeX‑воркспейс с глубокой интеграцией GPT‑5.2.

Помимо базы (неограниченное число проектов и соавторов, совместное онлайн редактирование, рендеринг LaTex) Prism, естественно, напичкан всевозможным ИИ:

– Агент видит весь проект, предыдущие правки, черновики и пр. и вносит изменения, исходя из всей структуры работы (aka Cursor для статей)

– Помимо генерации текста модель может проверить ваши рассуждения, прояснить аргументацию, помочь отрефакторить таблицу, ссылки, формулы и тд.

– Есть интеграция arXiv для поиска релевантной литературы и синхронизация с Zotero для управления источниками и цитированием.

Ну и еще несколько приятных дополнений: например, автоматическое обновление ссылок и списка литературы при изменениях текста или генерация схем/диаграмм/формул из рукописных набросков.

Доступно абсолютно всем, у кого есть аккаунт ChatGPT, так что вперед: prism.openai.com/

Читать полностью…

(sci)Berloga Science

пока выглядит прикольно но всё что она сгенерирует по авторским принадлежит openai.(Но это не точно), спасибо внимательным читателям.

Читать полностью…

(sci)Berloga Science

Интересная работа. Некоторым моделям учить проще, чем делать самим :)

В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A

# TL;DR

ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.

ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.

Подробнее: /channel/gonzo_ML_podcasts/2256

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 31.01.2026

Опыт обучения архитектуре GPU и CUDA (1 сообщений)
Недостаток качественной документации по GPU (1 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 30.01.2026

Методы решения многос шаговых задач с LLM (1 сообщений)
Новый подход к обучению с множественными наградами (1 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

Любопытный (но дорогой) заход на стабильность мультишаговых воркфлоу с LLM :)

Solving a Million-Step LLM Task with Zero Errors

Elliot Meyerson, Giuseppe Paolo, Roberto Dailey, Hormoz Shahrzad, Olivier Francon, Conor F. Hayes, Xin Qiu, Babak Hodjat, Risto Miikkulainen
Статья: https://arxiv.org/abs/2511.09030
Ревью: https://arxiviq.substack.com/p/solving-a-million-step-llm-task-with
Код: https://github.com/cognizant-ai-lab/neuro-san-benchmarking

# TL;DR

ЧТО сделали: Предложили фреймворк MAKER (Maximal Agentic decomposition, first-to-ahead-by-K Error correction, and Red-flagging), который позволяет решать задачи длиной более миллиона последовательных шагов LLM с нулевым количеством ошибок. Разбив задачу «Ханойская башня» на атомарные подзадачи (m=1) и применив специфический механизм голосования, авторы показали, что относительно небольшие модели (не являющиеся рассуждающими, reasoning models) могут достигать уровня надёжности, ранее считавшегося невозможным для стохастических генераторов.

ПОЧЕМУ это важно: Работа бросает вызов догме, что для длинных задач нужны экспоненциально более умные модели. Вместо этого приводится доказательство существования Массивно декомпозированных агентных процессов (MDAP). Показано, что архитектурные изменения — в частности, экстремальная модульность и статистическая коррекция ошибок — позволяют стоимости расти лог-линейно (Θ(s ln s)), а не экспоненциально в зависимости от длины задачи.

Подробнее: /channel/gonzo_ML_podcasts/1749

Читать полностью…

(sci)Berloga Science

https://youtube.com/shorts/xW2aRK1Glys?si=5eSeaeF9XyTYxeZQ

Читать полностью…

(sci)Berloga Science

а есть картинка где GPT решил задачу соединением путей в правой части? и типа петля получилась, задавить всех в любом случае

Читать полностью…

(sci)Berloga Science

делаем диаграммы правильно

Читать полностью…

(sci)Berloga Science

📆 Что обсуждалось вчера 18.01.2026

Обсуждение философских концепций Аристотеля и Платона (4 сообщений)
Обсуждение мифологии и лора эльфов (3 сообщений)
Обсуждение юмора и восприятия шуток (2 сообщений)

#dailysummary | ⭐️ поддержать команду

Читать полностью…

(sci)Berloga Science

Они вообще каменые, кроми лестных те дикие

Читать полностью…
Subscribe to a channel