7668
Мультидисциплинарный канал о науке и технологиях. Data Science, Bioinformatics, Biology, Mathematics, Physics, IT, Computer Science. @sberlogabio био и дата сайнс @sberlogasci математика, физика и ДС https://www.youtube.com/c/SciBerloga
💻 Джи-пи-ти... Уже все наслышаны про модели-трансформеры, прекрасно генерирующие текст. Но сверх классического применения, версия GPT4, как говорят, хорошо помогает в задачах кодинга. Бластим решил это проверить.
19 января 19:00 мск мы проведем эксперимент в реальном времени и посмотрим, сможет ли чат-бот воспроизвести или в точности повторить результат труда биоинформатика. Рабочий кейс — сингл селл колоректального рака. Попробуем цикл от контроля качества до оценки лиганд-рецепторных взаимодействий! Настоящая импровизация шаг за шагом.
Наш спикер Дмитрий Тычинин будет модерировать работу чата и экспертно оценивать преимущества и недостатки ответов на вопросы, возникающие у людей, которые работают с single cell данными. Кроме того, на мастер-классе любые вопросы аудитории получат ответы в двойном объеме: и от ИИ, и от человека!
🚩Онлайн-встреча будет интересна всем: уже знакомым с нашумевшим чат-ботом, тем, кто никогда не прибегал к помощи GPT, работодателям, которые хотят посмотреть на навыки биоинформатика за 10$/месяц 😉
👉 Регистрируйтесь на мастер-класс по ссылке: bit.ly/3TVqOny
И с нетерпением ждем следующую пятницу!
🚀 NIPS Workshop on Challenge "Open Problems – Single-Cell Perturbations"
"Predict how small molecules change gene expression in different cell types"
⌚️ 16 December 2023 at 13:30-16:30 CST (GMT-6). You can find the schedule and Zoom link on Google Sheets here: https://docs.google.com/spreadsheets/d/19VF9s9jDVE76Hg4wJDi9S8Dg3ZC1E1SAS4sdUazuTWI/edit?usp=sharing
Everyone is invited to attend. Link to information post: https://www.kaggle.com/competitions/open-problems-single-cell-perturbations/discussion/461113
NIPS workshop посвященный челенджу "Open Problems – Single-Cell Perturbations" - уже завтра - Суббота.
Наш тим U900 (Антонина Долгорукова, Дмитрий Руденко, Дмитрий Ершов, Антон Вахрушев, Александр Червов)
тоже приглашен и презентует наше решение "PYBOOST - is what you need"
Присоединяйтесь послушать топовых спецов в теме (ну и нас тоже).
🚀 @SBERLOGACOMPETE webinar on data science:
👨🔬 Anton Vakhrushev "SketchBoost: Fast Gradient Boosted Decision Tree for Multioutput Problems"
⌚️ Monday 11 December 19.00 (Moscow time)
Add to Google Calendar
Gradient Boosted Decision Tree (GBDT) is a widely-used machine learning algorithm that has been shown to achieve state-of-the-art results on many standard data science problems. We are interested in its application to multioutput problems when the output is highly multidimensional. Although there are highly effective GBDT implementations, their scalability to such problems is still unsatisfactory. In this paper, we propose novel methods aiming to accelerate the training process of GBDT in the multioutput scenario. The idea behind these methods lies in the approximate computation of a scoring function used to find the best split of decision trees. These methods are implemented in SketchBoost, which itself is integrated into our easily customizable Python-based GPU implementation of GBDT called Py-Boost. Our numerical study demonstrates that SketchBoost speeds up the training process of GBDT by up to over 40 times while achieving comparable or even better performance.
It easy to install: pip install py-boost
It easy to use - see tutorial notebooks: Kaggle Open problems notebook, Tutorial_1_Basics, Tutorial_2_Advanced_multioutput, Tutorial_3_Custom_features
Github
Paper: Iosipoi, Leonid, and Anton Vakhrushev. "SketchBoost: Fast Gradient Boosted Decision Tree for Multioutput Problems." Advances in Neural Information Processing Systems 35 (2022): 25422-25435.
Gold medals on Kaggle: CAFA5 , Open problems - single cell perturbations 2023, Open problems 2022,
Lots of silver/bronze medals in recent Open problems 2023 were based on Pyboost.
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📖 Presentation: /channel/sberlogacompete/10211, Poster: /channel/sberlogacompete/10215
📹 Video: https://youtu.be/5xRxuDh_cGk
🚀 @SBERLOGACOMPETE webinar on data science:
👨🔬 Aлександр Рыжков, Ольга Цымбой "Почти золото “Kaggle - LLM Science Exam”: retrieval is almost all you need"
⌚️ Четверг 7 Декабря 19.00 (по Москве)
Add to Google Calendar
В этом докладе мы представим разбор нашего итогового решения, занявшего 21е место с 0.916 MAP@3 на приватном лидерборде соревнования “Kaggle - LLM Science Exam”. В ходе рассказа затронем основные моменты в данных или зачем мы использовали дополнительные данные, стратегии поиска контекстов для задачи multiple choice QA, а также как подбирали параметры итогового ансамбля. В конце нашего доклада рассмотрим и сравним другие решения из топа лидерборда.
Описание решения на Каггл: https://www.kaggle.com/competitions/kaggle-llm-science-exam/discussion/447589
О докладчиках: Александр Рыжков - тройной Каггл грандмастер, тим-лид авто-мл "LAMA" (LightAutoML) в Сбер АИ Лаб,
Ольга Цымбой - исследователь в центре инструментов машинного обучения, Cбер АИ Лаб
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe out youtube channel !
📖 Presentation: /channel/sberlogacompete/10196
📹 Video: https://youtu.be/RWV2cYHRUqU?si=dolyowmtfQLaMeDp
🚀 @SBERLOGACOMPETE webinar on data science:
👨🔬 "Review of the Kaggle competition 'H2o.ai Predict the LLM' "
⌚️ Thursday 16 November, 19.00 (Moscow)
The review of the recent NLP competition will be given. The speakers include Kaggle Grandmaster Dmitry Larko who is one of the organizers of the competition. The objective of this competition is to detect which out of 7 possible LLM models produced a particular output. With each model having its unique subtleties and quirks, can you identify which one generated the response?
Add to Google Calendar
Speakers / Спикеры
1. "Dataset preparation and H2O LLM Studio" Dmitry Larko, Kaggle Grandmaster, AutoML & GenAI research at H2O.ai, Competition Organizer
2. "To Catch-up Log-Loss 1 and Philipp Singer's baseline… " Samvel Kocharyan, Aleksey Schukin, 8th Place Solution (Chuk & Gek team)
3. "Winning solutions review", Rashmi Banthia, Harward University, 3rd Place
19:05 - 19:20 - Dmitry Larko
19:20 - 19:40 - Samvel Kocharyan, Aleksey Schukin
19.40 - 20.00 - Rashmi Banthia
20.00 - 20.20 - Q&A
Announcement on Kaggle
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
🚀 @SBERLOGABIO webinar on bioinformatics:
👨🔬 Семен Стешин “Lo-Hi: Practical ML Drug Discovery Benchmark”
⌚️ Четверг 19 Октября, 18.00 (Moscow time)
Add to Google Calendar
ML модели сложно сравнить по качеству между собой. Особенно сложно сравнивать молекулярные модели, в которых проверка одного предсказания может стоить несколько тысяч долларов и занимает несколько месяцев.
Семен расскажет про свою новую работу с NeurIPS 2023 “Lo-Hi: Practical ML Drug Discovery Benchmark” в которой он рассматривает две задачи — Hit Identification и Lead Optimization — и сравнивает ML модели для предсказания молекулярных свойств. Он расскажет как разделять датасеты с помощью линейного программирования, чтобы избежать утечек теста, и расскажет про простую библиотеку для сплитинга.
Вы узнаете:
- Работает ли ML в химии или он просто заучивает трейн.
- Умеет ли ML различать небольшие модификации молекул.
- Какие модели лучше подходят для поиска новых молекул. Какие лучше подходят для оптимизации (это разные модели).
- Почему существующие бенчмарки не позволяют выбрать модели для реальных задач.
- Где граница между модификацией существующего лекарства и по-настоящему новой молекулой.
Приглашаются все причастные к разработке лекарств и все фрустрированные утечками теста в биохимическом ML. Доклад ~30 минут.
Тред в Твиттере: https://twitter.com/ZdarovaAll/status/1712085059073605929
Статья: https://arxiv.org/abs/2310.06399
Библиотека: https://github.com/SteshinSS/lohi_splitter
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📖 Presentation: /channel/sberlogabio/63561
📹 Video: https://youtu.be/1IUHAtiyPso?si=zq4Lad-I5RUXq4w8
Ловите крутейший data-форум сезона — Loginom Day 2023!
Уже 5 лет мы собираем руководителей, специалистов по данным и IT-шников на наш форум экспертов по low-code аналитике
Реальные кейсы, экспертиза и прямой диалог со спикерами, которые успешно используют платформу Loginom для задач бизнеса. Это событие для людей, которые хотят обогатить свой опыт в анализе данных и получить множество классных идей и новых знакомств
Когда? 2 ноября 2023 года в 13:00 гибрид (Москва, ВДНХ + онлайн-трансляция). Участие бесплатное
И если вы хотите узнать, почему мигрировать с SAS Marketing Automation нужно именно на Loginom, за счет чего retail-компании удалось повысить лояльность клиентов, а также как силами нескольких аналитиков построить систему поддержки принятия решений крупного банка, ждем по ссылке.
🚀 @SBERLOGACOMPETE webinar on bioinformatics and data science:
👨🔬 Alexander Chervov "Introduction to Kaggle competition - Single-Cell Perturbations."
⌚️ Thursday 5 October, 19.00 (Moscow time)
Add to Google Calendar
We will give brief introduction mainly from machine learning perspective. Task contains about 614 samples in train and 255 in test, with only two features, which both are categorical (cell type, and drug). Metric is MMSE (row wise). Cross-validation - by cell types with modifications. Baselines with encoding categorical features - one-hot, target encoding with optimization of smoothing parameter, pytorch embedding neural network. Alternative features: "ChemBert" ( link - by Aleksey Trepetsky), molecular descriptors ( link by Antonina Dolgorukova), etc. Most of approaches use dimensional reduction (pca-like) of targets (18211) to smaller dimension 25-100, then predicting these reduced target and then making inverse transform. Notebooks: EDA , modeling , pytorch embeddings , single cell RNA-seq data brief look.
Unusual: 50 000$$ - for biologically insightful solutions which will shed light on "How did you integrate the ATAC data? Did you learn a gene regulatory network?" etc.
Announcement on Kaggle
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📖 Presentation: A.Chervov:
📖 Presentation: A.Dolgorukova "Molecular descriptors"
📹 Video: https://youtu.be/dRG3qTaALp0?si=c6k6CARJuik-xF08
🚀 @SBERLOGACOMPETE вебинар по дата сайнс:
👨🔬 Лидия Шишина "Обзор Каггл соревнования TRAUMA Abdominal Detection Competitions."
⌚️ Понедельник 2 Октября, 19.00 (Moscow time)
Add to Google Calendar
📖 Presentation: https://docs.google.com/presentation/d/1hOX0MD7Q09n6FjnC4kfa8Jpf31r0sn7_tewPdM9LmCk/edit?usp=sharing
✔️ Ноутбук: https://www.kaggle.com/code/lidiashishina/rsna23-weighted-mean-baseline-scale-adj-at-end
В докладе будет рассказано о соревновании - постановка задачи, метрика, и будет дан обзор интересных сеток и решений. В том числе несколько бейзлайнов на CNN и несколько других подходов.
Ссылка на соревнование: https://www.kaggle.com/competitions/rsna-2023-abdominal-trauma-detection , анонс на Каггл: https://www.kaggle.com/competitions/rsna-2023-abdominal-trauma-detection/discussion/444286
Ссылка на зум будет доступна в канале @sberlogabig перед началом доклада. Видео записи: https://www.youtube.com/c/SciBerloga - подписывайтесь на ютуб канал.
📹 Video: https://youtu.be/90zbKUUCoI8?si=h8BOUE7cHCzimTLM
Заходите 21 сентября в 13:00 по Мск на вебинар Владимира Кушнарева на канале @cancerchameleon
Читать полностью…
🚀 @SBERLOGABIO вебинар по биологии:
👨🔬 Елена Белова "Глубокая стимуляция мозга при болезни Паркинсона – от истории поиска методов терапии к теориям двигательного контроля."
⌚️ Пятница 15 Сентября, 19.00 (Moscow time)
Add to Google Calendar
Глубокая стимуляция мозга (англ. Deep Brain Stimulation, DBS) появилась 30 лет назад как чисто эмпирический подход для нейрохирургического облегчения симптомов паркинсонизма и других двигательных расстройств. За три десятилетия нейрофизиологи многое узнали о работе подкорковых структур головного мозга, участвующих в моторном контроле, предложили усовершенствования для этой технологии и опробуют возможности DBS для облегчения других неврологических расстройств. На лекции поговорим о современных представлениях о патофизиологии болезни Паркинсона и особенностях нейрохирургического лечения различных форм этого заболевания.
Ссылка на зум будет доступна в канале @sberlogabig перед началом доклада. Видео записи: https://www.youtube.com/c/SciBerloga - подписывайтесь на ютуб канал.
О докладчике: Елена - сотрудник ИХФ РАН, автор замечательннго телеграм канала - @hippopocampus - "удивительное про мозг, поведение и нейронауки" - подписывайтесь !
📖 Presentation: /channel/sberlogabio/61301
📹 Video: https://youtu.be/h1fSCaJu710?si=vnnFb8pGCW2q1hHH
📹 Video 2: https://youtu.be/hV4BWrYCWSk (короткое дополнение: по структурам СТЯ и внешнего бледного шара)
Привет, Чемпион!
🏆 Хочешь быстрее покорить Kaggle и научиться выигрывать соревнования по анализу данных? Тогда приглядись к курсу "Введение в соревновательный Data Science"!
🎯 Что ты получишь?
- Первый русскоязычный курс по соревновательному Data Science с максимальным количеством практики.
- Насыщенная программа, содержащая эффективные методы для выбивания максимального качества из твоих ML-моделей.
- Более 200 практических заданий, интервью с Kaggle Grand Masters.
- Большое русскоязычное коммьюнити студентов курса для совместного прохождения и участия в соревнованиях.
🤘 На данный момент у курса:
👍 Уже 500+ участников.
👍 50+ отзывов, оценка 5 из 5.
👍 Выдано 70 сертификатов, отправлено 60 комплектов мерча.
😵 Медали на Kaggle у 5-ти студентов
🚀 На канале курса проводим еженедельные открытые вебинары, где разбираем решения победителей чемпионатов и делаем обзоры текущих соревнований.
🤕 Кстати, доступ к курсу можно получить оплатой через работодателя. Подробности тут.
📀 Промокод на скидку SBERLOGA
🚀 Голосуйте !)
📖 Сейчас на Каггл открыты (и будут продолжаться около 2 месяцев) - четыре "денежных" (не плейгруанд) соревнования
Если у вас есть интерес принять в них участие, то обычно это лучше делать в команде. В командах обычно идет интенсивный обмен опытом, нетворкинг, опыт командной работы и прочий фан. Чтобы было проще найти сокомандников - мы сделали голосовалки - голосуйте, пишите коллегам, кто в тоже проголосовал - объединяйтесь в команды - главное - не стесняйтесь:
Kaggle соревнование по картинкам :
RSNA 2023 Abdominal Trauma Detection
Голосуем тут: /channel/sberlogacompete/6638
Kaggle соревнование распознавание речи:
Bengali.AI Speech Recognition
Голосуем тут: /channel/sberlogacompete/6639
Kaggle соревнование NLP:
Kaggle - LLM Science Exam
Голосуем тут: /channel/sberlogacompete/6641
Kaggle соревнование NLP:
CommonLit - Evaluate Student Summaries
Голосуем тут: /channel/sberlogacompete/6640
Вводный доклад по этому соревнованию тут:
👨🔬 Ivan Glebov "Kaggle competition: CommonLit - Evaluate Student Summaries"
/channel/sberlogabig/299
Хакатон - цифровой прорыв 2023. Сезон искусственного интеллекта.
Голосуем тут: /channel/sberlogacompete/7160
Kaggle соревнование
TpuGraphs Kaggle competition, EvolutionaryScale.
Голосуем тут: /channel/sberlogacompete/7145
Kaggle соревнование
Child Mind Institute - Detect Sleep States
Detect sleep onset and wake from wrist-worn accelerometer data
/channel/sberlogacompete/7316
🚀 @SBERLOGABIO webinar data science, bioinformatics:
👨🔬 John Mitchell "Kaggle Competition Review: Novozymes Enzyme Stability Prediction"
⌚️ Friday 18 August, 19.00 (Moscow time)
Link to Announcement on Kaggle.
Add to Google Calendar
Kaggle's Novozymes Enzyme Stability Prediction was a challenging competition that rewarded expertise in bioinformatics as much as in Machine Learning. Two issues that made the competition particularly difficult were that the training data was rather different from the test data, and that there was no obvious or easy local validation protocol available. A wide variety of features and models proved valuable, while ensembling was generally considered essential. The nature of the competition lent itself to overfitting, and it was unsurprising that there was a large shake-up between Public LB and Private LB ranks. I discuss the experience gained from this competition and consider how the lessons learned might be applicable to other bioinformatic competitions.
About the reporter:
John Mitchell is expert both in bioinformatics and machine learning, and also experienced Kaggler and one of the top participants of CAFA5 , will share his experience on the past Kaggle competition "Novoenzymes" which in certain respects similar to CAFA5 challenge.
Zoom link will be available in /channel/sberlogabig shortly before start of the talk.
📹 Video record: https://youtu.be/M8tqVF4Gyi0
📖 Presentation: /channel/sberlogabio/59283
🔥 8 августа в 19:30 мск пройдёт вебинар на тему «7 вещей, которые никогда не стоит делать на алгоритмическом собеседовании!»
Что разберем на вебинаре?
— Как крутая статья может помочь получить оффер на работу в Яндекс;
— Как вырасти от стажера до тимлида;
— C чего начать и как продуктивнее изучать алгоритмы и структуры данных;
— Каких ошибок нельзя совершать на алгоритмических секциях.
Кто проводит вебинар?
Тим-лид биллинговых микросервисов Яндекса. Выпускник МФТИ. Преподаватель МФТИ по алгоритмам и структурам данных Павел Косицын. Павел прошел путь от стажера до тимлида в Яндексе. Выступал на конференции для стажеров Яндекса.
💻Организаторы вебинара - сообщество алгоритмистов @eda_academy
Кого ждем?
Приглашаются действующие и начинающие разработчики С++/Python/Java/Go. Дс, аналитики тоже приходите.
✔️Регистрируйтесь сейчас, а перед вебинаром придёт напоминание: https://clck.ru/35Cmdj
🚀 Дорогие коллеги, поздравляем всех Вас с наступающим Новым Годом, желаем огромных успехов, здоровья, счастья, удачи во всех начинаниях !
💰 Новый год - время подарков - вот, например, Каггл подарит 50 000$$ тем, кто соберет Кубики Рубика за меньшее число ходов, чем другие участники ежегодного новогоднего соревнования "Santa 2023 - The Polytope Permutation Puzzle - Solve twisty puzzles in the fewest moves".
👛 А мы предлагаем приз в 5000 р тому, кто опубликует публичный ноутбук с решением, который превосходит текущий лучший публичный ноутбук на 5% и расскажет решение на нашем вебинаре. (Если Ваш ноутбук будет лучше на 1% - приз 1000р, 2% - 2000р, 3%-3000р, 4%-4000р. Условия действительны до 7 января). Каггл - лучший способ изучать практический дата-сайнс, именно потому, что люди делятся там своим кодом, идеями. Мы всячески хотели бы поощрять эту активность, надеемся, что наш приз будет этому способствовать.
Комментарии, обсуждения постановки задачи - вы можете найти в нашем чате. Если кратко - то предложен набор позиций многомерных кубиков Рубиков и задача - предъявить наиболее короткую последовательность ходов для их сборки. С точки зрения математики это задача поиска кратчайшего пути на графе Кэли группы движений кубика. Хотя задача и выглядит игровой - она является модельной для многих серьезных проблем в комбинаторной оптимизации, и методы выработанные для ее решения будут полезны для многих практических задач.
🚀 @SBERLOGACOMPETE webinar on bionformatics and data science:
👨🔬 Дмитрий Руденко, Александр Червов "Обзор прошедшего соревнования "Open Problems – Single-Cell Perturbations""
⌚️ Четверг 20.00 (по Москве) 14 Декабря
Добавить в Гугл календарь
В соревнование требовалось предсказать как под действием лекарств (146 разных) меняются экспрессии генов. Было только две фичи и они категорные - название клеточного типа (6 типов клеток крови) и название лекарств. Это реальные экспериментальные данные полученные по топовым технологиям и стоящие огромных денег (200 тысяч клеток секвинировали мультимодально) - реально cutting-edge research questions. Семплов мало - 600+ в трейне, 255 в тесте, но таргетов было много 18211 (все гены). Удивительно, но особого шейкапа не было, хотя СВ-ЛБ билось плохо и семплов мало. Основные решения строились на PYBOOST и нейронках (удивительно, но нейронки хорошо работают даже при таком малом числе семплов).
Наша команда (Антонина Долгорукова, Дмитрий Руденко, Дмитрий Ершов, Антон Вахрушев, Александр Червов) заняла "счастливое" 13 место - ровно на 1 ниже золота (((((
Но у нас есть шанс еще на приз от экспертов - и ваши апвоуты - нам не помешают:
"U900 team - PYBOOST is what you need"
https://www.kaggle.com/competitions/open-problems-single-cell-perturbations/discussion/460858 описание решения и ответы на вопросы оргов. (Ваш альтруизм не будет забыт!)
В данном докладе мы напомним в чем была задача, немного расскажем о подходе на PYBOOST и перейдем к обзору решений других команд.
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
PS
Подписывайтесь на канал Дмитрия о дата сайнс и Каггл: /channel/pseudolabeling
📹 Video: https://youtu.be/NvH0tQ4wVxA
📖 Presentations: /channel/sberlogacompete/10469
Девчонки, будьте осторожны!
🤯 Кажется, парни пронюхали, что можно не только для резюме использовать... поэтому уже скоро во всех тиндер профилях)
🧑🔬 На входе очень некачественные разноформатные фотки, но на выходе AI магия 🧙♂️
@avatar_resume_bot
Следующая остановка — аннотация генетических вариантов!
Но чтобы до нее добраться, нужно знать путь 😉 Мы разработали интенсив, который за 2 дня поможет научиться применять современные методы аннотации и интерпретации вариантов для анализа генетических данных в медицинских и биологических исследованиях.
Например, вы научитесь:
— Идентифицировать и фильтровать генетические варианты
— Применять на практике инструменты аннотации и интерпретации вариантов
— Работать с базами данных и литературными источниками для проведения аннотации вариантов
— Интерпретировать наследственные и соматические варианты с использованием ген-специфических рекомендаций
Программа построена от теории к практике таким образом, чтобы студенты научились применять знания в реальных условиях, что является важным навыком для любого специалиста!
🚀 @SBERLOGABio webinar on bioinformatics and data science:
👨🔬 Antonina Dolgorukova "Bioinformatics analysis for the Kaggle Single Cell Perturbations data challenge"
⌚️ Monday 06 November, 19.00 (Moscow Time)
Add to Google Calendar
The bioinformatics analysis with Seurat package for single-cell data RNA sequencing data from the Kaggle challenge "Single-cell perturbations" will be presented.
- Calculation of Mitochondrial/ribosomal contamination (all cells), what percentage of all genes copies comes from the single most observed gene in each cell (10% of cells)
- Identification of highly variable features, followed by PCA, selection of principles components (10% of cells)
- Clustering cells based on main PC for the highly variable features
- Running non-linear dimensional reduction (UMAP/tSNE)
The talk will be based on the notebook: https://www.kaggle.com/code/antoninadolgorukova/op2-adata-analysis-with-seurat
Announcement on Kaggle
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📹 Video: https://youtu.be/lcc5vY-Pycs?si=NDz8KEarMFN8Llka
🚀 @SBERLOGACOMPETE informal webinar on data science:
👨🔬 Brainstorm on "Kaggle: Open Problems - Single-Cell Perturbations."
⌚️ Tuesday 17 October, 18.30 (Moscow time)
Add to Google Calendar
Let us discuss what's up on Kaggle challenge - Open Problems - Single-Cell Perturbations: overview proposed public solutions, CV-schemes, features constructions, some insights from biological data and so on. It is planned to be pretty informal - a kind of discussion and opinions exchange - everybody welcome. Some notes can be found link1, link2, link3.
Announcement on Kaggle
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📹 Video: https://youtu.be/6ySKxnjHX8Y?si=ICiv26d7j1LbYaKn
🚀 @SBERLOGACOMPETE webinar on data science:
👨🔬 Oleg Khudyakov "Introduction to Kaggle competition - Detect sleep states."
⌚️ Thursday 12 October, 19.00 (Moscow time)
Add to Google Calendar
Introduction and overview of the competition will be given. Parsing the raw data, including data labeling errors. Basic feature engineering. Application of gradient boosting and neural networks. Assumptions for postprocessing.
Announcement on Kaggle
Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga - subscribe !
📹 Video: https://youtu.be/RDnz9QASwaQ?si=KijFwYk94pAwYCk1
📖 Materials: Link
⚠️ Острожно - спуфинг атаки от имени админов Сберлоги и других чатов/каналов (не только Сберлоги) - будьте внимательны !
Некоторые коллеги получили просьбы перевести 120к на карту , некоторые предварительно получив оборвавшийся звонок по телеграм. Якобы от имени админов. Будьте внимальны - админы Сберлоги (и, думаю, других каналов) не пишут в личку с такими просьбами ! Не переводите денег ! Мошенники часто создают похожий по имени экаунт (спуфинг) и пишут от его имени - будьте внимательны !
Друзья!
Давайте Бустить!
/channel/sberlogabig?boost
В ближайшие два месяца мы будем делиться с вами публикациями и выступлениями с ряда ключевых конференций 2023 года: WCLC, ASCO, ESMO, AACR, SITC и SABCS, в которых принимали участие наши эксперты.
Сегодня начнем с WCLC. С 9 по 12 сентября в Сингапуре прошла Всемирная конференция по опухолям легкого (2023 World Conference on Lung Cancer). На ней были доложены результаты молекулярно-генетического анализа большой когорты карцином легкого на терапии ингибиторами контрольных иммунных точек: "NSCLC Microenvironment Subtypes Correlate with Response and Survival to Immune Checkpoint Inhibitor Therapy".
Соавторы работы — основатель нашего сообщества Владимир Кушнарев и эксперты курса по нейроэндокринным неоплазиям — Иван Валиев и Анастасия Макарова.
Завтра 21 сентября в 13:00 по Мск Владимир Кушнарев поделится опытом исследования на семинаре. Встречу проведем в этом телеграм канале.
Ждём всех желающих 🙂
🚀 SciBerloga @deep_learners club: учебный семинар по дата-сайнс
👨🔬 Иван Павленко "Введение в автоэнкодеры"
⌚️ Понедельник 11 Сентября, 19.00 (Moscow time)
Add to Google Calendar
План:
* Автокодировщики - что это такое.
* Область применения.
* Разбор реализации.
* Обзор набора данных UTKFace.
* Разбор класса модели и обучение.
* Обзор эпох обучения.
* Эксперимент с незнакомыми данными.
* Не самый удачный, но поучительный вариант с использованием свёрточных слоев.
* Небольшой эксперимент с восстановлением качества размытого изображения.
* Пара слов про вариационные автокодировщики.
Ноутбуки:
Основной ноутбук:
https://www.kaggle.com/code/mrgobus/autoencoder-utkface-from-old-to-young
Попытка использовать свёрточные слои:
https://www.kaggle.com/code/mrgobus/autoencoder-conv2d-utkface-from-man-to-woman
Не самая удачная, но поучительная =)
И на сладкое, вот эти два:
https://www.kaggle.com/code/mrgobus/ae-mnist-digits-distribution
https://www.kaggle.com/code/mrgobus/vae-mnist-digits-distribution
Это попытка посмотреть на распределение обычно и вариационного кодировщиков.
Зум линк будет доступен в группе: @deep_learners перед началом доклада.
🚀 @SBERLOGACOMPETE образовательный вебинар по data science:
👨🔬 Alexander Chervov "Hands on Hugging Face Transformers and Kaggle CommonLit challenge"
⌚️ Четверг 7 Сентября, 20.00 (Moscow time)
Link to Announcement on Kaggle. (Talk planned to be in English).
Add to Google Calendar
Образовательный вебинар для начинающих: примеры использования моделей типа DeBERTa из коллекции Hugging Face трансформеров для решения задач NLP. На примере Kaggle соревнования "CommonLit - Evaluate Student Summaries". Рассмотрим ноутбуки как файн-тюнить трансформеры под конкретные задачи. Это не так сложно, но все же несколько сложнее чем ".fit/.predict" (в sklearn), но не сильно - нужно примерно следующее 1) перевести данные в формат HF-датасета 2) токенизировть текст 3) добавить таргеты 4) подготовить параметры трейнинга 5) только потом запустить трейнинг. Мы рассмотрим как это происходит в деталях. Во второй половине обсудим соревнование "CommonLit" дадим обзор подходов и паблик ноутбуков, некоторых загадок подготовки данных организаторами, внешние данные и т.д.
Ноутбуки с моделями nb1, nb2, с обзором пабликов nb .
Zoom link will be available in /channel/sberlogabig shortly before start of the talk.
Предыдущий вебинар по данному соревнованию:
📹 Video: https://youtu.be/OL3ZW2AY6yg
👨🔬 Ivan Glebov "Kaggle competition: CommonLit - Evaluate Student Summaries"
Данный доклад:
📖 Presentation: https://docs.google.com/presentation/d/101mmtjEvIwKKP2klTwJZ_yIGydXyorQkKn19SrMoZnE/edit?usp=sharing
📹 Video: https://youtu.be/L6OQmXk1Am4
🚀 @SBERLOGABIG webinar data science:
👨🔬 Никита Бухал "Разбор формулы attention и реализации в pytorch-е"
⌚️ Среда 23 Августа, 20.00 (Moscow time)
Add to Google Calendar
Будет рассказано о механизме внимания и его основных свойствах. Приведены примеры реализации на pytorch, пример на Каггл , в колабе.
📖 Презентация доступна тут.
📹 Video: https://youtu.be/OL3ZW2AY6yg
📹 Video Part2 : https://youtu.be/HmotCYcllOs?si=bZfkjCy3sDBH_HOk
🚀 @SBERLOGACOMPETE webinar on Kaggle competition:
👨🔬 Ivan Glebov "Kaggle competition: CommonLit - Evaluate Student Summaries"
⌚️ Thursday 10 August, 18.00 (Moscow time)
Link to Announcement on Kaggle.
Add to Google Calendar
Обзор текущего соревнования на Каггл "CommonLit - Evaluate Student Summaries" - новое НЛП соревнование от организаторов фидбэка, необходимо оценить уровень студентов в написании саммари (изложения). Есть несколько текстовых колонок, но к ним есть вопросы. Трейн выборка сильно меньше тестовой, паблик всего 13 процентов. Снова "стэк бертов"? Или что-то еще... Будет интересно ! Соревнование продлится еще 2 месяца. Общий призовой фонд 60 000$$.
Zoom link will be available in /channel/sberlogabig shortly before start of the talk.
📹 Video: https://youtu.be/dcOvr_51u-w
📖 Notebook1: (with transformers - public top4) https://www.kaggle.com/code/bulivington/transformers-predictions-base
📖 Notebook2: (no transformers ) https://www.kaggle.com/code/bulivington/no-transformers-but-not-so-bad
🚀 "Везение и труд - все перетрут" ))) Поздравляем Лиду с успешным поднятием скора с 0.45+ до 0.47+ и получением приза. Линк на Ноутбук Лиды - апвоуты приветствуются !
Как оказалось, чтоб поднять можно было почти ничего не делать - просто запустить ноутбук и сделать сабмит. И ноутбук со скором 0.45+ превращается в скор 0.47+ , если вам немного везет. Как такое может быть ? Полезно подумать. Кто не придумает мы подскажем. Дополнительная замена активации с RELU на GELU во внутренних слоях - подняла скор еще, сигмойду в последнем слое - не меняем.
Новый пазл на 30 июля - приз такой же 1000р.
Цель - скор - 0.49+ на лидерборде.
Кто поднимает скор сегодня 30 июля выше 0.49 , тот получает 1000р
Доп. условия: Ноутбук должен быть пабликом, можно менять сетку, менять эмбеды, блендить свои сетки внутри ноутбука. Копировать чужие паблики нельзя, блендить с пабликами тоже, использовать бустинги и другие модели - нельзя - только пайторч сетки. Также оставить часть с вычислением локальных скоров из предыдущего ноутбука - локальный скор тоже должен подрасти - не только лб скор. Если несколько человек - приз получает тот у кого больше лб скор на конец 30 июля. Присоединяйтесь к обсуждениям пайторча в группе: /channel/+6Z2OPBOtjpNkNGIy
Update: Пазл продлен на 31 июля, с чуток повышенной целью 0.491
Update: Пазл продлен на 1 августа, с чуток повышенной целью 0.492
Ударный день - 1 августа:
Борис улучшил скор до 0.49545
Иван 0.49651
Лидия 0.51098
Андрей Шевцов 0.52875 - лучший паблик CAFA5, который получает скор моделью, без внешних данных
( https://www.kaggle.com/code/andreylalaley/pytorch-cafa-5-prediction?scriptVersionId=138595845
Ваши апвоуты - приветствуются ! )
Update: Следующая цель - 0.53 по лб, с аналогичными условиями