14289
Уютный чат для профессионалов, занимающихся поиском питоньих мудростей. Как не получить бан: https://t.me/ru_python/1961404
Всё, понял, ты говоришь об эмбеддинге каждого отдельного токена
Читать полностью…
Исходный - это представление промпта в виде векторов, а добавочный - это контекстное представление каждого вектора после аттеншена. Потом по этим же данным будет выполняться корректировка весов через градиент.
Читать полностью…
Да, маску я тоже добавил, чтобы следующие токены GPT не видел и не учился запоминать "будущую" информацию.
Читать полностью…
А я узнал буквально неделю назад, теперь вот пытаюсь описать своими словами
Читать полностью…
На PyTorch делалось, не знаю, на чём ещё можно 💁♂️
Читать полностью…
На чём учил?
Интересно было бы поближе глянуть архитектуру. Сколько слоёв, какого они размера? Аттеншен, надо думать, классический фулловый взял?
Вузу нужно план выполнить что ли? Делайте любую хрень, главное чтоб с ИИ.
Читать полностью…
Очевидные проблемы - зацикленность, пока что нет структуры "хорошего предложения", только локальные связи между словами. Но общий принцип соответствует структуре трансформеров согласно исследованиям.
Читать полностью…
Так нету баланса сложности для большинства, в состояние потока не войти когда тебе всё нужно на бинарной логике делать и посмотреть тонну видосов по ньюансам редстоуна
Читать полностью…
Там с редстоуном на флай машинах делается оч прикольно в ваниле с логическими воротами
Еще мод create есть бомба, беспроводной редстоун, всякие детекторы можно надолго засесть даже в креативе
Есть еще computer craft, там вообще можно к своему api серверу обращаться из майна
Не совсем понимаю что имеешь в виду под исходным сигналом (а моё знание их архитектуры слишком поверхностно, чтобы предположить, что ты имеешь в виду)
Читать полностью…
Окружающий, или предшествующий? GPT в момент чтения токена n не видит токен n+1, то-есть видит только предыдущие токены
Читать полностью…
В общих чертах понятно, но это с учётом того, что архитектуру трансформера в общих чертах я ранее уже знал
Читать полностью…
Слой пока один, размеры тестовые (эмбеддинги из 4 элементов), архитектура: матрицы Q, K, V для представления одного токена через окружающий его в предложении контекст. Аттеншн добавляем к исходному сигналу и прогоняем через FFN. На выходе получаем логиты и соответственно вероятности токенов, какой может быть следующим.
Не знаю, понятные ли формулировки? Сам только изучаю. Уже добавил температуру и тестирую алгоритм Top-K.
Сделай словарь, где из токенов только голые символы (буквы и цифры для начала, юникодовские ужасы в расчёт не берём) и попробуй запустить это
Читать полностью…
Почему про create вспомнили, а про pneumaticcraft нет? Ну зумеры...
Читать полностью…