3048
ИИ на практике или "мама, а меня тоже заменят?"
Stability запилили свой собственный Suno под названием Stable Audio. Пока генерирует только инструментал, до песен они не добрались.
Звучит вполне приемлемо, даже по сравнению с Suno v3, хотя на мой вкус у Суно получше с развитием и переходами между частями.
Stable Audio умеет генерировать сразу 3 минуты, причем есть режим Audio to Audio, то есть вы загружаете свой трек и получаете что-то похожее. Звучит круто, но есть нюанс. Загруженный трек проверяется на копирайты и его объем ограничен месячной квотой. Я попробовал и что-то пока не оценил.
Промпты лучше брать из их библиотеки и дорабатывать. Я попробовал использовать свой промпт, который отлично сработал в Суно, и получил на выходе мусор.
Бесплатно с новой моделью можно создать 10 треков в месяц. Дальше цена сопоставима с Suno.
https://stableaudio.com/generate
#StableAudio #suno #music
Как говорится, было классно работать с вами, друзья.
У Sora сегодня новые демки https://openai.com/blog/sora-first-impressions
А одна из моих любимых студий PostPanic объявила о закрытии. Это в копилку к еще паре среднего размера студий закрывшихся за последние недели.
Кто говорит «ai это просто инструмент» давайте дружить - вместе будем разносить еду в кафе и мыть посуду, лучше связи налаживать заранее
Дискуссии о том, заменит ли ИИ художников/музыкантов/писателей, очень не хватает рассудительности. Чаще всего "люди искусства" склонны впадать в крайности в суждениях, поэтому в большинстве их комментариев слышны истеричные нотки, из-за чего "люди науки" ожидаемо встают в защитную позу. В результате диалоги такого рода заканчивается взаимными оскорблениями, пусть и весьма изобретательными.
Тем отраднее видеть, что существуют и взвешенный подход в этом вопросе. Я вот с интересом посмотрел интервью Юзефович про ИИ в литературе. И вам посоветую.
https://www.youtube.com/watch?v=Y0lA3R1PQas
#литература #chatgpt
Игры с промптами до добра не доводят. Я тут на базе GPT-4 сотворил Нейро-Понасенкова, который готов саркастически-снисходительно отвечать на любой комментарий в интернете.
На комментарии к этому посту тоже будет отвечать он, так что, если вы готовы к интеллектуальным унижениям, то можете рискнуть о чем-нибудь у него спросить. Думаете, он вас не переиграет?
#gpt4
Ещё чуток про бездушную музыку, уж простите. В новой версии Suno можно продолжать трек, начиная с выбранного таймкода. А ещё можно для продолжения указать совершенно другой жанр.
Суно, сохранив гармонию и основные мелодические ходы, создаст гладкий переход в новые инструменты и настроение. Это не всегда работает сразу (например переход из симфонии в дабстеп дался мне ценой двадцати генераций), но это того стоит.
P.S. Кстати, серьезный вопрос ухастым ребятам. По каким признакам вы поймёте, что этот трек сделан нейросетью, если услышите его в дикой природе без дисклеймера?
#suno
Кто про что, а вшивый о Суне.
Начался открытый альфа-тест Chirp V3. Новая версия доступна для платных пользователей.
Из нового:
- Гораздо более чистый микс и в целом качество аранжировки
- Эффект автотюна стал почти незаметен (зависит от жанра и голоса)
- Максимальная длина теперь 2 минуты, при этом всё ещё работает продолжение мелодии
- Галка "Инструментал" для создания композиций без голоса
Понятно, что это Альфа-версия, и разработчики говорят про возможные галлюцинации и ограничения, но у меня пока всё ровно и красиво. Разве что он перестал добавлять интро в песни и начинает сразу с текста, но, думаю, это пофиксят.
Я даже потестил инструментальный режим с финальным боссом, а именно "Epic orchestral movie soundtrack". И я бы сказал, что это не так ужасно, как могло бы быть. Нюансы сведения, конечно, присутствуют, но в целом хоть сейчас вставляй в корпоративный фильм под закадровый текст. Мне все время слышались фантомные "Audio Jungle".
#suno
И снова об играх. Valve, наконец-то, сформулировали правила использования генеративного контента в играх, которые могут продаваться в Steam.
1. При создании страницы игры вы теперь обязаны указать, в какой форме вы использовали ИИ в разработке. Эта информация будет видна всем пользователям.
2. Вы "обещаете" ("promise", так и написано), что вы не нарушаете ничьих прав.
3. Вы обещаете, что игра и маркетинговые материалы соответствуют друг другу по качеству. То есть нельзя сгенерировать только красивую обложку, а в самой игре использовать ассеты серии Polygon.
4. Самое пока сложное - это контент, который генерируется во время игры. Вы должны гарантировать, что он не нарушает правила площадки, и рассказать Valve, какие ограничения стоят в вашем генераторе. Также пользователи смогут пожаловаться на вашу игру прямо из Steam-overlay.
В целом звучит разумно, пусть и немного запоздало. По моим наблюдениям, процентов 90 игровых студий с корнями из СНГ, которые в гробу видали все эти ваши авторские права, уже как минимум используют генеративный ИИ, а как максимум имеют целые ИИ-отделы.
https://store.steampowered.com/news/group/4145017/view/3862463747997849618?l=russian
#gamedev #steam
Если вы где-то читаете пост о том, что "нейросеть придумала, как бы выглядел Гарри Поттер в Челябинске" или "нейросеть сгенерировала мультфильм в стиле Миядзаки", то можете смело отписываться от такого канала и больше к нему никогда не возвращаться, потому что его ведут идиоты.
Нейросеть ничего не делает сама. За любым интересным контентом всегда стоит немалый человеческий труд. А иногда так и прямо огромный. И авторы заслуживают того, чтобы быть упомянутыми.
Как пример, это видео Дмитрия Алексеева и Сергея Козлова. Если вы никогда не работали с картинкой и анимацией, может, вы и не увидите тут чего-то особенного. Но, вообще-то, это серьезная, сложная композная работа, которая будет не под силу большинству выпускников курсов "After Effects за месяц". Не говоря уже про добротную режиссуру и, в целом, художественный вкус.
Дмитрий Алексеев и Сергей Козлов - Авторы. А нейросеть - это просто инструмент.
https://www.youtube.com/watch?v=lyqrS6hkRuo
#youtube #анимация
ChatGPT, кстати, исполнился годик.
Он уже уверенно сидит, ползает на четвереньках, может стоять и даже ходить, держась за опору. Способен осмысленно играть с игрушками. Понимает речь и способен односложно отвечать на вопросы. Подражает действиям взрослых и испытывает базовые эмоции, такие как страх, радость, гнев и удивление.
Поздравим!
#chatgpt
Какая песня сгенерирована нейросетью?
anonymous poll
Приходи – 68
👍👍👍👍👍👍👍 79%
Поле – 18
👍👍 21%
👥 86 people voted so far.
Как получить от Суно законченную песню с нужной вам структурой:
1. Старайтесь соблюдать размер в стихах. Если ваш текст сложно петь, получится речитатив независимо от жанра. Если вы сделаете в припеве и куплете разные размеры, то Суно будет проще придумать между ними переходы. Между соседними куплетами вставляйте пустую строку, получится пауза.
2. Ударения в словах можно выделять большой буквой, вот так: "ПоросЯтам". Когда это не работает, измените само слово: вместо "прямЫ" напишите "примЫ". Иногда помогает разбить слово на две части, вместо "элЕктрогенератор" написать "элЕктро генерАтор".
3. В круглых скобках можно добавлять бэк-вокал. Неплохо работают звуки типа (О-о-о, у-у-у-у).
4. Размечайте песню тегами. Точно работают: [Verse], [Chorus], [Bridge], [Solo]. К Соло иногда можно добавлять конкретику, например [Piano solo], но это может изменить инструменты всей песни. [Coda] помогает сделать концовку. С переменным успехом у меня работали [Calm] и [Aggressive]. Надо экспериментировать с другими тегами в квадратных скобках.
5. Иногда можно кастомизировать жанр, добавляя слова типа Energetic, Rhythmic, Aggressive, Slow, Fast. Обязательно пишите With Female/Male vocals, чтобы избежать инструментала и указать пол певца (тоже не всегда срабатывает). Разработчики не рекомендуют смешивать разные жанры, но, например, Chiptune Punk мне очень зашёл.
6. Максимальный размер одной генерации 1:20. Когда вам понравился кусок, выбирайте меню с тремя точками и пункт "Continue fom this clip". В тексте оставьте только те строки, которые не влезли в прошлый фрагмент, и нажимайте Generate. Так можно делать несколько раз, например у вас может быть три-четыре таких последовательных фрагмента. В самом конце в меню выбирайте пункт "Get Whole Song" и песня склеится из всех фрагментов.
К сожалению нельзя перегенерировать только кусок песни, поменяв что-то локально в тексте. Поэтому приходится прощать мелкие ошибки или править результат в вашем DAW.
Песни пишутся здесь в пункте Create (Custom):
https://app.suno.ai/
#suno
Это уже за гранью добра и зла. Ты даёшь нейросети текст и описание аранжировки. Она за две минуты генерирует две готовые песни. С куплетами, припевом, бриджем. С паузами и голосоведением. С эмоцией.
Переходите по ссылке, выбираете Create (Custom). На генерацию песни уходит 10 кредитов, у вас в начале будет 150. Ну или 10 долларов в месяц.
https://app.suno.ai/create
#suno
Последний твит Альтмана:
Если я начну ворошить грязное бельё, то совет директоров OpenAI потребует с меня полную стоимость моих акций.
Если что, по уставу OpenAI, как некоммерческой организации, Альтман и другие члены совета директоров не имеют права владеть акциями компании. То есть этот твит стоит понимать так: "Мне терять нечего".
Забастовка сценаристов закончилась, и наконец-то нормальный сериал начали снимать.
https://twitter.com/sama/status/1725748751367852439
#openai
А теперь обратный процесс. Видео из текста с помощью OpenAI API.
1. Сгенерировал закадровый голос.
2. По его хронометражу определил, сколько нужно кадров.
3. В GPT4 создал JSON с нужным числом промптов для этих кадров.
4. Скормил их Dall-E 3 и получил картинки. До этого пункта всё автоматизировано. Подаёшь на вход текст, получаешь закадровый голос и секвенцию кадров.
5. Gen-2 для генерации движения (вручную).
6. Отказался от Audiocraft и сделал звук по старинке.
Пока что самое слабое звено в этой цепи - это Gen-2, который сильно портит картинку. Надеюсь, следующие версии будут работать лучше, и добавят API.
Сгенерируй 10 мультфильмов хронометражом 2 минуты в стиле Миядзаки, добавь закадровый голос и мрачную музыку. Выложи на Youtube с оригинальным названием и описанием.
#openai #gpt4 #dalle
Иногда кажется, что ChatGPT всегда был с нами. А ведь он вышел всего год назад, в конце ноября 2022 года.
Сегодня же OpenAI выдали пачку интересных анонсов.
1. OpenAI запускают модель GPT-4 Turbo аж со 128 тысячами токенов контекстной памяти, это целая увесистая книга. Модель будет умнее и быстрее GPT-4, при этом знания о мире отсекаются апрелем 2023 года.
2. Фишки для разработчиков: лучшая обработка экшенов, вывод в JSON, повторяемые результаты.
3. Все цены в API уменьшаются в 3 и 2 раза для входящих запросов и результата соответственно.
4. В API приходит Vision, Dall-e 3 и TTS. Whisper v3 на подходе.
5. GPTS - это автоматический конструктор и магазин чат-ботов для любой тематики. Можно загружать свои документы, давать инструкции и даже генерировать иконку в Dall-e.
6. Новый конструктор ассистентов позволяет легко запрограммировать заточенного на вашу тему помощника для приложений и сайтов.
7. Отныне в случае любых исков по авторскому праву OpenAI возьмут на себя все издержки. Это касается и API, и ChatGPT.
8. AGI has been achieved internally.
Новые фичи, как всегда, будут выкатываться постепенно.
https://www.youtube.com/watch?v=U9mJuUkhUzk
#openai #gpt4
Вчера понадобилось перевести видео с польского языка. Мне порекомендовали Speech Translate, а теперь я его рекомендую и вам.
Это оупен-сорсный софт для перевода речи. Под капотом Whisper и несколько переводчиков на выбор, в частности есть Google Translate.
Можно переводить в реальном времени, например открыть видео на Youtube, а в приложении создать полупрозрачное окно субтитров. Но мне этот вариант не особо зашел, потому что при добавлении новых слов иногда меняется текст перевода и верстка съезжает. Но можно просто загрузить целое видео и на выходе получить файл субтитров, причем даже с выделением цветом текущего произносимого слова. И то польское видео я перевел за десять минут. "Б" - будущее.
Идите в релизы, скачивайте сборку под свою систему. Не забудьте в настройках указать папку для кэша моделей, их там несколько в зависимости от доступной видеопамяти.
https://github.com/Dadangdut33/Speech-Translate
#whisper #translation #soft
Если вы занимаетесь программированием, вам наверняка знаком сайт https://leetcode.com/, на котором собраны алгоритмические задачи. Вы можете выбрать задачу, решить ее на любом языке программирования и автоматически проверить решение. Задачи с этого сайта часто используются на собеседованиях для проверки кандидатов.
Пять месяцев назад мне пришла идея эксперимента: Я беру сложные задачи, скармливаю их GPT4, без правок копирую результат на сайт и проверяю автотестом. Игра продолжается до первой ошибки. И тогда я срезался на первой же задаче, потому что решение содержало ошибки.
Вчера я вспомнил об этом эксперименте и решил его повторить. Памятуя о прошлом провале я начал с простой задачи. Она решилась мгновенно. Потом перешел на средние и решил 15 штук. Переключился на сложные. Тут я, честно говоря, в какой-то момент начал уставать, так как ошибок всё не было и не было. Меня спасло достижения лимита сообщений в ChatGPT. До этого момента я решил 22 сложные задачи.
В общем, за 43 минуты GPT4 решил 38 задач с LeetCode без единой ошибки.
Не все решения были оптимальными по быстродействию. Примерно половина укладывалась в среднее значение (по сравнению с человеческим кодом), процентов 30 была медленнее, зато оставшиеся были быстрее, чем 90 процентов предложенных решений.
Какой можно сделать вывод?
Ну, во-первых, GPT4 сейчас и GPT4 пять месяцев назад очень сильно отличаются друг от друга. Это бьется с последним интервью Альтмана, в котором он признался, что они больше не хотят революционных прорывов, а планируют медленно разогревать воду в котле с лягушками.
А во-вторых, следующее поколение программистов будет ленивым и неизобретательным, зато задачи будут щёлкаться как семечки.
#gpt4 #programming
Ну что же, маэстро Нейро-Понасенков готов ко взрослой жизни. Теперь он существует в виде отдельного GPT.
Можете обсудить с ним волнующие вас вопросы на любом языке. Если, конечно, вы достаточно элитарны и обеспечены, чтобы оплатить подписку на ChatGPT. А чернь мы не будем отвлекать от поедания земли, или чем там они любят заниматься в свободное время?
https://chat.openai.com/g/g-MTW9O1uz4-sarcasmic-bliss
#gpt4 #chatgpt
Меня спрашивают, мол, почему ты часто пишешь про игры?
Во-первых, игры - это круто, и если вы не играете, то упускаете важный пласт человеческой культуры.
Во-вторых, это самая быстро развивающаяся и технологичная индустрия развлечений, причем для игр требуется создавать много контента. И конечно генеративный ИИ в том или ином виде уже стал важной частью геймдева.
С момента публикации Стимом новых правил размещения игр, сделанных с применением ИИ, прошло почти два месяца. За это время появилось более 500 подобных игр. Их список можно посмотреть на сервисе SteamDB (там придётся зарегистрироваться):
https://steamdb.info/search/?a=app_keynames&type=1&keyname=565&operator=1&keyvalue=
Сразу оговорюсь, это не список готовых игр, в которые можно поиграть. В большинстве своём там страницы игр, которые ещё не вышли. Средний инди-разработчик создаёт страницу за полгода-год до выхода игры. А то и вообще забивает на игру и не выпускает ее, такое тоже случается.
Но интересно посмотреть, что именно пишут авторы про использование ИИ. Часто это похоже на заискивающее оправдание, мол, мы маленькая команда, и генеративный ИИ помогает нам сделать игру мечты, вы не сердитесь, а посмотрите, хорошо же получилось, у нас сценарий точно писал человек, совсем немного GPT помог.
Это понятно. Пока ещё нет уверенности, как именно пользователи отреагируют на подобный дисклеймер. Громкое меньшинство хейтеров ИИ может занизить оценки игры в магазине, что для независимых авторов часто становится болезненным ударом. Я полагаю, что в первое время будет много воплей по этому поводу.
Но если у ААА-студий цикл разработки игры может занимать от 5 лет до бесконечности, то новые инди-игры появляются каждый день. И на тысячу игр случается один суперхит типа Vampire Survivors или Loop Hero, который сможет сдвинуть окно дискурса и изменить отношение пользователей к ИИ. А через пару-тройку лет, пройдя по костям павших в этой борьбе инди-разработчиков, на арену выйдут ААА-студии со своими собственными нейросетями, чтобы собрать урожай подготовленных игроков.
Если где-то и произойдёт быстрая нормализация контента, созданного нейросетями, то именно в геймдеве.
Что думаете? Если в описании игры написано, что в ней графика сделана ИИ, станете в нее играть?
#steam #gamedev
В общем, пока мы все обсуждали видео от Соры, которую еще никто в глаза не видел, Suno сделали настоящую революцию. Инструментальный режим в третьей версии генерирует практически идеальную продакшн-музыку.
Вы делаете игру, а денег не то, что на Ханса Циммера, но даже на Мика Гордона и Майкла МакКана не хватает? Не беда. За 20 баксов и пару часов можно сделать готовый саундтрек, который будет звучать вполне адекватно на большинстве консьюмерских девайсов.
Я вот так и сделал, презентую вам OST к выдуманной игре про роботов, которые видят сны.
Пара советов начинающим композиторам:
- Не пишите в стиле слово Orchestral, если не хотите банальную корпоративную музыку со второй страницы выдачи AudioJungle.
- Используйте в промпте стилистику (sci-fi themed exploration theme), настроение (calm, sad, aggressive, thoughtful) и набор инструментов (Piano, Cellos, Bells, Toms, Violins, Pads, Moog).
- Если мелодия прерывается на середине, используйте функцию Continue from this Song.
- Если трек логично закончился, Суно может добить хронометраж повтором. В этом случае просто отрежьте финал в своем любимом аудиоредакторе.
Композиторам успехов!
#suno
Suno втихаря запустили сервис по созданию песен ко дню святого Валентина. Там нужно вписать, кому эта песня посвящена, где вы встретились и что делает этого человека уникальным. Сервис генерирует стихи и песню, которую можно послать вместо валентинки. Дешево и сердито.
Эта новость не стоила бы выеденного яйца, если бы не слухи, что там под капотом третья версия Чирпа, которой пока нет в открытом доступе. И на мой слух генерации действительно получаются лучше. Микс чуть более внятный, нет такой каши в низах, эффект автотюна на голосе сильно ослабился. Всё ещё не идеально, но лучше, чем было раньше.
https://vdaysong.com/yzet6p2y
Попробовать самому можно вот тут: https://v-day.suno.ai/
Дата выхода третьей версии на основной платформе пока хранится в секрете. Но вроде как скоро.
#suno
Для тех, кто не понимает всей этой новогодней суматохи, я сделал депрессивную версию самой надоедливой праздничной песни.
https://youtu.be/41xJLUMfleg
#youtube #suno
С наступающим!
Лучший подарок - это подарок, созданный бесплотными руками нейросетей. Поэтому я нагенерировал вам кавер-версий песен из старых диснеевских мультфильмов в разных жанрах.
https://www.youtube.com/watch?v=xjZNGc0Jy0Q
Вот тут весь плейлист:
https://www.youtube.com/playlist?list=PL6R8KrRTZPFHOH1lPLklgN59lywHNIkcn
Если что, я даже Youtube-канал для этого создал, так что подписка, колокольчик, лайки, все дела.
#suno #youtube
Будем считать, что голосование закончилось. Как и ожидалось, большинство слушателей, 77 процентов, правильно определило генерацию.
Трек "Приходи" я сделал в Суно, а трек "Поле" - это композиция группы с милым названием "нож улыбочка". Вот тут можно заценить их альбом: https://ionoffmusic.bandcamp.com/album/--92
Давайте обсудим, что именно выдаёт "искусственную песню"?
На мой взгляд, помимо очевидного отсутствия души, которое вы все, конечно, заметили, это качество сведения. Когда Суно пытается играть Tutti или просто добавляет в микс побольше инструментов, то получается каша. В моём треке такой кашеобразной получилась кода. Это приемлемо для некоторых жанров, но в электронной музыке мы привыкли слышать все инструменты.
Второй момент - это голос. В зависимости от партии, в нём могут прорезаться модуляции. Хотя мне кажется это не так критично, учитывая, что во многих современных треках автотюн используется чуть ли не как основной эффект. Остальное, типа необычной фразировки, придыханий и так далее, можно услышать и в человеческой музыке.
В общем, контрольную точку мы сохранили. Давайте условимся, что через полгода, в мае, мы соберёмся на том же месте и повторим эксперимент уже с новыми нейросетевыми инструментами, которые наверняка появятся к тому времени.
Всем добра! Не ругайтесь из-за музыки.
#suno
Эксперимент.
Я провёл какое-то время на Бэндкампе в поисках интересных инди-групп. Надо было найти песню достаточно простую, но при этом хорошую, чтобы с ней было приятно работать.
Дальше я в похожей стилистике написал текст и сгенерировал свой трек в Suno. Процесс немного вышел из-под контроля и я просидел полночи в поисках нужного звука.
Для чистоты эксперимента я чуток обработал "человеческую" музыку эквалайзерами и ухудшаторами, да простят меня авторы.
Как вы думаете, какой из этих треков сгенерирован?
Если что, я это затеял не чтобы принизить достоинство авторов исходного трека. Мне их творчество очень понравилось, альбом я купил и дам ссылку при объявлении итогов. Мне просто интересно, что из этого получится. Ставлю на то, что при сегодняшнем уровне генерации большинство угадает правильно.
Хочу зафиксировать этот момент истории, чтобы повторить эксперимент через полгода.
#suno
А у вас есть в окружении такие люди, которых можно назвать "скептиками ИИ"?
Ты ему показываешь по-настоящему крутое изображение от нейросети, а он: "Фигня, сделано без души! Человек бы потратил больше времени, но нарисовал лучше!".
Или даёшь послушать сгенерированную песню, а он: "Забавно, конечно, но без искры божьей. Вот ты слышал Квин или Пинк Флойд?".
Ну, то есть, я слушал и Квин, и Пинк Флойд, и Джона Зорна и даже Карлхайнца Штокхаузена, будь он неладен. Это не мешает мне удивляться новому. Почему вроде неглупые люди отказываются замечать настоящие чудеса которые происходят здесь и сейчас, рядом с нами? Как с ними разговаривать?
Первый сезон сериала подошёл к концу. Альтман возвращается в OpenAI. Не буду анализировать, строить догадки и теории заговоров. Просто скажу, что это было интересно.
Вся эта история с увольнением выглядит глупо и, в то же время, очень по-человечески - как семейная ссора с битой посудой, хлопаньем дверьми и примирением в конце. Но семейная ссора, за которой наблюдали миллионы людей. Такие события трудно представить в гигантской корпорации, где каждый ход заранее просчитан, заверен командой юристов и пиарщиков.
Я бы сказал, что прошедший "скандал выходного дня" - это очень милая, душевная и действительно человечная история. А ещё, кажется, что она была совсем не про деньги.
Группа энтузиастов-идеалистов по щелчку пальцев оказывается в центре внимания. Сегодня даже мелкая ошибка с их стороны может привести к катастрофическим последствиям, и теперь им придется играть по другим правилам.
Подозреваю, что мы больше не увидим от них такой открытости. Теперь они наймут тот самый штат юристов и пиарщиков и потихоньку станут превращаться в классическую корпорацию зла.
#openai
P.S. А по поводу возможного перехода Сэма в Микрософт: Сколько бы миллионов не предлагали, никто в здравом уме не уйдёт из компании, в которой можно будет первым опробовать GPT5.
Ваше мнение: что стало причиной увольнения Альтмана из OpenAI?
anonymous poll
Разногласия по поводу контроля над ИИ и прибыли – 27
👍👍👍👍👍👍👍 31%
Подковёрная борьба за власть – 25
👍👍👍👍👍👍 29%
Damage control после событий, о которых мы еще не знаем – 17
👍👍👍👍 20%
Другое – 10
👍👍👍 11%
Отношение к AGI – 5
👍 6%
Личные конфликты – 3
👍 3%
👥 87 people voted so far.
Ну что, я потестил обновлённый API от OpenAI.
1. Из кода через GPT4 сгенерировал шесть описаний последовательности кадров на заданную тему.
2. По ним в Dall-e 3 сгенерировал картинки.
3. По картинкам в GPT4 Vision создал поэтичный текст.
4. Сгенерировал дикторский голос в OpenAI TTS. Эти пункты полностью автоматизированы.
5. Засунул картинки в Gen2 и создал видео (пока вручную).
6. В локальном Audiocraft сгенерировал музыку (если это можно так назвать).
7. Профит
Выводы:
- Для чистоты эксперимента я ничего отдельно не редактировал и не перегенерировал. Если добавить минимальный человеческий ввод, то можно добиться лучших результатов. Единственное, я наложил на видео немного шумов, потому что могу.
- Голос у OpenAI самый лучший из тех, что я слышал. Но у него плохо с ударениями в русском языке. Сложные слова: "мореплавателю", "гавани", "пенистый", "зову".
- Мы всё ближе к полностью автоматической генерации комплексного контента без лишней прослойки в виде человека.
#openai #gpt4 #dalle #gen2
А ещё использование языковой модели в качестве интерфейса позволяет общаться с Dall-E, как с обычным дизайнером. Только Dall-E быстрее работает и меньше выделывается.
Например, вам нужна карикатура. Можно прямо по-русски в общих чертах сформулировать задачу. Под капотом GPT4 придумает четыре сюжета и для каждого сгенерирует свою картинку, причём сюжеты будут конкретными и детальными, в стиле "черноволосый человек сидит за компьютером, на экране видно то и сё...".
Потом вы можете попросить переделать конкретную картинку: изменить стиль, палитру, добавить-убрать предметы или героев, вставить надпись, поиграть шрифтами, ну, вы понимаете, побыть заказчиком.
Как и с мясным дизайнером результат не всегда предсказуем, и Stable Diffusion со своими инпейнтами и контролнетами всё ещё рулит. Но сам процесс такой работы над картинкой и поиска идей гораздо удобнее и понятнее интерфейса Автоматика.
#dalle #gpt4