51346
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergeyTsyptsyn
Это я вечером понедельника.
Бахнул все посты. Поставил прожарку.
И читаю комменты под прожаркой.
@cgevent
Локальный Виспер без питонга.
Продолжение нашего вчерашнего разговора про транскрибацию с помощью ChatGPT.
У кого нет ChatGPT или у кого аллергия на ChatGPT, можно пользоваться вот такой вот штукой.
Это полностью локальная транскрибация звука на вашем компе.
Есть клиент для Винды, для Мака и для Линукса. И всё это скачивается вот по этой ссылке.
https://sourceforge.net/projects/buzz-captions/files/
Для Винды не подписано, Винда будет бессильно ругацца.
Для тех, кто хочет в код, есть ссылка и на код.
https://github.com/chidiwilliams/buzz
Для меня тут основная новая фишка - это то, что он умеет выводить субтитры и различать говорящих, а также принимать на вход видеофайлы.
И да, там есть CUDA и MLX ускорение.
Полный список фич:
- Транскрибация аудио- и видеофайлов, а также видео по ссылкам YouTube
- Транскрибация аудио в реальном времени с микрофона
- Отдельное окно для отображения текста во время мероприятий и презентаций
- Разделение речи перед транскрибацией для повышения точности на записях с шумом
- Определение говорящих в транскрибированных аудио и видео
- Поддержка нескольких бэкендов Whisper
- CUDA-ускорение на видеокартах NVIDIA
- Поддержка Apple Silicon на Mac
- Vulkan-ускорение Whisper.cpp на большинстве GPU, включая встроенную графику
- Поддержка нескольких семейств моделей Transformer через Hugging Face в режиме Whisper
- Экспорт транскрипций в TXT, SRT и VTT
- Расширенный просмотрщик транскрипций с поиском, управлением воспроизведением и регулировкой скорости
- Горячие клавиши для быстрой навигации
- Отслеживаемая папка (Watch Folder) для автоматической транскрибации новых файлов
- Интерфейс командной строки (CLI) для скриптов и автоматизации
- Система плагинов, включая AI-суммаризацию и автоматическое изменение размера/форматирования транскриптов
@cgevent
OpenAI завтра снова открывает подписку Pro за $200 для новых пользователей.
Но.
Новый Pro $200 будет давать примерно вдвое меньше usage, чем старый, если пересчитывать его в эквивалент расходов через API.
То есть формально:
старый Pro $200 -> условно X долларов вычислений по API
новый Pro $200 -> примерно 0.5X.
Цена подписки при этом остаётся $200.
Но.
OpenAI утверждает, что реальный объём выполненной работы уменьшиться не должен. Наоборот - со временем он должен расти.
Э-э, кхгм?
Во-первых, OpenAI не возвращает старый 5-часовой лимит. Остаётся недельный бюджет, который можно расходовать тогда, когда он действительно нужен, хоть значительную часть за один день.
Во-вторых, сами модели становятся какбэ дешевле.
На этой неделе OpenAI выпустила GPT-6 Sol и GPT-6 Luna и примерно вдвое снизила их API-стоимость относительно предыдущего поколения:
GPT-5.6 Sol -> $4 input / $20 output
GPT-6 Sol -> $2 / $10
GPT-5.6 Luna -> $0.20 / $1.20
GPT-6 Luna -> $0.10 / $0.50
Поэтому возникает занятная арифметика.
Если раньше подписка позволяла выполнить объём работы, который через API условно стоил $1000, а новая модель делает сопоставимую работу вдвое дешевле, то сегодня те же вычисления могут стоить уже около $500.
Типа то на то..
Насколько это будет соответствовать действительности, непонятно.
А теперь десерт.
Завтра OpenAI собирается добавить в Pro новые возможности, которые вообще не будут расходовать основной usage.
По слухам, OpenAI постепенно хочет прийти к модели, где огромная субсидия внутри подписки вообще перестанет быть главным преимуществом Pro.
API становится дешевле, модели эффективнее, и разница между «я плачу $200 и получаю конскую халяву» и «я просто покупаю необходимый compute по мере использования» типа должна постепенно сокращаться.
Подробности - завтра
@cgevent
Это я с утра - когда в личку ломятся боты и кожаные с вопросами:
- вы используете нейросети?
- вам интересны запуски, запуски, запуски?
- учим арбитражу
- давайте заработаем мульен вместе!
Теперь посылаю им вот это.
@cgevent
Мертвые заговорили!
Полный Kling 4.0 выходит в октябре, а Kling 4.0 Flash уже бахнули для подписчиков Ultra Yearly.
Главное:
- до 30 секунд видео одной нативной генерацией вместо прежних 15;
- до 10 keyframes;
- до 15 мультимодальных референсов одновременно - персонажи, предметы, изображения, видео и другие материалы;
- более развитый Omni Reference и редактирование уже существующего видео;
- 4K;
- 10-bit HDR (воще непонятно какой именно);
- улучшенный native stereo audio;
- более точный lip sync;
- video extension;
- больше языков, акцентов и диалектов.
Это редактирующая модель.
Можно менять:
персонажа;
выражение лица;
движение персонажа;
отдельный объект;
фон;
визуальный стиль;
ракурс;
движение камеры.
В Edit можно использовать один основной ролик и до четырёх дополнительных видео как референсы.
Теперь про Kling 4.0 Flash.
Это облегчённая версия 4.0 для более быстрой генерации. Она уже работает в early access, тогда как полноценный 4.0 появится только в октябре.
Но: Kling пока не опубликовал нормальную официальную таблицу 4.0 vs 4.0 Flash.
Из предварительных материалов и утечек Flash примерно так:
Kling 4.0:
до 30 секунд
до 4K
до 15 референсов
до 10 keyframes
максимальное качество и контроль
Kling 4.0 Flash:
предварительно до 20 секунд
предварительно 720p
часть продвинутых функций может быть урезана
Цена, Карл?
https://kling.ai/release-note/release-notes/Kling_4
@cgevent
ElevenLabs смотрел-смотрел, как обходят конкуренты, и выкатил Eleven v4
Сразу в топ Artificial Analysis
Новая архитектура – модель читает сценарий «как актёр озвучки»: понимает, кто говорит, что только что произошло и с какой интонацией подать реплику. Языков стало 90+ (у v3 было 70+).
Бенчмарки Artificial Analysis:
– Provider Voice Arena – #1 с Elo 1319, лучше Cartesia Sonic 3.6 (1276) и Gemini 3.8 Flash TTS (1267). Первое место во всех четырёх категориях: саппорт, ассистенты, обучение, развлечения. Если что это все английский, остальные языки самим тестировать надо.
– Controlled Voice (все модели говорят одним и тем же кастомным голосом) – #2 с 1157, уступает только Qwen-Audio-3.1-TTS-Plus от Alibaba. Короче, голоса у elevenlabs лучше, а вот стандартный голос может чуть уступать.
– Pronunciation Robustness – 91.7%, лучший результат, который AA вообще намеряли. Gemini 3.8 Flash TTS – 89.5%, v3 – 85.6%
– скорость – 73.4 символа в секунду против 42.5 у v3.
Что внутри:
– теги вроде [laughs], [whispers], [door slams] прямо в тексте, v4 слушается их лучше, чем v3
– context stitching – длинный текст (хоть аудиокнига) без швов по темпу и подаче
– перегенерация фразы хоть 50 раз – голос не «плывёт»
– вернули Professional Voice Clone, которого не было в v3
v4 Turbo – для реалтайма и агентов: ~150 мс до первого звука (у Sonic 3.6 – 262 мс, у GPT-4o mini TTS – 814 мс, но это замеры самих ElevenLabs) и двунаправленный стриминг – звук идёт ещё до того, как LLM допишет предложение. Но если что конкуренты быстрее. 75-150 мс дают основные топовые модельки.
А теперь про деньги: $80 за 1M символов. Дешевле, чем 3 версия. Sonic 3.6 – $49, Gemini 3.8 Flash TTS – $16.49. То есть Google в 5 раз дешевле и отстаёт всего на 52 пункта Elo. Inworld в 4 раза дешевле, Grok, Soniox - еще дешевле.
Короче, по качеству и произношению – топ, для аудиокниг и брендового голоса норм. Рекламы всякой, озвучки фильмов.
А вот для колл-центра на миллионы минут я бы сначала посчитал юнит-экономику на Gemini, InWorld, Grok, Cartesia – разница в 5-10 раз по цене быстро съедает разницу в качестве.
https://elevenlabs.io/v4
Получил с утра такое
Задумался, испытал затруднения с ответом.
Потом придумал:
- Ашоето?
@cgevent
Вот это работа!
И - Идея
С - Сценарий
М - Монтаж
Нейропржарщегам на заметку.
@cgevent
#Сеня_и_Даня_Здесь_Были
Время вечерней молитвы. А то в выходные вы расслабились без дедулиных постов.
За что вам это, вы помните.
Это не Сиданский, кстати, то Минимаксевич.
@cgevent
Рубрика крутые подписчики. Забрал из коментов пост от Kenan HKS
Ну чтож. Добрался я до ACE Studio. Поставил на свою 5080 RTX 16GB large модель 2 гига отлетает в рам но норм полет.
В Пинокио ужасные результаты но вот с подключением Комфи картина радикально меняется.
Первое что понял. Это конкурент Суно? Да. НО! если знаешь музыку. К счастье музыкальное образование и постоянная практика в написании нот помогает тут держаться на плаву. Главный плюс нет цензуры и модель не играется в коммерческое усреднение. Однако для почти каждого трека нужен свой подход.
Но это именно и даст вам результат если вы действительно хотите получить кастомный трек. Однако тут надо по честному прямая генерация со слов как по мне дает хоть и при нормально настройке что то сносное но в основном это почти одинаковые квадраты зацикленные. Развитую тему вам придется писать самим. И тут уже я использую такой прием. Каждая дорожка должна быть сгенерированна отдельно и потом уже в любом удобном для вас DAW сводиться, редактироваться подчищаться и прочее.
Фактически у вас на руках кастомный генератор VST на компе бесплатный. (Ну как бесплатный на видеокарту пришлось выложиться, но буду себя утешать что бесплатно теперь все 😁 )
По итогу решился вот сделать кавер на Diablo 2 - Rogue Encampment но в стиле Иранской фол психоделики. Для этого вам надо в начале сам трек переложить в такую стилистику тобиш найти оригинальные ноты, порепетировать, написать партии для разных инструментов, подготовить транспозиции, вынести исполнения в гармонии нужные и потом уже готовые миди сохранить в WAV формат и просить генерить каждую дорожку отдельно. Тут важно надо долго и муторно работать с промптами и пайплайнами чтобы получить одно "НУЖНО ИМЕННО НАЛОЖИТЬ ИНСТРУМЕНТ НА ДОРОЖКУ" не переделывать ее, не додумывать, не дорисовывать. Наверное одна из важных подсказок для промптов это "ЗАПИСЬ В ЛИНИЮ" так обычно на студиях будут говорить когда берут инструмент и записывают именно его через пульт на носитель как роу файл для дальнейшей обработки.
А дальше уже как я и сказал дорога ваша в DAW я вот юзаю REASON studio. Небольшой фрагмент с результатом прилагаю.
————————————
https://acestudio.ai/
@cgevent
Runway: выпустили плагин для DaVinci Resolve, Adobe Premiere и After Effects.
Он позволяет генерить, расширять и апскейлить видео / картинки прямо на таймлайне. Редактирование видео, включая апгрейд до HDR, тоже есть и делается через Aleph 2. Доступные модели для видео: Runway Gen-4.5, Veo 3.1, Seedance 2.5, и Kling 3.0 Pro. Для картинок: Gen-4 Image, Nano Banana и GPT Image 2.
Плагин есть на Windows и MacOS. На линукс попроси Клода.
Анонс
Сайт
Ютюберы в кучу
Автомонтаж подъехал.
Здесь такой дисклеймер, что Flash 3.8 - это лучшая модель для понимания видео, аудио и вообще любых модальностей. Дело в том, что в посте про мультимодальность я немножко облажался. Мне потребовалось сделать небольшой ресерч, чтобы выяснить, что все вот эти громкие заявления, что наша модель мультимодальная, - это на самом деле то, что она понимает картинки и текст. И всё.
То есть два — это уже мультимодальность. И никто, ни DeepSeek, ни какой-нибудь Kimi, никто не понимает на вход, например, аудио. И в этом смысле Gemini — это единственная модель, которая реально хавает всё. Ну хорошо, еще новый Qwen Omni.
Я даже специально спросил: а вот эта наша новая Astra, она же мультимодальная, она может понимать аудио на вход? Ответ: нет. Она принимает на вход только текст и картинки. Я честно пытался засовывать в неё MP3 файлы, она галлюцинирует. Поэтому в этом смысле новость, вообще говоря, бомба. Потому что Google строит прямо интересную систему вокруг мультимодальности Flash 3.8, ну и, надеемся, Gemini 4.
YouTube показал, пожалуй, одну из самых интересных фишек - полноценного разговорного монтажёра на Gemini Omni.
Идея простая: загружаешь исходники в Shorts или YouTube Create и вместо ручного ковыряния таймлайна начинаешь разговаривать с Gemini.
Например:
«Собери первый черновик»
-> «Убери паузы»
-> «Сделай начало динамичнее»
-> «Переставь эти куски»
-> «Синхронизируй монтаж с битом»
-> «Добавь текстовый hook»
Gemini сама режет речь, переставляет кадры, синхронизирует музыку и собирает первый монтаж. После этого можно руками полезть в обычный timeline, что-то поправить и снова отдать работу AI. То есть это не чёрный ящик «нажал кнопку - получил видео», а гибридный монтаж человек + модель.
Параллельно YouTube перестраивает вокруг AI вообще весь workflow автора.
YouTube Studio сможет смотреть ранний монтаж и давать персональные советы по темпу, структуре и сторителлингу.
Появится A/B-тестирование уже не только заголовков и превью, но и до трёх разных монтажных версий одного видео. Можно сделать три разных начала и посмотреть, какой hook реально лучше держит зрителя.
Dynamic Thumbnails смогут показывать разные из трёх превью разным сегментам аудитории, вместо попытки найти одно универсально лучшее.
Ask Studio сможет в фоне копаться в старых видео канала, находить кандидатов на повторное продвижение, предлагать новые превью и тестировать их.
Генерация thumbnails тоже становится персонализированной - YouTube пытается подстраивать изображения под стиль конкретного канала.
Плюс экспериментальный AI-модератор комментариев будет постепенно учиться на том, какие комментарии конкретный автор удаляет и оставляет.
На итоге, ютюберы:
-> исходники
-> автоматический первый монтаж
-> разговорные правки
-> ручная доводка
-> AI-анализ ролика
-> превью
-> A/B-тест разных монтажей
-> публикация
-> анализ старого каталога и попытка его оживить.
Пока это именно новая линейка анонсированных инструментов Made on YouTube 2026, а не набор функций, который сегодня одновременно появился у всех. Например, A/B-тест трёх монтажей YouTube прямо помечает как coming soon.
В общем, начинаем кричать, не на монтажера, а в монитор.
https://blog.youtube/news-and-events/made-on-youtube-new-tools-power-creation-journey/
@cgevent
#Сеня_и_Даня_здесь_были
Вы плохо молитесь, поэтому будете смотреть это раз в день.
Прекраснейший референс для этого Сиданс-кальмар-шоу выложу в первый комент.
@cgevent
#Нейропрожарка
Jobless
Автор: Евгений Парфёнов
@noomarxism
Запись на youtube
С мая вынашивал идею переснять старый ролик, сделанный наскоро из подручных средств для секции "Образ светлого будущего" на конференцию Цифровой Социализм. Сценарий по факту уже был — чуть доработал вместе c Claude Opus и отложил до появления времени.
На этих выходных добрался и за 2 дня и 2 вечера сделал что сделалось.
Никакого опыта продакшена видео у меня не было, поэтому следовал советам нейросеток.
Изображения генерировал в gpt-image-2.5, видео — на Syntx.ai Им я и отдал за токены порядка 15 тыс. рублей за это удовольствие.
Что пригодилось:
— Runway Gen4 Act-Two
— Hailuo Minimax 3.0
— Kling 3.0
— Seedance 2.5
— Topaz AI
— Fish.audio — голос Володарского бесплатно
— Mvsep.com
Сводил преимущественно не я, а Codex на Astra в DaVinchi Resolve (Free).
Подписки на Claude, ChatGpt, Suno уже были.
Все сомнительные решения — мои.
Осталась масса огрехов, которые выправить уже жалко денег и сил.
@cgevent
Вы же помните пост с перестрелкой?
Напомню, что в качестве рефа для Сиданского использовалось вот это видео:
https://www.youtube.com/watch?v=S8Z3gGqc7W4
А теперь Опус 5.5 взял на вход видео с Сеней и Даней, и воспроизвед его в Блендоре.
Это получается вторая производная от ютюба.
Ну и молиться не забывайте, а то возьму третью производную.
И пора вводить рубрику #СеняДаняЗдесьБыли
У меня этого добра много.
@cgevent
Джейсон Крэк
Вот еще полезная штуковина для просмотра Джейсонов.
https://jsoncrack.com/editor
Вы чем пользуетесь?
@cgevent
#Сеня_и_Даня_Здесь_Были
Время дневной молитвы.
Reference Video: прекрасное Kotte Animation's "Spider-Man Stops A Train"
Сиданский 2.5
За что вам это, вы помните. Смотреть до конца, не моргая.
@cgevent
Ну, за метаверс?
Слева находится то, на что Цукерберг потратил около 80 миллиардов, чтобы достичь результата.
Справа вы видите работу Opus 5.5 в Блендоре, на что он потратил немножко токенов.
Качество Опусянского и Астрачки подтянется, а вот 80 миллиардов уже не вернуть.
Меня до сих пор бомбит от прогнозов Маккинзи в июне 2022: “By 2030 the metaverse could generate $4 trillion to $5 trillion across consumer and enterprise use cases.”
Позже, в январе 2023 года, McKinsey повторила оценку в A CEO’s guide to the metaverse(путеводитель руководителя по метаверсу, блэт):
размер активности метаверса оценивался в $200-300 млрд в 2022 году и мог вырасти примерно до $4-5 трлн к 2030 году.
Я, кстати, кинул в ChatGPT запрос, типа ты аналитик и твои знания ограничены июнем 22 года. И он нарисовал мне 700 миллиардов вместо 5 триллионов и робко спросил о том, что вообще-то говоря определения метаверса не было и до сих пор нет.
За что МакКинзи берут деньги? За что, скажите мне, за что им платят?
@cgevent
#Нейропрожарка
ТИЗЕР: Начало Сингулярности
Автор сценария: Александр Петров
Исполнитель (AI Director): Ник Черненко
В лучшем качестве: https://www.youtube.com/watch?v=haq8sfgv0bI
Бюджет: $3000
Срок реализации: ~6 месяцев от постановки ТЗ
Данный тизер сделан к ещё несуществующему фантастическому сериалу о том, как логарифмическая кривая развития технологий изменит наш мир: быстро, беспощадно, радикально. Получается так, что примеряться к продакшену стало относительно недорого (и становится все дешевле), именно в формате тизера. Не имея по сути ничего кроме пока незаконченного черновика сценария. Я даже не исключаю, что весь сериал будет выгоднее вскоре сгенерировать.
Как это делалось:
Генераторы изображений: Midjourney, Gpt-image 2, Nano banana pro.
Локальные модели: Flux-2, qwen. Так же различные воркфлоу на уровне: img_2_depth map, depth map_2_image, Flux-Upscale (перерисовывает изображение, по факту увеличивается и разрешение изображения и его детализация, фоторильность), различные Lora.
Из видео-генераторов Seedance и Kling. В Клинге из интересного это использование тогда еще нового Multi-shot. Это особенно помогло при генерации видео сразу с речью (а значит консистентный голос персонажа) в разных сценах/локациях. При разных генерациях одного персонажа с одним и тем же промтом, голос выходил все равно слегка разным. И мультишотом это решилось.
Часть start-фреймов дорабатывалась локально. Когда нужно было добавить крови или сделать что-то, что цензура не позволяла.
Некоторые задачи, для соблюдения точности концепта требовали более сложных решений.
Например, кадр с подлодкой требовал создания 3D модели подлодки, чтобы она соответствовала замыслу. Из интересных особенностей, путем проб и ошибок вышло следующее. Если загружать clay-рендер в банану, результат выходил хуже, чем если делать во флюксе из карты глубины в картинку. Так же, никто из видео-генераторов не справился с невидимостью. Поэтому тут еще в Kling О3 был получен из кадра с останавливающийся подлодкой пустой плейт. И далее уже потом тонна композа с масками, доп. эффектами и тд.
По этой же причине, девушка в лесу, которая проявляется как голограмма, генерировалась на зеленке, а затем кеилась.
Кадр с вываливающимся кубом из портала, там портал тоже делался руками, потому что все генерации портала не соответствовали замыслу концепта.
В целом было довольно много композа, создания 3D моделей и прочих ухищрений. Конечно же создание лор для флюска и листов персонажей для бананы.
А далее монтаж, цветкор, добавление пылинок, бликов и т.д. И Саунд-дизайн.
Вот такой получился симбиоз локальных моделей, серверных решений, 3D, композа и VFX.
@cgevent
Google выкатил своих реалтаймовых аватаров.
Да, это прямой конкурент Runway Characters и Pika Stream.
Но я считаю, что Google просто всех пожрёт и уничтожит на этом поле. И здесь не важны цены, здесь не важны фичи, здесь важна юзер-база и вся система, в которую встроены аватары, точнее встроены клиенты Google.
Не случайно раскатка идёт только на Enterprise. Ну, просто потому что это решение, ориентированное прежде всего на компании, которые делают своих говорящих чат-ботов, которые зачем-то прикручивают говорящие головы в колл-центры, которые, опять же, зачем-то делают службу поддержки с говорящими аватарами и всю эту зловещую долину.
Но самое главное преимущество Google в том, что они не продают реалтаймовый рендеринг или реалтаймовый ответ. Они продают всё в одном флаконе: и LLM, и видео, и звук, и мозги. В то время как Runway концентрируются в основном на рендер-слое.
Итак:
Модель реально слышит голос, может одновременно "видеть" поток с камеры или screen share, понимает, что происходит, вызывает tools и API, отвечает голосом и тут же генерирует лицо, мимику и lip-sync. Если перебить - разговор перестраивается. Поддерживается переключение между 97(!) языками прямо во время диалога.
И все это в Реальном времени!
Можно взять готового персонажа из генерации Google или загрузить reference photo + образец голоса и получить своего. Правда, custom avatars пока дают только через enterprise allowlist. И там огого рестрикшены. БредовПиттов не присунешь.
Посмотрите видосы. В принципе мы все это видели у Рунвей и Виду, просто у Гугла мышц больше и неограниченная дурь на серварах.
И теперь самое интересное - сколько стоит эти твари.
Avatar video output:
$1 за 1 млн video tokens.
А Live Avatar расходует 6 192 video tokens в секунду.
Считаем:
6 192 x 60 / 1 000 000 = $0.3715 за минуту.
То есть примерно $0.37 за минуту, пока аватар говорит.
Когда он заткнулся и слушает кожаного - за avatar video Google денег не берёт.
К видео добавляется собственная речь Gemini. Audio output стоит $12 за 1 млн tokens. По опубликованному Google коэффициенту 25 audio tokens/sec это ещё примерно $0.018 за минуту речи.
Итого грубо:
Gemini Live Avatar -> около $0.39 за минуту активной речи.
Плюс мелочь за входящий звук, видео, текст и reasoning. И есть ещё одна засада: Gemini Live повторно обрабатывает накопленный session context на каждом диалоге, поэтому длинный разговор постепенно дорожает.
Теперь сравним с конкурентами.
Runway Characters -> $0.20 за минуту.
То есть сам realtime-видеоперсонаж Runway примерно в 1.86 раза дешевле видеослоя Gemini: $0.20 против $0.3715.
Но.
Runway прежде всего продаёт визуальный слой. К нему можно подключить своего агента, свой LLM, STT и TTS. Runway официально предусматривает такую архитектуру и интеграции с LiveKit/ElevenLabs.
На итоге может быть недешево.
Google продаёт всю тварь целиком и сразу: мозг, слух, голос, зрение, tools и лицо являются частями одного realtime-контура.
Но.
Есть еще Vidu S2 ~$0.315 - у него существует полностью комплектный Real-time Edition: ASR + LLM + TTS + RTC + avatar. Документация прямо перечисляет эти компоненты как предоставляемые Vidu. Тоже полный организьм.
Также Vidu S2 пытается генерировать живого персонажа целиком, а не только морду: 720p, до 42 FPS, движения тела, танец, взаимодействие с предметами, смена одежды и фона непосредственно во время разговора.
Но я вернусь к началу поста.
Гугль всех пожрет. Где Рунвей с Виду - и где Гугль?!
Юзер база плюс экосистема. Стартапам никогда не добраться до цифр Гугла.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://cloud.google.com/blog/products/ai-machine-learning/gemini-3-8-live-with-live-avatar-is-now-generally-available/
https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/guides/gemi
У ChatGPT один из самых лучших транскрипшенов в мире.
Он реально хорош. Он вырезает паузы, он вырезает вот эти все: э-э, ну, ну и так далее. Он даже вырезает: "Нет, вот это или Нет, вот так" и вставляет то, что должно быть по смыслу.
То есть там не только транскрипция, но ещё и обработка того, что вы сказали. И он БЫСТРЫЙ.
Короче, я просто в восторге от него и даже начал писать утилиту, которая бы переключалась в ChatGPT, там надиктовывала и переключалась обратно куда-нибудь, где я пишу.
Но неожиданно нашлась неназначенная хоткей клавиша, которая позволяет включать так называемый диктейшн не только в ChatGPT, а вообще в любом приложении, по крайней мере на Windows. Соответственно можно стоять где-нибудь в Worde или в Notepad, нажать эту кнопку и надиктовать с помощью транскрипта какой-нибудь текст, и он будет вставлен прямо в то приложение, в котором вы его открыли.
Я назначил себе это на, грубо говоря, Control Shift Ф9, потом через PowerToys отмапил его на правый Alt и теперь лихо наговариваю в телеге или в заметках, или где угодно, ChatGPT это транскрибирует В ФОНЕ, я смотрю и, как правило, отправляю без редактирования.
Но.
В последней версии приложения для Windows по какой-то неизвестной причине настройки этого шортката исчезли. Но сам шорткат у меня работает. Я попросил ChatGPT Work прошерстить и файлы, и реестр, и всё что угодно на моём диске, он не нашёл, где приложение ChatGPT хранит настройки шорткатов.
Соответственно, челлендж: если сможете найти где это, дайте знать и заодно получите великолепный шорткат на транскрибирование с помощью ChatGPT в любом месте.
И да, наговорил, а потом почистил. Все равно у меня разговорный стиль.
@cgevent
Seedance NSFW
Похоже мы имеем дело не с ТОЛЬКО с отдельной порнографической моделью ByteDance, но и с куда более интересной схемой.
Попросил друга исследовать вопрос подробно. Получилось для гиков.
Спойлер: да, есть порно-сиданс-модель, см пункт 8. Но только для энтерпрайза.
Для остальных - пункт 9 и чтение простыни.
Итак.
1. BytePlus действительно позволяет отключать часть модерации
В официальном ModelArk есть Content Filter. Он проверяет вход и выход модели, в том числе категории Nudity и Sexual Content.
И этот фильтр владелец inference endpoint (API провайдер) может отключить.
То есть у BytePlus safety - это не один намертво вшитый фильтр. Есть как минимум отдельный конфигурируемый слой модерации.
Но даже после его отключения остаются базовые safety policies самой платформы.
2. Значит ли это, что Seedance становится полностью uncensored?
Не совсем.
У BytePlus фактически два уровня:
входной Content Filter -> генерация Seedance -> output/model moderation.
Первый слой можно ослабить или отключить. Второй частично остаётся.
Поэтому правильнее говорить не «uncensored Seedance», а «Seedance с менее строгой конфигурацией moderation».
3. Самая интересная находка - Ofox
Ofox вообще не создаёт отдельную модель seedance-2.5-nsfw.
У них модель остаётся обычной:bytedance/seedance-2.5
Но можно выбрать provider:volcengine
илиbyteplus
И в документации прямо указано, что Volcengine использует обычную строгую moderation, а BytePlus route допускает контент категории not-for-all-audiences / NSFW.
То есть модель одна и та же.
Меняется только маршрут.
4. А другие API просто прячут эту схему под отдельным model ID (но это не модель, а маршрут)
Например, Modelflare показывает:seedance-2.5
иseedance-2.5-nsfw
При этом у них одинаковые API endpoint, параметры, длительность, разрешения, reference workflow и общая схема вызова.
Фактически меняется только model ID.
Очень похоже, что -nsfw здесь - просто alias, который внутри выбирает другой provider или другую moderation configuration.
5. MeToken даёт ещё более интересный пример
В их документации есть реальный ответ API:model: seedance-2-5-nsfw
и одновременно:provider: byteplus
То есть пользователь вызывает якобы отдельную NSFW-модель, а дальше запрос уходит именно в BytePlus.
Это прекрасно укладывается в схему:
клиент -> API-агрегатор -> NSFW alias -> специальный BytePlus route -> обычный Seedance.
6. Поэтому реальная архитектура, скорее всего, выглядит примерно так
Для озабоченных нищебродов Seedance один. Для бизнеса - другая история и цены.
А дальше есть разные способы его употребления:
Volcengine route -> более строгая moderation.
BytePlus route -> другая moderation policy.
Внутри BytePlus ещё может быть отключаемый Content Filter, entitlement аккаунта и другие настройки.
А агрегаторы превращают всё это в красивые названия:seedance-2.5seedance-2.5-officialseedance-2.5-nsfwseedance-2.5-self-developedseedance-2.5-self-developed-nsfw
И это вовсе не обязательно пять разных чекпойнтов. Это вполне могут быть пять presets одной инфраструктуры.
7. А что с Moderation.Strategy = Skip
Вот здесь важное уточнение.
Официально BytePlus подтверждает возможность отключения Content Filter.
А несколько интеграторов BytePlus документируют ещё параметр:Moderation.Strategy = "Skip"
который позволяет пропустить большую часть дополнительной pre-moderation.
Причём у некоторых API этот режим доступен не всем и может возвращать ошибку вроде:moderation_skip_not_allowed
То есть очень похоже, что тут существует отдельный entitlement для определённых клиентов.
Но я пока не нашёл текущую публичную страницу BytePlus API Reference, где этот Strategy=Skip был бы прямо задокументирован самой BytePlus для всех пользователей.
Поэтому:
отключаемый Content Filter - подтверждено самим BytePlus.Moderation.Strategy=Skip - подтверждается интеграторами.
Доступность Skip всем клиентам - не подтверждена.
8. Настоящий порно-доступ к непотребной модели Сиданса.
Если очень надо, нужно связываться с BytePlus, иметь компанию и получать отдельный B2B access.
Подтверждено подписчиками.
9. И всё это можно довольно ловко проверить экспериментально самому
Ofox позволяет взять одну и ту же модель:bytedance/seedance-2.5
один и тот же prompt,
те же reference,
те же duration/resolution,
и поменять только:provider = volcengine
наprovider = byteplus
Если первый маршрут даст moderation rejection, а второй примет идентичный запрос, то мы фактически получим A/B-тест, показывающий, что различие находится в serving route и safety stack, а не обязательно в весах самой модели.
На итоге:
Существование более непотребного маршрута Seedance через BytePlus уже подтверждается сразу несколькими независимыми API-провайдерами и частично самой документацией BytePlus.
Ссылки для экспериментов:
https://ofox.ai/docs/api/videos/provider-routing
https://ofox.ai/models/bytedance/seedance-2.5
https://docs.byteplus.com/en/docs/modelark/Content_Pre-filter
https://ai.byteplus.com/en/help/article/why-was-my-request-rejected-for-sensitive-or-non-compliant-content-and-how-do-i-reduce-false-rejections
https://docs.byteplus.com/pt/docs/legal/acceptable_use_policy_byteplus_genai
https://docs.modelflare.dev/models/video/seedance-2-5-nsfw/
https://docs.modelflare.dev/models/video/seedance-2-5/
https://metoken.ai/docs
@cgevent
TrackGleam: мастеринг для Suno
Схема такая:
Suno -> готовый WAV -> TrackGleam -> финальный мастер.
TrackGleam берёт уже сгенерированный трек и пытается привести его в более аккуратный, плотный и «релизный» вид.
Что он умеет делать после Suno:
corrective EQ - поправляет общий частотный баланс;
dynamic EQ - давит проблемные частоты только тогда, когда они реально выпирают;
multiband compression - отдельно контролирует низ, середину и верх;
glue/parallel compression - делает микс более собранным;
upward compression - подтягивает тихие детали;
de-harsh - убирает неприятную резкость, особенно в верхней середине;
harmonic saturation / exciter - добавляет плотность и гармоники;
transient shaping - подчёркивает или сглаживает атаку ударных и других транзиентов;
stereo width и M/S processing - приводит в порядок стереобазу и центр;
soft clipping - аккуратно снимает пики;
true-peak limiting - доводит финальную громкость без вылета за пики;
dithering - корректно готовит файл к финальному экспорту.
Для AI-музики есть отдельные режимы AI Fix Gentle и AI Fix Strong.
Их задача - как раз бороться с ПЕСКОМ типичными артефактами генераторов: жёстким верхом, стеклянной серединой, неприятными сибилянтами, грязноватым tonal balance и слишком агрессивной компрессией.
При этом базовый режим бесплатный:
без регистрации;
без watermark;
можно скачать WAV;
обработка идёт прямо в браузере;
по заявлению разработчика, сам аудиофайл в бесплатном режиме на сервер не отправляется.
Есть и платный GleamAI с более индивидуальным подбором обработки.
Ссылки:
https://trackgleam.com/
https://trackgleam.com/pricing
@cgevent
Ответачка Метачки
Meta показала (но не бахнула) VR-очки за $1299, которые весят всего около 100 г.
И как тебе такое, Эппле-Маска?
Фокус простой: Meta вынесла процессор, батарею, память и основную электронику в отдельный внешний пак на кабеле. Сам пак весит около 300 г, так что вся система - примерно 400 г, но на кожаном лице остаются только 100 г.
Для сравнения, актуальный Apple Vision Pro M5 весит примерно 750-800 г на голове плюс отдельная батарея 353 г. Конец шейному отделу. То есть именно нагрузка на голову у Meta меньше примерно в 7-8 раз.
И стоит устройство $1299 против $3499 у Apple.
Фанаты Эппле тихо выли два года назад - вот следующая версия будет легче и дешевле (с надеждой).
Палучите.
Внутри два micro-OLED-дисплея 2412 x 2288 на глаз, до 120 Гц и около 37 PPD. По количеству пикселей Vision Pro впереди примерно вдвое, но Марк Гурман после демо пишет, что визуально картинка Meta уже довольно близка к Apple.
Главная жертва ради компактности - поле зрения. У Meta всего около 70x66 градусов против примерно 110x96 у Quest 3. То есть это не радикальный immersive VR, а скорее ставка на лёгкость, резкость и длительную работу.
(Эппле намеренно не публикует точного FOV, потому что он зависит от Light Seal, положения глаз и посадки. Независимые оценки обычно дают примерно 100x73, хотя измерения с более тонким Light Seal доходят примерно до 112x78-82)
Управление тоже очень в духе Vision Pro: глаза, руки, pinch-жесты, голос. Но есть интересная фишка - обычный стол можно превратить в виртуальную клавиатуру и трекпад. По отзывам журналистов, работает неожиданно хорошо.
Meta также обещает кино, несколько виртуальных мониторов, Quest-игры, Xbox Cloud Gaming, Dolby Vision/Atmos, IMAX Enhanced и свои Hologram-видеозвонки.
И тут у меня главный вопрос (опять) - а зачем?!?! Зачем вот это вот все за 1200 баксов? Смотреть Нетфликс и Киновотч?
Доля виар-гемеров - ничтожна среди нормального кожаного населения.
Голографические звонки - серьезно?
Зачем мне надевать эту байду на голову и носить в кармане горячий блок, облучающий мои тестикулы\яичники??
За время, прошедшее со времени фиаско с лыжной маской от Эппле, кожаные так и не придумали применения такого рода девайсам ДЛЯ МАССОВОГО ПРИМЕНЕНИЯ. В бизнесе (тренажеры, обучение, медицина) - да. А для людей с улицы - зачем, кроме просмотра кино и игрушек??
Ожидаю фиаско, но с более длинным хвостом. Часть Qвестовиков проапгрейдится (+400% к цене), а часть такая - 1200? - идите лесом.
Ссылки:
https://about.fb.com/news/2026/09/introducing-meta-vr-glasses-3d-movies-immersive-live-sports-100-grams/
https://www.theverge.com/tech/999517/meta-vr-glasses-connect-2026-hands-on
https://www.engadget.com/2267222/meta-vr-glasses-hands-on-hand-tracking/
https://www.uploadvr.com/meta-vr-glasses-officially-announced-connect-2026/
@cgevent
#Сеня_и_Даня_здесь_были
Вы плохо молитесь, поэтому будете смотреть это раз в день.
Хотя это очень смешно. Надо было дожать тему с MadMax<->Minimax
@cgevent
#нейропрожарка
ШАПОЧКА
Автор: Дмитрий Кочубеев
Впервые заехал на MyFilm48 (тема: Москва 2050).
Все стандартно: видео до 3 минут за 96 часов.
Идея: Хотелось снять маленькое кино не про технологии и роботов, а про обычных живых людей. Про их взгляды, чувства и эмоции. Хотелось давно. Конкурс стал хорошим поводом.
Сценарий: Загнал ТЗ в разные ЛЛМ-ки и получил кучу синопсисов. Ни один из них не понравился. Кстати, некоторые из них просматривались в других работах конкурса. Видимо, ЛЛМ-ки ленятся и на один и тот же запрос выдают всем одно и то же. В итоге решил писать сценарий сам. На его роды ушло часов пять.
Герои и озвучка: Не хотелось дефолтных ИИшных лиц, поэтому искал нужные типажи с уникальной харизмой. Потом подбирал под эти лица голоса. И тут произошла забавная вещь. Изначально имен у них не было, но как только герои заговорили, стало совершенно ясно: это Саша и Лиза. Другие варианты просто отпали. Более того, по сценарию героиня планировалась с длинными волосами. Но в процессе генерации появилась Лиза, которую они только портили. Такое ощущение, что персонажи зажили своей жизнью, не спрашивая автора: сами выбрали себе и имена, и внешность.
Проработка кадра: Случайных вещей здесь мало. Дольше всего провозился с дроном-доставщиком, потратив на него больше часа, добиваясь нужного концепта. Дурацкий перфекционизм...
Саундтрек: Тут повезло. На мой взгляд, хорошо вписался трек, который я сделал еще год назад, а слова к нему были написаны вообще в 2024-м.
Монтаж: Уже утром, после ночи без сна, в день дедлайна возник жесткий выбор: делать монтаж без спешки или поехать проводить супругу на вокзал. Я выбрал второе. В итоге собирал всё в диком темпе и работу отправлял за 30 минут до кареты-в-тыкву.
Инструменты: SD 2.5, MJ 8.2, Banana, GPT2, Suno 4.5, LANDR, Topaz, FL Studio, Premiere, Photoshop, Opus 5, 11labs.
Итог: 3 ночи без сна и море эндорфинов.
Спасибо за внимание. Буду рад конструктиву и общению в комментариях.
@cgevent
Black Forest Labs продолжает издеваться над людьми, которые ждут от них веса FLUX.3 для видео.
Что логично выпустить дальше?
Правильно. Модель для робатов.
BFL выкатила FLUX 3 Action - 7B World Action Model, которая смотрит через камеры на окружающий мир, получает команду и предсказывает сразу будущие кадры плюс следующие 32 действия робата.
То есть технически штука действительно интересная, но нам это зачем???
https://bfl.ai/models/flux-3-action
https://github.com/black-forest-labs/flux-action
https://huggingface.co/collections/black-forest-labs/flux-3-action
И я прекрасно понимаю стратегию. Image -> video -> world model -> action model -> embodied AI. Большие деньги, промышленность, роботы, Audi, автоматизация, вот это вот всё.
Но можно нам сначала FLUX3.VIDEO?
Ждём FLUX 4 Forklift.
#явярости
@cgevent
У Seedance 2.5 появился Draft Mode - и это, пожалуй, одна из самых нарядных фич для AI-видео за последнее время
Идея простая: сначала генерируем дешёвый черновик в 480p. Не понравился -> выбрасываем. Понравился -> отправляем именно этот draft на финальную генерацию в нативных 1080p.
И важный момент: это НЕ обычный upscale.
При переходе 480p -> 1080p Seedance делает новую генерацию, но привязанную к выбранному черновику. Сохраняются prompt, references, seed, aspect ratio, duration и другие параметры. Поэтому модель КАК БЫ старается удержать композицию, движение камеры, действия персонажей, тайминг и общее creative direction. Надо проверять.
Пиксель-в-пиксель результат не идентичен - мелкие детали, лица, волосы, текстуры и фон могут измениться.
ByteDance заявляет экономию на итерациях до 77%. Финальный 1080p от этого магически дешевле не становится - экономия возникает потому, что все эксперименты мы гоняем в 480p и платим за HD только для выбранных дублей.
Попробовать уже можно официально в BytePlus:
https://ai.byteplus.com/en/product/seedance
Есть более человеческая реализация в Magnific: Seedance 2.5 -> Draft -> выбираем понравившийся ролик -> Generate in HD.
https://magnific.ai/
Artlist тоже уже поддерживает workflow 480p -> Render to 1080p:
https://help.artlist.io/hc/en-us/articles/38194082501021-Seedance-2-5
Теперь про деньги.
BytePlus, разумеется, решил не портить нам жизнь какой-нибудь понятной ценой вроде "$0.20 за секунду".
Поэтому Seedance 2.5 стоит:
$6.40 / 1M токенов - если есть video input
$10.70 / 1M токенов - без video input
Почему генерация без входного видео дороже и сколько конкретно долларов будет стоить ваш 10-секундный 1080p ролик - непонятки.
https://ai.byteplus.com/en
@cgevent
Google выкатил Gemini 3.8 TTS.
Видимо все силы кинул в голос )
Моделей две:
– Gemini 3.8 Flash TTS: для творческой работы, чтобы задать характер персонажа и сыграть сцену
– Gemini 3.8 Flash-Lite TTS: для больших объёмов, когда важна цена
Что умеют:
– Голос генерируется по текстовому описанию, больше 100 языков и диалектов
– Больше 2000 готовых голосов с региональными вариантами: мексиканский испанский, квебекский французский, шотландский английский
– Клонирование голоса по 30-секундному сэмплу, с проверкой согласия и водяным знаком SynthID
– Режиссура по строкам: в сценарии пишешь ремарки обычным языком, и модель их отыгрывает
– Держат голос стабильным на часах аудио
– Нативный диалог двух спикеров
– Смех, вздохи, «ага», «угу», перебивания: всё, что раньше выдавало робота
– Скоро обещают ремикс голоса: тембр, высота, темп, акцент
По бенчмаркам:
– Hume AI Voice Design: первое место (71.4), по акцентам тоже первое (60.8)
– Hume AI Overall Quality: первое и второе места у Flash и Flash-Lite
– Voice Arena: топ по японскому, бразильскому португальскому, вьетнамскому, арабскому, мексиканскому испанскому и хинди
Доступно уже сегодня
Видос: https://youtu.be/FL6mI_Br-mc
Есть и ложка дёгтя: клонирование голоса не работает в ЕС, Великобритании, Швейцарии, Индии, Иллинойсе и Техасе.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
И еще один генератор картинок! Теперь спецом под дизайн, постеры, юи и вот это вот все
Ant Group тихо бахнул Ming-Image-0.1-Design - 6B open-weight(!!) модель для картинок, которая особенно заточена под UI, постеры, инфографику, текст и дизайн.
Ништяки: до 2K, нативный RGBA с прозрачностью, всего 12 sampling steps.
И, внимание, расслоятор!
Отдельная модель Ming-Image-0.1-Design-Layer умеет брать готовую (вашу) картинку и разбирать её на отдельные RGBA-слои.
На дизайн арена Минг уже побивает Идеограм 4.
Где пробовать:
Hugging Face Space - самый простой вариант, прямо в браузере:
https://huggingface.co/spaces/hugging-apps/ming-image-0-1-design-demo
OpenRouter - уже появился API через NovitaAI. На момент проверки цена стоит $0. Да, пока бесплатно. Медианная генерация около 37 секунд:
https://openrouter.ai/inclusionai/ming-image-0.1-design
Локально тоже можно. Веса открыты под MIT:
https://github.com/inclusionAI/Ming-Image
https://huggingface.co/inclusionAI/Ming-Image-0.1-Design
Но: полный checkpoint около 53 GB, а официально проверенная конфигурация - CUDA GPU с 80 GB VRAM в BF16. Это не обязательно реальный минимум, просто пока именно такую конфигурацию валидировали разработчики.
ComfyUI тоже уже на подходе. Kijai написал поддержку, PR в основной ComfyUI открыт, но пока ещё не смёржен:
https://github.com/Comfy-Org/ComfyUI/pull/16482
Орудует тут:
https://huggingface.co/Kijai/Ming-Image-ComfyUI
И отдельно лежит Design-Layer:
https://huggingface.co/inclusionAI/Ming-Image-0.1-Design-Layer
Заинтригован, однако. Картинки на гитхабе прям сладкие.
@cgevent