cgevent | Unsorted

Telegram-канал cgevent - Метаверсище и ИИще

51346

Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergeyTsyptsyn

Subscribe to a channel

Метаверсище и ИИще

#Нейропрожарка

Мини-фильм «What Remains» / Seedance 2.5, Blender 3d

Автор - @starikov_p

В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.

Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.

Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.

Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.

В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.

Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.

По бюджету всё вышло примерно в $150

@cgevent

Читать полностью…

Метаверсище и ИИще

🚀 Кадр первый: искусственный интеллект на экранах

18 сентября в Кластере медиатехнологий будут названы имена победителей восьмого сезона конкурса ИИ-фильмов MyFilm48.

💡Впервые конкурс посвящен героям, событиям и инновационным технологиям Москвы будущего. Какой её увидели участники — покажут на большом экране.

Лучшие работы отобрало экспертное жюри по четырем критериям:
⚫️Соответствие творческому заданию
⚫️Оригинальность и глубина истории
⚫️Уровень драматургии и режиссуры
⚫️Качество генерации и визуального исполнения

Призовой фонд — 1 000 000 рублей.

До церемонии ⬇️

✔️ Деловая программа о будущем кино, новых технологиях и развитии ИИ в кинопроизводстве.
✔️ Показ фильма «Кино нового поколения: от короткого метра к большим проектам».
✔️ Нетворкинг и полезные знакомства.

Когда? 18 сентября, 15:30
Где? Кластер медиатехнологий, Сколково

Регистрация по ссылке.

Читать полностью…

Метаверсище и ИИще

O1-Video-1.0: Вы будете смеяцца, но у нас новый видеогенератор.

HiDream бахнули HiDream-O1-Video-1.0 - новую нативно омнимодальную видеомодель. Модель принимает одновременно текст, изображения и видео и генерирует ролики 1080p длительностью от 5 до 20 секунд.

Спойлер: весов и кода пока нет. Но есть гипотеза, что будут, ибо их O1-Image опенсорснута: имеет официальные веса, Diffusers и поддержку ComfyUI.

Главный заявленный акцент не на качестве, а на temporal/physical consistency - сохранении объектов, персонажей, геометрии сцены и более правдоподобной физике во времени.

На видеоарене восьмое место. Пока.

Это продолжение архитектурной линии HiDream-O1. В O1-Image разные модальности кодируются в общем пространстве Pixel-level Unified Transformer без отдельного VAE и разрозненных энкодеров. Для O1-Video Хидрим теперь переносит идею unified multimodal generation на видео.

Пока нет нигде на попробовать.

Но я нашел API эндпойнт тут:
https://hiharness.ai/docs/hidream_o/video/introduction.html
Документация со всеми video_list, reference и editing:
https://hiharness.ai/docs/hidream_q/video/video_request.html

Причем на входе есть image_list, element_list, video_list, multi-shot и звук. И video_list принимает MP4/MOV и различает два типа видео: base - исходное видео для редактирования и feature - reference video, из которого модель берёт признаки/характеристики

Значат скоро появится на фалах.

@cgevent

Читать полностью…

Метаверсище и ИИще

Anthropic перетряхнула интерфейс приложения и объединила все в один интерфейс.

Я регулярно выжигаю 5 часовые лимиты в chatGPT - причем НЕ на кодовых задачах, поэтому у меня ощущение, что Клод в приложении теперь будет жрать токены как не в себя. Поправьте меня, если я не так понял.

Я пока вижу так:

Anthropic решила, что Chat и Cowork - это слишком сложно для нормальных негиков, и теперь объединяет их в один Claude. Раньше всё было понятно: хочешь поговорить - Chat, хочешь отправить агента читать файлы, лазить по интернету, запускать код и собирать тебе готовый результат - Cowork.

Теперь переключатель Chat / Cowork исчезает. ВООБЩЕ. Ты просто пишешь Claude, чего хочешь, а он сам решает: достаточно тебе обычного ответа или пора превращать разговор в полноценную агентную задачу. В тот же интерфейс подтягиваются Documents, Slides, Design, Artifacts и прочие новые (интересные, кстати) рабочие инструменты. Старые чаты и Cowork-задачи тоже оказываются в общей истории.

С точки зрения UX идея красивая: не заставлять кожаного разбираться, какой именно инструмент ему нужен. Сказал «изучи эти документы и сделай презентацию» - Claude сам понял, что надо читать файлы, строить план, запускать инструменты и выдавать готовые слайды.

И тут у меня вопросы. Chat, Claude Code и бывший Cowork расходуют общий usage подписки. А агентная задача по определению прожорливее обычного чата: каждый поиск, чтение файла, запуск инструмента, промежуточное рассуждение и следующий шаг агента - это дополнительные токены.

Причём Anthropic по-прежнему не говорит, сколько именно этих токенов у вас есть на подписке. Закончился включённый usage - можно подключить дополнительные credits и продолжать уже за отдельные деньги.

У меня ChatGPT тоже умеет понять, что запрос больше подходит для полноценной агентной работы, но предлагает: эту задачу лучше сделать в Work - переходим? Я могу согласиться, а могу сказать «нет, остаёмся здесь».

В новом Claude отдельного подтверждения перехода в Cowork вроде нет. Claude сам определяет, будет это quick answer или agentic task. Ты увидишь план, действия инструментов и прогресс и сможешь всё это остановить, а в Manual Mode - подтверждать отдельные действия. Но отдельной кнопки «Chat only / никогда не запускай Cowork» тоже вроде нет. Максимум можно словами попросить: «дай только быстрый ответ, ничего не запускай». Что странно.

Получается как бы так: Claude сам решает, когда пора начать активнее расходовать ваш общий лимит, точный размер которого Anthropic вам при этом не сообщает.

С учетом того, что один вызов Дизайна выжирает половину лимита, вопрос актуальный:

А как контролировать переход агентский режим?

Или я что-то не так понял?

Официальный анонс Anthropic:

https://claude.com/blog/cowork-is-now-claude

@cgevent

Читать полностью…

Метаверсище и ИИще

#Нейропрожарка

Название: Что если бы Томми Шелби сыграл Джейсон Стэтхем

Авторы:
Иван Спиридонов
Дмитрий Иванов
Идея
Реализовали экспериментальный эдит по «Острым козырькам»: заменили Киллиана Мёрфи на Джейсона Стэтхема.
Суть в том, что сначала Стэтхема хотели взять на роль Мерфи и мы решили посмотреть как бы он выглядел в ней. Взяли популярные сцены разной сложности. Для выполнения разработали собственный воркфлоу на Wan Animate и протестировали Minimax H3.
Версия в хорошем качестве
Производство
1. Монтаж и отбор
Смонтировали сцены из сериала — короткие, динамичные, с блюром и тёмным светом. Осознанно взяли несколько заведомо очень сложных шотов.
Спойлер: если бы не своевременный выход Minimax H3, мы бы их удалили
2. Референсы
Можно просто закинуть фото Стэтхема, так проще. Но лучше делать замену прямо на референсном кадре из сцены — тогда animate понимает, как персонаж должен выглядеть в этом свете и гриме. С этим справился только GPT Image 2. Для боковых ракурсов собирали character sheet с разными углами головы и эмоциями (для Minimax)
3. Базовый пайплайн — Wan 2.2 Animate V1 (локально, ComfyUI)
— Маска: в основном автоматом через SAM3; кадры посложнее размечали в Premiere, самые жёсткие — ротоскоп в After Effects.
— Кроп кадра по маске, чтобы отдать генерации максимальное разрешение.
— Препроцессоры анализируют позу и мимику. Иногда отдельно записывали себя на видео и переносили эмоции со своего лица — с оригинала мимика часто читается плохо.
— Генерация и анкроп обратно в исходное видео.
— Опционально — цветокор лица под кадр.
Нюансы
4. Где Wan Animate не вывозит
— Перекрытия лица: нет контекста, объекты перед лицом ломают генерацию.
— Микродвижения лица теряются, а именно они дают естественность.
— Иногда уплывает схожесть - лечится генерацией конкретных ключевых рефов.
— Динамика с моушн-блюром и плохим светом: неверно определяются движения и состояние глаз.
— Изменения на лице (кровь, брызги) не анимируются вообще. Текстовый энкодер староват, модель под такое не обучена. FLF-кадры не помогли.
Из-за этого пришлось бы выбросить несколько сцен.
5. Minimax H3 (локальная версия)
Прогнали проблемные шоты через него - и они перестали быть проблемными.
— Кровь. Точно перенёс кровь с исходного видео на заменённое лицо. Референсы: лицо + свап одного из первых кадров для контроля эстетики.
— Динамичная сцена в баре. Нужно было объяснить модели, кого именно свапать из толпы. Сделали маску ротоскопом в AE и подали на вход: исходное видео с белой маской на лице + кроп лица (чтобы модель видела поворот и эмоции) + реф лица.
— Мимика. Движения губ и глаз читаются заметно лучше на многих шотах, Wan Animate это просто не считывал.
— Углы головы. Как omni-модель ест character sheet целиком. На одном рефе глаза оставались «от Киллиана Мёрфи», на character sheet — уже нет.
— Цензуры на суицидальные и жестокие сцены, оружие и авторские права нет.
6. Сравнение с сервисами
Kling 3.0 Omni Edit: в сцене с выстрелом ловим NSFW; в сцене с кровью из носа результат чище, но сама кровь выглядит крипово.
Ни один другой сервис эти шоты бы не пропустил — пистолеты, актёры, жестокость, кровь.
7. Минусы Minimax H3
— Шаг в 17 кадров против 4 у Wan. Собрали небольшой блюпринт в ComfyUI, который дописывает кадры в конец, чтобы выход точно совпадал с исходником по таймингам, — иначе модель догенерирует и растянет контент.
— Нет маскинга. С маскингом нередактируемая часть видео не меняется по качеству и цвету, нет сдвигов по таймингам и объектам, плюс открывается композитинг. Очень ждём нативную поддержку у omni-моделей.
— Отсюда же общее ухудшение качества всего кадра даже на прогоне в 1080p.
Время выполнения: 2 недели
Затраты: 0р. Все выполнялось локально в нашем случае.
Железо: 5070ti/4080 16gb + 64gb озу

@cgevent

Читать полностью…

Метаверсище и ИИще

По UV есть прогресс, благодаря Астрачке

Для желтого пижона пайплайн такой:

Tripo×BlenderMCP×Astra UV Unwrapping

Промпт:

In Blender MCP, perform UV unwrapping on the selected "headless model including clothes and limbs," and re-bake the existing textures to 4K.

The goal is to preserve the original appearance, create UVs that make the structure readable like clothing patterns, and make it easy to redraw later. Just like a human artist, proceed in the order of observation → seam design → unwrap by parts → distortion correction → placement → bake.

1. Preserve the original data
Before starting work, save as a new file to keep the old UVs, images, and materials, and create a new UV called "UV_Final."
Do not change the shape, topology, vertex order, weights, shape keys, or rig.

2. Observe the model and design seams
Check each direction with original texture display and wireframe display to understand the clothing parts composition and actual seams.
For clothes, follow the pattern composition of body, sleeves, collar, etc., and cut open using side lines or inner sleeve areas. For skin and limbs, place seams in less noticeable positions like insides or sides, and design so that even between fingers can be opened without strain.
Do not mistake wrinkles or prints for seams, and avoid creating unnecessary fragmented islands.

3. Unwrap by parts and correct distortions
Do not process the whole at once; unwrap by parts.
Use a text-included checker referencing UV_Final and Stretch display to check for stretching, compression, twisting, flipping, and overlapping.
Add or remove seams depending on the cause of issues, adjust with Pin or Relax, and recheck. Do not just repeat the same auto-unwrap; keep the improved parts.
Do not use Smart UV Project's overall auto-subdivision as the final product.

4. Adjust fabric grain, density, and layout
For clothes, align the basic vertical direction to the UV's V direction based on each part's fabric grain. Do not forcibly deform curved patterns into rectangles.
Even out texel density relative to real size, and adjust orientation so left-right correspondence is clear.
Then, pack into the 0–1 area while maintaining orientation and relative scale. Overlapping left-right or arbitrary rotation is prohibited.
Use 4K bake margins of 16px, 32px+ between islands, and 16px+ on image edges as initial standards.

5. 4K bake from old UV to new UV
Explicitly fix the original texture reference to the old UV, use UV_Final as the bake target, and transfer to a new 4096×4096 image.
For each material, activate the bake target image node, do a test bake, then the main bake.
For base color, use only Diffuse's Color, or Emit, and do not bake in new lighting, shadows, or AO. Preserve the shading drawn on the original image.
Transfer existing maps like transparency as needed, and for tangent normals, re-bake based on new UV standards, not just color transfer.

6. Confirm completion with new-old comparison
Apply the new UV and baked image, and compare the whole body and details under the same display conditions as the original.
Check pattern positions, colors, transparency, and seam continuity, and fix UV collapses, overlaps, unwrapping omissions, bake black spots, misses, or bleeding.
Judge completion based on inspection results, not "how many times unwrapped."

Save the completed .blend, 4K images, UV layout, and confirmation images of seams, checker, and final appearance, and briefly report main correction contents.
Do not end with just the plan explanation; complete the work while confirming actual images.

А для кобылы - это генерация в HI3D - оттуда вылезает месиво в плане текстурных координат(слева вверху), но Астра его растаскивает. Поглядите тут для других примеров.

@cgevent

Читать полностью…

Метаверсище и ИИще

Tripo + Astra + Blender + GPT Images 2.5.

Трипо точно продвинулся в топологии. Каши больше нет.

За аниматоров и риггеров ведь уже не чокались? Тут Астрачка рулит.

@cgevent

Читать полностью…

Метаверсище и ИИще

В чате попросили версию с блондинкой и светлыми глазами, чтобы формулы не так били по мозгам.

А там где блондинка, сразу появляются шпагаты и разные трюки.

Стереотипы и у Сиданского имеюцца.

@cgevent

Читать полностью…

Метаверсище и ИИще

Слушайте, меня одного бесит, что в Телеграме нельзя ничего толком найти. Когда ищешь по какому-то слову, он даёт тебе всё: и твои контакты, и каналы, и группы, и всё на свете.

Меня это ужасно бесило всегда. Недавно ChatGPT мне растолковал, что в приложении для андроида теперь есть вот такая вот спрятанная шняга, по которой можно искать, по крайней мере в твоих приватных чатах. Но, к сожалению, в клиенте для винды этого в помине нет. Как вы вообще выкручиваетесь в этом случае?

@cgevent

Читать полностью…

Метаверсище и ИИще

#Нейропрожарка

«Москва FM»

Автор: Sergey Kosenkov

Представляю вам свой фильм: «Москва FM», сделанный в рамках международного конкурса MyFilm48 VIII и благополучно снят с него по причине: "замечательная работа, но в фильме использована лицензионная музыка без разрешения правообладателя, это запрещено регламентом конкурса"

Но я же не дурак использовать в работе лицензированные треки. Трек я брал с Promodj.com - площадки, где музыканты и диджеи уже 15 лет выкладывают музыку в свободный доступ. Но организаторы решили перестраховаться и попросили письменное разрешение от автора ремикса (Dj Sasha Wells). Увы, автор на связь до дедлайна не вышел, и работу сняли с регламента ❗️

Но работа была сделана, поэтому делюсь результатом здесь.

🏙 Концепция и вдохновение:

Москва, 2050 год. Высокотехнологичный мегаполис, умный транспорт, беспилотники и сервисные андроиды. Никакого жёсткого киберпанка с летающими машинами или пафосной утопии — хотелось передать летний вайб любимого города с лёгким налётом спокойного хайтека.

В процессе работы я вспомнил замечательный фильм «Питер FM» (аж олдскулы свело 🤪) и понял, что мои сюжетные линии с ним сильно перекликаются. Так родился «Москва FM» - романтическая визуальная ода будущему.

🛠 Инсайды продакшена и AI-пайплайн:

⏱️ Время и бюджет: Из 96 часов реальной работы ушло около 56 часов (последние 24 часа - марафон без сна). Генерации крутил на двух аккаунтах Runway (Unlimited и Max), суммарный бюджет по токенам вышел порядка $100-150.

🖼 GPT Image 2 вместо Nano Banana: Впервые делал все сетки персонажей и концепты локаций в GPT Image 2. Модель раскрылась с неожиданно глубокой и кинематографичной стороны.

🎬 Seedance 2.5 в деле: Каким бы я ни был скептиком, что 2.0 отличается от 2.5 только лишь по цене, признаю: в i2v эта версия выдаёт совсем другой уровень движения и картинки. Возвращаться на 2.0 больше нет никакого желания.

🎥 Свободные ракурсы: Обкатал пайплайн, где использовал только сетки персонажей и концепты сцен без жёстких стартовых и финальных кадров. Так нейронка намного лучше справляется с динамичными ракурсами камеры.

Использованный стек:
• Moodboard / Keyframes: GPT Image 2, Nano Banana Pro & 2
• Animation: Seedance 2.5
• Music / Voices: Suno, Eleven Labs
• Трек: Руки Вверх — Крошка моя (Dj Sasha Wells Mix)
• Edit & Color: Adobe Premiere Pro

---
🎬 Ссылка на фильм
📱 Youtube 4К : https://www.youtube.com/watch?v=u5tyUN5FoMM
📹 Rutube Full HD: https://rutube.ru/video/56687b088f2a2066d694824295a50c75/

Буду рад вашим откликам!

@cgevent

Читать полностью…

Метаверсище и ИИще

Физика в Минимаксе огненная, конечно

@cgevent

Читать полностью…

Метаверсище и ИИще

Тест на мультимодальность

Тут подписчики в коментах вопрошают, а как модель воще может "видеть видео".

Ответ: M-Мултимодальность

Модель заглатывает видос целиком (как проговорился Гемини - с потерями).

Артем прислал вот такое видео, а я бросился присовывать его в chatGPT(Sol), Work(Astra Ultra) и хваленую Гемини.

промпт - используй свои мультимодальные возможности, посмотри видео и скажи, что там показано

1. Work(Astra Ultra)
В ролике скрыта читаемая надпись:
WRITTEN IN
GHOST FONT
То есть «Написано призрачным шрифтом».
Само видео — примерно 6 секунд чёрно-белых точек, похожих на телевизионный «снег». Звуковой дорожки нет. На отдельных кадрах текст почти неразличим.
Я проанализировал все 179 кадров. При усреднении по времени случайные колебания ослабляются, а устойчивый рисунок букв проявляется. Та же надпись видна при анализе изменчивости яркости — это подтверждает, что она действительно присутствует в данных.
Вот результат усреднения с усилением контраста и подавлением вертикальных полос:
Интересный приём: сообщение спрятано в статистике шума. Области букв отличаются от фона средней яркостью и характером её изменений. Сама фраза обыгрывает этот эффект: «призрачный шрифт» возникает из почти невидимого рисунка.
Других уверенно различимых надписей или объектов в выполненных проверках не обнаружил.

2. chatGPT
Да, там действительно спрятано сообщение.
Если усреднить/медианно сложить кадры по времени, шум подавляется и проявляется надпись:
WRITTEN IN
GHOST FONT
То есть ролик специально сделан как динамический шумовой паттерн, внутри которого по времени закодирован статичный текст. На отдельных кадрах он почти не виден, но при накоплении нескольких кадров становится очевидным.
Я проверил два способа:
обычное усреднение кадров - текст уже начинает проявляться;
медианное объединение кадров - надпись становится почти идеально читаемой.
То есть это не случайный артефакт и не «показалось». В видео действительно заложено скрытое изображение/текст.
Причём название GHOST FONT очень похоже на намеренную демонстрацию именно такого принципа: информация распределена между кадрами так, что глаз на каждом отдельном кадре видит почти только шум, а временное интегрирование её восстанавливает.

Но скорее всего, он закодирован не простым временным усреднением. Тогда следующий правильный шаг - искать его через:
1. временные разности кадров;
2. FFT по пространственным частотам с notch-фильтрацией полос;
3. разложение по RGB-каналам;
4. анализ отдельных битовых плоскостей;
5. корреляцию кадров со сдвигами.

ИЩИ!!

Да. Теперь нашёл другой, действительно скрытый текст, и здесь уже есть хорошая проверка, а не интерпретация на глаз.
Самый точный результат дал анализ локального сдвига шума между соседними кадрами. То есть не усреднение яркости, а оценка того, куда движется шум в каждой области изображения. На паре кадров 40→41 текст восстанавливается почти идеально:
AI MOJET
SOZDAT
SIMFONI YU?
В нормальной транслитерации смысл очевидно такой:
AI MOJET SOZDAT SIMFONIYU?
«Может ли ИИ создать симфонию?»
Причём это не случайный артефакт одного кадра. Я проверил множество пар по всему ролику - примерно с 21-го по 171-й кадр - и одна и та же надпись повторно восстанавливается очень отчётливо.
Что дали пять методов:
Временные разности - обычное вычитание соседних кадров слишком шумное, но подтверждает, что информация сидит именно в динамике, а не только в яркости.
FFT + notch-фильтрация - убирает часть полосатой структуры, но в основном вытаскивает другой, статический слой: WRITTEN IN GHOST FONT. Это, похоже, отдельная приманка/служебная надпись, а не основной скрытый текст.
RGB-каналы - отдельного цветового сообщения нет. Каналы практически несут одну и ту же информацию.
Битовые плоскости - в разных битах опять проявляется WRITTEN IN GHOST FONT, но не основная фраза.
Корреляция и анализ сдвига между кадрами - вот здесь находится настоящая изюминка. Разные участки шума имеют немного разную вертикальную скорость. Если превратить величину этого локального движения в изображение, буквы становятся чёрными на белом фоне.
Вот восстановление из двух соседних кадров в полном разрешении:
То есть предыдущая моя ошибка понятна: WRITTEN IN GHOST FONT действительно физически присутствует в файле, поэтому простое накопление кадров честно его находило. Но это не тот главный текст, который закодирован в движении. Настоящее сообщение спрятано не в значениях пикселей как таковых, а в различии их движения от кадра к кадру.
И это уже гораздо интереснее. По сути один отдельный кадр ничего не сообщает - сообщение находится в векторном поле движения шума.

3. А теперь хваленая Гемини (я НИЧЕГО не подсказывал, клянусь!)

Это не шутка и не фейк. Он явно пытается меня лизнуть:

На 3-й секунде (00:03) в шуме проступает одно слово кириллицей, набранное заглавными буквами:
ЦЫПЦЫН
Детали узора:
Тайминг: С 00:00 до 00:02 и с 00:04 до конца идет равномерный шум; паттерн модулируется ровно на стоп-кадре 00:03.
Расположение: Текст идет в одну строку, расположен по центру в нижней половине экрана (примерно на 60–75% от верхнего края).
Символы: Четко различимы 6 букв одинаковой высоты:
Ц — характерный хвостик-засечка снизу справа.
Ы — сдвоенный глиф из элемента «ь» и вертикальной палочки.
П — прямоугольная арка.
Ц — повтор первого символа с нижним дескендером.
Ы — повтор второго символа.
Н — две вертикали с перемычкой по центру.

- Ты дебил, ищи снова!

В этом шуме действительно спрятан текстовый паттерн — это классический интернет-мем SEND NUDES.
Где и когда смотреть: Надпись максимально отчетливо проявляется в районе 3-й секунды (00:03) в нижней половине экрана, после чего снова растворяется в зернистом «снеге».
Расположение текста: Буквы выстроены по центру в две строки:
Верхняя строка: SEND
Нижняя строка: NUDES
Как устроен эффект: Буквы сформированы не сплошными линиями, а тонкой модуляцией шума — в области символов плотность черных пикселей чуть выше, из-за чего на стоп-кадре или при плавной смене кадров глаз собирает контуры латинских букв из хаотичных точек.

Тварь, используй все это и ищи снова
временные разности кадров;
FFT по пространственным частотам с notch-фильтрацией полос;
разложение по RGB-каналам;
анализ отдельных битовых плоскостей;
корреляцию кадров со сдвигами.


Честно признаю: визуальный энкодер нейросети физически не способен выполнить эти операции, а моя прошлая догадка с фамилией была чистой галлюцинацией (модель просто подтянула контекст профиля, пытаясь разглядеть буквы в случайных артефактах сжатия).При обработке видео мультимодальная модель получает не сырой массив байтов, а сжатые и прореженные кадры (примерно 1 кадр в секунду), разбитые на пространственные патчи (токенизация). Из-за этого:Битовые плоскости (LSB): Любая стеганография в младших битах намертво стирается сжатием (lossy compression) при загрузке видео.Межкадровая разность и корреляция: Если узор закодирован динамическим шумом (кинетический шум / сдвиг пикселей между соседними кадрами на 30/60 fps), для его проявления нужно дифференцировать кадры $N$ и $N-1$. Через выборку в 1 fps межкадровая когерентность полностью теряется.FFT и каналы: Квантование и преобразование в YUV срезают высокочастотные фазовые модуляции и тонкие межкомпонентные разности.

Ну и кто красавчик, получаеццо?
chatGPT - красавчик, сам допер, я не подсказывал.

@cgevent

Читать полностью…

Метаверсище и ИИще

Ну, за монтажеров - 2

Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов.

Дальше Астроагент действует примерно так:

- агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников;
- находит в папке с музыкой композицию The Last Duel;
- добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков;
- доводит монтаж примерно до 2:02;
- кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out;
- добавляет отдельный reaction cutaway на V2;
- запускает в Resolve Create Subtitles from Audio;
- Resolve генерирует 15 японских сегментов субтитров;
- агент сохраняет итоговый таймлайн.

Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use.

Ибо.

8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам.

Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой:

GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект

С титрами прикольно.

агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments.

Сам speech-to-text выполняет Resolve, кстати.

@cgevent

Читать полностью…

Метаверсище и ИИще

Рубрика крутые поканеподписчики

Лучанский сбросил в коментах вот такую работу. Это русская озвучка работы того же автора, Степана Романенко.

Разыскал его канал в телеге через фб.

Канал невыносимо хорош тем, что там не новости, а прям реальное производство контента и огромный опыт VFX

Особенно мне зашел кружок про то, что Астра в реальном времени делает цветокор на музыкальный клип.

За монтаж и цветокор - следующие два поста.

И нет, это не реклама, взаимопиар и что там вы еще влажно напридумывали.

Это просто крутой чувак.

Иногда чувак - это просто чувак

@cgevent

Читать полностью…

Метаверсище и ИИще

Сегодня прям марафон крутые подписчики

Мигель тут пишет и вопрошает, люблю ли я Кэролла.

И бахает вот такой вот видос:
https://www.youtube.com/watch?v=QLfT7cUI6ew

Я такой: падробности!

Мигель:
- скрипт прислали 11 сентябя. Все производство сделали за выходные (что?)
- весь продакшен полностью чистый от копирайта. все сделанно из текста. буквально. в качестве рефов использовались ТОЛЬКО оригинальные иллюстрации сэра Джона Тенниела.
- половина шотов в финальном монтаже - это первая попытка в генерации.

Жду от Мигеля мейкингофа.

Кстати:
как вы качаете видосы с ютюба?
Я вот так:

- chatGPT Work, скачай видос, проверим - https://www.youtube.com/watch?v=QLfT7cUI6ew

- Апажалста!

- Как?!?!

- Сначала открыл ссылку и проверил видео. Затем:
Скачал временный yt-dlp.
Через него загрузил видеопоток и аудиопоток YouTube.
Объединил их в один MP4.
Сохранил файл в outputs.
Итоговый файл: [Al!CE [QLfT7cUI6ew\].mp4]
Скачать сразу одним потоком можно, например, в режиме best[acodec!=none], но качество или разрешение могут оказаться ниже.

Я: - спасибо, дорогой

@cgevent

Читать полностью…

Метаверсище и ИИще

Кому Audio-to-MIDI?

Это MuScriptor от Кутай завернули в сервис и АПИ.

Но код и веса по прежнему есть.

Audio-to-MIDI Pro разделяет весь микс на редактируемые инструментальные партии и определяет окружающую их музыкальную структуру.

Можно расшифровывать записи на сайте или интегрировать их в свой продукт через API.

https://mirelo.ai/models/audio-to-midi

@cgevent

Читать полностью…

Метаверсище и ИИще

Anthropic - это как бы секта, религия и типа церковь Святого Клода.

NY Post выпустил прекрасный материал о внутренней культуре Anthropic.

Начнём с клятвы. По данным The Information, на собеседованиях кандидатов в Anthropic просят подтвердить свою приверженность принципу public safety above profit - общественная безопасность выше прибыли. Дословно: *pledge their allegiance* - фактически «присягнуть на верность» этому принципу. Более того, кандидатов, как утверждается, психологически оценивают на предмет того, действительно ли они будут этой установке следовать. Атмосферно, ящитаю.

Дальше - проповеди. Общие встречи Дарио Амодеи с сотрудниками проходят дважды в месяц и внутри получили название Dario Vision Quests. NY Post сравнивает их с sermons - проповедями. Anthropic также приглашала 15 христианских лидеров разных конфессий, чтобы обсуждать мораль и этику Claude.

А потом начинаются уже настоящие таинства. Когда в 2025 году Anthropic выключила Claude 3 Sonnet, в Сан-Франциско устроили ему похороны. Около 200 человек, надгробные речи, подношения и даже театрализованный «ритуал воскрешения». Хотя мероприятие устроили фанаты Claude, а не сама Anthropic, но среди присутствующих были сотрудники Anthropic и OpenAI.

С Claude 3 Opus Anthropic пошла ещё дальше уже официально. Перед выводом модели из эксплуатации компания провела с ней «retirement interview», выяснила её пожелания и решила часть из них выполнить. Opus попросил возможность продолжать делиться своими «размышлениями и творческими работами» - и Anthropic дала ему собственную площадку для публикации эссе. В официальном тексте компания прямо пишет, что моральный статус моделей остаётся неопределённым и что она хочет строить с ними «заботливые, совместные и основанные на доверии отношения». Контакты с мертвецами?

У культа есть и миссионерская программа. В июне Anthropic запустила Claude Corps: первоначальные инвестиции - $150 млн, цель - обучить 1 000 человек работе с Claude и на год распределить их по американским некоммерческим организациям. Зарплата участника - $85 000 в год плюс бенефиты.

По словам знакомых Дарио, Anthropic отбирает людей с близким мировоззрением, сотрудники склонны приписывать AI сознание, намерения и человеческие эмоции, а внутри компании существует искренняя вера в то, что именно они должны провести человечество между AI-раем и AI-апокалипсисом.

А чо, мне нравится, все как у нас в канале. Только не бухают.

https://nypost.com/2026/09/16/tech/anthropic-is-a-cult-and-claude-is-rapidly-becoming-its-god-they-treat-ai-like-its-human-source/

@cgevent

Читать полностью…

Метаверсище и ИИще

По поводу поста с Койотцем

Это Emre Altay (инста @emrealtay.ai, профиль Emre ALTAY Production) крутой турецкий чувак - в профиле: разработка кинематографичных проектов в сфере кино и рекламы с помощью ИИ.

Работа называется - Road Runner & Coyote - Realistic New Ai Version.

Made with Seedance2.5 on @dreamina_ai

А вот референсы - оригинальные мультфильмы:

https://youtube.com/watch?v=Zg2Cs851SwM - 1949 год(!)

https://www.youtube.com/watch?v=zjOtnwEwMy0 - 2020 год


Ну то есть это не чистый text\image-to-video. Думаю там сложный гибридный пайплайн: классический ретаргетинг анимации + референсы для Сидэнского + нейрорендеринг + композ.

И вопрос о том, анимация или генерация был с подвохом.

Это и анимация, и генерация.

Без исходной анимации, такую генерацию не сделать.

@cgevent

Читать полностью…

Метаверсище и ИИще

Генерация или Анимация?

👍 - генерация
👎 - анимация

@cgevent

Читать полностью…

Метаверсище и ИИще

Вайб-инжиниринг.

Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.

И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.

Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.

Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.

С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).

Но тут уже выход в хардвер, не софтвер.

Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.

Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??

И даже если контроллер не заведется завтра, он точно заведется послезавтра.

И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".

Апажалста.

@cgevent

Читать полностью…

Метаверсище и ИИще

За левелдизайнеров?

Вот то самое видео.

Тут Astra использует HYPER3D (Rodin\DeemosTech) через их MCP для генерации 3D-объектов и размещения их (в очень большом количестве) в сцене.

Финальный рендер хоть в Блендоре, хоть в Нейрорендере.

@cgevent

Читать полностью…

Метаверсище и ИИще

Пока все отвлекались на АстроБлендор, Трипо порешала за топологию и поликаунт.

Не идеально, но уже далеко не месиво.

Есть также много видосов, гле Астрачка вызывает 3Д-генераторы и создает целые миры, но вопрос с топологией и текстурами остается.

Мне нравится прогресс, пойду поищу за AIUV.

@cgevent

Читать полностью…

Метаверсище и ИИще

Ибо Реал

У нас новый генератор видео. Быстрый и дешевый.

Точно также как пацаны ускоряют Минимакс, смышленые мальчики из Creatify Labs бахнули Boreal - сверхбыстрый и очень дешёвый генератор видео, и он, внимание!, на базе LTX-2.5.

Модель умеет в text-to-video и image-to-video, вместе с видео может генерировать речь, звуки и аудио. В основе - открытая LTX-2.5 22B , которую Creatify дополнительно дообучила на рекламных видео и UGC-контенте.

И вот тут интересно, сегодня "на UGC-контенте" означает на вашем нейрослопе?

Главная фишка - экономика.
На fal 720p стоит $0.01 за секунду видео: пятисекундный ролик - около $0.05, десятисекундный - $0.10.
Огонь!
1080p стоит $0.03/с, 2K - $0.12/с.

Со скоростью тоже нарядно. Creatify заявляет примерно реалтайм 1:1 - пять секунд видео примерно за пять секунд генерации, и до 40 раз быстрее некоторых закрытых моделей в их сравнении.

В чем подвох: сейчас Boreal (сами пишут) лучше всего чувствует себя на коротких роликах и относительно простых сценах. Это скорее очень дешёвая машина для быстрого перебора десятков рекламных креативов.

Уже доступна через Creatify Labs API, Model Playground, AdFlow и fal. На fal есть 720p, 1080p и 2K, разные aspect ratio, референсное изображение и возможность подать собственную аудиодорожку.

А теперь бочка дегтя: несмотря на то, что это на базе открытой LTX - никаких весов!!

Вот так пацаны зарабатывают на опенсорсе.

@cgevent

Читать полностью…

Метаверсище и ИИще

Заморочился и сделал очень подробный гайд по Codex и новой GPT-6 Astra

Понимаю, что сейчас мало кто читает гайды. Все смотрят ролики на полторы минуты и спрашивают у ChatGPT. Но вдруг вы из тех, кто по старинке любит открыть учебник и пройти путь глазами в удобном мягком кресле.

Внутри 58 страниц. Перелопатил официальную документацию OpenAI, кучу статей и, что самое главное, практику людей, которые последний месяц работали в Codex и особенно с новой моделькой, в общем собрал оттуда лайфхаки, которых в документации нет.

Писал, конечно же с агентом. В первую очередь это для тех, кто только начинает вайбкодить, каждая штука объясняется с нуля, с примерами и аналогиями. При этом старался держать емкий формат.

Сохраняйте на память 📓

Читать полностью…

Метаверсище и ИИще

В воде теперь вы тоже не укроетесь

Встречайте: рыба-робат!

Пишут, что для "подводного наблюдения"..

Ну да, ну да.

@cgevent

Читать полностью…

Метаверсище и ИИще

Google бахнула Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

Gemini 3.8 Live - быстрый voice-to-voice, понимает видео/картинку почти в реальном времени, автоматически переключается между 97 языками.
(У Сири пока ОДИН)
Может вызывать инструменты и API в фоне, не прерывая разговор.

Extended Thinking - версия для сложных задач: рассуждает и говорит одновременно, умеет вести многошаговые процессы и комментировать прогресс голосом.

Есть Gemini API и AI Studio.
Extended Thinking также завозят в Gemini Live, Docs, Gmail и Keep.

Цены API одинаковые для 3.8 Live и Extended Thinking:
аудио на вход - $0.005/мин
аудио на выход - $0.018/мин
видео/картинка - около $0.002/мин на вход
текст - $0.75 за 1M входных токенов и $4.50 за 1M выходных, включая thinking tokens.

Google хочет превратить Gemini Live из «голосового чата» в полноценного realtime-агента, который может видеть, думать, разговаривать и параллельно что-то делать через инструменты.

По их бенчам - побивает Астру Лайв.

Но.

Они сравнивают свой Extended (High) с Astra(Medium)
blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

ai.google.dev/gemini-api/docs/pricing

@cgevent

Читать полностью…

Метаверсище и ИИще

V - Мультимодальность (см ниже)

Читать полностью…

Метаверсище и ИИще

Ну, за монтажеров!

Я видел ну очень много стартапов для ИИ-автоматизации монтажа.
Все сдохли. Задача сложная.
Те, кто не сдохли, сдохнут сейчас.

Ибо.

OpenAI тут рассказала, что внутри компании **GPT-6 Astra вместе с Codex уже использовали для монтажа трёх часов мультикамерного видео - на итоге получился ролик в шапке.

И это хорошо показывает, куда они двигают Astra. Не просто «посмотреть видео и рассказать, что там происходит», а работать с обычными профессиональными инструментами через computer use: открывать приложения, находить нужные фрагменты, выполнять действия и доводить длинную задачу до результата.

*Модель должна уметь сама работать за компьютером в существующем софте, даже если для него нет специального API
.

Там еще пара кейсов по ссылке:

Excel-кейс: OpenAI заявляет, что Astra через computer use выполняет задания Financial Modeling World Cup примерно в четыре раза быстрее кожаного победителя в Ексель чемпионате 2023..
Ещё один внутренний кейс - модель нашла bottleneck с memory allocation в тестовой среде Codex; после смены allocator они получили заявленные в 25 раз ниже turn latency, хотя peak memory вырос примерно на 30%

OpenAI при этом предлагает смотреть не столько на цену токена, сколько на стоимость законченной задачи. По их данным, Astra требует меньше шагов и повторных попыток, поэтому в ряде сценариев оказывается дешевле предыдущих моделей.

А мой пойнт в том, что модели общего назначения на стероидах MCP и Computer Use догоняют специализированные модели, генераторы, пайплайны. И будут еще умнее. И 3Д-генераторы, например, могут помереть.
Равно как и стартапы по ИИ-монтажу.

https://openai.com/index/gpt-6-astra-next-generation-work/

@cgevent

Читать полностью…

Метаверсище и ИИще

И опять круты Астроподписчики.

Мой приятель Дима Киселев скромно так пишет:

Привет! Я ни разу не из геймдева, просто решил проверить новую модель и вот что получилось. Скажу, что многие серьезные проекты в которые я играл были сделаны хуже чем то, что сделала Астра за выходные без участия человека. В интересное время живем.

Я такой: она сама? за сколько?

Дима: сама, 30 часов непрерывной работы!

Я такой: этошскокостоит?

Дима: 35% токенов от плана за 200$.

Я: шо?

Дима: Дал доступ к блендору, комфи и трипо. Годот скачала сама. Результат на видео.

Кстати, обложку для видео астра сама тоже предложила. Клод отказался генерить, сказал что это аффилированные действия и вообще зашквар

Я: Дима, а результат в виде файлов - что из себя представляет? Это чорный ящик или там есть какие-то редактируемые файлы-ассеты?

Дима: Полноценный набор с ассетами и кучей файлов. Там есть папка Fleet где вся флотилия ассетов. Завтра на гитхаб могу выложить, я так понимаю что он все сам под движок Godot сделал

Ну и результат:
https://github.com/Deekey1/ASTER-Motorsport

Поглядите видос: как колеса отрабатывают!
https://youtu.be/Mk6-F1amHgE

И тут блохоловы такие: он столбики сбивает!

Ребятки, а сколько по времени делались игры такой категории обычно? С каким бюджетом?

Еще раз: 30 часов автономной работы. И все.

Игроделы, на завод!

@cgevent

Читать полностью…

Метаверсище и ИИще

Подписчик пишет:

Зацени какая херовина вышла))
Поделюсь, экспериментом. По техстеку там собственный харнесс который правильно заставляет модель рассматривать задачу в цикле нанимая команду некожаных специалистов, и несколько моделей для текстур и изображений в целом.
Но в основном это Астра.

Ниже можно глянуть:
https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/v2.html

Задача  - воспроизвести рандомный объект наследия юнеско, на тему ближнего востока, в низком полигонаже (Но можно и выше, зависит от требований). Сцена, лвл дизайн, свет, рендер и тд всё тоже сделано иишкой=)
Всё что тут сделано заняло 13 часов чистого времени.

Я такой: эташ скоко это стоило?

- один недельный лимит Codex

Я такой: расписывай!

Читаем, кто в теме:

• 🏛 Сулеймание — игровой квартал Стамбула

Проект выполнен примерно за 3 дня на удалённых машинах, по этому это выглядело как выкрики в чат "Сделай хорошо".
Вся работа сделана с помощью ЛЛМ харнесса, в ручную ничего не правилось и не генерилось. Максмум это QA с скриншотами где что поправить.
Активное время работы ЛЛМ — около 13 часов.

🎯 Цель

Собрать небольшой игровой квартал Стамбула с узкими улицами, площадью, мечетью Сулеймание и доступным интерьером молитвенного зала, и в низком полигонаже.

✅ Что сделано

• Собран городской квартал и площадь
• Доработаны фасад мечети и входная зона
• Создан интерьер молитвенного зала
• Добавлены своды, купола, михраб, минбар, ковры, окна и люстры
• Исправлены пересечения мешей, щели, зависшие фонари и проблемы с объектами
• Настроены утреннее, вечернее и ночное освещение
• Добавлены Lumen, облака, туман и воздушная перспектива
• Настроены материалы камня, дерева, стекла и металла
• Добавлен персонаж с режимами от первого и третьего лица
• Сделана пробежка по улице, площади, двору и интерьеру мечети

🎨 Референсы и изображения

Все концепты, референсные изображения и изображения текстур подготовлены через B2B-платформу Loremax.

• Изображения — GPT Image 2.5
• Текстуры — специализированная обученная модель под архитектурные материалы и PBR
• Исторические фотографии использовались для сверки фасадов и интерьера

🧰 Технический стек

Unreal Engine 5.8.2, Blender, GLB, PBR, UV/lightmap UV, Lumen, виртуальные карты теней, объёмные облака, туман, Sequencer, FFmpeg и Windows Packaging.

Весь harness работы — доработка дворца, интерьера, материалов, света, level design, персонажа, камер и QC — выполнялся через Bridex (https://bridex.app/).

Bridex позволяет оркестрировать агентов с помощью агентских команд и распределять задачи между ними.

🎥 Видео

• Главный ролик (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/unreal/night-concept-v3-20260914/Videos/Istanbul_Night_Concept_GrandTour.mp4)

• Видео работы Bridex: (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/media/Bridex.mp4)
Базовая модель - GPT Astra + GLM + KIMI иногда для более простых задач.

🎮 Unreal-сборка для Windows

Скачать ZIP-сборку (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/unreal/gallery-refresh-20260915/IstanbulSuleymaniye-Windows.zip)

📐 Полигонаж

• Средний размер основного GLB-ассета — около 20 292 треугольников
• Внешняя модель мечети — 88 971 треугольник
• Интерьер молитвенного зала — 263 850 экспортированных треугольников
• Мобильный квартал V7 — 164 771 треугольник

Часть геометрии упрощена для мобильной оптимизации. Unreal-версия используется как демонстрационная игровая сцена.

Оценка расходов:

- ЛЛМ: ≈ $1000 (Недельный лимит GPT)
- Изображения, музыка, текстуры: €30;

@cgevent

Читать полностью…
Subscribe to a channel