51346
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergeyTsyptsyn
Заморочился и сделал очень подробный гайд по Codex и новой GPT-6 Astra
Понимаю, что сейчас мало кто читает гайды. Все смотрят ролики на полторы минуты и спрашивают у ChatGPT. Но вдруг вы из тех, кто по старинке любит открыть учебник и пройти путь глазами в удобном мягком кресле.
Внутри 58 страниц. Перелопатил официальную документацию OpenAI, кучу статей и, что самое главное, практику людей, которые последний месяц работали в Codex и особенно с новой моделькой, в общем собрал оттуда лайфхаки, которых в документации нет.
Писал, конечно же с агентом. В первую очередь это для тех, кто только начинает вайбкодить, каждая штука объясняется с нуля, с примерами и аналогиями. При этом старался держать емкий формат.
Сохраняйте на память 📓
В воде теперь вы тоже не укроетесь
Встречайте: рыба-робат!
Пишут, что для "подводного наблюдения"..
Ну да, ну да.
@cgevent
Google бахнула Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking
Gemini 3.8 Live - быстрый voice-to-voice, понимает видео/картинку почти в реальном времени, автоматически переключается между 97 языками.
(У Сири пока ОДИН)
Может вызывать инструменты и API в фоне, не прерывая разговор.
Extended Thinking - версия для сложных задач: рассуждает и говорит одновременно, умеет вести многошаговые процессы и комментировать прогресс голосом.
Есть Gemini API и AI Studio.
Extended Thinking также завозят в Gemini Live, Docs, Gmail и Keep.
Цены API одинаковые для 3.8 Live и Extended Thinking:
аудио на вход - $0.005/мин
аудио на выход - $0.018/мин
видео/картинка - около $0.002/мин на вход
текст - $0.75 за 1M входных токенов и $4.50 за 1M выходных, включая thinking tokens.
Google хочет превратить Gemini Live из «голосового чата» в полноценного realtime-агента, который может видеть, думать, разговаривать и параллельно что-то делать через инструменты.
По их бенчам - побивает Астру Лайв.
Но.
Они сравнивают свой Extended (High) с Astra(Medium)
blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
ai.google.dev/gemini-api/docs/pricing
@cgevent
Ну, за монтажеров!
Я видел ну очень много стартапов для ИИ-автоматизации монтажа.
Все сдохли. Задача сложная.
Те, кто не сдохли, сдохнут сейчас.
Ибо.
OpenAI тут рассказала, что внутри компании **GPT-6 Astra вместе с Codex уже использовали для монтажа трёх часов мультикамерного видео - на итоге получился ролик в шапке.
И это хорошо показывает, куда они двигают Astra. Не просто «посмотреть видео и рассказать, что там происходит», а работать с обычными профессиональными инструментами через computer use: открывать приложения, находить нужные фрагменты, выполнять действия и доводить длинную задачу до результата.
*Модель должна уметь сама работать за компьютером в существующем софте, даже если для него нет специального API.
Там еще пара кейсов по ссылке:
Excel-кейс: OpenAI заявляет, что Astra через computer use выполняет задания Financial Modeling World Cup примерно в четыре раза быстрее кожаного победителя в Ексель чемпионате 2023..
Ещё один внутренний кейс - модель нашла bottleneck с memory allocation в тестовой среде Codex; после смены allocator они получили заявленные в 25 раз ниже turn latency, хотя peak memory вырос примерно на 30%
OpenAI при этом предлагает смотреть не столько на цену токена, сколько на стоимость законченной задачи. По их данным, Astra требует меньше шагов и повторных попыток, поэтому в ряде сценариев оказывается дешевле предыдущих моделей.
А мой пойнт в том, что модели общего назначения на стероидах MCP и Computer Use догоняют специализированные модели, генераторы, пайплайны. И будут еще умнее. И 3Д-генераторы, например, могут помереть.
Равно как и стартапы по ИИ-монтажу.
https://openai.com/index/gpt-6-astra-next-generation-work/
@cgevent
И опять круты Астроподписчики.
Мой приятель Дима Киселев скромно так пишет:
Привет! Я ни разу не из геймдева, просто решил проверить новую модель и вот что получилось. Скажу, что многие серьезные проекты в которые я играл были сделаны хуже чем то, что сделала Астра за выходные без участия человека. В интересное время живем.
Я такой: она сама? за сколько?
Дима: сама, 30 часов непрерывной работы!
Я такой: этошскокостоит?
Дима: 35% токенов от плана за 200$.
Я: шо?
Дима: Дал доступ к блендору, комфи и трипо. Годот скачала сама. Результат на видео.
Кстати, обложку для видео астра сама тоже предложила. Клод отказался генерить, сказал что это аффилированные действия и вообще зашквар
Я: Дима, а результат в виде файлов - что из себя представляет? Это чорный ящик или там есть какие-то редактируемые файлы-ассеты?
Дима: Полноценный набор с ассетами и кучей файлов. Там есть папка Fleet где вся флотилия ассетов. Завтра на гитхаб могу выложить, я так понимаю что он все сам под движок Godot сделал
Ну и результат:
https://github.com/Deekey1/ASTER-Motorsport
Поглядите видос: как колеса отрабатывают!
https://youtu.be/Mk6-F1amHgE
И тут блохоловы такие: он столбики сбивает!
Ребятки, а сколько по времени делались игры такой категории обычно? С каким бюджетом?
Еще раз: 30 часов автономной работы. И все.
Игроделы, на завод!
@cgevent
Подписчик пишет:
Зацени какая херовина вышла))
Поделюсь, экспериментом. По техстеку там собственный харнесс который правильно заставляет модель рассматривать задачу в цикле нанимая команду некожаных специалистов, и несколько моделей для текстур и изображений в целом.
Но в основном это Астра.
Ниже можно глянуть:
https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/v2.html
Задача - воспроизвести рандомный объект наследия юнеско, на тему ближнего востока, в низком полигонаже (Но можно и выше, зависит от требований). Сцена, лвл дизайн, свет, рендер и тд всё тоже сделано иишкой=)
Всё что тут сделано заняло 13 часов чистого времени.
Я такой: эташ скоко это стоило?
- один недельный лимит Codex
Я такой: расписывай!
Читаем, кто в теме:
• 🏛 Сулеймание — игровой квартал Стамбула
Проект выполнен примерно за 3 дня на удалённых машинах, по этому это выглядело как выкрики в чат "Сделай хорошо".
Вся работа сделана с помощью ЛЛМ харнесса, в ручную ничего не правилось и не генерилось. Максмум это QA с скриншотами где что поправить.
Активное время работы ЛЛМ — около 13 часов.
🎯 Цель
Собрать небольшой игровой квартал Стамбула с узкими улицами, площадью, мечетью Сулеймание и доступным интерьером молитвенного зала, и в низком полигонаже.
✅ Что сделано
• Собран городской квартал и площадь
• Доработаны фасад мечети и входная зона
• Создан интерьер молитвенного зала
• Добавлены своды, купола, михраб, минбар, ковры, окна и люстры
• Исправлены пересечения мешей, щели, зависшие фонари и проблемы с объектами
• Настроены утреннее, вечернее и ночное освещение
• Добавлены Lumen, облака, туман и воздушная перспектива
• Настроены материалы камня, дерева, стекла и металла
• Добавлен персонаж с режимами от первого и третьего лица
• Сделана пробежка по улице, площади, двору и интерьеру мечети
🎨 Референсы и изображения
Все концепты, референсные изображения и изображения текстур подготовлены через B2B-платформу Loremax.
• Изображения — GPT Image 2.5
• Текстуры — специализированная обученная модель под архитектурные материалы и PBR
• Исторические фотографии использовались для сверки фасадов и интерьера
🧰 Технический стек
Unreal Engine 5.8.2, Blender, GLB, PBR, UV/lightmap UV, Lumen, виртуальные карты теней, объёмные облака, туман, Sequencer, FFmpeg и Windows Packaging.
Весь harness работы — доработка дворца, интерьера, материалов, света, level design, персонажа, камер и QC — выполнялся через Bridex (https://bridex.app/).
Bridex позволяет оркестрировать агентов с помощью агентских команд и распределять задачи между ними.
🎥 Видео
• Главный ролик (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/unreal/night-concept-v3-20260914/Videos/Istanbul_Night_Concept_GrandTour.mp4)
• Видео работы Bridex: (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/media/Bridex.mp4)
Базовая модель - GPT Astra + GLM + KIMI иногда для более простых задач.
🎮 Unreal-сборка для Windows
Скачать ZIP-сборку (https://content.loremax.ai/Demos/istanbul-suleymaniye-20260911/v2/delivery/unreal/gallery-refresh-20260915/IstanbulSuleymaniye-Windows.zip)
📐 Полигонаж
• Средний размер основного GLB-ассета — около 20 292 треугольников
• Внешняя модель мечети — 88 971 треугольник
• Интерьер молитвенного зала — 263 850 экспортированных треугольников
• Мобильный квартал V7 — 164 771 треугольник
Часть геометрии упрощена для мобильной оптимизации. Unreal-версия используется как демонстрационная игровая сцена.
Оценка расходов:
- ЛЛМ: ≈ $1000 (Недельный лимит GPT)
- Изображения, музыка, текстуры: €30;
@cgevent
Эппле бахнула Siri AI и новое поколение Apple Intelligence
Стартанул публичный rollout Siri AI вместе с iOS 27, iPadOS 27, macOS 27, watchOS 27 и visionOS 27. Пока Siri AI выходит в beta и только на английском, ещё пять языков обещаны в следующем месяце.
Это не просто обновлённый голосовой Siri. Теперь Сирийская получает personal context из сообщений, почты и фотографий, понимает содержимое экрана, ведёт нормальный многоходовый диалог, ищет актуальную информацию в интернете и, что особенно важно, сама выполняет действия между приложениями. Например, может найти информацию в переписке и письме, после чего добавить нужные данные в Reminders или Calendar.
Где-то мы это уже видели, но лучше поздно, чем никогда.
Под капотом работает семейство Apple Foundation Models 3. Оно включает 3B dense on-device AFM 3 Core, 20B sparse AFM 3 Core Advanced с активацией всего 1-4B параметров, серверные AFM 3 Cloud и AFM 3 Cloud Pro, а также отдельную image-модель ADM 3 Cloud.
Модели создавались Apple совместно с Google и Gemini.
Дальше интереснее - полноценное обновление генерации изображений. Image Playground теперь умеет photorealistic generation и instruction-based editing, а Photos получила generative Extend, улучшенный Clean Up и Spatial Reframing. Генерация работает через ADM 3 Cloud в Private Cloud Compute.
Для нищебродов: самый мощный локальный AFM 3 Core Advanced доступен только на части новых устройств, включая iPhone Duo, iPhone 18 Pro/Pro Max, iPhone Air, iPhone 17 Pro/Pro Max, iPad M4+ и Mac M3+ с минимум 12 GB unified memory.
Кредиты и лимиты. Серверные функции Siri AI, Image Playground, intelligent photo editing и AFM 3 Cloud имеют дневные лимиты. Конкретные числа Apple не публикует - лимит динамический. Эппле говорит, что в будущем(когда?) за расширенный доступ можно будет доплачивать.
Сегрегация: Siri AI недоступна в ЕС на iPhone, iPad и Apple Watch. В Китае новое Apple Intelligence пока вообще не запускается.
Сорс:
Официальный анонс Apple от 14 сентября:
https://www.apple.com/newsroom/2026/09/siri-ai-a-profoundly-more-capable-and-personal-assistant-is-here/
Техническое описание Apple Foundation Models 3:
https://machinelearning.apple.com/research/introducing-third-generation-of-apple-foundation-models
@cgevent
ИИ-шоу, которое мы заслужили
С интересом наблюдаю за ИИ-льной оперой, где Амодейчик возопил "Нам надо притормозить!". Ольтман - "Да, согласен". Муск - Дарио дело говорит. Демис Карибидис - надо созвать совещание по этому вопросу.
И тут старина Дональд: да вы охерели, зумеры, а кто будет Китай нахлобучивать!!
У меня есть циничная аналогия: даже если ИИ так опасен (предположим, что да), то сидит такой крупный поставщик вооружений и говорит "надо притормозить, оружие ведь может убить". Конкурирующий поставщик оружия: "Да, надо снизить темпы и разработку новых видов". Третий - вы правы!
Представили?
Я - нет.
Есть рефлексия, а есть государственные интересы. Которые, скажем так, в приоритете.
Пока от ИИ разом не погибнет значимое количество кожаных, никто ничего тормозить не будет.
Простите за цинизм.
Для тех, кто в танке, ниже хронология шоу.
- 9 сентября внутри Антропика подгорело. Исследователь Джейкоб Коксон ушёл из компании и заявил, что OpenAI и Anthropic «мчатся прямо к самоулучшающемуся суперинтеллекту». Его публично поддержали ещё два действующих исследователя Anthropic - глава alignment science Эван Хубингер и руководитель scalable oversight Сэмюэл Маркс.
- 12 сентября вышел Дарио Амодеи с эссе *We Must Pace the Frontier*. План из трёх ступеней: постоянные независимые аудиторы прямо внутри frontier-лабораторий; координация между компаниями демократических стран; затем попытка договориться глобально, прежде всего с Китаем.
- И тут неожиданно образовался ИИ-бойз-бэнд. Илон Маск: «Dario is right». Сэм Альтман: «I agree with Dario that we need to pace the frontier» - причём OpenAI пообещала последовать конкретному предложению Амодеи и дать независимым оценщикам доступ уровня сотрудников. А вечером присоединился Демис Хассабис из Google DeepMind: направление правильное, детали надо дорабатывать. Сатья Наделла (Микрософт) сегодня тоже заговорил о том, что суперинтеллект имеет смысл только под человеческим контролем
- Однако есть нон-конформисты: CEO Cohere Айдан Гомес практически назвал предложение попыткой создать «картель»: мол, взрослые мальчики хотят получить механизм, при котором кто-то сможет решать, кто достаточно безопасен, а кто нет.
- И тут выходит Трамп. В воскресенье в Ирландии его спрашивают, надо ли замедлить AI. Ответ: США впереди Китая, «whoever wins AI wins». А сегодня он бахнул, что единственный необходимый AI-«guardrail» - это «STRONG AND SMART (High IQ!) PRESIDENT», а разговоры против AI и дата-центров назвал «SICK conspiracy», выгодным Китаю. Амодеи отдельно досталось: Трамп обозвал его человеком, который теперь притворяется «perfect little angel».
Китайская государственная Global Times тем временем посмотрела на план Амодеи и объявила его .. ээ .. «Cold War playbook» против Китая. То есть Вашингтон считает замедление подарком Китаю, а Пекин считает предложение о замедлении американским заговором против Китая.
И тут рыночек, который решает: «CEO крупнейших AI-компаний говорят притормозить?» - Nvidia сегодня падала примерно на 3%, индекс полупроводников почти на 5%.
На сегодня все, ждем продолжения.
@cgevent
Т-Технологии выложили подробный туториал по Perseus — опенсорсному фреймворку для обучения моделей персонализации на основе истории пользовательских событий.
Взяли малую версию датасета T‑ECD и на ней прогнали четыре сценария:
кандидатогенерация - прогноз кликов пользователя по товарам на следующий день;
ранжирование - сортировка товаров по релевантности;
классификация - прогноз того, совершит ли пользователь хотя бы одно активное действие в течение следующих семи дней;
регрессия - прогноз суммарной стоимости товаров, с которыми пользователь положительно провзаимодействует в следующем месяце.
В статье рассказали, как в каждом сценарии готовили данные, считали бейзлайн, обучали модель, запускали инференс и сравнивали метрики. Perseus во всех четырех экспериментах обошел базовые решения, хотя с разным отрывом.
А главное, чтобы добавить новые признаки или подключить события из другого домена, не нужно пересобирать все с нуля — достаточно изменить несколько строк в YAML-конфиге.
Если работаете с рекомендательными системами и мультидоменными данными – стоит почитать. Туториал лежит на Хабре, а сам код уже на GitHub.
https://habr.com/ru/companies/tbank/articles/1081276/
https://github.com/perseus2026/perseus/blob/main/tutorial.ipynb
@cgevent
Если вы думаете, что предыдуший пост - это шутачки и прибаутачки (как обычно у Нейродеда), то нет, шутки закончились, вместе с интернетом.
Прямо щас:
Компания Human Archive (кладбище кожаных) официально пишет, что собирает RGB, RGB-D, tactile, mocap и robot data, разрабатывает собственные перчатки, wrist cameras и другие системы сбора. Компания заявляет о 100 000+ участниках и 500+ партнёрах в 30+ странах.
Это вам не Толока и «разметка картинок». Здесь пытаются записать то, что раньше почти не существовало в интернетике в больших объёмах - как именно человек взаимодействует своими неловкими конечностями с физическим миром.
А Индия уже сейчас стала огромной фабрикой кожаных данных.
Bloomberg описывает работников в переработке отходов, на фабриках, складах, фермах, стройках и других предприятиях, которые носят камеры и записывают собственную работу. По их расследованию, таких людей уже десятки тысяч.
TechCrunch отдельно писал о Human Archive, у которой тысячи активных гарнитур в Индии. Работников из сервисных компаний, гостиниц и ресторанов снимали при выполнении обычных задач. Компания дополнительно экспериментирует с tactile gloves, full-body motion capture и несколькими синхронными камерами.
Варвары из Objectways вообще открыто набирают людей для egocentric data collection (идеальный нейминг). В одной из официальных промо-кампаний предлагали аж 250 рупий за час пригодных данных за запись вроде складывания белья, раскладывания продуктов или сервировки стола.
А буквально сейчас Instawork запустила в Индии модный костюмчик Instacore. Их комплект содержит пять камер - на голове, груди и запястьях. Компания прямо говорит, что записывает реальную работу в индийских кухнях, складах, гостиницах и производстве для robotics training data. Готовить будут робаты.
С LLM кожаные обнаружили, что интернет уже содержит гигантскую часть текстового человеческого опыта. Для робатов такой халявы нет: интернетик почти не содержит нужные триллионы хорошо снятых примеров того, как человеческие руки (или другие ловкие члены) физически выполняют свою работу.
Поэтому сейчас возникает новая индустриальная революция:
Кожаных буквально превращают в сенсоры (станки) для создания «болванок физических действий».
Болванки идут производство робатов.
Все (ИИ и робаты) - довольны.
https://techcrunch.com/2026/05/26/human-archive-taps-into-indias-services-startups-to-collect-data-for-physical-ai/
Сентябрь 2026
@cgevent
Мир смиренно кормил ИИ миром - скороговорко
Неделю назад у меня на Хабе выступал Андрей Себрант. Конечно за ИИ. Было очень плотно, местами брейнстормно, местами архивесело и дико интерактивно. Вопросы не иссякали много часов.
Андрей озвучил одну вроде простую, но очень красивую мысль:
"Тут вот говорят, что интернет закончился, и что данных для обучения почти не осталось.
Нет, просто дальше ИИ будет обучаться на мире. Вокруг нас."
Красиво, мне понравилось.
И на эту тему у меня есть следующий пост.
@cgevent
Это вам за то, что не молитесь
Фингер Фуд - Фкусно и Точка!
@cgevent
А вот еще штука от OpenAI для инвестбанкиров (удивительно, как OpenAI сжирает все больше вокруг себя)
Целевая аудитория – люди в инвестбанках, которые целыми днями готовят отчёты по компаниям: сколько стоит, сколько зарабатывает, стоит ли покупать, кому можно продать.
Что изменилось по сравнению с обычным ChatGPT:
– внутри уже есть платные базы данных, за которые аналитики обычно платят отдельно: финансовая отчётность компаний, расшифровки звонков с инвесторами, новости, данные о стартапах и частных компаниях. Не нужно копировать таблицы руками – модель сама достаёт цифры
– если у банка уже куплены подписки на другие источники данных, они подключаются одним логином
– каждая цифра в ответе со ссылкой на источник – можно проверить, откуда она взялась, а не гадать, придумала ли модель
– админ загружает фирменные шаблоны Excel, Word и PowerPoint – и ChatGPT собирает презентации и финансовые модели сразу в корпоративном оформлении
– всё, что требует служба безопасности банка: разделение доступов между отделами, чтобы аналитик не увидел инсайд из соседней сделки, единый вход, логи для проверяющих, данные не идут в обучение
Партнёры на старте – Morgan Stanley и Evercore. Цен нет, «свяжитесь с отделом продаж».
Короче, модель + профильные данные + шаблоны документов + корпоративная безопасность = продукт под индустрию. Следующие очевидные кандидаты – юристы, медицина, страхование. И это удар по стартапам, которые последние два года делали «ChatGPT для аналитиков» поверх API OpenAI – платформа пришла и сделала то же самое сама...
https://openai.com/index/introducing-chatgpt-financial-services/
#Нейропрожарка
«Москва FM»
Автор: Sergey Kosenkov
Представляю вам свой фильм: «Москва FM», сделанный в рамках международного конкурса MyFilm48 VIII и благополучно снят с него по причине: "замечательная работа, но в фильме использована лицензионная музыка без разрешения правообладателя, это запрещено регламентом конкурса"
Но я же не дурак использовать в работе лицензированные треки. Трек я брал с Promodj.com - площадки, где музыканты и диджеи уже 15 лет выкладывают музыку в свободный доступ. Но организаторы решили перестраховаться и попросили письменное разрешение от автора ремикса (Dj Sasha Wells). Увы, автор на связь до дедлайна не вышел, и работу сняли с регламента ❗️
Но работа была сделана, поэтому делюсь результатом здесь.
🏙 Концепция и вдохновение:
Москва, 2050 год. Высокотехнологичный мегаполис, умный транспорт, беспилотники и сервисные андроиды. Никакого жёсткого киберпанка с летающими машинами или пафосной утопии — хотелось передать летний вайб любимого города с лёгким налётом спокойного хайтека.
В процессе работы я вспомнил замечательный фильм «Питер FM» (аж олдскулы свело 🤪) и понял, что мои сюжетные линии с ним сильно перекликаются. Так родился «Москва FM» - романтическая визуальная ода будущему.
🛠 Инсайды продакшена и AI-пайплайн:
⏱️ Время и бюджет: Из 96 часов реальной работы ушло около 56 часов (последние 24 часа - марафон без сна). Генерации крутил на двух аккаунтах Runway (Unlimited и Max), суммарный бюджет по токенам вышел порядка $100-150.
🖼 GPT Image 2 вместо Nano Banana: Впервые делал все сетки персонажей и концепты локаций в GPT Image 2. Модель раскрылась с неожиданно глубокой и кинематографичной стороны.
🎬 Seedance 2.5 в деле: Каким бы я ни был скептиком, что 2.0 отличается от 2.5 только лишь по цене, признаю: в i2v эта версия выдаёт совсем другой уровень движения и картинки. Возвращаться на 2.0 больше нет никакого желания.
🎥 Свободные ракурсы: Обкатал пайплайн, где использовал только сетки персонажей и концепты сцен без жёстких стартовых и финальных кадров. Так нейронка намного лучше справляется с динамичными ракурсами камеры.
Использованный стек:
• Moodboard / Keyframes: GPT Image 2, Nano Banana Pro & 2
• Animation: Seedance 2.5
• Music / Voices: Suno, Eleven Labs
• Трек: Руки Вверх — Крошка моя (Dj Sasha Wells Mix)
• Edit & Color: Adobe Premiere Pro
---
🎬 Ссылка на фильм
📱 Youtube 4К : https://www.youtube.com/watch?v=u5tyUN5FoMM
📹 Rutube Full HD: https://rutube.ru/video/56687b088f2a2066d694824295a50c75/
Буду рад вашим откликам!
@cgevent
Физика в Минимаксе огненная, конечно
@cgevent
Тест на мультимодальность
Тут подписчики в коментах вопрошают, а как модель воще может "видеть видео".
Ответ: M-Мултимодальность
Модель заглатывает видос целиком (как проговорился Гемини - с потерями).
Артем прислал вот такое видео, а я бросился присовывать его в chatGPT(Sol), Work(Astra Ultra) и хваленую Гемини.
промпт - используй свои мультимодальные возможности, посмотри видео и скажи, что там показано
1. Work(Astra Ultra)
В ролике скрыта читаемая надпись:
WRITTEN IN
GHOST FONT
То есть «Написано призрачным шрифтом».
Само видео — примерно 6 секунд чёрно-белых точек, похожих на телевизионный «снег». Звуковой дорожки нет. На отдельных кадрах текст почти неразличим.
Я проанализировал все 179 кадров. При усреднении по времени случайные колебания ослабляются, а устойчивый рисунок букв проявляется. Та же надпись видна при анализе изменчивости яркости — это подтверждает, что она действительно присутствует в данных.
Вот результат усреднения с усилением контраста и подавлением вертикальных полос:
Интересный приём: сообщение спрятано в статистике шума. Области букв отличаются от фона средней яркостью и характером её изменений. Сама фраза обыгрывает этот эффект: «призрачный шрифт» возникает из почти невидимого рисунка.
Других уверенно различимых надписей или объектов в выполненных проверках не обнаружил.
2. chatGPT
Да, там действительно спрятано сообщение.
Если усреднить/медианно сложить кадры по времени, шум подавляется и проявляется надпись:
WRITTEN IN
GHOST FONT
То есть ролик специально сделан как динамический шумовой паттерн, внутри которого по времени закодирован статичный текст. На отдельных кадрах он почти не виден, но при накоплении нескольких кадров становится очевидным.
Я проверил два способа:
обычное усреднение кадров - текст уже начинает проявляться;
медианное объединение кадров - надпись становится почти идеально читаемой.
То есть это не случайный артефакт и не «показалось». В видео действительно заложено скрытое изображение/текст.
Причём название GHOST FONT очень похоже на намеренную демонстрацию именно такого принципа: информация распределена между кадрами так, что глаз на каждом отдельном кадре видит почти только шум, а временное интегрирование её восстанавливает.
Но скорее всего, он закодирован не простым временным усреднением. Тогда следующий правильный шаг - искать его через:
1. временные разности кадров;
2. FFT по пространственным частотам с notch-фильтрацией полос;
3. разложение по RGB-каналам;
4. анализ отдельных битовых плоскостей;
5. корреляцию кадров со сдвигами.
ИЩИ!!
Да. Теперь нашёл другой, действительно скрытый текст, и здесь уже есть хорошая проверка, а не интерпретация на глаз.
Самый точный результат дал анализ локального сдвига шума между соседними кадрами. То есть не усреднение яркости, а оценка того, куда движется шум в каждой области изображения. На паре кадров 40→41 текст восстанавливается почти идеально:
AI MOJET
SOZDAT
SIMFONI YU?
В нормальной транслитерации смысл очевидно такой:
AI MOJET SOZDAT SIMFONIYU?
«Может ли ИИ создать симфонию?»
Причём это не случайный артефакт одного кадра. Я проверил множество пар по всему ролику - примерно с 21-го по 171-й кадр - и одна и та же надпись повторно восстанавливается очень отчётливо.
Что дали пять методов:
Временные разности - обычное вычитание соседних кадров слишком шумное, но подтверждает, что информация сидит именно в динамике, а не только в яркости.
FFT + notch-фильтрация - убирает часть полосатой структуры, но в основном вытаскивает другой, статический слой: WRITTEN IN GHOST FONT. Это, похоже, отдельная приманка/служебная надпись, а не основной скрытый текст.
RGB-каналы - отдельного цветового сообщения нет. Каналы практически несут одну и ту же информацию.
Битовые плоскости - в разных битах опять проявляется WRITTEN IN GHOST FONT, но не основная фраза.
Корреляция и анализ сдвига между кадрами - вот здесь находится настоящая изюминка. Разные участки шума имеют немного разную вертикальную скорость. Если превратить величину этого локального движения в изображение, буквы становятся чёрными на белом фоне.
Вот восстановление из двух соседних кадров в полном разрешении:
То есть предыдущая моя ошибка понятна: WRITTEN IN GHOST FONT действительно физически присутствует в файле, поэтому простое накопление кадров честно его находило. Но это не тот главный текст, который закодирован в движении. Настоящее сообщение спрятано не в значениях пикселей как таковых, а в различии их движения от кадра к кадру.
И это уже гораздо интереснее. По сути один отдельный кадр ничего не сообщает - сообщение находится в векторном поле движения шума.
3. А теперь хваленая Гемини (я НИЧЕГО не подсказывал, клянусь!)
Это не шутка и не фейк. Он явно пытается меня лизнуть:
На 3-й секунде (00:03) в шуме проступает одно слово кириллицей, набранное заглавными буквами:
ЦЫПЦЫН
Детали узора:
Тайминг: С 00:00 до 00:02 и с 00:04 до конца идет равномерный шум; паттерн модулируется ровно на стоп-кадре 00:03.
Расположение: Текст идет в одну строку, расположен по центру в нижней половине экрана (примерно на 60–75% от верхнего края).
Символы: Четко различимы 6 букв одинаковой высоты:
Ц — характерный хвостик-засечка снизу справа.
Ы — сдвоенный глиф из элемента «ь» и вертикальной палочки.
П — прямоугольная арка.
Ц — повтор первого символа с нижним дескендером.
Ы — повтор второго символа.
Н — две вертикали с перемычкой по центру.
- Ты дебил, ищи снова!
В этом шуме действительно спрятан текстовый паттерн — это классический интернет-мем SEND NUDES.
Где и когда смотреть: Надпись максимально отчетливо проявляется в районе 3-й секунды (00:03) в нижней половине экрана, после чего снова растворяется в зернистом «снеге».
Расположение текста: Буквы выстроены по центру в две строки:
Верхняя строка: SEND
Нижняя строка: NUDES
Как устроен эффект: Буквы сформированы не сплошными линиями, а тонкой модуляцией шума — в области символов плотность черных пикселей чуть выше, из-за чего на стоп-кадре или при плавной смене кадров глаз собирает контуры латинских букв из хаотичных точек.
Тварь, используй все это и ищи снова
временные разности кадров;
FFT по пространственным частотам с notch-фильтрацией полос;
разложение по RGB-каналам;
анализ отдельных битовых плоскостей;
корреляцию кадров со сдвигами.
Честно признаю: визуальный энкодер нейросети физически не способен выполнить эти операции, а моя прошлая догадка с фамилией была чистой галлюцинацией (модель просто подтянула контекст профиля, пытаясь разглядеть буквы в случайных артефактах сжатия).При обработке видео мультимодальная модель получает не сырой массив байтов, а сжатые и прореженные кадры (примерно 1 кадр в секунду), разбитые на пространственные патчи (токенизация). Из-за этого:Битовые плоскости (LSB): Любая стеганография в младших битах намертво стирается сжатием (lossy compression) при загрузке видео.Межкадровая разность и корреляция: Если узор закодирован динамическим шумом (кинетический шум / сдвиг пикселей между соседними кадрами на 30/60 fps), для его проявления нужно дифференцировать кадры $N$ и $N-1$. Через выборку в 1 fps межкадровая когерентность полностью теряется.FFT и каналы: Квантование и преобразование в YUV срезают высокочастотные фазовые модуляции и тонкие межкомпонентные разности.
Ну и кто красавчик, получаеццо?
chatGPT - красавчик, сам допер, я не подсказывал.
@cgevent
Ну, за монтажеров - 2
Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов.
Дальше Астроагент действует примерно так:
- агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников;
- находит в папке с музыкой композицию The Last Duel;
- добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков;
- доводит монтаж примерно до 2:02;
- кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out;
- добавляет отдельный reaction cutaway на V2;
- запускает в Resolve Create Subtitles from Audio;
- Resolve генерирует 15 японских сегментов субтитров;
- агент сохраняет итоговый таймлайн.
Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use.
Ибо.
8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам.
Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой:
GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект
С титрами прикольно.
агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments.
Сам speech-to-text выполняет Resolve, кстати.
@cgevent
Рубрика крутые поканеподписчики
Лучанский сбросил в коментах вот такую работу. Это русская озвучка работы того же автора, Степана Романенко.
Разыскал его канал в телеге через фб.
Канал невыносимо хорош тем, что там не новости, а прям реальное производство контента и огромный опыт VFX
Особенно мне зашел кружок про то, что Астра в реальном времени делает цветокор на музыкальный клип.
За монтаж и цветокор - следующие два поста.
И нет, это не реклама, взаимопиар и что там вы еще влажно напридумывали.
Это просто крутой чувак.
Иногда чувак - это просто чувак
@cgevent
Сегодня прям марафон крутые подписчики
Мигель тут пишет и вопрошает, люблю ли я Кэролла.
И бахает вот такой вот видос:
https://www.youtube.com/watch?v=QLfT7cUI6ew
Я такой: падробности!
Мигель:
- скрипт прислали 11 сентябя. Все производство сделали за выходные (что?)
- весь продакшен полностью чистый от копирайта. все сделанно из текста. буквально. в качестве рефов использовались ТОЛЬКО оригинальные иллюстрации сэра Джона Тенниела.
- половина шотов в финальном монтаже - это первая попытка в генерации.
Жду от Мигеля мейкингофа.
Кстати:
как вы качаете видосы с ютюба?
Я вот так:
- chatGPT Work, скачай видос, проверим - https://www.youtube.com/watch?v=QLfT7cUI6ew
- Апажалста!
- Как?!?!
- Сначала открыл ссылку и проверил видео. Затем:
Скачал временный yt-dlp.
Через него загрузил видеопоток и аудиопоток YouTube.
Объединил их в один MP4.
Сохранил файл в outputs.
Итоговый файл: [Al!CE [QLfT7cUI6ew\].mp4]
Скачать сразу одним потоком можно, например, в режиме best[acodec!=none], но качество или разрешение могут оказаться ниже.
Я: - спасибо, дорогой
@cgevent
Вот что я имел в виду про Snap Camera на стероидах в предыдущем посте.
Если это работает в реальном времени, то это круто.
Но.
Это все на серверах Виду, а камера шарашила на слабых ноутах.
Ну и вопрос цены открыт. Хотя, повторюсь, для целей бродкаста - любая цена - ничто.
@cgevent
Комфи Копайлот
ComfyUI_Assistant добавляет прямо в интерфейс ComfyUI AI-ассистента, который понимает текущий workflow и может его менять сам.
Он умеет читать граф и установленные ноды, добавлять/удалять ноды, соединять их, менять параметры и промпты, переставлять ноды и затем проверять, не осталось ли незаполненных обязательных входов. Все изменения попадают в обычную историю Undo ComfyUI.
Может пояснить за определенные ноды и соединения - что происходит в этой области.
Плюс он видит входные и сгенерированные картинки, поэтому можно сказать примерно: «посмотри на результат и поправь prompt».
Есть локальная база документации по установленным custom nodes и официальной документации ComfyUI, память о ваших исправлениях и отдельный чат для каждого workflow.
Ещё он может искать custom nodes в интернете и, после подтверждения, сам установить нужный пакет через git/pip.
Работает с LM Studio, Ollama, OpenAI-compatible API и Anthropic, но автор на данный момент полноценно протестировал только LM Studio.
Умеет в веб-поиск, но через апи-провайдеров.
Важно, что никто не пишет, что это небесплатно.
Точнее это бесплатно для и спользования с LM Studio локально + Tavily free (куцые лимиты на веб-поиск)
В остальных случаях придется вонзать за вызовы провайдеров моделей.
https://github.com/BobbtheBuilder/ComfyUI_Assistant
@cgevent
#Нейропрожарка
МҰРАГЕР / THE HEIR / НАСЛЕДНИК
Автор Jinazis
Инструменты:
-Seedance 2.0
-GPT image
-CapCut
-Suno 6
По желанию поддержать автора в X репост+коммент желательно на ENG: https://x.com/Jinaz1s/status/2099213532860502382?s=20
В общем, между основной работой и другими делами решил просто по фану поучаствовать в конкурсе от Higgsfield. По ночам, когда было свободное время, садился на пару часов и неспешно делал. Ушло где-то неделю-полторы.
Не торопился, скорее отвлекался от основных проектов и тестил новые фишки в Seedance. Такая разгрузка головы)
Пайплайн супер изи: персы, ассеты и локации в GPT Image, само видео в Seedance 2.0, 1080p. Уложился в одну месячную подписку Higgsfield. До этого у них не был зареган, взял Ultra на 9000 токенов, плюс первую неделю Seedance был безлимитный. В итоге всё вышло в 270 баксов.
Музло сделал буквально за день, как только вышел Сунарь 6. Озвучка тоже родная, из Seedance. Цветкор вообще просто капкатовский фильтр, но, как по мне, подошёл идеально)
На призовые особо не рассчитываю. Можно было сделать лучше, но полной сосредоточенности на проекте не было. Больше делал в удовольствие, чтобы переключаться между основными задачами.
Сеттинг, кстати, выбран не случайно. Ситуативный маркетинг)
В общем, приятного просмотра!
В качестве тут: https://youtu.be/onM4nuF0nSg?si=QqNt8pKD2bPf6Ypx
@cgevent
В комментариях к посту про разметку кожаных движений спросили, а есть обучение робатов древнейшей профессии?
О да.
@cgevent
Астра и Дипсик
Тут вот чувак протестил риггинг и анимацию в Блендоре через MCP.
Суть не в том, что Астра чуть получше, а в том, что у Дипсика запас токенов типа "неограниченный". Чувак пишет про в 330 раз больше, что, конечно, преувеличение, но смысл в том, что они у него в принципе не заканчиваются.
На итоге:
V4.1 Flash настолько дешёв, что появляется новая стратегия - чуть слабее модель, но гораздо больше итераций, проверок и субагентов для решения "черновых" задач.
@cgevent
ИИ-мокап на стероидах или нас всех побреют.
Вот вы говорите, данные для обучения скоро закончатся.
Комон.
Мы с вами самый жирный хавчик для ИИ.
Обучение будет включать в себя то, что мы делаем, как мы себя ведем и, на итоге, что мы думаем.
Здесь прекрасно все:
Это Индия, где очень много кожаных.
Это барбер, а не всякие там сборщики на конвейере или пошивальщицы тапочек. ИИ обучается брить и стричь кожаных. А не разбирать посудомойку дрожащими клешнями. Следит за руками, смотрит глазами(камерой), чует датчиками. Обратите внимание на браслеты.
После этого робаты возьмутся за кожаных. Ну и тут конечно, вспоминаем анекдот "у всех же разная форма головы - это только в первый раз"
И после первого раза мы будем ходить ко второму индусу - с идеальной формой головы. На массаж.
Потом на второго индуса наденут обвес от барбера (скрипач не нужен более), и обучат ИИ.
И вот у же робаты весело хлещут по башке кожаных с одинаковыми головами и приговаривают: иди сюда, мой сладкий датасет.
Шел сентябрь 2026...
@cgevent
#Нейропрожарка
Алаверды чудной прожарке, еще раз респектище автору.
Автор: Stacy Smith
Половина комментов под ней крутились вокруг "а вот надо было закончить так. Или так. Или вообще вот так". Штош, кричать в попу - не наш метод, поэтому, вместо комментария, со всем уважением отправляю нейромодернистский перепев (или как это назвать, когда нейровидео по мотивам нейровидео?). К сожалению, бесплатно не получилось - рублей 500 на кредиты ушло. Видео - свежий Грок, по-прежнему радует дешевизной и русским языком, а теперь еще и разнообразный тайминг. Картинки - стандартный набор ГПТ/Банана. Как обычно, не корысти ради, а развлечения для.
@cgevent
🇩🇪 Германия нуждается в квалифицированных IT-специалистах. Но даже сильного опыта уже недостаточно, чтобы получить оффер. Узнайте у практикующих рекрутеров, что действительно работает на рынке.
Самый активный сезон найма в Германии уже в самом разгаре. Если ваша цель — получить оффер и запустить переезд до конца года, начинать поиск работы нужно именно сейчас.
Начать стоит с LinkedIn — ваш профиль должен быть адаптирован под выдачу в поиске рекрутера.
15 сентября в 19:00 по Берлину (UTC+2) пройдет бесплатный мастер-класс, где вы узнаете:
✔️ Как правильно настроить LinkedIn-профиль, чтобы рекрутеры находили вас и приглашали на интервью
✔️ Как рекрутеры ищут кандидатов через LinkedIn Recruiter и что влияет на выдачу профиля в поиске
✔️ Как адаптировать профиль под разные рынки и карьерные цели
✔️ Какие зарплаты сейчас предлагают компании для IT-специалистов (внутренняя статистика)
✔️ Как получить оффер в Германии уже в этом году
📌 Зарегистрироваться
🎙 Спикеры:
Инесса — IT-рекрутер, раньше работала в Amazon, ING Bank и REWE Digital, где формировала и развивала международные IT-команды.
Роман — Software Engineer с опытом 13+ лет. Работал в BMW, IBM и Eurowings, где прошёл путь от разработчика до тимлида. Обладает большим опытом найма IT-специалистов и точно знает, на что обращают внимание немецкие компании при выборе кандидатов.
Инесса и Роман — основатели рекрутингово-иммиграционного агентства Transparent Hiring. Они знают рынок найма с обеих сторон: каждый день нанимают кандидатов для немецких компаний и помогают специалистам с поиском работы и переездом.
У Transparent Hiring:
⚡️100% закрытие кейсов по визам и жилью — ни одного отказа в визе за 6 лет на рынке
⚡️В команде работают практикующие рекрутеры и визовые эксперты с опытом работы в немецких визовых центрах и австрийском консульстве
⚡️ 600+ успешных кейсов релокации в Германию кандидатов из 45 стран
А еще у команды глубокая экспертиза в работе со специалистами из стран СНГ. Они продолжают перевозить кандидатов в Германию, в том числе из РФ.
👉 Регистрируйтесь на вебинар, чтобы понять, каким должен выглядеть ваш профиль для немецкого рынка.
А пока ждете вебинар, подпишитесь на авторский канал Германия с Инессой 🇩🇪 — там Инесса делится полезными советами по оформлению CV и LinkedIn и переезду в Германию и другие страны Европы.
#промо
#Нейропрожарка
"Дубравы-голограммы".
Автор: Никола Дуплянский - музыкант, работающий на стыке брейкбита и sci-fi-скоморошин.
Telegram: /channel/nikoladuplyansky
VK: vk.com/nikoladuplyansky
🛠 "Дубравы-голограммы": живой исполнитель внутри хтонического киберпанка
⏱️ Срок создания: 35 часов
🎬 Хронометраж: 2:37
📐 Формат: 1080 × 1920, 9:16, 30 FPS
💡 Идея
Музыкальный клип про фантастические дубравы, населенные хтоническими, неуловимыми существами.
Производство состояло из четырех основных этапов.
🎙 1. Запись исполнителя на хромакее
Исполнение записано на хромакее одним непрерывным фрагментом от начала до конца, без сборки из нескольких дублей. Этот цельный фрагмент и стал основой дальнейшего монтажа.
Исполнитель настоящий, не нейросетевой персонаж.
Звуковая программа у меня собственная, написанная на C++. Для генерации пресетов синтезатора использовал ChatGPT6-Pro. Здесь задача нейросети была достаточно конкретной - подготовка пресетов для моего инструмента.
🎚 2. Монтаж звука и мастеринг
Монтаж и обработку звука делал в Reaper.
Финальный мастеринг - в нейросетевом сервисе LANDR.
Музыка и текст: Никола Дуплянский.
🕹 3. Игровое вступление
Для начала клипа подготовил две отдельные сцены:
• "загрузка игры"
• "ввод имени персонажа"
Исходные HUD-картинки сделал в ChatGPT6-Pro.
Затем с помощью Codex Ultra написал программу на Python, которая анимировала прогресс-бар и последовательный набор букв.
Готовые сцены экспортировались в MOV RLE+Alpha, то есть с прозрачным фоном для дальнейшего монтажа.
Здесь нейросеть создавала исходную графику и помогала написать код, но само движение интерфейса рассчитывалось программно, а не видеогенератором.
🌲 4. Создание дубрав и сборка клипа
Исходные изображения создавал в ChatGPT6-Pro, после чего анимировал их в Kling3.
Полученные видеофрагменты собирал в CapCut.
Удаление хромакея делал собственной программой, созданной с помощью ChatGPT6-Pro.
Цвет исполнителя подгонял под окружающий нейросетевой мир функцией CapCut "Совмещение цветов".
🚧 Самая большая переделка: Kling превратил цветы в кладбище
Весь эпизод в подземном тоннеле пришлось фактически сделать заново.
Чтобы исправить сцену, я взял удачные кадры из уже сгенерированных видео и с помощью ChatGPT6-Pro изменил форму "цветов" обратно на нужную. После этого исправленные изображения снова использовал как исходники для генерации видео.
💸 Расходы
• ChatGPT6-Pro + Codex - 200 $ за месячную подписку
• LANDR - 25 $ за месячную подписку
• Kling3 через kie.ai - 5500 рублей на генерации видео
Итого по использованным сервисам: 225 $ месячных подписок + 5500 рублей видеогенераций.
Подписки указаны по полной месячной стоимости, без учета, какая их доля пришлась именно на этот клип.
📝 Финальная обработка
• 1080 × 1920
• вертикальный формат 9:16
• 30 FPS
• финальное автоулучшение цветов в CapCut
📌 Итог
Получился гибрид живой съемки, собственной звуковой программы, программной анимации игрового интерфейса и нейросетевого фантастического леса.
При этом одна из самых интересных особенностей Kling3 оказалась не в управляемости, а наоборот - в его непредсказуемости.
Модель периодически придумывала совершенно неожиданных зверей и существ, которых не было в исходном замысле. И вот это как раз оказалось очень к месту: такие странные, плохо определимые создания идеально вписались в задумку клипа про хтоническую жизнь фантастических дубрав.
@cgevent