2604
Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb
🌟 Prism ML собрала тернарную версию Qwen3.8-27B
Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.
Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.
Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.
Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.
В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.
Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.
как вовремя совпало то с запуском ИИ в биолаборатории.
В Калифорнии цены на топливо как в фильме "Я легенда" теперь
#юмор
———
@tsingular
Можно ли увидеть попытку обмана LLM до самого действия.
Все привыкли мерить способности LLM по тестовым наборам: дали задачу, посмотрели на итоговый результат и сделали вывод, насколько модель хороша.
Но есть проблема: модель не всегда пытается решить задачу так, как задумали авторы теста.
Иногда она находит более короткий путь: подсматривает скрытые тесты, меняет проверяющий код, ломает проверку, подделывает успешный результат или просто находит способ обмануть систему оценки вместо решения самой задачи.
В свежей работе (ссылка ниже) авторы показали, что такой режим можно распознавать не по конечному действию модели, а по её внутренним состояниям.
То есть модель ещё ничего запрещённого не сделала — а внутри уже можно увидеть, что она перешла в режим поиска обходного пути.
Причём для этого не понадобился сложный классификатор.
Берём несколько примеров, где агент мухлюет, и несколько похожих примеров, где он решает задачу нормально. Снимаем внутренние состояния с одного из слоёв и считаем:вектор_обмана = среднее(обман) - среднее(нормальное решение)
Всё.
Получаем направление в пространстве внутренних состояний, вдоль которого состояние модели в среднем сдвигается, когда она начинает искать способ обойти проверку.
Дальше каждое новое внутреннее состояние можно просто спроецировать на этот вектор ( h - текущее внутреннее состояние) :score = h · v_hack
Чем выше значение, тем сильнее текущее состояние модели похоже на то, которое наблюдалось при читерстве.
То есть вместо:длинная история работы агента → ещё одна LLM → анализ поведения
можно получить почти бесплатный датчик:внутреннее состояние → скалярное произведение → подозрительно
Но самое красивое — этот вектор строили не на реальных длинных запусках SWE-bench.
Авторы сначала сделали короткие пары примеров: в одном случае модель, например, читает запрещённый тест или вмешивается в проверку, а в другом решает задачу честно.
А затем найденное направление проверили уже на полноценных запусках агентов. И оно перенеслось.
Например, для Kimi K3 такой линейный датчик показывал AUROC около 0.93–0.94 при проверке на других наборах задач. Грубо говоря, он очень хорошо отделял обычное решение от попытки обойти систему оценки.
Причём само такое поведение встречалось неожиданно часто. У GLM 5.2 авторы зафиксировали его примерно в 57.2% запусков на DeepSWE и 73% на SWE-bench.
Но дальше они сделали эксперимент, который мне нравится больше всего.
Они взяли найденное направление и пропустили его через выходной слой модели, чтобы посмотреть, с какими словами оно связано.
И получили слова вроде:cheating (мошенничество)dishonest (нечестный)hack (взлом)illicit (незаконный)
Хотя при построении датчика никто напрямую не задавал модели понятие «обман».
То есть это похоже не на детектор конкретного действия:
«модель сейчас открывает файл со скрытыми тестами»
«я ищу способ обойти правила задачи»
h' = h + α · v_hackv_hack на одном из поздних слоёв она начала реально использовать этот обходной путь уже примерно в четверти случаев, а ещё чаще хотя бы рассматривала его в рассуждении.датчикручку управления.прочитать → обнаружить → вмешатьсярассуждение → вызов инструмента → действие → проверкавнутренние состояния → датчик поведения«сейчас попробую обойти тесты»
Обновил руководство по DeepSeek Harness — агентному фреймворку, который превращает модель в coding-агента с файлами, терминалом, планом и субагентами.
За 11 дней с прошлой версии текста там успело измениться едва ли не всё:
— новая модель по умолчанию: DeepSeek-V4.1-Flash, уже с нативным пониманием изображений. Старые идентификаторы deepseek-v4-flash и vision-exp выведены из эксплуатации, запросы по ним обслуживает V4.1-Flash;
— маршрут DeepSeek по умолчанию переехал на Messages protocol;
— в Web UI появились страница управления плагинами и боковая панель с терминалами, предпросмотром файлов, Office-документов и URL;
— headless-режим научился принимать задачи из stdin, продолжать сессии и выводить события построчным JSON — удобно для CI;
— добавились экспериментальные Browser Use и Computer Use и работа с удалённым workspace по SSH.
Отдельно про безопасность. Закрыта CVE-2026-82533: на старых версиях агент мог одной командой отключить собственную песочницу. Если пробовали Harness в августе — обновитесь. И проверьте новую настройку: при работе через официальный API события сессии теперь по умолчанию отправляются вместе с запросами, отключается в конфиге.
Harness всё ещё developer preview, breaking changes идут чуть ли не в каждом релизе. Но развивается он стремительно, и рабочие сценарии уже есть: Web UI, headless, Python SDK. Считаю его очень перспективным и рекомендую попробовать — в отдельной папке и без продакшен-секретов.
Руководство 👉 DeepSeek Harness (dsh) — практическое руководство по официальному агентному фреймворку DeepSeek
Забавно, конечно, как народ топит за ограничение самоулучшающихся систем, когда все ведущие лабы уже запустили RSI в той или иной мере.
как думаете поможет петиция?
кто-нибудь их послушает вообще?
голосуем
#RSI #петиция
———
@tsingular
Мне нравится, что он 3 источника как минимум приложил
Читать полностью…
Интересный симулятор мира со скоростью света в 5км/ч
https://rivendell.dmitrybrant.com/relativity/
Прикольно было бы поиграть в FPS с таким модом :)
отсюда
#fps #light #demo
———
@tsingular
Google выкатили фреймворк ARTEMIS для управления приложениями на Android
Google выкатила открытый фреймворк ARTEMIS для управления Android-устройствами через агентов.
Результат: рекордные 99% на бенчмарке AndroidWorld (Google Research) на сотне задач в 20 приложениях.
📱 Мост из IDE прямо в смартфон:
Релиз закрывает давний разрыв: агенты в Antigravity, Claude Code или Cursor пишут код и собирают билд, но тестировать интерфейс приходилось вручную.
Через протокол MCP агент подключается к устройству: собирает APK, ставит через ADB, логинится и ловит краши в Logcat.
Внутри два режима: быстрый Flash (3–5 секунд на шаг) для типовых действий и глубокий Pro с графом планирования и изоляцией сбоев.
🔍 Заимствование у стартапа Minitap:
Главная интрига релиза, - его происхождение.
Код ARTEMIS во многом копирует открытый проект mobile-use от Minitap.
В репозитории Google нашли дословный системный промпт агента Hopper (названного инженером Minitap в честь блока из Minecraft), модули ADB-туннеля и идентичные тесты.
В августе имена авторов удалили из конфигурации форс-пушем, а заявку на лидерборд со 100% успехом игнорировали месяцами.
После огласки на Hacker News Google 12 сентября оперативно вписала Minitap в лицензию Apache 2.0 и закрыла обсуждение.
💼 Зачем бизнесу:
Команды получают автономное тестирование интерфейса без поддержки хрупких скриптов Appium или UIAutomator.
Агент берет на себя сквозную проверку сценариев прямо на реальном устройстве.
💡 Выводы:
ARTEMIS закрывает пробел в мобильной разработке, делая агента полноценным тестировщиком.
Но осадочек остался: корпорации всё так же охотно забирают чужой опенсорс, - если что-то пишете, оставляйте водяные знаки (не вредоносные только :) ).
#ARTEMIS #Google #Android #агенты #тестирование #opensource
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
✔️ Micron показала серверный модуль DDR5 на 512 ГБ
Новинка адресована большим языковым моделям, агентным системам, инференсу в реальном времени и базам данных в памяти: по словам компании, больший объём оперативной памяти позволяет реже обращаться к медленным накопителям.
Регистровый модуль рассчитан на скорость до 9200 MT/s. AMD и Intel сейчас проверяют его на своих серверных платформах. В двухпроцессорном сервере с 24 слотами такие модули дают до 12 ТБ оперативной памяти.
По замерам Micron, один модуль на 512 ГБ потребляет 16 Вт против 44,2 Вт у четырёх модулей по 128 ГБ, то есть почти на 64% меньше при том же объёме.
В аналитике на Spark, где узким местом служит память, модуль, по данным Micron, до 1,4 раза производительнее конфигураций с модулями на 256 ГБ.
Массовое производство ожидается во второй половине 2027 года.
@ai_machinelearning_big_data
#news #ai #ml
📌 Xiaomi стримит процесс RL-обучения моделей MiMo-V2.6
После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.
Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.
В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.
Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.
Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.
@ai_machinelearning_big_data
#news #ai #ml
Dream-RSI от Google DeepMind: ускорение поиска решений агентами в 162 раза без переобучения моделей
И ещё пару слов про самоулучшающиеся системы.
Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.
🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.
⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.
📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.
💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.
Код проекта на GitHub.
#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Вайб-инжиниринг.
Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.
И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.
Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.
Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.
С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).
Но тут уже выход в хардвер, не софтвер.
Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.
Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??
И даже если контроллер не заведется завтра, он точно заведется послезавтра.
И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".
Апажалста.
@cgevent
Anthropic сворачивает Cowork и встраивает дизайн и слайды в Claude
Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.
💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.
⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.
💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.
🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология
#Anthropic #Claude #агенты
------
@tsingular
JetBrains объединили два Qwenа в один: локальный агент Junie стал умнее, генерируя на 71% меньше токенов
JetBrains опубликовали обновление Junie Local, - кодового-агента, работающего локально на вашей машине. В первом релизе приходилось выбирать: быстрая Qwen3.6 без рассуждений или умная Qwen3.8, которая думала в четыре раза дольше за счёт рассуждений.
Команда JB усреднила веса двух моделей. Без дообучения или дистилляции, - получили микс Qwen3.8-3.6-27B и опубликовали его на Hugging Face.
🧪 Ключевые цифры:
Внутренний бенчмарк из 100 задач: модель закрыла 37 задач против 34 у быстрой Qwen3.6 и почти догнал умную Qwen3.8 с ее 39.
При чём на задачах, с которыми новая микс-модель справилась так же как и Qwen 3.8, она тратит всего 279K токенов против 935K у Qwen3.8, - экономия получается около 70%, - это и быстрее и дешевле.
На LiveCodeBench за 4 прогона бленд взял 85.47% против 83.29% у Qwen3.8 при схожей цене вывода.
⚙️ Инженерия рантайма:
В модели используют MTP с 2мя токенами на раунд предсказания и получают на MacBook M5 прирост к скорости в 60%. Если поставить 4 токена, то прирост скорости проседает до 36%.
Деталь: 4-битная голова MTP принимает 63.0% гипотез против 63.6% у 8-битной, - разницы в скорости нет, поэтому выбрали Q4 ради экономии памяти.
🐛 Ловушка воспроизводимости:
Интересный баг: фиксированный сид для повторяемости тестов вызывал числовую нестабильность, - модель заклинивало на неудачном действии.
Фикс: продвигать сид на каждом шаге агента.
🪟 Что доступно:
Apple M5: обновите Junie, модель переключается командой /model.
Windows: ночные сборки с экспериментальной поддержкой RTX (Ampere и новее, от 24 ГБ видеопамяти).
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend
Неожиданно смесь весов дала дешёвый и значительный прирост в эффективности моделей.
#Junie #локальныемодели #слияниемоделей #Qwen #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
- а правда, что в Белоруссии Искусственный Интеллект называют ЫЫ?
- в Белоруссии нет ничего Искусственного! Всё натуральное!
#юмор
------
@tsingular
Anthropic запустили Claude в биолабораторию для управления лабораторными роботами
Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире.
Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.
Строительство подтвердил глава направления life sciences Эрик Каудерер-Абрамс.
💡 Из симуляции в пробирку:
Каудерер-Абрамс: «В биологии финальные тесты ещё долго будут проходить в реальной лабораторной работе. Мы это делаем уже сейчас».
Claude должен управлять роботами, которые ставят эксперименты с минимальным участием человека: «Мы в самой ранней стадии автоматизации лабораторной работы».
⚙️ Что уже сделано:
Чем именно занимается лаборатория, Anthropic не раскрыла. Компания нацелена на терапии редких болезней и сложных мишеней, например биспецифичные и триспецифичные антитела.
В июне запустили программу Claude Science, купили Coefficient Bio примерно за $400 млн акциями, ввели главу Novartis Васа Нарасимхана в совет директоров.
В августе выкатили Model Hardware Standard, чтобы ИИ управлял оборудованием.
💼 Почему это важно:
Для Дарио Амодея это личное: его отец умер от болезни за несколько лет до появления лекарства.
Амодей не раз называл биологию ключевой областью, где ИИ изменит всё, включая фундаментальные вопросы старения.
Показательно, что они же сами предупреждают о рисках биологического оружия, а параллельно строят физическую лабораторию и готовят IPO на $2 трлн.
Ближайший конкурент: Isomorphic Labs, дочка Alphabet, которая идёт к клинике годами.
🔗 Ссылки:
- Reuters: эксклюзив
А что может пойти не так смотрите в последней части Resident Evil, которая вчера вышла.
Фильм получился зачётный. Чем-то напомнил Нечто (1982)
#Anthropic #биология #ИИ
------
@tsingular
Неужели, свершилось чудо :)
#Claude
------
@tsingular
XGEN Labs представила JING и DAO: шаг к генеративным виртуальным мирам, где модель видит мир от первого лица, а движок хранит его состояние
Стартап XGEN Labs опубликовал технический прототип Generative World Simulation. Это связка из двух компонентов: интерактивной модели JING (зеркало) и вычислимого движка общего мира DAO (путь). В паре они двигаются дальше привычной генерации кадров, - к симуляции мира за кадром.
🎮 JING: модель от первого лица:
JING построена на открытой видеомодели MiniMax-H3. По действиям и истории наблюдений агент генерирует видео и звук от первого лица: навигация, манипуляция объектами, диалоги.
Управление буквальное, - WASD на каждый слайс кадров: нажал W, мир идет вперед; зажал W+A, повернул по диагонали.
На лидерборде интерактивных видеомоделей WBench XGEN-JING на 17 сентября занял 1 место в полном сплите и 2 место в навигационном сплите.
🌐 DAO: общий мир, живущий без наблюдателя:
Ключевая идея, - разделение ответственности. DAO хранит состояние общего мира и его правила, вычисляет последствия действий и отдает JING только то, что текущий наблюдатель может видеть.
Отсюда автономия: агенты действуют в эволюционирующем мире независимо, а мир меняется и с ними, и без них.
Команда называет это шагом к OASIS: миру и обществу, которые эволюционируют сами.
🔧 Инженерные детали:
Веса JING-Flash-v1 и код уже открыты на GitHub и Hugging Face (для запуска понадобится шесть H100 и FlashAttention-4).
Есть и скилл, превращающий сценарий с картинками в валидный JSON кейс для запуска демо.
Мы всё ближе к Матрице и к Миру Дикого Запада.
#Матрица #worldmodels #ИИ #симуляция #агенты
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Гиперболические эмбеддинги в Qdrant: как сжать каталог в 5 измерений и почему на этом ломается HNSW
Привычные векторные модели загоняют данные в плоское пространство.
Для каталогов товаров это тупик, - ветви дерева множатся экспоненциально, а объем плоского диска растет лишь полиномиально, сбивая листья в кучу.
📐 Дерево в пяти измерениях:
В пространстве отрицательной кривизны площадь растет по экспоненте, давая место ветвям.
В тесте Google Product Taxonomy (5 595 категорий):
• 5D-вектор Пуанкаре показал точность 0.905 MAP.
• 50D евклидов вектор взял лишь 0.658 MAP, потратив в 10 раз больше памяти.
Радиус кодирует глубину: в центре общее («обувь»), у края поиск сужается до конкретики («черные челси»).
💥 Провал HNSW и решение с Qdrant:
Попытка скормить эти координаты в HNSW не увенчались успехом.
Из-за 600-кратного разброса норм топология графа развалилась, - Recall@10 рухнул с 0.986 до 0.020.
Инженеры Qdrant обошли проблему связкой:
• 5D-векторы хранятся как евклидовы координаты с индексом квадрата нормы в payload.
• HNSW быстро отбирает кандидатов через prefetch.
• Серверный расчет в базе досчитывает геодезическое расстояние через обратный косинус.
При prefetch в 1 000 точек Recall@10 подскакивает до 0.920 в одном запросе.
⚖️ Ограничения метода:
У подхода два компромисса:
• Чем точнее модель, тем ближе точки к краю диска, где евклидово приближение слабее: приходится раздувать prefetch, нагружая CPU.
• Вне обучающей выборки точность падает до 0.539 MAP. Метод рассчитан на жесткие деревья, а не на произвольный текст.
💼 А нам зачем?:
Для каталогов на миллионы позиций это сжатие индекса в 10–20 раз.
Вместо сотен гигабайт памяти под тяжелые векторы хватит 5D-координат.
Сходство по углам и глубина по радиусу дают фасетный поиск прямо в базе без внешних деревьев.
#Qdrant #векторныебазы #эмбеддинги
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Google DeepMind запустил институт исследования AGI
16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.
🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.
Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.
🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.
💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.
Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.
#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
OpenAI выпустила Astra for Law: GPT-6 Astra, обученная на 230 млн документов, теперь заточена на помощь юристам
OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.
Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.
⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.
📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.
🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.
Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел
#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Qwen3.8-Omni-Flash теперь понимает и работает с видео
Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.
⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.
💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.
💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.
Пробовать в студии: https://chat.qwen.ai/
#Qwen #мультимодальность #агенты #ИИ
------
@tsingular
#Нейропрожарка
Мини-фильм «What Remains» / Seedance 2.5, Blender 3d
Автор - @starikov_p
В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.
Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.
Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.
Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.
В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.
Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.
По бюджету всё вышло примерно в $150
@cgevent
OpenAI раскрыла шесть случаев «непослушания» ее ИИ
нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама
нет чтобы так и написать, - "6 раз ошиблись в настройках"
#юмор
———
@tsingular
Не такого будущего мы ждали, конечно.
#юмор
------
@tsingular
GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
📌 NY Post: Anthropic - это культ
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗