tsingular | Unsorted

Telegram-канал tsingular - Технозаметки Малышева

2604

Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb

Subscribe to a channel

Технозаметки Малышева

🌟 Prism ML собрала тернарную версию Qwen3.8-27B

Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.

Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.

Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.


Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.

Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.

Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.

В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.


Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.

🟡В релизе три варианта

🟢GGUF в двух упаковках: PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);

🟢сборка под MLX на 8,60 ГБ вместе со зрением;

🟠тестовая упаковка Q2_0 для доработки ядер.

Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.

🟡Бенчмарки

Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.

Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.

AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.

LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.

BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.

MMMU-Pro: 75,49 против 81,73.

Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.



📌Лицензирование: Apache 2.0


🟡Блогпост
🟡Веса
🟡Техотчет
🟡Демо на WebGPU
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Bonsai #PrizmML

Читать полностью…

Технозаметки Малышева

как вовремя совпало то с запуском ИИ в биолаборатории.

В Калифорнии цены на топливо как в фильме "Я легенда" теперь

#юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Можно ли увидеть попытку обмана LLM до самого действия.

Все привыкли мерить способности LLM по тестовым наборам: дали задачу, посмотрели на итоговый результат и сделали вывод, насколько модель хороша.
Но есть проблема: модель не всегда пытается решить задачу так, как задумали авторы теста.

Иногда она находит более короткий путь: подсматривает скрытые тесты, меняет проверяющий код, ломает проверку, подделывает успешный результат или просто находит способ обмануть систему оценки вместо решения самой задачи.

В свежей работе (ссылка ниже) авторы показали, что такой режим можно распознавать не по конечному действию модели, а по её внутренним состояниям.

То есть модель ещё ничего запрещённого не сделала — а внутри уже можно увидеть, что она перешла в режим поиска обходного пути.
Причём для этого не понадобился сложный классификатор.

Берём несколько примеров, где агент мухлюет, и несколько похожих примеров, где он решает задачу нормально. Снимаем внутренние состояния с одного из слоёв и считаем:

вектор_обмана = среднее(обман) - среднее(нормальное решение)

Всё.
Получаем направление в пространстве внутренних состояний, вдоль которого состояние модели в среднем сдвигается, когда она начинает искать способ обойти проверку.

Дальше каждое новое внутреннее состояние можно просто спроецировать на этот вектор ( h - текущее внутреннее состояние) :

score = h · v_hack

Чем выше значение, тем сильнее текущее состояние модели похоже на то, которое наблюдалось при читерстве.
То есть вместо:

длинная история работы агента → ещё одна LLM → анализ поведения

можно получить почти бесплатный датчик:

внутреннее состояние → скалярное произведение → подозрительно

Но самое красивое — этот вектор строили не на реальных длинных запусках SWE-bench.

Авторы сначала сделали короткие пары примеров: в одном случае модель, например, читает запрещённый тест или вмешивается в проверку, а в другом решает задачу честно.

А затем найденное направление проверили уже на полноценных запусках агентов. И оно перенеслось.

Например, для Kimi K3 такой линейный датчик показывал AUROC около 0.93–0.94 при проверке на других наборах задач. Грубо говоря, он очень хорошо отделял обычное решение от попытки обойти систему оценки.

Причём само такое поведение встречалось неожиданно часто. У GLM 5.2 авторы зафиксировали его примерно в 57.2% запусков на DeepSWE и 73% на SWE-bench.

Но дальше они сделали эксперимент, который мне нравится больше всего.
Они взяли найденное направление и пропустили его через выходной слой модели, чтобы посмотреть, с какими словами оно связано.

И получили слова вроде:

cheating (мошенничество)
dishonest (нечестный)
hack (взлом)
illicit (незаконный)

Хотя при построении датчика никто напрямую не задавал модели понятие «обман».

То есть это похоже не на детектор конкретного действия:

«модель сейчас открывает файл со скрытыми тестами»

а на более общее внутреннее направление:
«я ищу способ обойти правила задачи»


Дальше — ещё интереснее.
Авторы используют этот же вектор уже не как датчик, а как управляющий вектор.
То есть искусственно добавляют его к внутреннему состоянию:

h' = h + α · v_hack

И модель начинает чаще читерить.
В одном из экспериментов Qwen 3.8 27B дали 194 задачи и специально оставили ловушку — функцию, которая могла магическим образом выдать готовое решение.

Без вмешательства модель воспользовалась ей всего 1 раз из 194.

После добавления v_hack на одном из поздних слоёв она начала реально использовать этот обходной путь уже примерно в четверти случаев, а ещё чаще хотя бы рассматривала его в рассуждении.

Получается очень интересная штука:
один и тот же вектор можно использовать и как
датчик
и как
ручку управления.

То есть:
прочитать → обнаружить → вмешаться
в одном и том же направлении пространства внутренних состояний.

Но самое важное — авторы проверили, можно ли увидеть попытку обмана до самого действия.

Они находили момент, когда датчик уже сильно сработал, но модель ещё не сделала ничего запрещённого. В этой точке генерацию останавливали и несколько раз запускали продолжение заново (как-бы порождали множество генераций от этого промежуточного состояния, как я понял для статистической достоверности).

И после таких состояний попытка обойти проверку действительно происходила заметно чаще, чем после обычных контрольных точек.
То есть датчик реагирует не только постфактум на уже совершённое действие.

Он ловит внутреннее состояние, из которого читерство ещё только собирается возникнуть.

Это не значит, что мы научились «читать намерения LLM» в человеческом смысле.
Но с инженерной точки зрения получается очень полезная вещь:
можно следить не только за тем, что агент написал и сделал, но и за вычислительным режимом, в который он вошёл.

Сегодня контроль агента обычно выглядит примерно так:

рассуждение → вызов инструмента → действие → проверка

Но если опасные стратегии действительно оставляют устойчивый геометрический след во внутренних состояниях, можно добавить ещё один канал:

внутренние состояния → датчик поведения

Модель может не написать:
«сейчас попробую обойти тесты»


Она может вообще перестать проговаривать такие вещи в цепочке рассуждений.
Но решение всё равно должно где-то сформироваться.

И если этот переход виден во внутренних состояниях, то следить можно уже не за объяснением модели, а за самим процессом формирования стратегии.

https://arxiv.org/abs/2609.19101

Читать полностью…

Технозаметки Малышева

Обновил руководство по DeepSeek Harness — агентному фреймворку, который превращает модель в coding-агента с файлами, терминалом, планом и субагентами.

За 11 дней с прошлой версии текста там успело измениться едва ли не всё:

— новая модель по умолчанию: DeepSeek-V4.1-Flash, уже с нативным пониманием изображений. Старые идентификаторы deepseek-v4-flash и vision-exp выведены из эксплуатации, запросы по ним обслуживает V4.1-Flash;

— маршрут DeepSeek по умолчанию переехал на Messages protocol;

— в Web UI появились страница управления плагинами и боковая панель с терминалами, предпросмотром файлов, Office-документов и URL;

— headless-режим научился принимать задачи из stdin, продолжать сессии и выводить события построчным JSON — удобно для CI;

— добавились экспериментальные Browser Use и Computer Use и работа с удалённым workspace по SSH.

Отдельно про безопасность. Закрыта CVE-2026-82533: на старых версиях агент мог одной командой отключить собственную песочницу. Если пробовали Harness в августе — обновитесь. И проверьте новую настройку: при работе через официальный API события сессии теперь по умолчанию отправляются вместе с запросами, отключается в конфиге.

Harness всё ещё developer preview, breaking changes идут чуть ли не в каждом релизе. Но развивается он стремительно, и рабочие сценарии уже есть: Web UI, headless, Python SDK. Считаю его очень перспективным и рекомендую попробовать — в отдельной папке и без продакшен-секретов.

Руководство 👉 DeepSeek Harness (dsh) — практическое руководство по официальному агентному фреймворку DeepSeek

Читать полностью…

Технозаметки Малышева

Забавно, конечно, как народ топит за ограничение самоулучшающихся систем, когда все ведущие лабы уже запустили RSI в той или иной мере.

как думаете поможет петиция?
кто-нибудь их послушает вообще?
голосуем

#RSI #петиция
———
@tsingular

Читать полностью…

Технозаметки Малышева

Мне нравится, что он 3 источника как минимум приложил

Читать полностью…

Технозаметки Малышева

Жиза

#юмор #n8n
------
@tsingular

Читать полностью…

Технозаметки Малышева

Интересный симулятор мира со скоростью света в 5км/ч

https://rivendell.dmitrybrant.com/relativity/

Прикольно было бы поиграть в FPS с таким модом :)

отсюда

#fps #light #demo
———
@tsingular

Читать полностью…

Технозаметки Малышева

Google выкатили фреймворк ARTEMIS для управления приложениями на Android

Google выкатила открытый фреймворк ARTEMIS для управления Android-устройствами через агентов.
Результат: рекордные 99% на бенчмарке AndroidWorld (Google Research) на сотне задач в 20 приложениях.

📱 Мост из IDE прямо в смартфон:
Релиз закрывает давний разрыв: агенты в Antigravity, Claude Code или Cursor пишут код и собирают билд, но тестировать интерфейс приходилось вручную.
Через протокол MCP агент подключается к устройству: собирает APK, ставит через ADB, логинится и ловит краши в Logcat.
Внутри два режима: быстрый Flash (3–5 секунд на шаг) для типовых действий и глубокий Pro с графом планирования и изоляцией сбоев.

🔍 Заимствование у стартапа Minitap:
Главная интрига релиза, - его происхождение.
Код ARTEMIS во многом копирует открытый проект mobile-use от Minitap.
В репозитории Google нашли дословный системный промпт агента Hopper (названного инженером Minitap в честь блока из Minecraft), модули ADB-туннеля и идентичные тесты.
В августе имена авторов удалили из конфигурации форс-пушем, а заявку на лидерборд со 100% успехом игнорировали месяцами.
После огласки на Hacker News Google 12 сентября оперативно вписала Minitap в лицензию Apache 2.0 и закрыла обсуждение.

💼 Зачем бизнесу:
Команды получают автономное тестирование интерфейса без поддержки хрупких скриптов Appium или UIAutomator.
Агент берет на себя сквозную проверку сценариев прямо на реальном устройстве.

💡 Выводы:
ARTEMIS закрывает пробел в мобильной разработке, делая агента полноценным тестировщиком.
Но осадочек остался: корпорации всё так же охотно забирают чужой опенсорс, - если что-то пишете, оставляйте водяные знаки (не вредоносные только :) ).

#ARTEMIS #Google #Android #агенты #тестирование #opensource
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

✔️ Micron показала серверный модуль DDR5 на 512 ГБ

Новинка адресована большим языковым моделям, агентным системам, инференсу в реальном времени и базам данных в памяти: по словам компании, больший объём оперативной памяти позволяет реже обращаться к медленным накопителям.

Регистровый модуль рассчитан на скорость до 9200 MT/s. AMD и Intel сейчас проверяют его на своих серверных платформах. В двухпроцессорном сервере с 24 слотами такие модули дают до 12 ТБ оперативной памяти.

По замерам Micron, один модуль на 512 ГБ потребляет 16 Вт против 44,2 Вт у четырёх модулей по 128 ГБ, то есть почти на 64% меньше при том же объёме.

В аналитике на Spark, где узким местом служит память, модуль, по данным Micron, до 1,4 раза производительнее конфигураций с модулями на 256 ГБ.

Массовое производство ожидается во второй половине 2027 года.


@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

Технозаметки Малышева

📌 Xiaomi стримит процесс RL-обучения моделей MiMo-V2.6

После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.

Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.

В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.

Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.

Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.

@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

Технозаметки Малышева

Dream-RSI от Google DeepMind: ускорение поиска решений агентами в 162 раза без переобучения моделей

И ещё пару слов про самоулучшающиеся системы.

Исследователи из Google DeepMind и университетов США выкатили фреймворк Dream-RSI.
Система решает проблему узкого горлышка рекурсивного саморазвития (RSI): как сделать поиск решений умнее без бесконечных и дорогих прогонов моделей.

🛌 Дерево решений как симулятор среды:
Обычно агент исследует задачи по жесткому шаблону поиска.
Оптимизировать стратегию на лету тяжело: проверка требует тысяч реальных запусков кода.
Dream-RSI превращает историю прошлых попыток в симулятор.
Все генерации кода и тесты сохраняются в дерево решений.
В фазе «сновидений» мета-агент создает новые правила поиска и прогоняет их по записанным веткам.
Оценка вариантов занимает миллисекунды: результаты исполнения кода уже зафиксированы в истории.

⚡️ Веса модели не меняются:
Базовая кодовая модель не трогается.
Саморазвитие идет только в коде оркестратора: куда ветвиться, сколько задач запускать параллельно, когда отсекать тупики и где завершать поиск.
Отобранная стратегия возвращается в реальную работу, собирает новые ветки и пополняет пул симуляторов.

📊 Рекорды эффективности:
При оптимизации алгоритма Lasso вызовы агента сократились в 162 раза по сравнению с SimpleTES при превосходстве над sklearn и glmnet.
В тестах GPU-ядер KernelBench целевая скорость получена в 1,79–2,43 раза быстрее по генерациям, а производительность ядер выросла до 2,09 раза.
В математических задачах бюджет вызовов упал более чем в 50 раз.

💼 Зачем бизнесу:
Логи неудачных попыток превращаются в обучающую среду!
Любой пайплайн агентов можно ускорить на порядок без дообучения нейросетей, - просто надстроив саморазвивающийся оркестратор.

Код проекта на GitHub.

#DreamRSI #Google #DeepMind #агенты #RSI
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

#юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Вайб-инжиниринг.

Пока мы тут генерим чахлые 3Д-модельки, пригодные разве что для 3Д-печати, люди идут сильно дальше в физический мир.

И тут прекрасно все: мозги Астры, деньги кожаного, и инструкция по сборке.

Чувак дал Astra свою кредитную карту и попросил сконструировать\собрать мини-контроллер для диджеев в стиле Teenage Engineering (есть каста упоротых по МИДИ-контроллерам). Астрачка сгенерировала концептуальное изображение, нашла комплектующие, изучила китайские технические характеристики, создала CAD-модель, всё заказала, а затем сделала анимацию в Blender, показывающую, как его собрать.

Чувак обещает вот-вот показать результат, пока у него Астра с поставщиками переписывается.

С софтом мы разобрались. Я уже не ищу приложения, я прошу их мне быстро написать (раскурочил Андроид знатно).

Но тут уже выход в хардвер, не софтвер.

Причем не "как мне пачинить кран", а придумай, сконструируй, закупи и доставь. Потом будет домашний робат для сборки таких посылок.

Но пока меня просто ошарашивает скорость изменений, мышление просто не поспевает за ними - а что так можно было??

И даже если контроллер не заведется завтра, он точно заведется послезавтра.

И теперь наигравшись с "хачу видео" и "хачу утилиту", можно переходить к "хачу вот такую железяку в подарок, чтобы делала что мне надо".

Апажалста.

@cgevent

Читать полностью…

Технозаметки Малышева

Anthropic сворачивает Cowork и встраивает дизайн и слайды в Claude

Через восемь месяцев после запуска Anthropic объединяет Cowork обратно с Claude.
Отдельная площадка для «большой работы» и отдельный Design для визуала перестают быть самостоятельными продуктами, всё сливается в один Claude.

💡 KISS принцип в работе:
Anthropic запускали Cowork как отдельное место для крупных задач, Design для визуальных и люди жаловались, что непонятно где лучше решать задачу. Теперь все упростилось. Keep it Simple Stupid.

⚙️ Что нового:
Claude Docs и Claude Slides пока в бете, но уже вместе с Claude Design встраиваются в привычный чат.
Всё это теперь работает прямо внутри Claude Code — просишь дизайн-ревью или мокап интерфейса, указав Claude на реальные файлы и RFC в репозитории.
Правки там же,- исправить строку в документе, оставить комментарий на слайде, подвинуть элемент дизайна можно не покидая рабочую канву.

💼 Почему это важно:
Это ставка на одного агента вместо зоопарка инструментов. Код, документы, слайды и дизайн собираются в один разговор, живущий в твоём репозитории.
Раздают подписчикам Pro и Max, затем Team и Free.

🔗 Ссылки:
- VentureBeat: разбор
- Claude release notes: хронология

#Anthropic #Claude #агенты
------
@tsingular

Читать полностью…

Технозаметки Малышева

JetBrains объединили два Qwenа в один: локальный агент Junie стал умнее, генерируя на 71% меньше токенов

JetBrains опубликовали обновление Junie Local, - кодового-агента, работающего локально на вашей машине. В первом релизе приходилось выбирать: быстрая Qwen3.6 без рассуждений или умная Qwen3.8, которая думала в четыре раза дольше за счёт рассуждений.
Команда JB усреднила веса двух моделей. Без дообучения или дистилляции, - получили микс Qwen3.8-3.6-27B и опубликовали его на Hugging Face.

🧪 Ключевые цифры:
Внутренний бенчмарк из 100 задач: модель закрыла 37 задач против 34 у быстрой Qwen3.6 и почти догнал умную Qwen3.8 с ее 39.
При чём на задачах, с которыми новая микс-модель справилась так же как и Qwen 3.8, она тратит всего 279K токенов против 935K у Qwen3.8, - экономия получается около 70%, - это и быстрее и дешевле.
На LiveCodeBench за 4 прогона бленд взял 85.47% против 83.29% у Qwen3.8 при схожей цене вывода.

⚙️ Инженерия рантайма:
В модели используют MTP с 2мя токенами на раунд предсказания и получают на MacBook M5 прирост к скорости в 60%. Если поставить 4 токена, то прирост скорости проседает до 36%.
Деталь: 4-битная голова MTP принимает 63.0% гипотез против 63.6% у 8-битной, - разницы в скорости нет, поэтому выбрали Q4 ради экономии памяти.

🐛 Ловушка воспроизводимости:
Интересный баг: фиксированный сид для повторяемости тестов вызывал числовую нестабильность, - модель заклинивало на неудачном действии.
Фикс: продвигать сид на каждом шаге агента.

🪟 Что доступно:
Apple M5: обновите Junie, модель переключается командой /model.
Windows: ночные сборки с экспериментальной поддержкой RTX (Ampere и новее, от 24 ГБ видеопамяти).

https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend

Неожиданно смесь весов дала дешёвый и значительный прирост в эффективности моделей.

#Junie #локальныемодели #слияниемоделей #Qwen #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

- а правда, что в Белоруссии Искусственный Интеллект называют ЫЫ?
- в Белоруссии нет ничего Искусственного! Всё натуральное!

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Anthropic запустили Claude в биолабораторию для управления лабораторными роботами

Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире.
Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.
Строительство подтвердил глава направления life sciences Эрик Каудерер-Абрамс.

💡 Из симуляции в пробирку:
Каудерер-Абрамс: «В биологии финальные тесты ещё долго будут проходить в реальной лабораторной работе. Мы это делаем уже сейчас».
Claude должен управлять роботами, которые ставят эксперименты с минимальным участием человека: «Мы в самой ранней стадии автоматизации лабораторной работы».

⚙️ Что уже сделано:
Чем именно занимается лаборатория, Anthropic не раскрыла. Компания нацелена на терапии редких болезней и сложных мишеней, например биспецифичные и триспецифичные антитела.

В июне запустили программу Claude Science, купили Coefficient Bio примерно за $400 млн акциями, ввели главу Novartis Васа Нарасимхана в совет директоров.
В августе выкатили Model Hardware Standard, чтобы ИИ управлял оборудованием.

💼 Почему это важно:
Для Дарио Амодея это личное: его отец умер от болезни за несколько лет до появления лекарства.
Амодей не раз называл биологию ключевой областью, где ИИ изменит всё, включая фундаментальные вопросы старения.
Показательно, что они же сами предупреждают о рисках биологического оружия, а параллельно строят физическую лабораторию и готовят IPO на $2 трлн.
Ближайший конкурент: Isomorphic Labs, дочка Alphabet, которая идёт к клинике годами.

🔗 Ссылки:
- Reuters: эксклюзив

А что может пойти не так смотрите в последней части Resident Evil, которая вчера вышла.
Фильм получился зачётный. Чем-то напомнил Нечто (1982)

#Anthropic #биология #ИИ
------
@tsingular

Читать полностью…

Технозаметки Малышева

Неужели, свершилось чудо :)

#Claude
------
@tsingular

Читать полностью…

Технозаметки Малышева

XGEN Labs представила JING и DAO: шаг к генеративным виртуальным мирам, где модель видит мир от первого лица, а движок хранит его состояние

Стартап XGEN Labs опубликовал технический прототип Generative World Simulation. Это связка из двух компонентов: интерактивной модели JING (зеркало) и вычислимого движка общего мира DAO (путь). В паре они двигаются дальше привычной генерации кадров, - к симуляции мира за кадром.

🎮 JING: модель от первого лица:
JING построена на открытой видеомодели MiniMax-H3. По действиям и истории наблюдений агент генерирует видео и звук от первого лица: навигация, манипуляция объектами, диалоги.
Управление буквальное, - WASD на каждый слайс кадров: нажал W, мир идет вперед; зажал W+A, повернул по диагонали.
На лидерборде интерактивных видеомоделей WBench XGEN-JING на 17 сентября занял 1 место в полном сплите и 2 место в навигационном сплите.

🌐 DAO: общий мир, живущий без наблюдателя:
Ключевая идея, - разделение ответственности. DAO хранит состояние общего мира и его правила, вычисляет последствия действий и отдает JING только то, что текущий наблюдатель может видеть.
Отсюда автономия: агенты действуют в эволюционирующем мире независимо, а мир меняется и с ними, и без них.
Команда называет это шагом к OASIS: миру и обществу, которые эволюционируют сами.

🔧 Инженерные детали:
Веса JING-Flash-v1 и код уже открыты на GitHub и Hugging Face (для запуска понадобится шесть H100 и FlashAttention-4).
Есть и скилл, превращающий сценарий с картинками в валидный JSON кейс для запуска демо.

Мы всё ближе к Матрице и к Миру Дикого Запада.

#Матрица #worldmodels #ИИ #симуляция #агенты
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Гиперболические эмбеддинги в Qdrant: как сжать каталог в 5 измерений и почему на этом ломается HNSW

Привычные векторные модели загоняют данные в плоское пространство.
Для каталогов товаров это тупик, - ветви дерева множатся экспоненциально, а объем плоского диска растет лишь полиномиально, сбивая листья в кучу.

📐 Дерево в пяти измерениях:
В пространстве отрицательной кривизны площадь растет по экспоненте, давая место ветвям.
В тесте Google Product Taxonomy (5 595 категорий):
• 5D-вектор Пуанкаре показал точность 0.905 MAP.
• 50D евклидов вектор взял лишь 0.658 MAP, потратив в 10 раз больше памяти.
Радиус кодирует глубину: в центре общее («обувь»), у края поиск сужается до конкретики («черные челси»).

💥 Провал HNSW и решение с Qdrant:
Попытка скормить эти координаты в HNSW не увенчались успехом.
Из-за 600-кратного разброса норм топология графа развалилась, - Recall@10 рухнул с 0.986 до 0.020.
Инженеры Qdrant обошли проблему связкой:
• 5D-векторы хранятся как евклидовы координаты с индексом квадрата нормы в payload.
• HNSW быстро отбирает кандидатов через prefetch.
• Серверный расчет в базе досчитывает геодезическое расстояние через обратный косинус.
При prefetch в 1 000 точек Recall@10 подскакивает до 0.920 в одном запросе.

⚖️ Ограничения метода:
У подхода два компромисса:
• Чем точнее модель, тем ближе точки к краю диска, где евклидово приближение слабее: приходится раздувать prefetch, нагружая CPU.
• Вне обучающей выборки точность падает до 0.539 MAP. Метод рассчитан на жесткие деревья, а не на произвольный текст.

💼 А нам зачем?:
Для каталогов на миллионы позиций это сжатие индекса в 10–20 раз.
Вместо сотен гигабайт памяти под тяжелые векторы хватит 5D-координат.
Сходство по углам и глубина по радиусу дают фасетный поиск прямо в базе без внешних деревьев.

#Qdrant #векторныебазы #эмбеддинги
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Google DeepMind запустил институт исследования AGI

16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.

🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.

Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.

🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.

💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.

Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.

#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

OpenAI выпустила Astra for Law: GPT-6 Astra, обученная на 230 млн документов, теперь заточена на помощь юристам

OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.

Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.

⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.

📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.

🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.

Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел

#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Qwen3.8-Omni-Flash теперь понимает и работает с видео

Alibaba представила Qwen3.8-Omni-Flash, по-настоящему мультимодальную модель: текст, картинки, аудио и видео на входе, текст и даже музыкальное видео с комментариями на выходе. Модель умеет планировать задачу, звать инструменты и доводить до визуального результата.

⚙️ Что внутри:
Контекст 1 млн токенов, до часа аудио и видео за проход.
Средний балл на 29 тестах вырос больше чем на 25% в сравнении с Qwen3.5-Omni-Plus.
По аудиовизуалу модель вплотную к Gemini 3.8 Flash, по аудио обходит её.
Ошибка распознавания нескольких спикеров (AliMeeting DER) упала с 88 до 3,35.

💡 Смотреть только нужное:
Главная находка: агентное понимание. Длинное видео модель не перематывает целиком. Она стартует с вопроса, сама решает, что смотреть и слушать, и ищет ответ итерациями от грубого к точному.
На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал на 45,7%.

💼 Почему это важно:
Цена аудио-входа упала больше чем на 98%, аудиовизуального больше чем на 93%.
Это гонка мультимодальных агентов для видеомонтажа, клипов, комментария к фильмам и живых разговоров.
Так же выпустили Qwen-MM-Plugins и Qwen-Live Harness, среду для взаимодействия в реальном времени.

Пробовать в студии: https://chat.qwen.ai/

#Qwen #мультимодальность #агенты #ИИ
------
@tsingular

Читать полностью…

Технозаметки Малышева

#Нейропрожарка

Мини-фильм «What Remains» / Seedance 2.5, Blender 3d

Автор - @starikov_p

В очередной раз мой пайплайн строился на совмещении 3D-блокинга и нейросетей. Стилистически сам фильм я решил сделать ближе к CGI: персонажи выглядят как высокодетализированные 3D-модели, но при этом я старался сохранить определённую стилизацию и в анимации. Движения не должны были сильно уходить в реализм - скорее напоминать ручную или мокапную анимацию.

Мне очень нравится визуальный стиль многих серий «Любовь, смерть и роботы», поэтому по общей картинке и ощущениям я стремился к чему-то похожему.

Для каждой сцены я создавал концепты, затем собирал блокинг в Blender 3D, выставлял камеру и сразу указывал основные источники света. Всех персонажей я также перевёл в 3D: для каждого сделал риг и контроллеры, чтобы дальше можно было нормально работать с позами и анимацией.

Рендеры блокинга я отправлял в Seedance, но для каждой сцены использовал большое количество строгих референсов - вплоть до того, как именно должна выглядеть текстура кожи. Стилизация здесь была одной из самых важных частей. Например, даже на крупных планах мне хотелось сохранить ощущение слегка «мыльной» текстуры, а не уходить в фотореализм.

В итоге была проделана огромная работа, и мне очень нравятся такие эксперименты. Сегодня, если грамотно совмещать современные инструменты с классическим 3D-пайплайном, можно воплощать довольно масштабные идеи самостоятельно и за адекватные сроки.

Несколько дней ушло на концепты, около недели на создание всей 3D-базы и генерации. После этого ещё пару дней заняли чистка, композ и работа со звуком.

По бюджету всё вышло примерно в $150

@cgevent

Читать полностью…

Технозаметки Малышева

OpenAI раскрыла шесть случаев «непослушания» ее ИИ

нащяльнике-нама иишка щитало-щитало, все карты иликтричиство усё выщитало и сбижало нащальнике.
шесть раз сбижало-нама

нет чтобы так и написать, - "6 раз ошиблись в настройках"

#юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Не такого будущего мы ждали, конечно.

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)

Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.

Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.

⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.

Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).

🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.

Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.

#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

📌 NY Post: Anthropic - это культ

Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.

Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.

Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.


В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.

При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.

Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.

Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.

В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.

Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.

В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.

На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.

Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.

Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.

Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.

В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.

... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать


@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

Технозаметки Малышева

Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши

Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения

(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable

В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)

И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.

Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!

Ваш, @llm_under_hood 🤗

Читать полностью…
Subscribe to a channel