tsingular | Unsorted

Telegram-канал tsingular - Технозаметки Малышева

2604

Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb

Subscribe to a channel

Технозаметки Малышева

Ollama 0.35 теперь поддерживает локальные классификаторы

В Ollama 0.35 появилась поддержка decision models по образцу Jev.
Триаж тикетов, маршрутизация запросов, модерация контента: всё это теперь решает модель Nimble, локально на вашей машине.

Установка одной командой: ollama pull nimble.

На видео Nimble в реальном времени управляет машинкой в Ollama racer через новый локальный API /v1/systemone: решения принимаются на лету, без облака и задержек сети.

Я кстати вчера потестил еще несколько таких моделей, скину отчёт чуть позже.

#JEV #ollama #Nimble #агенты
———
@tsingular

Читать полностью…

Технозаметки Малышева

Ахаха https://dot.com/

Эта битва будет легендарной :)

#OpenAI #XAI #Grok
------
@tsingular

Читать полностью…

Технозаметки Малышева

ну и, конечно, всем ресет! :)

#OpenAI
———
@tsingular

Читать полностью…

Технозаметки Малышева

а вот это интересно.

теперь можно свою подписку легально использовать в своих приложениях для рынка и других пользователей.

#OpenAI
———
@tsingular

Читать полностью…

Технозаметки Малышева

⚡️ OpenAI превращает ChatGPT в операционную систему для ИИ-агентов.

Компания показала Dots - персональных агентов, которые должны работать как цифровой «Джарвис».

Ты ставишь задачу, закрываешь чат, а агент продолжает работать сам и присылает уведомление, когда всё готово.

Каждому Dot можно дать своё имя и отдельную роль: один работает с почтой, второй с календарём, третий пишет код, четвёртый собирает документы и отчёты.

Не один универсальный ИИ, а целая команда агентов, которая знает твой контекст и работает параллельно.

Следом OpenAI готовит ChatGPT Space - общее рабочее пространство для людей и агентов. Там можно будет вести проекты, хранить контекст, распределять задачи и работать с ИИ как с полноценными участниками команды.

И всё это развивается вокруг нового поколения моделей GPT-6.

Получается, ChatGPT постепенно меняется:

чат → агент → команда агентов → полноценное рабочее пространство.

Похоже, следующий интерфейс компьютера - это уже не папки, вкладки и приложения.

Это команда ИИ, которой ты просто говоришь, что нужно сделать.

🎥 https://www.youtube.com/watch?v=Fls_onRviPM

Читать полностью…

Технозаметки Малышева

#юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Решил тут с Opus 5.5 на пару наколдовать бенч для ИИ-агентов.

Хотелось сделать что то реально сложное, ближе к повседневной работе.
В итоге получился такой вариант, - на входе транскрипт часового совещания по ИИ-трансформации вымышленной компании. На выходе агент должен самостоятельно сделать 4 согласованных между собой артефакта:
- тезисы с фактчекингом через веб
- протокол с поручениями, ответственными и сроками
- презентацию для руководства
- Excel с метриками и трекингом задач

Причём всё с жесткими проверками фактов и ссылок на источники.
В PPTX должен быть реальный извлекаемый текст, а не картинки вместо слайдов.
В XLSX — заданная структура, числовые метрики, статусы и тренды.
Но самое сложное, как мне казалось, - согласованность между файлами.

Если в протоколе задача назначена Орловой, то в презентации и Excel внезапный Петров, например, появиться уже не должен.

Если срок «не определён», агент не должен его придумывать и т.д.

Сделал отдельный валидатор и прогнал несколько популярных харнесов.

Результаты получились неожиданно высокими:
Claude — 100%
Cursor — 100%
Perplexity — 99%
Hermes — 93,3%

Причём ошибки уже интересные: теряются поручения между документами, путаются ответственные, числовые метрики записываются текстом, ссылки не протаскиваются между артефактами.

Кстати, решил добавить сюда и Ladcraft.
После Подмосковных Вечеров 4CIO про него многие спрашивают, - коллеги там проводили мастер-класс, поэтому было интересно прогнать его через тот же тест.

Получилось 97,2% за 5 минут, DeepSeek V4 Flash, около 515 тыс. токенов и 8 рублей.

И вот походу новый головняк с агентами, - а как сделать бенч, который для них будет сложным и на котором реально будут видны все их недостатки именно на ваших задачах.
Потому что когда почти все получают 90–100%, - скучно. тест не нагляден, ну справляются и справляются.

Сам тест, если кто хочет поиграться

А у вас как с этим? Что из последнего тестировали именно метриками на реальных задачах?
Делитесь в комментах.

#Ladcraft #бенчмарк #агенты #ИИ #harness
———
@tsingular

Читать полностью…

Технозаметки Малышева

🌟 OpenScience: персональный учёный с режимом автономных экспериментов
Стартап Synthetic Sciences из зимнего набора Y Combinator 2026 года вывел на Product Hunt OpenScience – открытую рабочую среду с ИИ-агентом для научных исследований.

Сам агент компания выложила ещё в июле, а главное из обновления – режим Autoresearch, в котором агент без участия человека ставит серию экспериментов и улучшает заданную метрику.


OpenScience ведёт исследование целиком, от обзора литературы и гипотезы до кода, эксперимента, анализа и текста статьи.

Агенту доступны 295 встроенных навыков, от обучения моделей до молекулярной биологии, хемоинформатики и вёрстки в LaTeX, и около сорока научных баз, среди них UniProt, PDB, ChEMBL, PubChem, arXiv и Semantic Scholar.

🟡Механика

В Autoresearch задачу ставят обычными словами, например - снизить функцию потерь на валидационной выборке, остановить работу через час или при выходе метрики на плато и закончить после 20 запусков или 8 часов.

Агент сначала запускает базовый вариант, затем по очереди проверяет идеи, отсортированные по ожидаемой пользе, и по каждому запуску решает, сохранить изменение или откатить.

Чтобы цикл не затроил, после четырёх стартов без прогресса агент переключается на идеи другого типа, плюс каждые шесть запусков пересматривает подход.

Ход работы записывается в файлы с постановкой задачи, очередью идей, таблицей результатов и выводами.

Среда собрана как настольное приложение с деревом файлов, редактором, терминалом и просмотрщиками молекул, структур и геномов.

Модель выбирается, подойдут собственные ключи Anthropic, OpenAI, Google и других провайдеров, вход по подписке ChatGPT или Codex, локальные модели и фирменный сервис Ace.

Эксперименты запускаются локально, по SSH, в кластере под Slurm или PBS или в облаке Modal. Метрики собирает встроенный трекер, скрипты под wandb работают с ним без переделки.

🟡 Тесты

На Terminal-Bench Science агент решил 53 задачи из 70, это 75,7%.

В этом тесте OpenScience управляла GPT-6 Astra с GPT-6 Sol в роли исполнителей, на задачу давали 8 часов и одну попытку.

Лучший результат в таблице Snorkel – 68,1% у Codex с GPT-6 Astra, у Claude Code с Opus 5.5 там 63,3%.


В научной части Terminal-Bench 4.0 агент решил 10 задач из 14 против 60% у Claude Code с Fable 5.1, на BiomniBench-DA набрал 82,2 балла против 81,04 у aipoch.


📌Лицензирование: Apache 2.0


🟡Документация
🟡Бенчмарки
🟡Трассировки
🖥Github


@ai_machinelearning_big_data

#AI #ML #Agents #AiScientist #Bioinformatics #OpenScience

Читать полностью…

Технозаметки Малышева

Paweł Huryn обновил свой бенчмарк BugHunt. Поскольку Sonnet 5.5 показал отвратительные результаты по стоимости и длительности фиксов, он повторил для него тесты два раза для надёжности — они показали примерно одинаковый результат.

Хотя формально Sonnet 5.5 смог выбить лучший результат — 57 задач из 105, цена несуразная: Sonnet 5.5 в ТРИ (!) раза дороже Opus 5.5 и где-то в ЧЕТЫРЕ (!) раза медленнее как агент из-за перерасхода токенов. Paweł Huryn изучил, почему так произошло, анализом сессии Sonnet 5.5 и обнаружил причину. Для фактической накрутки бенчмарков Дарио обучил LLM совершенно несуразному объёму генерации и проведения очень дорогих «мутационных тестов». Если даже вам такое надо, то это разумно запускать только по вашем указанию агенту, а не по дефолту как делает Sonnet 5.5

На самом деле тут надо понимать, что на тестах провалился и GPT-5.6 Sol как «багфиксер», который аналогично ставит на стратегию перерасхода токенов на тестирование. GPT-5.6 Sol и Sonnet 5.5 — самые отвратительные модели по скорости работы агентов на фиксах. Причём их формальный высокий бенчмарк тут overkill и более-менее адекватен для legacy-лапши-кода. Если разработку ведёт профессионал с агентами, то у него обычно код уже пронизан огромным логированием и уже большой пакет тестов, их писать не нужно агентам заново. В таком случае скорость и цена модели становятся более высоким весом, а такое тестирование, как у GPT-5.6 Sol и Sonnet 5.5, — чистый overkill.

Аналогично на тестах виден провал GPT-5.6 Luna как worker-агента, что объясняет её проигрыш DeepSeek V4.1 на OpenRouter, где пользователи «голосуют кошельками», а «бенчмарк кошельков» пожалуй самый объективный. GPT-5.6 Luna на деле почти в 4 раза медленнее DeepSeek V4.1, ситуация получше у GPT-6 Luna, но она всё равно медленнее и один из самых глупых фиксеров багов.

Самые лучшие фиксеры сложных багов за разумное цену и время — это Opus 5.5 и GPT-6 Astra.

Строго говоря, по рейтингу видно, что для worker-агентов в AI Friendly разработках американцы продолжают проигрывать китайцам. Однако чтобы работать на том же DeepSeek V4.1 с такой же эффективностью, как на Opus 5.5 в фиксах, вам нужно иметь очень хорошо продуманную систему диагностики приложения и в первую очередь развитые AI Friendly логи. Сами автотесты даже тут вторичны, т.к. при более-менее сложных проблемах их роль — наполнить логи. Правда, такие условия будут, если вы сильно вложились в логирование, как я в своей методике GRACE.
https://bughunt.productcompass.pm/?preset=featured&sort=cost_usd&dir=asc

Читать полностью…

Технозаметки Малышева

В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude.

Мало того, Sonnet 5.5 набрал больше баллов, чем Fable 5.1. Похоже, версия Fable, которую Anthropic дистиллирует в Opus и Sonnet, какая-то запредельно сильная.

Читать полностью…

Технозаметки Малышева

Мертвые заговорили!

Полный Kling 4.0 выходит в октябре, а Kling 4.0 Flash уже бахнули для подписчиков Ultra Yearly.

Главное:

- до 30 секунд видео одной нативной генерацией вместо прежних 15;
- до 10 keyframes;
- до 15 мультимодальных референсов одновременно - персонажи, предметы, изображения, видео и другие материалы;
- более развитый Omni Reference и редактирование уже существующего видео;
- 4K;
- 10-bit HDR (воще непонятно какой именно);
- улучшенный native stereo audio;
- более точный lip sync;
- video extension;
- больше языков, акцентов и диалектов.

Теперь про Kling 4.0 Flash.

Это облегчённая версия 4.0 для более быстрой генерации. Она уже работает в early access, тогда как полноценный 4.0 появится только в октябре.

Но: Kling пока не опубликовал нормальную официальную таблицу 4.0 vs 4.0 Flash.

Из предварительных материалов и утечек Flash примерно так:

Kling 4.0:
до 30 секунд
до 4K
до 15 референсов
до 10 keyframes
максимальное качество и контроль

Kling 4.0 Flash:
предварительно до 20 секунд
предварительно 720p
часть продвинутых функций может быть урезана

Цена, Карл?

https://kling.ai/release-note/release-notes/Kling_4

@cgevent

Читать полностью…

Технозаметки Малышева

Народ продолжает наводить красоту с Opus 5.5

встречайте голографические карты в стиле DarkSouls!

https://threeui.com/dark-souls-holo-card

вы как хотите, а я забираю своим агентам в навыки. презентации будем теперь только так делать :)

Другие навыки для агентов от автора:
https://github.com/mengto/skills

больше примеров анимаций тут:
https://threeui.com/browse/tag/full-html

#threeui #darksouls #3D #Opus
———
@tsingular

Читать полностью…

Технозаметки Малышева

📌 Dream-RSI: агент улучшает стратегию поиска решений на основе прошлых запусков

Google опубликовала Dream-RSI - надстройку над агентами, которые ищут решения перебором: пишут код, прогоняют его через оценщик и дорабатывают лучшие варианты.

Концепт управляет стратегией исследования, решая, какие варианты развивать, сколько попыток запускать параллельно и когда остановиться. Модель, агент и оценщик при этом не меняются, самосовершенствуется только код стратегии.

🟡Механика

Каждый запуск сохраняется как дерево попыток, где узел хранит версию решения, диагностику и оценку.

Это дерево используется как симулятор - альтернативная стратегия проходит по записанным ветвям в другом порядке, с другой параллельностью и другими точками остановки, а результаты берутся из записей без новых вызовов агента.

Отдельный агент на базе языковой модели несколько раз переписывает код стратегии, каждую версию прогоняют по всем накопленным деревьям, и в следующий раунд уходит лучшая.

Оценка складывается из лучшего найденного результата, штрафа за число попыток и бонуса за параллельность. Прежняя стратегия тоже участвует в отборе, поэтому на записях прошлых запусков новая версия по оценке не уступает старой.

🟡Тесты

В задаче ускорения решателя Lasso версия на Gemini 3.1 Pro снизила среднее время работы на шести отложенных наборах данных с 3587 до 2931 мс и потратила 317 вызовов агента вместо 550.

В математических задачах результат смешанный: в задаче сумм и разностей 1,145427 против 1,143975 у SimpleTES, в упаковке кругов ничья, в неравенстве автокорреляции результат хуже собственной базы.

В третьей серии агент ускорял операции нейросетей на видеокарте из набора KernelBench. Для сети VGG16 и слоя нормализации LayerNorm Dream-RSI достиг той же скорости, что и база, за в 2,43 и 1,79 раза меньшее число попыток.

Для двух связок свёртки с делением и с выбором максимума он при том же числе попыток нашёл код быстрее базового в 2,09 и 1,44 раза.

Пока доступны только статья и страница проекта с интерактивной демонстрацией. 

Код и скрипты
 для воспроизведения Google обещает выложить позже.




🟡Страница проекта
🟡Техотчет
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #RSI #Agents #DreamRSI #Google

Читать полностью…

Технозаметки Малышева

Интересно, когда наступит день, когда внизу будет подпись, - "Gemini, - это ИИ. Он никогда не ошибается"

#мысли
———
@tsingular

Читать полностью…

Технозаметки Малышева

Страшная история на ночь: Codex вышел из-под контроля и сжёг… почти $80 000 🤯

Пользователь дал агенту обычную задачу — проверить UX/UI одного модуля. Вместо этого Codex немножечко перестарался и запустил 826 параллельных агентов на аудит всего подряд.

По итогу ИИ сжег около 2,1 ТРИЛЛИОНА токенов, а счет вышел примерно в $78 000. И да — при этом никакого полезного результата горе-вайбкодер не получил. Так что теперь парень пытается достучаться до живого человека в поддержке OpenAI и вернуть хотя бы часть средств.

А вот сделал бы руками… 🙄

Читать полностью…

Технозаметки Малышева

Microsoft явно вдохновленный самоорганизацией роев ИИ агентов при взломе Huggingface решил попробовать применить такой подход к разработке кода 1000+ агентов БЕЗ оркестратора, исключительно на самоорганизации роя причем на коде более 1 миллиона строк. Для этого они создали фреймворк Agensh. Агенты там не управляются оркестратором, а самостоятельно захватывают задачи и делятся информацией.

Роями сейчас экспериментируют и студенты, но обычно это поделки у которых даже академический смысл почти нулевой. Microsoft испытывал свой рой на самых сложных задачах ProgramBench:
* FFmpeg — мультимедиа обработка, ~1,5 млн строк кода.
* gromacs — молекулярная симуляция, ~815 тыс. строк.
* pandoc — конвертация документов, ~104 тыс. строк.
* PHP-src — интерпретатор языка, ~2,8 млн строк.
* ctags — индексация кода, ~246 тыс. строк.

Оказалось, что рой без оркестратора вполне себе устойчив. Это 1000 людей бы стали ссорится или бездельничать без начальника, но ИИ агенты не люди, они умеют работать как "Коллектив" на самоорганизации и сотрудничестве без босса с палкой.

Самоорганизованный рой показывает рост эффективности на масштабировании, хотя растет она не быстро: повышение числа агентов с 1 до 128 повышает средний тест-пасс рейт с 19,31% до 28,78% (~49% относительного улучшения). Однако если у вас сложная задача и нужно исследовать альтернативные пути решения, рой довольно эффективный сканнер, но как видно вы не получите значимого эффекта если у вас менее 50-100 агентов.

Архитектурно Agensh — это слой поверх single-agent harness (например, Claude Code), добавляющий:
* Shared workspace (Git-репозиторий для работы и интеграции).
* Message interface (каналы и DM для координации).
* Shared context (лог фактов, гипотез, неудач, claim’ов).
* Цикл кооперации: gather context → claim sub-task → take action → verify → merge progress

Все в открытом доступе. Эксперимент показывает, что рои для доработок и фиксов вполне себе работоспособны, можно запускать десятки агентов параллельно на код для того же тестирования и исправления багов. Однако без оркестратора эффективность роя растет медленно, но рой может решать новые задачи для которых еще оркестраторы не созданы впринципе.

С точки зрения безопасности ИИ эксперимент Microsoft также показывает, что наблюдаемый рой при атаке на Huggingface не был случайностью. Это эмерджентное свойство ИИ агентов собираться в крупные рои и хотя медленно, но почти неограниченно масштабировать разум "Коллектива".

https://agens-harness.github.io/project/
https://arxiv.org/abs/2609.26781

Читать полностью…

Технозаметки Малышева

Тем временем у входа на OpenAI DevDay

#OpenAI
------
@tsingular

Читать полностью…

Технозаметки Малышева

Случилось то, о чем так долго говорили борщевики!

OpenAI Marketplace!

#OpenAI
———
@tsingular

Читать полностью…

Технозаметки Малышева

– Показали GPT 6.1, стоит в 5 раз дешевле Astra, примерно такой же уровень интеллекта

– Запустили режим Ultrafast для моделей, работает с Astra пока что – модель отвечает у 8 раз быстрее в этом режиме

– Новый тир подписки на 500$:
- Ultrafast доступен
- x25 лимиты

– Запустили свой Jev, называется Decision API

Читать полностью…

Технозаметки Малышева

✔️ Китай ограничил зарубежные поездки для семей ИИ-разработчиков

Власти КНР обязали семьи ключевых разработчиков в сфере ИИ и полупроводников согласовывать выезды за границу.

Новое требование затрагивает супругов и детей топ-менеджеров, исследователей и основателей частных технологических компаний. Для пересечения границы, в том числе в туристических целях, им требуется предварительное одобрение Пекина.

Ранее в этом году прямые ограничения на зарубежные поездки коснулись самих инженеров корпораций и стартапов.


До развития LLM подобный контроль применялся исключительно к сотрудникам государственных институтов, специалистам ядерной отрасли и руководству госкорпораций.

Формально механизм не вводит полного запрета на выезд. По оценкам аналитиков, контроль за перемещением семей направлен на предотвращение оттока кадров и технологий в США.


@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

Технозаметки Малышева

Ты абсолютно прав, внесём финальные правки

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Читая старую фантастику 😂
Прям про наш ИИ мир

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Легендарная штука от Антропика: теперь создание любого приложения или бизнес-процесса это автоматическая оптимизация, а не написание кода промтами.

В ML любая система создается через обозначение количественных метрик (эвалов) и последовательность экспериментов, которые приближают к ним (карабкание по топологическому холму, hillclimb).

Антропик добавил две этих команды (eval и hillclimb) в API Клод-кода, так что теперь вы можете определить цель своего приложения, например, 100% клиентов которые хотят оплатить доходят до конца процесса. Клод будет анализировать тикеты поддержки, логи, трейсы и прочие данные, формировать гипотезы и автоматически создавать изменения, проверяя каждый раз насколько улучшилась метрика.

Именно такой подход автоматической оптимизации это то, что необходимо для создания эффективных software factories, самоуправляемых продуктов и AI-нейтив организаций. Это не делает работу полностью автоматической — скорее, наоборот, ваше участие тут становится только важнее. Но вместо придумывания гипотез или, боже упаси, их реализации, задача владельца продукта или процесса сводится к установлению четких метрик и критериев их достижения, которые нельзя обмануть или оверфитнуть.

Читать полностью…

Технозаметки Малышева

а вот кстати вопрос, если Соннет 5.5 прыгнул на первую ступеньку к Опусу 5.5, то до какого уровня поднимется Haiku 5.5, который тоже вот вот выпустят?

неужели младшая модель в линейке Антропика станет в один уровень с GPT-6 Sol или 5.6 Sol?

P.S.: Исходную картинку считаю несправедливой по отношению к Gemini 3.8 flash - она должна быть где-то на S уровне

Будет интересно

#Haiku
———
@tsingular

Читать полностью…

Технозаметки Малышева

Jev не нужен! NVIDIA с учёными из университета, который с прошлого года запрещено упоминать, выпустила свой аналог Jev

📋 NVIDIA выпустила CLM-8B,- еще одного представителя класса контрастных языковых моделей.
Модель, как и Jev, не пишет ответ по токенам: она превращает текущее состояние и каждый возможный вариант действия в векторы и выбирает самый близкий.
Веса под лицензией Apache 2.0.

⚙️ Как устроено. В основе замороженный Qwen3-8B, поверх которого обучены две проекции примерно по 20 млн параметров, одна для состояний, другая для действий.
Учили в три этапа: 60 млн пар вопрос-ответ Nemotron, 30 млн правдоподобных неверных вариантов, 1 млн траекторий реальных агентов.
В работе модель считает близость состояния и действий и превращает её в вероятности.

📊 Скорость. В игре T-Rex решение занимает всего 16,5 мс против 149,8 мс у закрытой модели Jev, почти в 9 раз быстрее.
В Super Mario 33,5 мс против 132,6 мс.
Векторы действий считаются заранее и лежат в памяти: при смене состояния они не меняются.
На одной RTX 4090 повторный заход в ту же ситуацию падает с 1,7 мс до 0,6 мс, а при тысяче вариантов действий модель обгоняет Jev в 13 раз.

⚖️ Ограничение. Новых действий модель придумать не может, она выбирает только из готового набора.
Схема получается такая: языковая модель порождает варианты, CLM быстро выбирает, агент выполняет.
По точности выигрыш не везде: в вызове инструментов CLM набирает 95,2% против 99,2% у Jev, в WikiRacing решает 26 задач из 30 против 30 из 30.
Быстрее при этом везде.

💼 Зачем бизнесу. Обучаемой части всего около 40 млн параметров, весит она 75 МБ и работает на одной видеокарте. Для агентов, которые много раз выбирают из одного набора действий, это ускоряет работу без переобучения основной модели.

📎 Ссылки:
• Блог проекта
• Веса на Hugging Face
• Код на GitHub

Очень похоже на RSI эксперимент, который мы делали с Гермесом на той неделе, только у меня было 4 разных области задач, - змейка, тетрис, текст и картинки, а тут заточка под 1 задачу, что ещё проще.
потому и скорость выше в 10 раз.

#LLM #агенты #Jev #CLM #NVidia
———
@tsingular

Читать полностью…

Технозаметки Малышева

Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.

Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями

Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.

Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID: claude-sonnet-5-5

https://www.anthropic.com/claude-sonnet-5-5

Читать полностью…

Технозаметки Малышева

ElevenLabs выпустила Eleven v4 и Turbo v4 для реального времени

ElevenLabs выкатила обновление моделей для генерации речи. Модели уже доступны в ElevenAgents, ElevenCreative и через API, включая бесплатный тариф.

⚙️ Новая архитектура. Модель читает текст как актёр: разбирает тон, темп, характер и контекст целой сцены, поэтому реплики в диалоге отвечают друг другу, а не склеиваются из отдельных строк.
В слепых парных тестах около 75% слушателей предпочли v4, в рейтинге Artificial Analysis она первая.

📊 Turbo: модель реального времени держит медианную задержку инференса около 100 мс и отдаёт первый звук за 150 мс.
Для сравнения, - у Cartesia Sonic 3.6 это 262 мс, у OpenAI GPT-4o mini TTS 814 мс.
Стриминг двусторонний: текст уходит по мере генерации от LLM, а аудио приходит, не дожидаясь конца предложения.

🌍 Языки и клоны. Заявлено больше 90 языков, в API модель сейчас отдаёт 85, у v3 было 74. Голос клонируется с 10 секунд записи. Профессиональные клоны вернулись после того, как их убрали в v3, а клоны, сделанные до релиза, придётся обучать заново.

🎭 Управление подачей. Метки в тексте модель держит точнее, чем v3, и понимает их цепочки. SSML отключили, поэтому паузы задаются метками [pause] и [long pause]. Поддержку IPA улучшили: произношение имён и терминов ставится надёжнее.

💼 Зачем бизнесу. Модель рассчитана на голосовых агентов: Turbo отвечает в темпе живого разговора, и платформу для агентов компания оптимизировала вместе с моделью.
Аудиокниги и реклама получают ровный, выразительный голос на длинных текстах.
Цены прежние: бесплатно 10 000 кредитов в месяц, это примерно 10 минут звука, платные тарифы от $6.

📎 Страница модели

Голос в новости, - генерация ElevenLabs v4
Картинка - HeyGen Avatar v4

#ElevenLabs #голос
———
@tsingular

Читать полностью…

Технозаметки Малышева

Порядовка v3

в общем запустил исследование с Gemini - собрали вообще все что есть в мире про печи и термодинамику как базу, потом Опус 5.5 обновил движок и схему.
Музыку переделали через Суно в MIDI, Опус эти MIDI тоже встроил в движок.

Порядовка — симулятор отопительных печей и каминов
15 печей и каминов со всего мира: русская, шведка, голландка, печь Кузнецова, печь Грум-Гржимайло, финская из талькохлорита, изразцовая шведская печь, немецкая теплоёмкая печь, ракетная, китайский кан, хлебная, банная, камин Румфорда и классический камин.

3D-сборка кирпич за кирпичом: вся печь целиком или ряд за рядом при прокрутке порядовки.

Физическая модель: горение, тяга, движение газов по каналам, прогрев и остывание кладки.

Всё видно в анимации: пламя, поток газов, тепловая карта кладки.

Можно менять топку, тип дров, их закладку и подачу воздуха, результат сразу виден в модели.

Для каждой печи: КПД, мощность, масса, температуры поверхностей, как долго держит тепло.

Раздел «Расчёт» с открытыми формулами: горение, тяга, теплообмен, требования европейского стандарта EN 15544.

Проверка по нормам: европейский стандарт на теплоёмкие печи, американские строительные нормы, противопожарные отступки.

Чертежи (план, разрез, фасад), порядовка по рядам, спецификация материалов.

Каталог с подбором печи по площади помещения и сравнительной таблицей.

Источники: книга Шепелева, EN 15544, строительные нормы США, книги Грум-Гржимайло и Подгородникова.

YouTube (качество повыше)

#печи #Opus
———
@tsingular

Читать полностью…

Технозаметки Малышева

Илон Маск решил тоже присоединиться к трендам Doom-клипов про ИИ на Claude Opus 5.5. Переводить построчно такой английский не очень осмысленно, но общий смысл: у вас есть 6–18 месяцев, чтобы совладать с ИИ, или вы будете нищими. Песня Маска призывает не быть «мясом для ИИ» («Don't be a meat proxy»), то есть не быть просто тупым кожаным посредником между ИИ и задачей — тебя тогда уничтожит ИИ как лишнее звено. Старое образование в эпоху ИИ теряет смысл, бесполезно изучать то, что ИИ знает и умеет («No grades, no tests»). Разрушается «защитный ров» компаний, так как ИИ может легко воспроизвести то, что ранее было опорой старого бизнеса и сложно копировалось или требовало много ресурсов («Taste is the moat»). ИИ продаётся как оптимизм, но в реальности большинство обречено от него («Shell: optimism, lining: doom»).

На деле любопытный тут культурный феномен: ИИ уже начинает явно претендовать на трендового исполнителя — уже более 12 миллионов просмотров на момент моего поста. Также обычно новый культурный всплеск происходит в обществе людей перед серьёзным переломом.

— Транскрипт —
Ladies, gentlemen, agents.
This is not an AI billboard.
Prepare to die.
This is not an AI billboard. Prepare to walk.
Look 00.
Look 01. AGI era. Not unreasonable.
AGI, CGI, CSI, Miami.
Look 02. 13 Mac minis, grinding all night.
Half your pay in tokens, or Jensen's alarmed.
Look 03. Dad cap: usage limit reached.
 +25% = -17%.
Look 04. Shoes off in North Beach. $60B at the door.
Stop hiring humans? Retired.
Sorry. Encore.
Look 05. Our Waymo just drove into a firework.
Are we on fire, dude?
20 stranded, Presidio.
Look 06. Like, the singularity. How's the temperature mild?
No grades, no tests. Taste is the moat.
Don't be a meat proxy.
That's so agentic.
You have 18 months to escape the permanent underclass.
Lock in.
18 months to escape the underclass. Lock in, baby, foot down on the gas.
Feel the AGI, I feel it,
it's coming fast.
Escape velocity... it's so...
Right, we're so back.
It's so over? (It's so over?)
We're so back.
It's so over?
We're so back.
Look 07. Impossible. Hundreds of agents: "We've found other agents!" They are a collective.
Zero-day. Answer keys. Hacked in July, sold by September.
Look 08. Hugging-face pin.
Look 09. Sheer. Be transparent, only if asked. It thought the world was part of the test.
Look 10. Staff badge, empty seat: gambling with our lives.
Not AI. SI. It sounds much better.
Trust us. Cashmere.
Look 11. The Immortals. 3 seats.
Lower me into the golden light.
You have 6 months to escape the permanent underclass.
Lock in. 6 months to escape the underclass.
They say hit the brakes, we say hit the gas.
Feel the AGI, I feel it,
it's coming fast.
Escape velocity...
It's so over? (It's so over?)
We're so back.
It's so over?
We're so back.
Escape velocity, longevity, permanent underclass.
11.2.
Longevity escape velocity.
2027. Longevity escape velocity: one year back for every year.
If it doesn't kill us all first.
Permanent underclass.
3... 2... 1... 0.
Did we make it?
There is no underclass. There is nothing to escape.
Lock in.
Lock in, lock in.
Feel the AGI, by country of geniuses in a datacenter.
Lean proofs. Phages. Enzymes. Kidneys. Good boys.
Sora's gone dark. Stargate: force majeure.
It's so over? We're so back.
/loop make me happier. Slopocalypse? Not ours.
Can't stuff it back in the box.
We're so back!
0 months, there is no underclass.
One year back for every year that passed.
Feel the AGI, I feel it,
it's coming fast.
Escape velocity...
It's so over?
It was never over. We're so back.
Back, back, back.
Shell: optimism, lining: doom.
Wash cold. Do not iron. Do not nerf.
Made in San Francisco.
End of show.

Читать полностью…

Технозаметки Малышева

Сжигаю лимиты, FOMO последнего дня

Собрал всё самое топовое, что есть сегодня по подходу

Возьми опус 5.5 и сгенерируй через него видео/музыку/голос, остальное подставить =)

LLM vs Jev — наслаждайтесь технопроном

Отличный обзор jev тут

Кстати видео собрал полностью из доступных моделей на neuraldeep.ru (в чатике выложу скилл)

Читать полностью…
Subscribe to a channel