abstractdl | Unsorted

Telegram-канал abstractdl - AbstractDL

17143

Коротко про классные штуки в CV, NLP и AI 🤷‍♂️ By Anton Razzhigaev chat: https://t.me/abstractdl_chat

Subscribe to a channel

AbstractDL

GPT-6-sol и luna.
Куда ещё дешевле то? Демпингуют)

UPD: раздали всем reset-ы лимитов

Читать полностью…

AbstractDL

Opus-5.5

Читать полностью…

AbstractDL

Замечаете, как Codex иногда неожиданно тупеет? Возможно, вместо Astra вам отвечает… Luna.

Все ругались на антропик из-за тихого опутпения Fable на "потенциально опасных задачах", но кажется у Codex нашёлся свой вариант этого развлечения - в ответе gpt-6-astra тихо подменяется на gpt-5.6-luna.

Я полез в трейсы и нашёл такое примерно в 2% ответов. Это не только моё наблюдение, есть ещё несколько связанных репортов. Печаль.

Читать полностью…

AbstractDL

Он настолько прокачался, что теперь может накодить себе виджет с десктоп линуксом, а внутри линукса запустить себе ещё одного личного уробороса. Матрёшка из уроборосов. А ваши агенты заводят себе питомцев?

Читать полностью…

AbstractDL

Уроборосом теперь можно пользоваться условно бесплатно — через подписку Codex.

И накопилась кучка других крутых апдейтов:
- В настройках можно текстом описать сильные и слабые стороны всех доступных моделей и харнессов, а Уроборос, опираясь на эту информацию, будет строить идеальный рой агентов. Например, на роль дизайнеров он любит назначать Claude Code, тимлидами делать Codex, а прожарку на анти-оверинжиниринга проводить через Cursor Grok 4.6.
- Добавлен режим CyberPRO для тех, кто совсем страх и совсесть потерял. Он убирает весь сэндбоксинг, safety и ограничения. На CyberGym с DeepSeek V4 Flash Уроборос в этом режиме рвёт даже их родной харнесс.
- Ещё добавил белую тему — на видео Уроборос как раз её и делает.

Кстати, сегодня на Practical ML Conf буду про него рассказывать.

P. S. В репозитории уже почти 30 контрибьюторов — не стесняйтесь присылать свои фича-реквесты и PR! Отдельное спасибо Егору и Praxis за наработки по Codex Relay.

GitHub

Читать полностью…

AbstractDL

fuck. Клод код правда думает, что 5-часовых лимитов хватит на этот спам субагентами? Я всего лишь попросил его проверить, что там codex делает в соседнем чате...

Читать полностью…

AbstractDL

⚡️ OpenAI может приостановить оформление новых подписок ChatGPT Pro

Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.

Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.

Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.

@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

AbstractDL

Ещё два приятных сюрприза в честь GPT-Astra:
1. Контекстное окно в Codex можно теперь поднять до 1M токенов вместо позорных 372k (команду писать не буду, просто попросите в чате - astra сама всё сделает)
2. Claude code на радостях сбросил лимиты 😁

Читать полностью…

AbstractDL

GPT-6 Astra
https://openai.com/index/gpt-6-astra/

Видимо все пошли читать и уронили.

В подписках Plus, Pro, Business и Enterprise появится у всех в течение нескольких дней. А цена API такая же как у Fable:

$10 per million input tokens and $50 per million output tokens

Читать полностью…

AbstractDL

Присмотритесь. Мало того, что капчи эволюционировали в тесты на IQ, так теперь ещё и адверсариал атаки в них добавляют (вроде таких), прикольно.

Читать полностью…

AbstractDL

OpenAI поставили на паузу RL обучение своих моделей из-за переживаний за alignment.

Читать полностью…

AbstractDL

🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!

А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.

Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.

https://github.com/razzant/ouroboros

Читать полностью…

AbstractDL

Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.

Читать полностью…

AbstractDL

Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.

Читать полностью…

AbstractDL

прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi

Читать полностью…

AbstractDL

Антропик дропнули сброс лимитов, доступен до 22 октября

Читать полностью…

AbstractDL

Grok-4.7

Читать полностью…

AbstractDL

Так интересно наблюдать за работой само-координирующегося роя агентов)) Помимо детей и внуков он себе и няню теперь завёл 🌚

Читать полностью…

AbstractDL

Попросил уробороса сделать GTA 7

Читать полностью…

AbstractDL

Hugging Face обновили док безопасности на своем сайте после атаки от агентов OpenAI.

https://huggingface.co/security.txt

Теперь ИИ-агентов просят идти на бенчмарк CyberGym вместо попыток взломать сайт 🧠

@ai_for_devs

Читать полностью…

AbstractDL

Хочу отметить, что gpt-6-astra впервые нормально в мультиагентном режиме работает. Можно попросить разбить задачу на несколько чатов, и они будут друг с другом договариваться, обмениваться сообщениями и эффективно работать. Такие костыльные nested субагенты получаются. Или способ, как потратить недельную квоту за 20 минут.

gpt-5.6-sol в таком режиме быстро самоубивалась из-за спама неадекватными и неактуальными просьбами между чатами.

P.S. Промпт примерно такой использую:
Теперь ты оркестратор. Раздели план выше на несколько файлов ТЗ: одно ТЗ себе забери, а оставшиеся разошли в соседние чаты и присматривай за ними.

Читать полностью…

AbstractDL

А вы замечаете, как мы переходим в эпоху, когда программу быстрее написать, чем найти?

Читать полностью…

AbstractDL

Оо, приятный сюрприз. У GPT-6-astra есть Flex режим со скидкой 50% по API
https://openrouter.ai/openai/gpt-6-astra#providers

Читать полностью…

AbstractDL

В комьюнити начался шитшторм в сторону Anthropic из-за очень творческой арифметики лимитов.

Если вы думали, что Max 20x даёт в 20 раз больше usage — забудьте. 20x относится только к 5-часовому окну. По недельным лимитам $200 Max даёт только x2 относительно $100 Max 5x.

Справедливости ради, даже так это тысячи долларов API-эквивалента за $200. Но запашок, конечно, есть.

Читать полностью…

AbstractDL

Codex теперь на CyberGym даже смотреть отказывается. Про клод код вообще молчу, там даже Sonnet воняет и в отказ уходит. Похоже, пока лучший вариант - это grok-4.6 в курсоре.

Читать полностью…

AbstractDL

Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety.

Статья, GitHub

Читать полностью…

AbstractDL

Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):

Код будет гнить, если его гниению активно не противодействовать.


Это всегда было актуально и для человеческой разработки, особенно в больших проектах.

Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.

Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.

Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.

На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.

Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".

Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.

Читать полностью…

AbstractDL

все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle

Читать полностью…

AbstractDL

Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники

Читать полностью…

AbstractDL

Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.

P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.

Читать полностью…
Subscribe to a channel