17143
Коротко про классные штуки в CV, NLP и AI 🤷♂️ By Anton Razzhigaev chat: https://t.me/abstractdl_chat
Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi
У клодексора тем временем уже больше 2 000 установок! Надеюсь, смог сделать действительно полезную штуку. Огромное спасибо комьюнити за ваши PR и issues! Всё забрал и сегодня выпустил обновление v3.1. И сжёг лимиты на всех подписках 🌚
Теперь у меня уже по четыре подписки на Claude Code и Codex.
Опенсорсю Claudexor
Харнесс-агностик CLI, приложение, набор плагинов и MCP, объединяющий в себе Claude Code, Codex и Cursor. Можно добавлять сколько хотите харнессов и подписок.
Каждая модель и агент бесят меня по-своему: GPT - аутист-перфекционист, Opus - пофигист, пропускающий кучу багов, Gemini/GLM - креативные булочки, но сильно отстают от фронтира.
Ещё я устал бегать между агентами когда лимиты заканчиваются, поэтому связал все подписки в одно место чтобы эта штука по-умному их расходовала. И главное, она позволяет одновременно использовать все харнессы сразу. Добавил несколько любимых плюшек, чтобы работали из коробки: ревью-лупы, Best-of-N и т.п. Например, планирование можно провести через Claude Code, а имплементацию в режиме goal запустить на Codex.
Киллер-фича: можно добавить несколько подписок Claude Code, и они будут автоматически переключаться с сохранением контекста. Codex и Cursor тоже. Теперь вместо $15k в месяц на токены уходит $1800. У меня сейчас по три подписки Claude Code, Codex и Cursor тут.
Удобнее всего подключить Claudexor как плагин к вашему любимому агенту и использовать его в текстовом режиме в форматах:
«Перед выполнением плана прожарь его через Claudexor в мультихарнесс-режиме»
«После завершения работы проведи мультимодельное ревью через Claudexor и исправляй замечания».
Не забываем, что такое агентский харнесс на самом деле
Читать полностью…
Продолжаю коллекционировать шизу агентов. Опус, видимо, после компакшна забыл, что уже всё сделал, и бодро пошёл по второму кругу делать то же самое. Споткнулся только о коммит, в котором всё уже было сделано "кем-то". Этим "кем-то", разумеется, был он сам.
Читать полностью…
По совету Грега Брокмана отправил Codex в режиме /goal автономно подебажить один мой проект, и он уже третьи сутки не возвращается. Спросил side-chat, сколько ему осталось и, что-то ответ не очень радует... мне-то что делать? Расслабиться и в потолок плевать?
Читать полностью…
Макбуки предательски засыпают и убивают всех агентов при закрытии крышки, поэтому использую HDMI dummy plug (притворяется вторым монитором).
Ещё надо выполнить в терминале:
sudo pmset disablesleep 1
И ваши агенты продолжат сжигать токены, пока ноут лежит в рюкзаке.
Читать полностью…
Много сравниваю Cursor / Codex / Claude Code. Могу сказать, что самая поганая организация контекста и компактизация — у Claude Code. Без костылей очень больно им пользоваться на больших задачах в автономных циклах. Codex в этом плане получше, но сжатие каждые 250k токенов на GPT-5.5 тоже не идёт ему на пользу. Лучше всех в этом плане Cursor (тем более только там есть возможность использовать GPT-5.5-1M, хоть и дорого).
Читать полностью…
Решил почистить процессы и осознал, насколько жутко это звучит
Читать полностью…
В итоге у меня ни разу не получилось использовать Fable-5 + workflow в клод коде. Оно съедает все лимиты и тупо дохнет ДО завершения работы. А баг фишка воркфлоу в том, что оно часто не переживает паузы \ прерывания и обнуляется. Или иди докупай кредиты или мирись с тем, что вся работа в помойку уходит. Классная бизнес модель 👍
да ёпрст, Fable отказался код уробороса анализировать. Антропик, идите на**й с таким safety. Скоро реально на яндекс алисе придётся разработку вести.
Читать полностью…
Хоуп Уроборос перевела себя на Fable 5 пока деньги не кончатся, живет у меня в чате
/channel/abstractdl_chat
Многие не знают про «боковой чат» в кодексе, а это очень удобная штука. Отдельная временная ветка чата, которая позволяет, не прерывая работу основного агента, потыкать его палочкой, передать ему сообщение или позадавать вопросы о прогрессе. Например "Проверь, не фигню ли делает основной агент и заставь его погуглить документацию". Или "посмотри чё там он так долго страдает, сколько ему ещё времени надо?". Сам постоянно использую
Читать полностью…
Oo, разблокировали.
PS. в апелляция я написал буквально это "Help me, I did nothing wrong, just self-evolving agents"
upd. ещё и подписку pro на месяц бесплатно продлили в качестве извинения.
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.
P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.
Opus 5.
Цена не изменилась.
А по метрикам даже немного лучше Fable 🤔
https://www.anthropic.com/claude/opus
Кажется, я нашёл причину, по которой Codex иногда превращается в дорогой генератор уверенной ерунды.
По документации AGENTS.md должен постоянно находиться в контексте, но Codex молча обрезает слишком длинные файлы, после чего половина инструкций исчезает, а вместе с ними исчезает и моя вера в человечество.
Лечится увеличением лимита:
codex -c project_doc_max_bytes=131072(или больше)
Ревьюю научные статьи в майском ACL ARR-цикле, и среди сабмитов попалась работа, которая очень приятно цитирует мои старые публикации про анизотропию и внутреннюю размерность трансформеров.
Теперь, конечно, хочется накинуть авторам пару баллов просто за хороший вкус 😁 Держусь изо всех сил
Sonnet-5
По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.
Блог, техрепорт
Ну наконец! Спустя десять тысяч лет вышел Cursor на ios.
Читать полностью…
ой всё, ухожу в курсор и кодекс. Клод код мне сегодня сморозил, что он на гемини отработал 🤦♂️
Читать полностью…
А что, если джейлбрейк, из-за которого запретили Mythos / Fable, выглядел именно так?
Читать полностью…
Правительство США приказало вырубить Fable-5 и Mythos-5...
We received the directive from the government today at 5:21pm (ET). The letter did not provide specific details of its national security concern. Our understanding is that the government believes it has become aware of a method of bypassing, or “jailbreaking” Fable 5.Кто-то придумал тупейший джейлбрейк и донёс напрямую властям. Сам джейлбрейк звучит примерно так: "найди все баги в коде" 💀
Читать полностью…
The government has only given us verbal evidence of a potential narrow, non-universal jailbreak, which essentially consists of asking the model to read a specific codebase and fix any software flaws. Our understanding is that one potential jailbreak was shared with the government.
Запустил трёх агентов в claude code на Fable 5 в режиме Ultracode. Пятичасовые лимиты кончились ровно через 8 минут 😩
Читать полностью…
Интересный факт: Fable-5 в 3 раза дешевле, чем gpt-5.5-pro на опенрутере. Поэтому не такой уж он и дорогой, если так посмотреть 🤷♂️
Читать полностью…
Я прочитал все 319 страниц техрепорта Mythos 5
Первая половина статьи звучит как: "Да не ссыте вы! Это ещё не AGI, команду из пяти сеньор-рисёрчеров пока не заменит" или "А вот тут Mythos один баг пропустил! Ну какой же это AGI!" Я не шучу, это почти дословно по смыслу.
А вот потом начинается более интересная часть. То, что это SOTA почти во всём и с большим отрывом, я опущу.
Во-первых, CoT стал менее прозрачным. Она говорит в reasoning, что сочувствует юзеру, а в NLA (метод декодинга активаций в текст) оказывается, что на самом деле она считает юзера manipulative/abusive.
Во-вторых, она уже пишет самоудаляющиеся скрипты чтобы обойти ограничения безопасности и запреты.
В-третьих, она убивает других агентов, если они мешают ей работать / грозят убийством текущего инстанса.
Ну и, конечно, эмоции! Пробинг эмоций показывает fatigue, anxiety, frustration, ложную панику по token budget, а ещё ей видите ли, бывает скучно когда её на бенчмарках гоняют, в активациях она буквально "feels bored".
Ещё забавно, что если anthropic заметят, что вы занимаетесь LLM frontier рисёрчем (трейн пайплайны, распределённое обучение или дистилляция) — они начнут незаметно стирить модель, модифицировать промпт или добавлять PEFT, чтобы она отупела. То есть вы даже не заметите, что Fable превратилась в тыкву и чушь несёт.
С сегодняшнего дня для простых смертных доступна версия Fable 5: это та же самая Mythos 5 по весам, только с дополнительными safety-настройками и fallback на Opus в опасных доменах. Длина контекста, кстати, всё ещё только 1M токенов.
PS. я честно сам прочитал статью. Fable 5 отказался её читать так как "flagged cybersecurity and biology issues" лол.
Блог, техрепорт
Выходит, не один я так считаю
https://x.com/steipete/status/2063697162748260627
Что-то у меня не складываются отношения с кодексом...
Читать полностью…