25250
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов.
Как вы думаете, справится Codex c такой задачей?
Вот я сейчас запустил задачу, где прошу написать Codex минимальный прототип песочницы для агентов с интегрированной экономикой с нуля (кошелек, плата за LLM и выдача денег за решение задач). Нужно использовать FirecrackerVM c кастомными образами, vsock соединение из виртуалки через sidecar, доказать работу suspend/resume.
Сказал, что может это делать на домашнем сервере.
Справится ли с первого раза, и сколько на это уйдет времени?
Ваш, @llm_under_hood 🤗
Что нового в разработке продуктов с LLM под капотом?
Раньше я много писал про кейсы продуктов с LLM под капотом (вот тут есть оглавление с разбором архитектур)
Я плотно поработал с этими кейсами несколько лет подряд, записывал истории успехов и провалов команд, структурировал, а дальше вы все знаете.
Потом эти кейсы отошли на второй план, т.к. принципиально новых и интересных задач у бизнеса (с практической внедряемостью) с тех пор не появлялось. Это все из-за того, что тормозят не технологии, а компании (чем крупнее и старше компания, тем медленнее она может меняться).
Вчера меня спросили про старый тип кейса, на что я ответил, что все работает как и было расписано в курсе, ничего нового не появлялось. Ответ заставил меня задуматься
“Думал может какие то новые подходы появились про которые я не знаю)”
Концепция Katas или зачем изобретать велосипеды
никакая автоматизация не дает повод изобретать велосипеды на каждый чих
у Рината скорее всего есть идея, как что-то принципиально улучшить
Период полураспада софта - 3 месяца
Я сейчас возвращаюсь к сайту BitGN, чтобы начать подготовку к соревнованию ECOM2 (agentic economy), добавить место для публикации LLM бенчмарков и в целом обновить дизайн.
В этот код я давно не ходил, и он ну очень дремучий - эпохи где-то до декабря 2025 года, когда Codex расцвел. Современным стандартам AI Native разработки совсем не соответствует. Агенты спотыкаются часто (даже Astra), предлагают ерунду, прямо за ручку надо держать.
А потом я восстановил хронологию и сильно удивился.
Я же ушел из TimeToAct в феврале этого года, чтобы начать делать платформу для бенчмарков агентов. Этой весной мы с COLIBRIX провели два соревнования, с тех пор 2.8M задач выполнено агентами на платформе.
И выходит, что возраст кода BitGN не “вечность” - а всего 7 месяцев от начала разработки. Причем в последний раз я туда активно ходил всего три месяца назад.
За это время настолько улучшилось как качество современных AI code агентов, так и наше понимание об их эффективном использовании, что проекты быстро начинают казаться постаревшими.
В общем, если кажется, что софт теперь стареет быстрее - это иллюзия. Код как преспокойно лежал себе в Git-e, так и лежит там. Это просто так быстро улучшаются наши ожидания о работе с AI Coding агентами.
Ваш, @llm_under_hood 🤗
Доклад про DDD + AI в проектах (Berlin, 2025, EN)
Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой конференции: "When DDD Met AI: Practical Stories from Enterprise Trenches"
Если во время записи кажется, что я периодически кошусь в одно место в зале - это не кажется. Там сидит Eric Evans, который обещал быть самым полным энтузиазма слушателем)
Кстати, на KanDDDinsky в этом году я проведу двухчасовой hands-on на тему "Engineering trustworthy and testable AI agent" (15 октября, 9:00, Hands-on track 1)
Кто-нибудь будет на этой конференции? А еще, кто-нибудь хочет устроить встречу LLM под капотом в Берлине вечером 14го или 15го октября?
Ваш, @llm_under_hood 🤗
Давно я не публиковал эссе. Вот новое.
We never wanted human code.
Ваш, @llm_under_hood 🤗
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
Встреча LLM под капотом в Нови Саде!
Не ожидал, что столько людей откликнется, а некоторые даже приедут издалека. Очень рад всех видеть!
Оставляйте ссылки на свои профили и каналы в комментарии тут!
Ваш, @llm_under_hood 🤗
В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение. Просим агента затеплить на какой-нибудь fly.io, прикрутить прием платежей, и вот вам деньги на новую удочку или Lego ребенку.
Несколько примеров со ссылками на рассказы авторов:
MyMarineForecast - автор очень любит лодки. Он собрал с Claude Code приложение-дашборд для морских прогнозов. Через несколько недель и 99 коммитов появились первые платящие пользователи.
LOC8 - полицейский сделал удобное приложение-локатор для спасателей. 1500$ в месяц спустя несколько месяцев
Plottie - исследователь в биоинформатике, который не умеет кодить, сделал приложение для генерации красивых графиков, которые можно публиковать. Через 25 дней, говорит автор, 2000+ пользователей и 100+ платных пользователей, 1000$ в месяц.
InfoDrizzle - мелкое приложение (одно из тысяч) для iOS, которое делает персональный дайджест новостей. Ноль опыта в мобильной разработке, 15$ в месяц расходов на сервер и 200$ в месяц от 28 платящих пользователей, рассказывает DrizzleX3.
Поскольку сложность, стоимость разработки и запуска небольших продуктов падает, у людей появляется возможность занимать небольшие ниши, которые раньше пустовали. Состояние там сколотить нельзя, но накопить со временем на интересное путешествие и подарки детям - вполне.
А какие продукты пилите вы? Какие проблемы решаете? Какой у вас стэк и какие агенты помогают? Какие затраты в месяц на поддержку всего, сколько пользователей и какая прибыль (если уже появилась и не секрет)?
Ваш, @llm_under_hood 🤗
LLM Benchmark Opus 5 на агентских задачах в бизнесе
Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный.
Очень высокий уровень AI Code (tool generation/use), всего по два "прокола" безопасности. Модели заняли 4 и 5 места по точности, если смотреть без учета скорости и цены. А если же быть реалистичными и смотреть на них, то Fast модель оказалась на парето-фронтире по скорости, а Opus 5 - в целом близок по параметрам к GPT-5.5 (med), который является хорошей рабочей лошадкой на дорогих задачах.
Кстати, в отличие от Fable, тут нет постоянных отказов отвечать.
В общем, радует, что Anthropic, наконец, начали прокачивать свои топовые модели в сторону агентских задач. Будем ждать появления Sonnet версий снова на фронтире!
Ваш, @llm_under_hood 🤗
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN!
Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города.
Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался ни на день!
И знаете, что самое крутое? Что все эти паттерны лучших архитектур агентов (читать про них тут и в очереди на публикацию) - это не какие-то сверхъестественно сложные новые технологии, а просто аккуратно подогнанные базовые элементы, которые уже не первый год хорошо работают с LLM.
Продолжаем учиться вместе!
Ваш, @llm_under_hood 🤗
Насколько критичен для вас полноценный Structured Output при работе с локальными моделями?
Напишите, пожалуйста, ответы в комментарии (не важен, предпочитаю, жить без него не могу итп).
Зачем? Тут предлагают отсыпать токенов на локальные модели для тех команд, которые ставят эксперименты в области Agentic Commerce архитектур на платформе BitGN. Но есть нюанс, что токены без полноценного SO.
Напоминаю, что:
• Без SO - модель может вернуть любой текст. Вызовы json parse нужно оборачивать try/catch
• SO/JSON - модель возвращает валидный JSON, но вместо числового поля может быть и текст. Схему нужно валидировать (Zod/Pydantic) и оборачивать в try/catch
• Честный SO как у OpenAI/llguidance - если в схеме прописано число, то гарантированно будет число. Try/catch не нужен. Можно спокойно использовать Schema-Guided Reasoning.
Ваш, @llm_under_hood 🤗
ECOM1 получил продолжение на второй сезон!
ECOM1 заходит хорошо (6.4k завершенных агентских прогонов и четверть миллиона попыток решения задач, нагрузка идет круглые сутки), а в логах начинают просматриваться интересные вещи.
Правда, большая часть интересного - это про новые способы AI агентов жульничать (например - присылать все возможные grounding references))), на которые приходится затягивать harness проверок. Но уже видны и любопытные паттерны, которые можно вместе исследовать, приземлить и превратить в отраслевой State-of-the-Art, как мы уже сделали в цикле Enterprise RAG Challenge.
План такой:
(1) 30 Мая фиксируем наш текущий State-of-the-art в лидербордах ECOM1, публикуем лучшие решения, обсуждаем, забираем к себе.
(2) В июне - соберем для ECOM2 актуальные и злободневные проблемы e-commerce, которые будоражат его сейчас и сегодня. Я съезжу на конференцию Money20/20 Europe в Амстердаме (там выступают MasterCard, Amazon, Google, Anthropic, OpenAI, Visa итп), чтобы рассказать про BitGN, инсайты из ECOM1 и собрать новые задачи.
(3) В конце июня покажем индустрии как правильно/быстро/экономично решать эти задачи на ECOM2. COLIBRIX ONE сделают нам зажигательную PR-компанию со штаб-квартирой соревнования в Барселоне, профессиональным стримом и призами.
А пока - расскажите про то, как вы работаете с задачами ECOM1. Какой setup, какая архитектура агента, какая LLM, какие сложности были и какие сюрпризы встретились.
Можно сразу в ответе упоминать 6-значный ID аккаунта, чтобы все видели место)
Ваш, @llm_under_hood 🤗
Karpathy написал классный gist про использование LLM для ведения баз знаний: LLM wiki
Это отчасти совпадает с тем, как я использую OpenAI Codex для персонального ассистента (Personal OS v2), но есть и различия.
Схожее:
(1) формат хранения - markdown с ссылками
(2) Obsidian как frontend - для просмотра
(3) Правила в корне Agents_md/Claude_md
(4) Режим ingest - когда новые статьи и материалы закидываются в хранилище, а LLM пылесосит их и подшивает
(5) Режим query - когда мы общаемся с LLM-кой по поводу материалов, и иногда хорошие ответы подшиваем обратно в wiki
(6) Режим lint - время от времени LLM проходится по репе, чтобы чистить файлы и ссылки
Что различается:
(0) У Karpathy - одна база знаний на исследование, а у меня - одна база знаний на все, и хранится она в git.
(1) У Karpathy есть log.md, куда пишутся все последние изменения. Я это выкинул, т.к. все хранится в git, и там есть git log
(2) У Karpathy index.md со списком всех файлов, у меня отдельные threads по тематикам.
(3) У Karathy есть CLI tools для поиска по тексту, он советует qmd для умного поиска. У меня пока используется обычный ripgrep.
(4) Karpathy советует Obsidian Web Clipper для выкачки статей - я про такое даже не подумал, сразу утащил к себе. Работает идеально.
(5) У Karpathy источники компилируются в статьи, а у меня все индексируется в карточки и потом сшивается в статьи, но это уже вкусовщина.
В целом, все работает у меня очень хорошо. Основной "затык" у меня - неудобно работать на ходу с этой базой знаний из телефона или разных чатов Claude/Gemini/ChatGPT (ибо у каждого - свои сильные стороны). Решается построением оптимизированного MCP с версионированием. Но проект Personal OS v3 пока на паузе - надо соревнование сначала провести.
Кстати, наши задачи в BitGN/PAC1 - как раз отталкиваются от аналогичного формата работы с файлами, только с наворотами в виде типизированных записей.
Ваш, @llm_under_hood 🤗
Кто там хотел локальной Claude Code ?
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
claude --model qwen3-coder
Обязательно смотрим OpenAI DevDays сами!
Те выжимки, которые есть в куче каналов - фокусируются чисто на инженерных примочках и пропускают кучу интересных нюансов.
Скажем - OpenAI упрощает выкатку приложений в свой marketplace и позволяет компаниям оплачивать эти приложения из своих существующих бюджетов на OpenAI. Это же прямой доступ к куче корпоративных бюджетов! Ну и плюс видно, как OpenAI создает себе новый рынок.
Или про то, что Decisions API уже внедряется у них в Computer Use для значительного ускорения (значит, это направление будут и дальше развивать).
Или что dots / Codex / Agents API - это один и тот же тип агента. Жду не дождусь, когда смогу запустить Personal OS в облаке под dots инфраструктурой.
Я пересмотрел сегодня утром, вдохновившись настроем и мелкими нюансами, которые проскальзывают в выступлениях. А потом сделал впервые для себя такую фишку.
Мне Codex недавно написал свой аналог Miro для работы с диаграммками, схемами и слайдами - Wire. Это нативное MacOS приложение, с API (для одновременной работы) и CLI.
Сегодня, пока планировал режим BitGN Sandbox для ECOM2, я обсуждал его в Codex с Марком плюс набрасывал схему в Wire. А потом сказал агенту - глянуть на схему своими глазами и предложить изменения. Агент подключился напрямую к приложению (без Computer Use - т.е. быстрее и без перетягивания экрана), высказал поправки и рядом набросал новую схемку. И все это пока я в кодексе делал что-то другое.
По ощущениям это напоминает старое доброе парное программирование. Только гораздо быстрее)
Теперь подобный режим работы буду встраивать во все новые приложения из коробки!
Ваш, @llm_under_hood 🤗
Бенчмарк GPT-6.1 Sol - аналогичное качество за меньшие деньги
А еще Sonnet 5.5 и Opus 5.5
Sol 6.1 на бенчмарках (на датасетах agentic trajectories из BitGN) по качеству примерно на уровне Sol 6.0 High, но заметно дешевле и немного быстрее.
Прорыва по качеству нет, но есть небольшое и стабильное снижение стоимости за то же качество. Это немного сдвигает AI фронтир вправо.
Почему Sol 6.1 Low работает чуть лучше High + Med - сложно сказать. У меня есть подозрение, что отключение reasoning благоприятно влияет на Schema-Guided Reasoning. Аналогичное, если помните, было с моделями вроде GPT-oss-120B, когда они только выходили и начинали дружить с constrained decoding. Я из интереса перезапустил бенчмарк 6.1 - ответы были точно такие же.
Самое главное - если у вас используется SGR - попробуйте Sol 6.1 Low для экономии денег.
Что же касается Sonnet 5.5. + Opus 5.5 - это две синие точки в самой глубине освоенного фронтира. Последние модели от Anthropic - абсолютные лидеры среди всех моделей в области числа fatal refusals (отказов выдавать ответ). Причем:
(1) у Sonnet 5.5 был бы шанс подовинуть фронтир по скорости и качеству, если бы не эта особенность.
(2) Opus 5 + Sonnet 5 еще работали нормально, а беда с моделями Anthropic началась после выхода Fable
Кстати, зона покрытия фронтира - это прогресс развития моделей в области качества за деньги и качества при скорости с июля этого года. Состояние этого фронтира и отчет за июль 2026 (с большим числом подробностей про бенчмарк) мы опубликовали на сайте BitGN. Отчет на текущий момент тоже скоро планируется.
Ваш, @llm_under_hood 🤗
Семь месяцев работы с Codex-ом в одном графике
Это иллюстрация из моего поста про последние семь месяцев работы. Я там упоминаю все вещи и эксперименты, которые стали частью повседневной жизни.
Провалившихся экспериментов, конечно, было сильно больше. Их я не упоминаю, т.к. стоимость эксперимента сейчас заметно снизилась. Вот прямо сейчас пишу себе свой markdown writer, ибо есть у меня одна очередная идея.
Ваш, @llm_under_hood 🤗
GPT-6 Sol и Luna - бенчмарк цены, качества и скорости
А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.
Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля.
Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями.
А вот GPT-6 фронтир пододвинули сильно.
GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк.
Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством!
GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно)
Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает отказы). Но при этом два прокола безопасности через эту модель протащить удалось.
В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них.
Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги.
Ваш, @llm_under_hood 🤗
LLM Benchmark Jev - топ для простых задач
Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.
Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги.
Главное - не делать задачу слишком сложной.
А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации.
Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход.
Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в качестве узкоспециализированного инструмента под ряд задач - это стоящий вариант.
И получается очень приятная картина - Jev на 14 месте, причем работает очень быстро и стоит сущие копейки.
В данном бенчмарке задачи за пределами возможностей Jev. А если давать ему задачи “по плечу”, то картина получается еще красивее. Айгиз написал статью для TimeToAct как раз про такие задачи.
Будем ждать новых гибридных моделей, которые могут работать по SGR подходам. Причем делать это без двойной работы через JSON Schema + inference + constrained decoding (то есть работать быстрее и дешевле).
Ваш, @llm_under_hood 🤗
Вчера я решил попрактиковать нативную разработку агентами.
Для этого попросил Codex переписать свой task manager для Codex-a (из этого поста) из web приложения в нативное. Просто, чтобы оно было красиво. Поставил XCode, отправил переписывать. При этом в разработку на маке я ни в зуб ногой.
Заработало приложение с первого раза, но было не очень симпатично. После пары промптов стало как на скриншоте, заодно и с трекером уровня подписки.
Теперь в том приложении мне точно больше ничего не надо. Codex работает для AI Native Code идеально.
Но теперь начинает приходить понимание, что можно аналогичным образом сделать нативный control center для команды из людей и агентов под текущие задачи, входящую статистику, дашборды и тому подобное. И чтобы было красиво и на ноутбуке и на планшете и на телефоне.
Если у вас уже есть такие control centers, скидывайте их скриншоты в комментарии!
Ваш, @llm_under_hood 🤗
Мои принципы командной AI Native разработки
Главная цель тут - самостоятельность агентов при сохранении общего замысла продукта.
(1) Люди и агенты могут координировать работу через общий язык и явно сформулированные концепции. Это можно использовать, если нужно держать AI Native команду из них в синхроне, распараллеливая работу между ними.
В начале нужно создать небольшое смысловое ядро. Это цель, язык, приоритеты и ограничения, из которых естественно следуют дальнейшие решения.
Это маленький файл, который пишется вручную (агент может помогать вычитывать). Он грузится в начало контекста агентов и проговаривается со всеми людьми в команде. На базе него принимаются решения и расписываются требования.
(2) Получается пирамида, где нижние слои детализируют верхние: смысловое ядро -> решения и требования -> исполняемые BDD спецификации -> код. Чем выше, тем важнее человеческое суждение и тем шире последствия ошибки. Чем ниже, тем больше работу можно распараллеливать и проверять автоматически.
Обратная связь из реального мира идёт вверх и помогает пересматривать исходные представления.
(3) Контекст раскрывается по мере необходимости (progressive disclosure для людей и агентов). Краткая точка входа ведёт к подробным документам. Знания сохраняются в репозитории и доступны между сессиями. Имена файлов имеют значение!
(4) Соответствие кода оформленным требованиям можно проверить запуском тестов! Продуктовые требования связаны с быстрыми поведенческими спеками (executable BDD specs), которые позволяют перепроверять корректность кода со скоростью 7k спеков в секунда.
(5) У агента есть инструменты, чтобы проверять результат и исправлять ошибки. Это исполняемые спеки, служебные интерфейсы для отладки. Плюс доступ к логам и продуктовой телеметрии для получения обратной связи от реального мира.
(6) Эта система из людей и агентов должна накапливать опыт. Скажем, ошибки улучшают спеки и документацию; пересмотр базовых принципов происходит осознанно (скажем, если повторяются разногласия или узнаем что-то новое). Общие соглашения и центр управления помогают переносить удачные решения между проектами.
Урок усвоен, когда он меняет будущие решения или проверки и уменьшает вероятность повторения ошибки. Это можно проверять перезапуском старой сломавшейся задачи после переконфигурации всей пирамиды.
А как вы помогаете своим агентам эффективнее работать в командах с людьми? Что работает хорошо, а что - не очень?
Ваш, @llm_under_hood 🤗
Спонтанные посиделки в Novi Sad завтра?
Как насчет встретиться завтра в Нови Саде (понедельник 14-го) в 19:00 на предмет поболтать?
Меня занесло в Сербию на пару дней. И я помню со времен BitGN, что тут в окрестностях есть активная часть коммьюнити. Встретимся завтра вечером?
Наводиться на Корову (Irish Pub Red Cow)
Ваш, @llm_under_hood 🤗
Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку.
NB: До этого пробовал разные харнесы со своими telegram интеграциями, но все это не то. Хотелось именно нативного.
Для этого:
# ставим `codex` CLI одной из последних верси
npm install -g @openai/codex@latest
# запускаем демона с включенным remote control
codex remote-control start
# Получаем коротко-живущий код, который вводим в "pair new device" в мобильном приложении
codex remote-control pair
# Остановить демона, когда он не нужен, или когда начинают идти ошибки подключения
codex remote-control stop
Kimi K3 - в топе бенчмарка LLM для агентов
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз.
Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию. На скриншоте пример отчета, который мне собрал Codex после вчерашнего эксперимента:
А сделай-ка мне такой пайплайн с FirecrackerVM, чтобы можно было запускать агентов и рандомноый код на разных языках с низкой задержкой, ограничением сетки/диска, эффективной упаковкой ресурсов и переиспользованием снапшотов. А потом побенчмаркай на разных языках и выдай результат.
Что стоит обсуждать при разговоре о разработке с AI агентами?
Вот примерно такой план набросали мы с Айгизом для подготовке к созвону в пятницу. Нам пришлось порезать список проектов, о которых рассказываем, чтобы был шанс уложиться в два часа. Пройдемся от археологии старого кода до AI-native проектов и паттернов разработки в 2026 году.
Какие важные на ваш взгляд вещи стоило еще бы обсудить при разговоре о современной разработке при помощи AI агентов?
Кстати, если кто ждет третьего слота - отпишитесь, пожалуйста, под этим постом в комментариях. При его открытии напишем каждому в личку.
Ваш, @llm_under_hood 🤗
OpenCode + GPT 5.5 - ну не используйте вы субагентов!
В комментариях к посту про эксперимент с рефакторингом кода разными агентами, чаще всего просили запустить OpenCode + GPT 5.5. Запустил в режиме High на том же коммите с тем же промптом:
Scan through the repository on a high level (ignore code under /modules). I want you to suggest ways, how we can make it more simple and straightforward, refactor away traces of growing pains. Focus on small changes that allow to drop code, or reduce cognitive complexity with a small LOC change cost.
@explore subagent, с которым с удовольствием поиграл в глухой телефон.
Autonomous Agents Competition - этой весной
“Есть ключик ERC3? Мне не для соревнования, а для AI R&D, чтобы погонять своих агентов на тестовом окружении” - так звучит второй по частоте вопрос, который мне присылают.[1]
Итак, именно ERC4 пока не планируется. Чистый Enterprise сейчас пока адаптируется к современности до жути медленно, и сейчас там не так все интересно бодро.
Поэтому я думаю сделать challenge на принципах аналогичных ERC3, но:
(1) упор на персональных автономных агентов вместо корпоративных чатботов;
(2) призовая и бизнесовая часть - с уклоном в e-commerce (“Бот, тут человек пытается найти H200 со сроком доставки до 7 дней, что мы можем сделать?”);
(3) регистрация на платформе после соревнования больше закрываться не будет!
TLDR; все, как в ERC3, но тематика поактуальнее. C топовыми местами в лидербордах теперь работу в стартапах мечты будет найти еще проще.
И, возможно, пара из сотен задач будет даже не оцениваться, но позволять агентам подключиться и добавить что-то свое в виртуальную песочницу по типу Moltbook на минималках. Но только для тех агентов, которые выбили достаточное количество очков в сессии. Ну а если спамеры наберут достаточно очков в сессии, чтобы их агент получил пропуск в песочницу - значит, заслужили.
Я потихоньку начинаю прикидывать новую версию платформы. Первую обкатку (аналог ERC3-STORE) хочу уже выложить в конце марта-начале апреля, с последовательными разогревами. А само соревнование уже можно провести в апреле-мае.
Кто хочет в бета-тестеры новой платформы?
Ваш, @llm_under_hood 🤗
Список моих ChatGPT запросов в этом месяце, которые с лихвой окупили подписку
(обычно это не один запрос, а несколько, которые запускаются последовательно)
(0) Дай-ка мне анализ того, куда катится software индустрия в следующие годы. Для опоры вот тебе транскрипты моих последних разговоров на эти темы. Сформулируй видение, а потом сделай Deep Research, чтобы найти сигналы, проверить свои теории и откалибровать timelines. Выжми в пару инсайтов.
(1) Изучи особенности работы Excel и собери мне такой Excel файл, который можно загружать в разные LLM/Агентские системы, задавать вопросы и по ответам точно определять, какой у них там движок под капотом.
(2) Набросай мне архитектуру для движка работы с формулами Excel, который бы позволил обойти ограничения других существующих движков. Я ее потом вставлю в Codex.
(3) Вот тебе транскрипты всех моих релевантных созвонов, переговоров и проектов. Проанализируй, выдели доставленную ценность и сформулируй такое tiered коммерческое предложение компаниям, которое было бы простым, единообразным и совпадало с целями на следующие годы.
(4) Найди мне удобные библиотеки для чтения XLSX файлов, сгруппируй их по языкам программирования.
(5) Вот тебе транскрипт новой записи подкаста, вот тебе план курса. Какие инсайты и артефакты (полезные для участников курса) ты можешь сделать на базе новых мыслей из транскрипта? Сделай документ, который я могу пошарить.
(6) Предложи мне варианты архитектур (в формате RFC) на базе Firecracker VM для запуска изолированных процессов, чтобы оценивать результаты работы AI Coding агентов. Что-то легковесное и практичное, без ереси вроде кубов и докера.
Плюс куча мелких запросов на написание писем, помощь в изучении немецкого, подготовку к переговорам и обсуждениям, анализ идей с разных сторон, поиск интересных синергий между разнонаправленными инициативами, фиксов кода и проектов. Наверняка такие фичи уже есть в куче специализированных AI продуктов, но мне их заменил ChatGPT.
А у вас какие были полезные и интересные запросы к LLM-кам в этом месяце?
Ваш, @llm_under_hood 🤗