25250
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов.
Семь месяцев работы с Codex-ом в одном графике
Это иллюстрация из моего поста про последние семь месяцев работы. Я там упоминаю все вещи и эксперименты, которые стали частью повседневной жизни.
Провалившихся экспериментов, конечно, было сильно больше. Их я не упоминаю, т.к. стоимость эксперимента сейчас заметно снизилась. Вот прямо сейчас пишу себе свой markdown writer, ибо есть у меня одна очередная идея.
Ваш, @llm_under_hood 🤗
GPT-6 Sol и Luna - бенчмарк цены, качества и скорости
А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.
Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля.
Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями.
А вот GPT-6 фронтир пододвинули сильно.
GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк.
Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством!
GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно)
Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает отказы). Но при этом два прокола безопасности через эту модель протащить удалось.
В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них.
Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги.
Ваш, @llm_under_hood 🤗
LLM Benchmark Jev - топ для простых задач
Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.
Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги.
Главное - не делать задачу слишком сложной.
А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации.
Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход.
Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в качестве узкоспециализированного инструмента под ряд задач - это стоящий вариант.
И получается очень приятная картина - Jev на 14 месте, причем работает очень быстро и стоит сущие копейки.
В данном бенчмарке задачи за пределами возможностей Jev. А если давать ему задачи “по плечу”, то картина получается еще красивее. Айгиз написал статью для TimeToAct как раз про такие задачи.
Будем ждать новых гибридных моделей, которые могут работать по SGR подходам. Причем делать это без двойной работы через JSON Schema + inference + constrained decoding (то есть работать быстрее и дешевле).
Ваш, @llm_under_hood 🤗
Вчера я решил попрактиковать нативную разработку агентами.
Для этого попросил Codex переписать свой task manager для Codex-a (из этого поста) из web приложения в нативное. Просто, чтобы оно было красиво. Поставил XCode, отправил переписывать. При этом в разработку на маке я ни в зуб ногой.
Заработало приложение с первого раза, но было не очень симпатично. После пары промптов стало как на скриншоте, заодно и с трекером уровня подписки.
Теперь в том приложении мне точно больше ничего не надо. Codex работает для AI Native Code идеально.
Но теперь начинает приходить понимание, что можно аналогичным образом сделать нативный control center для команды из людей и агентов под текущие задачи, входящую статистику, дашборды и тому подобное. И чтобы было красиво и на ноутбуке и на планшете и на телефоне.
Если у вас уже есть такие control centers, скидывайте их скриншоты в комментарии!
Ваш, @llm_under_hood 🤗
Мои принципы командной AI Native разработки
Главная цель тут - самостоятельность агентов при сохранении общего замысла продукта.
(1) Люди и агенты могут координировать работу через общий язык и явно сформулированные концепции. Это можно использовать, если нужно держать AI Native команду из них в синхроне, распараллеливая работу между ними.
В начале нужно создать небольшое смысловое ядро. Это цель, язык, приоритеты и ограничения, из которых естественно следуют дальнейшие решения.
Это маленький файл, который пишется вручную (агент может помогать вычитывать). Он грузится в начало контекста агентов и проговаривается со всеми людьми в команде. На базе него принимаются решения и расписываются требования.
(2) Получается пирамида, где нижние слои детализируют верхние: смысловое ядро -> решения и требования -> исполняемые BDD спецификации -> код. Чем выше, тем важнее человеческое суждение и тем шире последствия ошибки. Чем ниже, тем больше работу можно распараллеливать и проверять автоматически.
Обратная связь из реального мира идёт вверх и помогает пересматривать исходные представления.
(3) Контекст раскрывается по мере необходимости (progressive disclosure для людей и агентов). Краткая точка входа ведёт к подробным документам. Знания сохраняются в репозитории и доступны между сессиями. Имена файлов имеют значение!
(4) Соответствие кода оформленным требованиям можно проверить запуском тестов! Продуктовые требования связаны с быстрыми поведенческими спеками (executable BDD specs), которые позволяют перепроверять корректность кода со скоростью 7k спеков в секунда.
(5) У агента есть инструменты, чтобы проверять результат и исправлять ошибки. Это исполняемые спеки, служебные интерфейсы для отладки. Плюс доступ к логам и продуктовой телеметрии для получения обратной связи от реального мира.
(6) Эта система из людей и агентов должна накапливать опыт. Скажем, ошибки улучшают спеки и документацию; пересмотр базовых принципов происходит осознанно (скажем, если повторяются разногласия или узнаем что-то новое). Общие соглашения и центр управления помогают переносить удачные решения между проектами.
Урок усвоен, когда он меняет будущие решения или проверки и уменьшает вероятность повторения ошибки. Это можно проверять перезапуском старой сломавшейся задачи после переконфигурации всей пирамиды.
А как вы помогаете своим агентам эффективнее работать в командах с людьми? Что работает хорошо, а что - не очень?
Ваш, @llm_under_hood 🤗
Спонтанные посиделки в Novi Sad завтра?
Как насчет встретиться завтра в Нови Саде (понедельник 14-го) в 19:00 на предмет поболтать?
Меня занесло в Сербию на пару дней. И я помню со времен BitGN, что тут в окрестностях есть активная часть коммьюнити. Встретимся завтра вечером?
Наводиться на Корову (Irish Pub Red Cow)
Ваш, @llm_under_hood 🤗
Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку.
NB: До этого пробовал разные харнесы со своими telegram интеграциями, но все это не то. Хотелось именно нативного.
Для этого:
# ставим `codex` CLI одной из последних верси
npm install -g @openai/codex@latest
# запускаем демона с включенным remote control
codex remote-control start
# Получаем коротко-живущий код, который вводим в "pair new device" в мобильном приложении
codex remote-control pair
# Остановить демона, когда он не нужен, или когда начинают идти ошибки подключения
codex remote-control stop
Kimi K3 - в топе бенчмарка LLM для агентов
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз.
Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию. На скриншоте пример отчета, который мне собрал Codex после вчерашнего эксперимента:
А сделай-ка мне такой пайплайн с FirecrackerVM, чтобы можно было запускать агентов и рандомноый код на разных языках с низкой задержкой, ограничением сетки/диска, эффективной упаковкой ресурсов и переиспользованием снапшотов. А потом побенчмаркай на разных языках и выдай результат.
Что стоит обсуждать при разговоре о разработке с AI агентами?
Вот примерно такой план набросали мы с Айгизом для подготовке к созвону в пятницу. Нам пришлось порезать список проектов, о которых рассказываем, чтобы был шанс уложиться в два часа. Пройдемся от археологии старого кода до AI-native проектов и паттернов разработки в 2026 году.
Какие важные на ваш взгляд вещи стоило еще бы обсудить при разговоре о современной разработке при помощи AI агентов?
Кстати, если кто ждет третьего слота - отпишитесь, пожалуйста, под этим постом в комментариях. При его открытии напишем каждому в личку.
Ваш, @llm_under_hood 🤗
OpenCode + GPT 5.5 - ну не используйте вы субагентов!
В комментариях к посту про эксперимент с рефакторингом кода разными агентами, чаще всего просили запустить OpenCode + GPT 5.5. Запустил в режиме High на том же коммите с тем же промптом:
Scan through the repository on a high level (ignore code under /modules). I want you to suggest ways, how we can make it more simple and straightforward, refactor away traces of growing pains. Focus on small changes that allow to drop code, or reduce cognitive complexity with a small LOC change cost.
@explore subagent, с которым с удовольствием поиграл в глухой телефон.
Autonomous Agents Competition - этой весной
“Есть ключик ERC3? Мне не для соревнования, а для AI R&D, чтобы погонять своих агентов на тестовом окружении” - так звучит второй по частоте вопрос, который мне присылают.[1]
Итак, именно ERC4 пока не планируется. Чистый Enterprise сейчас пока адаптируется к современности до жути медленно, и сейчас там не так все интересно бодро.
Поэтому я думаю сделать challenge на принципах аналогичных ERC3, но:
(1) упор на персональных автономных агентов вместо корпоративных чатботов;
(2) призовая и бизнесовая часть - с уклоном в e-commerce (“Бот, тут человек пытается найти H200 со сроком доставки до 7 дней, что мы можем сделать?”);
(3) регистрация на платформе после соревнования больше закрываться не будет!
TLDR; все, как в ERC3, но тематика поактуальнее. C топовыми местами в лидербордах теперь работу в стартапах мечты будет найти еще проще.
И, возможно, пара из сотен задач будет даже не оцениваться, но позволять агентам подключиться и добавить что-то свое в виртуальную песочницу по типу Moltbook на минималках. Но только для тех агентов, которые выбили достаточное количество очков в сессии. Ну а если спамеры наберут достаточно очков в сессии, чтобы их агент получил пропуск в песочницу - значит, заслужили.
Я потихоньку начинаю прикидывать новую версию платформы. Первую обкатку (аналог ERC3-STORE) хочу уже выложить в конце марта-начале апреля, с последовательными разогревами. А само соревнование уже можно провести в апреле-мае.
Кто хочет в бета-тестеры новой платформы?
Ваш, @llm_under_hood 🤗
Список моих ChatGPT запросов в этом месяце, которые с лихвой окупили подписку
(обычно это не один запрос, а несколько, которые запускаются последовательно)
(0) Дай-ка мне анализ того, куда катится software индустрия в следующие годы. Для опоры вот тебе транскрипты моих последних разговоров на эти темы. Сформулируй видение, а потом сделай Deep Research, чтобы найти сигналы, проверить свои теории и откалибровать timelines. Выжми в пару инсайтов.
(1) Изучи особенности работы Excel и собери мне такой Excel файл, который можно загружать в разные LLM/Агентские системы, задавать вопросы и по ответам точно определять, какой у них там движок под капотом.
(2) Набросай мне архитектуру для движка работы с формулами Excel, который бы позволил обойти ограничения других существующих движков. Я ее потом вставлю в Codex.
(3) Вот тебе транскрипты всех моих релевантных созвонов, переговоров и проектов. Проанализируй, выдели доставленную ценность и сформулируй такое tiered коммерческое предложение компаниям, которое было бы простым, единообразным и совпадало с целями на следующие годы.
(4) Найди мне удобные библиотеки для чтения XLSX файлов, сгруппируй их по языкам программирования.
(5) Вот тебе транскрипт новой записи подкаста, вот тебе план курса. Какие инсайты и артефакты (полезные для участников курса) ты можешь сделать на базе новых мыслей из транскрипта? Сделай документ, который я могу пошарить.
(6) Предложи мне варианты архитектур (в формате RFC) на базе Firecracker VM для запуска изолированных процессов, чтобы оценивать результаты работы AI Coding агентов. Что-то легковесное и практичное, без ереси вроде кубов и докера.
Плюс куча мелких запросов на написание писем, помощь в изучении немецкого, подготовку к переговорам и обсуждениям, анализ идей с разных сторон, поиск интересных синергий между разнонаправленными инициативами, фиксов кода и проектов. Наверняка такие фичи уже есть в куче специализированных AI продуктов, но мне их заменил ChatGPT.
А у вас какие были полезные и интересные запросы к LLM-кам в этом месяце?
Ваш, @llm_under_hood 🤗
Иллюстрация пайплайна из истории про спасение проекта с LLM под капотом
(проект про извлечение промышленных данных из разных PDF от разных поставщиков с таблицами и графиками)
Ссылки:
(1) Серии: 1, 2, 3, 4, 5, 6+7, Эпилог
(2) Описание первого и второго промпта.
Ваш, @llm_under_hood 🤗
Локальная gpt-oss-20b - эквивалент закрытой gpt-5-nano, а mini - 120b 🔥
Теперь все цифры сошлись. Я таки запустил gpt-oss-20b, как если бы reasoning у него изначально работал с поддержкой Structured Outputs.
Сейчас gpt-oss-20b из-за новизны архитектуры работает без Structured Outputs даже у Fireworks (это мне подтвердили ребята в OpenRouter). Но, думаю, для таких хороших моделей завезут поддержку новой архитектуры достаточно быстро.
Период полураспада софта - 3 месяца
Я сейчас возвращаюсь к сайту BitGN, чтобы начать подготовку к соревнованию ECOM2 (agentic economy), добавить место для публикации LLM бенчмарков и в целом обновить дизайн.
В этот код я давно не ходил, и он ну очень дремучий - эпохи где-то до декабря 2025 года, когда Codex расцвел. Современным стандартам AI Native разработки совсем не соответствует. Агенты спотыкаются часто (даже Astra), предлагают ерунду, прямо за ручку надо держать.
А потом я восстановил хронологию и сильно удивился.
Я же ушел из TimeToAct в феврале этого года, чтобы начать делать платформу для бенчмарков агентов. Этой весной мы с COLIBRIX провели два соревнования, с тех пор 2.8M задач выполнено агентами на платформе.
И выходит, что возраст кода BitGN не “вечность” - а всего 7 месяцев от начала разработки. Причем в последний раз я туда активно ходил всего три месяца назад.
За это время настолько улучшилось как качество современных AI code агентов, так и наше понимание об их эффективном использовании, что проекты быстро начинают казаться постаревшими.
В общем, если кажется, что софт теперь стареет быстрее - это иллюзия. Код как преспокойно лежал себе в Git-e, так и лежит там. Это просто так быстро улучшаются наши ожидания о работе с AI Coding агентами.
Ваш, @llm_under_hood 🤗
Доклад про DDD + AI в проектах (Berlin, 2025, EN)
Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой конференции: "When DDD Met AI: Practical Stories from Enterprise Trenches"
Если во время записи кажется, что я периодически кошусь в одно место в зале - это не кажется. Там сидит Eric Evans, который обещал быть самым полным энтузиазма слушателем)
Кстати, на KanDDDinsky в этом году я проведу двухчасовой hands-on на тему "Engineering trustworthy and testable AI agent" (15 октября, 9:00, Hands-on track 1)
Кто-нибудь будет на этой конференции? А еще, кто-нибудь хочет устроить встречу LLM под капотом в Берлине вечером 14го или 15го октября?
Ваш, @llm_under_hood 🤗
Давно я не публиковал эссе. Вот новое.
We never wanted human code.
Ваш, @llm_under_hood 🤗
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши
Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения
(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable
В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)
И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.
Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!
Ваш, @llm_under_hood 🤗
Встреча LLM под капотом в Нови Саде!
Не ожидал, что столько людей откликнется, а некоторые даже приедут издалека. Очень рад всех видеть!
Оставляйте ссылки на свои профили и каналы в комментарии тут!
Ваш, @llm_under_hood 🤗
В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение. Просим агента затеплить на какой-нибудь fly.io, прикрутить прием платежей, и вот вам деньги на новую удочку или Lego ребенку.
Несколько примеров со ссылками на рассказы авторов:
MyMarineForecast - автор очень любит лодки. Он собрал с Claude Code приложение-дашборд для морских прогнозов. Через несколько недель и 99 коммитов появились первые платящие пользователи.
LOC8 - полицейский сделал удобное приложение-локатор для спасателей. 1500$ в месяц спустя несколько месяцев
Plottie - исследователь в биоинформатике, который не умеет кодить, сделал приложение для генерации красивых графиков, которые можно публиковать. Через 25 дней, говорит автор, 2000+ пользователей и 100+ платных пользователей, 1000$ в месяц.
InfoDrizzle - мелкое приложение (одно из тысяч) для iOS, которое делает персональный дайджест новостей. Ноль опыта в мобильной разработке, 15$ в месяц расходов на сервер и 200$ в месяц от 28 платящих пользователей, рассказывает DrizzleX3.
Поскольку сложность, стоимость разработки и запуска небольших продуктов падает, у людей появляется возможность занимать небольшие ниши, которые раньше пустовали. Состояние там сколотить нельзя, но накопить со временем на интересное путешествие и подарки детям - вполне.
А какие продукты пилите вы? Какие проблемы решаете? Какой у вас стэк и какие агенты помогают? Какие затраты в месяц на поддержку всего, сколько пользователей и какая прибыль (если уже появилась и не секрет)?
Ваш, @llm_under_hood 🤗
LLM Benchmark Opus 5 на агентских задачах в бизнесе
Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный.
Очень высокий уровень AI Code (tool generation/use), всего по два "прокола" безопасности. Модели заняли 4 и 5 места по точности, если смотреть без учета скорости и цены. А если же быть реалистичными и смотреть на них, то Fast модель оказалась на парето-фронтире по скорости, а Opus 5 - в целом близок по параметрам к GPT-5.5 (med), который является хорошей рабочей лошадкой на дорогих задачах.
Кстати, в отличие от Fable, тут нет постоянных отказов отвечать.
В общем, радует, что Anthropic, наконец, начали прокачивать свои топовые модели в сторону агентских задач. Будем ждать появления Sonnet версий снова на фронтире!
Ваш, @llm_under_hood 🤗
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN!
Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города.
Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался ни на день!
И знаете, что самое крутое? Что все эти паттерны лучших архитектур агентов (читать про них тут и в очереди на публикацию) - это не какие-то сверхъестественно сложные новые технологии, а просто аккуратно подогнанные базовые элементы, которые уже не первый год хорошо работают с LLM.
Продолжаем учиться вместе!
Ваш, @llm_under_hood 🤗
Насколько критичен для вас полноценный Structured Output при работе с локальными моделями?
Напишите, пожалуйста, ответы в комментарии (не важен, предпочитаю, жить без него не могу итп).
Зачем? Тут предлагают отсыпать токенов на локальные модели для тех команд, которые ставят эксперименты в области Agentic Commerce архитектур на платформе BitGN. Но есть нюанс, что токены без полноценного SO.
Напоминаю, что:
• Без SO - модель может вернуть любой текст. Вызовы json parse нужно оборачивать try/catch
• SO/JSON - модель возвращает валидный JSON, но вместо числового поля может быть и текст. Схему нужно валидировать (Zod/Pydantic) и оборачивать в try/catch
• Честный SO как у OpenAI/llguidance - если в схеме прописано число, то гарантированно будет число. Try/catch не нужен. Можно спокойно использовать Schema-Guided Reasoning.
Ваш, @llm_under_hood 🤗
ECOM1 получил продолжение на второй сезон!
ECOM1 заходит хорошо (6.4k завершенных агентских прогонов и четверть миллиона попыток решения задач, нагрузка идет круглые сутки), а в логах начинают просматриваться интересные вещи.
Правда, большая часть интересного - это про новые способы AI агентов жульничать (например - присылать все возможные grounding references))), на которые приходится затягивать harness проверок. Но уже видны и любопытные паттерны, которые можно вместе исследовать, приземлить и превратить в отраслевой State-of-the-Art, как мы уже сделали в цикле Enterprise RAG Challenge.
План такой:
(1) 30 Мая фиксируем наш текущий State-of-the-art в лидербордах ECOM1, публикуем лучшие решения, обсуждаем, забираем к себе.
(2) В июне - соберем для ECOM2 актуальные и злободневные проблемы e-commerce, которые будоражат его сейчас и сегодня. Я съезжу на конференцию Money20/20 Europe в Амстердаме (там выступают MasterCard, Amazon, Google, Anthropic, OpenAI, Visa итп), чтобы рассказать про BitGN, инсайты из ECOM1 и собрать новые задачи.
(3) В конце июня покажем индустрии как правильно/быстро/экономично решать эти задачи на ECOM2. COLIBRIX ONE сделают нам зажигательную PR-компанию со штаб-квартирой соревнования в Барселоне, профессиональным стримом и призами.
А пока - расскажите про то, как вы работаете с задачами ECOM1. Какой setup, какая архитектура агента, какая LLM, какие сложности были и какие сюрпризы встретились.
Можно сразу в ответе упоминать 6-значный ID аккаунта, чтобы все видели место)
Ваш, @llm_under_hood 🤗
Karpathy написал классный gist про использование LLM для ведения баз знаний: LLM wiki
Это отчасти совпадает с тем, как я использую OpenAI Codex для персонального ассистента (Personal OS v2), но есть и различия.
Схожее:
(1) формат хранения - markdown с ссылками
(2) Obsidian как frontend - для просмотра
(3) Правила в корне Agents_md/Claude_md
(4) Режим ingest - когда новые статьи и материалы закидываются в хранилище, а LLM пылесосит их и подшивает
(5) Режим query - когда мы общаемся с LLM-кой по поводу материалов, и иногда хорошие ответы подшиваем обратно в wiki
(6) Режим lint - время от времени LLM проходится по репе, чтобы чистить файлы и ссылки
Что различается:
(0) У Karpathy - одна база знаний на исследование, а у меня - одна база знаний на все, и хранится она в git.
(1) У Karpathy есть log.md, куда пишутся все последние изменения. Я это выкинул, т.к. все хранится в git, и там есть git log
(2) У Karpathy index.md со списком всех файлов, у меня отдельные threads по тематикам.
(3) У Karathy есть CLI tools для поиска по тексту, он советует qmd для умного поиска. У меня пока используется обычный ripgrep.
(4) Karpathy советует Obsidian Web Clipper для выкачки статей - я про такое даже не подумал, сразу утащил к себе. Работает идеально.
(5) У Karpathy источники компилируются в статьи, а у меня все индексируется в карточки и потом сшивается в статьи, но это уже вкусовщина.
В целом, все работает у меня очень хорошо. Основной "затык" у меня - неудобно работать на ходу с этой базой знаний из телефона или разных чатов Claude/Gemini/ChatGPT (ибо у каждого - свои сильные стороны). Решается построением оптимизированного MCP с версионированием. Но проект Personal OS v3 пока на паузе - надо соревнование сначала провести.
Кстати, наши задачи в BitGN/PAC1 - как раз отталкиваются от аналогичного формата работы с файлами, только с наворотами в виде типизированных записей.
Ваш, @llm_under_hood 🤗
Кто там хотел локальной Claude Code ?
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
claude --model qwen3-coder
Платформа для ERC3: AI Agents открыта!
На ней мы будет проводить соревнование 26 ноября (и после) по поиску оптимальных архитектур для AI агентов. Готовиться можно начинать уже сейчас:
Что можно сделать уже сейчас
(1) Ввести свой email, с которым регистрировались на ERC3, и получить ERC3_API_KEY. Новые регистрации активируются на платформе в течение 24 часов.
(2) Посмотреть бенчмарки на платформе
(3) Посмотреть исходники тестового агента (gpt-4o) и запустить его с ключом и любой моделью
(4) Посмотреть, как работа агента отражается в логах в консоли и в самой платформе. Платформа сразу же выдает оценку агенту!
(5) Увидеть слабые места и улучшить его! Или запустить на локальной модели.
Дальше
(1) Послезавтра я активирую на платформе бенчмарк erc3-dev - это симуляция компании для соревнования, с тестовым набором задач. Оценки будут агентам выставляться сразу же. Интерфейсы там будут отличаться от симуляции магазина (более сложные).
(2) 26 ноября откроем рабочий бенчмарк. Нужно будет просто переключить своих агентов на новый набор задач и прогнать их.
Платформа | Регистрация | Пример агента
Можно запускать любое количество сессий и бенчмарков! Только, пожалуйста, описывайте кратко архитектуру и отправляйте статистику использования LLM (как в примере) с указанием названия модели в формате OpenRouter (например, `qwen/qwen3-8b`). Это позволит потом ранжировать агентов по локальности, требованиям к VRAM, стоимости и выводить красивые графики.
Ваш, @llm_under_hood 🤗
Новые бенчмарки LLM на бизнес задачах в SGR режиме
(1) gpt-5-chat-latest - это урезанный снапшот быстрой модели, которая работает под капотом в ChatGPT. У нее нет многих фич, даже StructuredOutputs, но текущая версия заняла 9 место.
(2) Еще из новых бенчмарков моделей, которые ранее были бы впечатляющими, но до уровня gpt-oss/qwen3-32b не дотягивают:
- qwen3-235b-a22b-2507 - 25 место
- deepseek-chat-v3.1 - 31 место
- qwen3-30b-a3b-thinking-2507 - 32 место
(3) пока StructuredOutputs не починили нигде для gpt-oss моделей - все еще расхлебывают последствия Harmony Response format (ollama ticket, openai ticket, vllm ticket). Поэтому все еще ждем возможности запустить локально эти малотребовательные к железу gpt-oss (в идеале еще и отключив reasoning).
Про бенчмарки подробнее написано тут.
Ваш, @llm_under_hood 🤗
3+1 Причины использовать Structured Outputs
Без Structured Outputs (SO) у меня не обходится ни один проект. Если кратко, то SO позволяет задать точную схему, по которой LLM будет отвечать. SO поддерживается всеми современными провайдерами и движками для запуска моделей локально.
Это полезно по 3+1 причинам (последняя - самая главная):
(1) когда модель отвечает числом или приводит ссылки, больше не нужно парсить ответы модели регулярными выражениями, чтобы извлечь нужные данные. Меньше кода, меньше возможностей у модели запутаться в форматировании и меньше ошибок.
(2) поскольку модель будет отвечать по схеме, мы можем прямо в схеме прописать последовательность шагов. Например, всегда сначала смотреть на заметки к таблице (“все цифры в тысячах евро”), а потом уже извлекать данные.
(3) Можно паковать в схемы множество таких логических шагов за раз, выполняя очень мощные и гибкие Custom Chain of Thought процессы за один промпт. На одних Enums можно делать глубокие онтологии, а если еще и использовать tagged unions и списки, то можно отправлять в LLM очень сложные workflows с ветвлениями и повторами.
OpenAI со своего места очень хорошо видит важность этой технологии. Поэтому неделю назад они сильно повысили лимиты того, как можно использовать Structured Outputs:
- Свойства объектов: 100 → 5000
- Символы в строке: 15 000 → 120 000
- Значения Enum: 500 → 1000
- Всего символов в строках Enum с количеством значений >250: 7500 → 15 000