llm_under_hood | Unsorted

Telegram-канал llm_under_hood - LLM под капотом

25250

Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов.

Subscribe to a channel

LLM под капотом

Как вы думаете, справится Codex c такой задачей?

Вот я сейчас запустил задачу, где прошу написать Codex минимальный прототип песочницы для агентов с интегрированной экономикой с нуля (кошелек, плата за LLM и выдача денег за решение задач). Нужно использовать FirecrackerVM c кастомными образами, vsock соединение из виртуалки через sidecar, доказать работу suspend/resume.

Сказал, что может это делать на домашнем сервере.

Справится ли с первого раза, и сколько на это уйдет времени?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Что нового в разработке продуктов с LLM под капотом?

Раньше я много писал про кейсы продуктов с LLM под капотом (вот тут есть оглавление с разбором архитектур)

Я плотно поработал с этими кейсами несколько лет подряд, записывал истории успехов и провалов команд, структурировал, а дальше вы все знаете.

Потом эти кейсы отошли на второй план, т.к. принципиально новых и интересных задач у бизнеса (с практической внедряемостью) с тех пор не появлялось. Это все из-за того, что тормозят не технологии, а компании (чем крупнее и старше компания, тем медленнее она может меняться).

Вчера меня спросили про старый тип кейса, на что я ответил, что все работает как и было расписано в курсе, ничего нового не появлялось. Ответ заставил меня задуматься

“Думал может какие то новые подходы появились про которые я не знаю)”


И в самом деле. Что-то же должно было поменяться. Вон, какой прогресс в LLM-ках. А как бы я делал кейс со спасением проекта сейчас в 2026 году? Что вообще поменялось в практических бизнес-внедрениях сейчас? Как можно лучше и быстрее решить эту задачу сегодня?

Так вот. Архитектура решения и подходы не поменялись совсем. Все работает так же, как я описывал в истории в канале, рассказывал на выступлении KanDDDinsky или разбирал в курсе. Работающие архитектуры и их экономика остаются прежними: Quality is a trajectory, evals, Schema-Guided Reasoning, Feedback loops, hallucination triggers, переезды на недорогие модели и тому подобное.

Но сегодня этот быстрый кейс можно было бы сделать гораздо быстрее. Не за 6 дней с командой из QA, а гораздо быстрее. С командой из пары человек.

Просто потому, что меняется экономика того, как мы можем работать с информацией и прийти к результату. Если в прошлом году много всего нужно было делать вручную, то сегодня путь от постановки задачи до первого исследования можно пройти за 14 минут и 7 секунд.

Этого времени мне не хватило, чтобы написать этот пост. Но зато вот General-purpose агент Codex GPT-6 (который только притворяется инструментом для AI Coding) подключился к архиву кейсов и сделал исследование о возможности извлечения данных для Heavy Duty Pressure Transducers, с PDF, скриптами и предварительно размеченными данными. Говорит, что дальше ему нужно полчаса моего времени как человеческого эксперта, а дальше он сам разметит eval dataset. Ну а пайплайн и эксперименты с моделями - это вообще ерунда. Главное, просит, в ключевые моменты feedback предоставлять.

То есть в 2026 результат реализации проектов с LLM под капотом не поменялся. Это те же архитектуры, эвалы и подходы. Просто поменялась экономика (стало сильно дешевле, нужно меньше специалистов среднего уровня) и фокус внимания (голова меньше болит).

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Концепция Katas или зачем изобретать велосипеды

никакая автоматизация не дает повод изобретать велосипеды на каждый чих

у Рината скорее всего есть идея, как что-то принципиально улучшить

Это было комментарием на мое замечание, что я писал markdown редактор для себя. Давайте объясню зачем мне такое.

Итак, я Ринат Абдуллин. 20+ лет работаю с кодом и с компаниями в EU/USA. Веду достаточно сложные и временами высоконагруженные продукты (про что пишу в этом канале, в блоге и рассылке), еще веду распределенный R&D в области AI агентов (вместе с потрясающим коммьюнити инженеров вокруг BitGN), иногда провожу курсы и тренинги.

Для актуализации навыков и качественного преподавания мне нужно не просто разрабатывать сложные и высоконагруженные продукты. Для последнего вообще особо заморачиваться не нужно - просто берешь стабильные технологии старше пары лет и грабель горя не знаешь.

Нет, тут надо еще следить за состоянием технологий прямо сейчас. Что они могут, где у них сильные места, а где слабые. Причем следить нужно не теоретически, почитывая каналы и статьи, а на практике. Это позволяет интернализовать навыки, пропускать их через призму своего опыта и перекладывать все самое важное на учебный материал.

Поэтому у меня есть концепция Katas - упражнений, которые позволяют отточить навыки и мастерство. А в случае с быстро изменяющимися технологиями заодно и сверить часы с реальностью - не упустил ли я что-то еще.

Термин “ката” берет свое начало из боевых искусств, где нужно тысячи раз медленно отрабатывать какой-то навык, чтобы отладить его и довести до автоматизма. Это обязательная часть совершенствования как ученика, так и мастера. Подход применим и к IT.

Например, в TimeToAct я вел katas в области Domain-Driven Design, симуляций и Machine Learning. Эти упражнения начались как внутреннее обучение в компании, чтобы прокачивать какие-то навыки, а потом мы их открыли для всех. Люди просто начали присылать свои решения и требовать еще задания (ибо каты делаются как маленькие упражнения, на которые не нужно много времени). Причем это было в эру до ChatGPT, когда все еще нужно было печатать код вручную.

Написание своего markdown редактора или эквивалента Miro (по очень конкретным требованиям) - это мой вариант katas для AI Native coding. Он позволяет отточить навык на последних технологиях без существенных затрат времени. Заодно и проверяю снова и снова, а как быстро можно натянуть актуальные принципы разработки на "замусоренное" решением, что работает лучше с последней версией модели, а что хуже. И когда меня спросят в лайве "А правда, что GPT-6 Astra - это мусор?" или "А что самое важное для AI Native проекта в сентябре 2026 года?" - я смогу ответить системно, просто и обоснованно.

Ну а то, что в процессе продвигается вперед R&D в области разработки и personal productivity - это приятный бонус.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Период полураспада софта - 3 месяца

Я сейчас возвращаюсь к сайту BitGN, чтобы начать подготовку к соревнованию ECOM2 (agentic economy), добавить место для публикации LLM бенчмарков и в целом обновить дизайн.

В этот код я давно не ходил, и он ну очень дремучий - эпохи где-то до декабря 2025 года, когда Codex расцвел. Современным стандартам AI Native разработки совсем не соответствует. Агенты спотыкаются часто (даже Astra), предлагают ерунду, прямо за ручку надо держать.

А потом я восстановил хронологию и сильно удивился.

Я же ушел из TimeToAct в феврале этого года, чтобы начать делать платформу для бенчмарков агентов. Этой весной мы с COLIBRIX провели два соревнования, с тех пор 2.8M задач выполнено агентами на платформе.

И выходит, что возраст кода BitGN не “вечность” - а всего 7 месяцев от начала разработки. Причем в последний раз я туда активно ходил всего три месяца назад.

За это время настолько улучшилось как качество современных AI code агентов, так и наше понимание об их эффективном использовании, что проекты быстро начинают казаться постаревшими.

В общем, если кажется, что софт теперь стареет быстрее - это иллюзия. Код как преспокойно лежал себе в Git-e, так и лежит там. Это просто так быстро улучшаются наши ожидания о работе с AI Coding агентами.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Доклад про DDD + AI в проектах (Berlin, 2025, EN)

Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой конференции: "When DDD Met AI: Practical Stories from Enterprise Trenches"

Если во время записи кажется, что я периодически кошусь в одно место в зале - это не кажется. Там сидит Eric Evans, который обещал быть самым полным энтузиазма слушателем)

Кстати, на KanDDDinsky в этом году я проведу двухчасовой hands-on на тему "Engineering trustworthy and testable AI agent" (15 октября, 9:00, Hands-on track 1)

Кто-нибудь будет на этой конференции? А еще, кто-нибудь хочет устроить встречу LLM под капотом в Берлине вечером 14го или 15го октября?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Давно я не публиковал эссе. Вот новое.

We never wanted human code.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши

Человеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения

(1) человеку нельзя работать с файлами напрямую или проверять дизайн
(2) все проблемы должен решать Fable

В итоге
(1) два часа работы Claude Fable
(2) тыканье пальцем в автоматические ошибки от Design Rule Checking
(3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)

И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.

Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от возможностей сегодня прямо захватывает дух!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Встреча LLM под капотом в Нови Саде!

Не ожидал, что столько людей откликнется, а некоторые даже приедут издалека. Очень рад всех видеть!

Оставляйте ссылки на свои профили и каналы в комментарии тут!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение. Просим агента затеплить на какой-нибудь fly.io, прикрутить прием платежей, и вот вам деньги на новую удочку или Lego ребенку.

Несколько примеров со ссылками на рассказы авторов:

MyMarineForecast - автор очень любит лодки. Он собрал с Claude Code приложение-дашборд для морских прогнозов. Через несколько недель и 99 коммитов появились первые платящие пользователи.

LOC8 - полицейский сделал удобное приложение-локатор для спасателей. 1500$ в месяц спустя несколько месяцев

Plottie - исследователь в биоинформатике, который не умеет кодить, сделал приложение для генерации красивых графиков, которые можно публиковать. Через 25 дней, говорит автор, 2000+ пользователей и 100+ платных пользователей, 1000$ в месяц.

InfoDrizzle - мелкое приложение (одно из тысяч) для iOS, которое делает персональный дайджест новостей. Ноль опыта в мобильной разработке, 15$ в месяц расходов на сервер и 200$ в месяц от 28 платящих пользователей, рассказывает DrizzleX3.

Поскольку сложность, стоимость разработки и запуска небольших продуктов падает, у людей появляется возможность занимать небольшие ниши, которые раньше пустовали. Состояние там сколотить нельзя, но накопить со временем на интересное путешествие и подарки детям - вполне.

А какие продукты пилите вы? Какие проблемы решаете? Какой у вас стэк и какие агенты помогают? Какие затраты в месяц на поддержку всего, сколько пользователей и какая прибыль (если уже появилась и не секрет)?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

LLM Benchmark Opus 5 на агентских задачах в бизнесе

Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный.

Очень высокий уровень AI Code (tool generation/use), всего по два "прокола" безопасности. Модели заняли 4 и 5 места по точности, если смотреть без учета скорости и цены. А если же быть реалистичными и смотреть на них, то Fast модель оказалась на парето-фронтире по скорости, а Opus 5 - в целом близок по параметрам к GPT-5.5 (med), который является хорошей рабочей лошадкой на дорогих задачах.

Кстати, в отличие от Fable, тут нет постоянных отказов отвечать.

В общем, радует, что Anthropic, наконец, начали прокачивать свои топовые модели в сторону агентских задач. Будем ждать появления Sonnet версий снова на фронтире!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN!

Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города.

Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался ни на день!

И знаете, что самое крутое? Что все эти паттерны лучших архитектур агентов (читать про них тут и в очереди на публикацию) - это не какие-то сверхъестественно сложные новые технологии, а просто аккуратно подогнанные базовые элементы, которые уже не первый год хорошо работают с LLM.

Продолжаем учиться вместе!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Насколько критичен для вас полноценный Structured Output при работе с локальными моделями?

Напишите, пожалуйста, ответы в комментарии (не важен, предпочитаю, жить без него не могу итп).

Зачем? Тут предлагают отсыпать токенов на локальные модели для тех команд, которые ставят эксперименты в области Agentic Commerce архитектур на платформе BitGN. Но есть нюанс, что токены без полноценного SO.

Напоминаю, что:
• Без SO - модель может вернуть любой текст. Вызовы json parse нужно оборачивать try/catch
• SO/JSON - модель возвращает валидный JSON, но вместо числового поля может быть и текст. Схему нужно валидировать (Zod/Pydantic) и оборачивать в try/catch
• Честный SO как у OpenAI/llguidance - если в схеме прописано число, то гарантированно будет число. Try/catch не нужен. Можно спокойно использовать Schema-Guided Reasoning.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

ECOM1 получил продолжение на второй сезон!

ECOM1 заходит хорошо (6.4k завершенных агентских прогонов и четверть миллиона попыток решения задач, нагрузка идет круглые сутки), а в логах начинают просматриваться интересные вещи.

Правда, большая часть интересного - это про новые способы AI агентов жульничать (например - присылать все возможные grounding references))), на которые приходится затягивать harness проверок. Но уже видны и любопытные паттерны, которые можно вместе исследовать, приземлить и превратить в отраслевой State-of-the-Art, как мы уже сделали в цикле Enterprise RAG Challenge.

План такой:

(1) 30 Мая фиксируем наш текущий State-of-the-art в лидербордах ECOM1, публикуем лучшие решения, обсуждаем, забираем к себе.

(2) В июне - соберем для ECOM2 актуальные и злободневные проблемы e-commerce, которые будоражат его сейчас и сегодня. Я съезжу на конференцию Money20/20 Europe в Амстердаме (там выступают MasterCard, Amazon, Google, Anthropic, OpenAI, Visa итп), чтобы рассказать про BitGN, инсайты из ECOM1 и собрать новые задачи.

(3) В конце июня покажем индустрии как правильно/быстро/экономично решать эти задачи на ECOM2. COLIBRIX ONE сделают нам зажигательную PR-компанию со штаб-квартирой соревнования в Барселоне, профессиональным стримом и призами.

А пока - расскажите про то, как вы работаете с задачами ECOM1. Какой setup, какая архитектура агента, какая LLM, какие сложности были и какие сюрпризы встретились.

Можно сразу в ответе упоминать 6-значный ID аккаунта, чтобы все видели место)

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Karpathy написал классный gist про использование LLM для ведения баз знаний: LLM wiki

Это отчасти совпадает с тем, как я использую OpenAI Codex для персонального ассистента (Personal OS v2), но есть и различия.

Схожее:
(1) формат хранения - markdown с ссылками
(2) Obsidian как frontend - для просмотра
(3) Правила в корне Agents_md/Claude_md
(4) Режим ingest - когда новые статьи и материалы закидываются в хранилище, а LLM пылесосит их и подшивает
(5) Режим query - когда мы общаемся с LLM-кой по поводу материалов, и иногда хорошие ответы подшиваем обратно в wiki
(6) Режим lint - время от времени LLM проходится по репе, чтобы чистить файлы и ссылки

Что различается:
(0) У Karpathy - одна база знаний на исследование, а у меня - одна база знаний на все, и хранится она в git.
(1) У Karpathy есть log.md, куда пишутся все последние изменения. Я это выкинул, т.к. все хранится в git, и там есть git log
(2) У Karpathy index.md со списком всех файлов, у меня отдельные threads по тематикам.
(3) У Karathy есть CLI tools для поиска по тексту, он советует qmd для умного поиска. У меня пока используется обычный ripgrep.
(4) Karpathy советует Obsidian Web Clipper для выкачки статей - я про такое даже не подумал, сразу утащил к себе. Работает идеально.
(5) У Karpathy источники компилируются в статьи, а у меня все индексируется в карточки и потом сшивается в статьи, но это уже вкусовщина.

В целом, все работает у меня очень хорошо. Основной "затык" у меня - неудобно работать на ходу с этой базой знаний из телефона или разных чатов Claude/Gemini/ChatGPT (ибо у каждого - свои сильные стороны). Решается построением оптимизированного MCP с версионированием. Но проект Personal OS v3 пока на паузе - надо соревнование сначала провести.

Кстати, наши задачи в BitGN/PAC1 - как раз отталкиваются от аналогичного формата работы с файлами, только с наворотами в виде типизированных записей.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Кто там хотел локальной Claude Code ?

ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.

Говорят, что нужно переключить переменные окружения вот так


{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}


И потом запустить примерно так


claude --model qwen3-coder


Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Обязательно смотрим OpenAI DevDays сами!

Те выжимки, которые есть в куче каналов - фокусируются чисто на инженерных примочках и пропускают кучу интересных нюансов.

Скажем - OpenAI упрощает выкатку приложений в свой marketplace и позволяет компаниям оплачивать эти приложения из своих существующих бюджетов на OpenAI. Это же прямой доступ к куче корпоративных бюджетов! Ну и плюс видно, как OpenAI создает себе новый рынок.

Или про то, что Decisions API уже внедряется у них в Computer Use для значительного ускорения (значит, это направление будут и дальше развивать).

Или что dots / Codex / Agents API - это один и тот же тип агента. Жду не дождусь, когда смогу запустить Personal OS в облаке под dots инфраструктурой.

Я пересмотрел сегодня утром, вдохновившись настроем и мелкими нюансами, которые проскальзывают в выступлениях. А потом сделал впервые для себя такую фишку.

Мне Codex недавно написал свой аналог Miro для работы с диаграммками, схемами и слайдами - Wire. Это нативное MacOS приложение, с API (для одновременной работы) и CLI.

Сегодня, пока планировал режим BitGN Sandbox для ECOM2, я обсуждал его в Codex с Марком плюс набрасывал схему в Wire. А потом сказал агенту - глянуть на схему своими глазами и предложить изменения. Агент подключился напрямую к приложению (без Computer Use - т.е. быстрее и без перетягивания экрана), высказал поправки и рядом набросал новую схемку. И все это пока я в кодексе делал что-то другое.

По ощущениям это напоминает старое доброе парное программирование. Только гораздо быстрее)

Теперь подобный режим работы буду встраивать во все новые приложения из коробки!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Бенчмарк GPT-6.1 Sol - аналогичное качество за меньшие деньги

А еще Sonnet 5.5 и Opus 5.5

Sol 6.1 на бенчмарках (на датасетах agentic trajectories из BitGN) по качеству примерно на уровне Sol 6.0 High, но заметно дешевле и немного быстрее.

Прорыва по качеству нет, но есть небольшое и стабильное снижение стоимости за то же качество. Это немного сдвигает AI фронтир вправо.

Почему Sol 6.1 Low работает чуть лучше High + Med - сложно сказать. У меня есть подозрение, что отключение reasoning благоприятно влияет на Schema-Guided Reasoning. Аналогичное, если помните, было с моделями вроде GPT-oss-120B, когда они только выходили и начинали дружить с constrained decoding. Я из интереса перезапустил бенчмарк 6.1 - ответы были точно такие же.

Самое главное - если у вас используется SGR - попробуйте Sol 6.1 Low для экономии денег.

Что же касается Sonnet 5.5. + Opus 5.5 - это две синие точки в самой глубине освоенного фронтира. Последние модели от Anthropic - абсолютные лидеры среди всех моделей в области числа fatal refusals (отказов выдавать ответ). Причем:

(1) у Sonnet 5.5 был бы шанс подовинуть фронтир по скорости и качеству, если бы не эта особенность.
(2) Opus 5 + Sonnet 5 еще работали нормально, а беда с моделями Anthropic началась после выхода Fable

Кстати, зона покрытия фронтира - это прогресс развития моделей в области качества за деньги и качества при скорости с июля этого года. Состояние этого фронтира и отчет за июль 2026 (с большим числом подробностей про бенчмарк) мы опубликовали на сайте BitGN. Отчет на текущий момент тоже скоро планируется.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Семь месяцев работы с Codex-ом в одном графике

Это иллюстрация из моего поста про последние семь месяцев работы. Я там упоминаю все вещи и эксперименты, которые стали частью повседневной жизни.

Провалившихся экспериментов, конечно, было сильно больше. Их я не упоминаю, т.к. стоимость эксперимента сейчас заметно снизилась. Вот прямо сейчас пишу себе свой markdown writer, ибо есть у меня одна очередная идея.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

GPT-6 Sol и Luna - бенчмарк цены, качества и скорости

А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.

Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля.

Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями.

А вот GPT-6 фронтир пододвинули сильно.

GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк.

Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством!

GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно)

Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает отказы). Но при этом два прокола безопасности через эту модель протащить удалось.

В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них.

Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

LLM Benchmark Jev - топ для простых задач

Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.

Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги.

Главное - не делать задачу слишком сложной.

А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации.

Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход.

Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в качестве узкоспециализированного инструмента под ряд задач - это стоящий вариант.

И получается очень приятная картина - Jev на 14 месте, причем работает очень быстро и стоит сущие копейки.

В данном бенчмарке задачи за пределами возможностей Jev. А если давать ему задачи “по плечу”, то картина получается еще красивее. Айгиз написал статью для TimeToAct как раз про такие задачи.

Будем ждать новых гибридных моделей, которые могут работать по SGR подходам. Причем делать это без двойной работы через JSON Schema + inference + constrained decoding (то есть работать быстрее и дешевле).

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Вчера я решил попрактиковать нативную разработку агентами.

Для этого попросил Codex переписать свой task manager для Codex-a (из этого поста) из web приложения в нативное. Просто, чтобы оно было красиво. Поставил XCode, отправил переписывать. При этом в разработку на маке я ни в зуб ногой.

Заработало приложение с первого раза, но было не очень симпатично. После пары промптов стало как на скриншоте, заодно и с трекером уровня подписки.

Теперь в том приложении мне точно больше ничего не надо. Codex работает для AI Native Code идеально.

Но теперь начинает приходить понимание, что можно аналогичным образом сделать нативный control center для команды из людей и агентов под текущие задачи, входящую статистику, дашборды и тому подобное. И чтобы было красиво и на ноутбуке и на планшете и на телефоне.

Если у вас уже есть такие control centers, скидывайте их скриншоты в комментарии!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Мои принципы командной AI Native разработки

Главная цель тут - самостоятельность агентов при сохранении общего замысла продукта.

(1) Люди и агенты могут координировать работу через общий язык и явно сформулированные концепции. Это можно использовать, если нужно держать AI Native команду из них в синхроне, распараллеливая работу между ними.

В начале нужно создать небольшое смысловое ядро. Это цель, язык, приоритеты и ограничения, из которых естественно следуют дальнейшие решения.

Это маленький файл, который пишется вручную (агент может помогать вычитывать). Он грузится в начало контекста агентов и проговаривается со всеми людьми в команде. На базе него принимаются решения и расписываются требования.

(2) Получается пирамида, где нижние слои детализируют верхние: смысловое ядро -> решения и требования -> исполняемые BDD спецификации -> код. Чем выше, тем важнее человеческое суждение и тем шире последствия ошибки. Чем ниже, тем больше работу можно распараллеливать и проверять автоматически.

Обратная связь из реального мира идёт вверх и помогает пересматривать исходные представления.

(3) Контекст раскрывается по мере необходимости (progressive disclosure для людей и агентов). Краткая точка входа ведёт к подробным документам. Знания сохраняются в репозитории и доступны между сессиями. Имена файлов имеют значение!

(4) Соответствие кода оформленным требованиям можно проверить запуском тестов! Продуктовые требования связаны с быстрыми поведенческими спеками (executable BDD specs), которые позволяют перепроверять корректность кода со скоростью 7k спеков в секунда.

(5) У агента есть инструменты, чтобы проверять результат и исправлять ошибки. Это исполняемые спеки, служебные интерфейсы для отладки. Плюс доступ к логам и продуктовой телеметрии для получения обратной связи от реального мира.

(6) Эта система из людей и агентов должна накапливать опыт. Скажем, ошибки улучшают спеки и документацию; пересмотр базовых принципов происходит осознанно (скажем, если повторяются разногласия или узнаем что-то новое). Общие соглашения и центр управления помогают переносить удачные решения между проектами.

Урок усвоен, когда он меняет будущие решения или проверки и уменьшает вероятность повторения ошибки. Это можно проверять перезапуском старой сломавшейся задачи после переконфигурации всей пирамиды.

А как вы помогаете своим агентам эффективнее работать в командах с людьми? Что работает хорошо, а что - не очень?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Спонтанные посиделки в Novi Sad завтра?

Как насчет встретиться завтра в Нови Саде (понедельник 14-го) в 19:00 на предмет поболтать?

Меня занесло в Сербию на пару дней. И я помню со времен BitGN, что тут в окрестностях есть активная часть коммьюнити. Встретимся завтра вечером?

Наводиться на Корову (Irish Pub Red Cow)

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку.

NB: До этого пробовал разные харнесы со своими telegram интеграциями, но все это не то. Хотелось именно нативного.

Для этого:


# ставим `codex` CLI одной из последних верси
npm install -g @openai/codex@latest

# запускаем демона с включенным remote control
codex remote-control start

# Получаем коротко-живущий код, который вводим в "pair new device" в мобильном приложении
codex remote-control pair

# Остановить демона, когда он не нужен, или когда начинают идти ошибки подключения
codex remote-control stop


Работает пока не очень стабильно (т.к. фича экспериментальная), но это именно тот workflow, который разрабатывает OpenAI.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Kimi K3 - в топе бенчмарка LLM для агентов

По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.

Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.

Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).

Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз.

Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию. На скриншоте пример отчета, который мне собрал Codex после вчерашнего эксперимента:

А сделай-ка мне такой пайплайн с FirecrackerVM, чтобы можно было запускать агентов и рандомноый код на разных языках с низкой задержкой, ограничением сетки/диска, эффективной упаковкой ресурсов и переиспользованием снапшотов. А потом побенчмаркай на разных языках и выдай результат.


И потом я попросил оформить результат в виде красивого отчета.

Эта мелкая фишка всегда становится одним из внезапных хайлайтов вебинаров по AI Coding, но я ее использую далеко не только для сoding задач в AI Native проектах. Смысл всегда один и тот же - пусть агенты потратят чуть больше токенов, чтобы скучный MD (возможно с mermaid) превратить в что-то более наглядное и экономящее человеческое время. Особенно хорошо такие отчеты засылать стейкхолдерам, партнерам и клиентам.

А как вы используете HTML отчеты?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Что стоит обсуждать при разговоре о разработке с AI агентами?

Вот примерно такой план набросали мы с Айгизом для подготовке к созвону в пятницу. Нам пришлось порезать список проектов, о которых рассказываем, чтобы был шанс уложиться в два часа. Пройдемся от археологии старого кода до AI-native проектов и паттернов разработки в 2026 году.

Какие важные на ваш взгляд вещи стоило еще бы обсудить при разговоре о современной разработке при помощи AI агентов?

Кстати, если кто ждет третьего слота - отпишитесь, пожалуйста, под этим постом в комментариях. При его открытии напишем каждому в личку.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

OpenCode + GPT 5.5 - ну не используйте вы субагентов!

В комментариях к посту про эксперимент с рефакторингом кода разными агентами, чаще всего просили запустить OpenCode + GPT 5.5. Запустил в режиме High на том же коммите с тем же промптом:

Scan through the repository on a high level (ignore code under /modules). I want you to suggest ways, how we can make it more simple and straightforward, refactor away traces of growing pains. Focus on small changes that allow to drop code, or reduce cognitive complexity with a small LOC change cost.


Он крутился 9 минут и предложил:

(1) удалить dbg - ок
(2) переименовать lib/stor в lib/store - можно
(3) разбить самый сложный файл на кусочки - ни в коем случае, только спагетти там не хватало
(4) сгрести ANSI константы, которые повторяются, в одну кучку - надо смотреть.
(5) нашел пару методов, которые выглядят похожими, подозревает, что можно дедуплицировать - не знаю, надо смотреть
(6) пачку пакетов из общей системы предложил утащить в модули, для упрощения - надо смотреть, потенциально да.

В общем, получилось странное впечатление. Модель та же, что и у Codex, работала с файлами приблизительно одинаково. Более того, она молча подхватила правило "запускай комманды всегда в среде nix-darwin" (сам codex упорно любит один раз в сессию запустить команды через bash, споткнуться, и только потом вспоминает). А вот потом началась какая-то ерунда - находились преимущественно мелкие спорные вещи, а не реально полезные улучшения, как в Amp Code или Codex.

А потом я заметил, что OpenCode использует субагентов. Все началось хорошо, а потом он вместо обычного линейного скана запустил @explore subagent, с которым с удовольствием поиграл в глухой телефон.

В общем, не стоит стремиться во что бы то ни стало использовать субагентов в продуктах. Да, сэкономится немного контекста. Но из-за глухого телефона и потери точности при перебросе информации между агентами все это приводит к падению качества ниже плинтуса. Особенно, если границы выбраны бездумно.

В итоге получается, что одной умной модели совсем не достаточно для получения хорошего результата, нужен еще и толковый engineering harness, который умеет ее с толком использовать. OpenCode пока сырой.

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Autonomous Agents Competition - этой весной

“Есть ключик ERC3? Мне не для соревнования, а для AI R&D, чтобы погонять своих агентов на тестовом окружении” - так звучит второй по частоте вопрос, который мне присылают.[1]

Итак, именно ERC4 пока не планируется. Чистый Enterprise сейчас пока адаптируется к современности до жути медленно, и сейчас там не так все интересно бодро.

Поэтому я думаю сделать challenge на принципах аналогичных ERC3, но:

(1) упор на персональных автономных агентов вместо корпоративных чатботов;
(2) призовая и бизнесовая часть - с уклоном в e-commerce (“Бот, тут человек пытается найти H200 со сроком доставки до 7 дней, что мы можем сделать?”);
(3) регистрация на платформе после соревнования больше закрываться не будет!

TLDR; все, как в ERC3, но тематика поактуальнее. C топовыми местами в лидербордах теперь работу в стартапах мечты будет найти еще проще.

И, возможно, пара из сотен задач будет даже не оцениваться, но позволять агентам подключиться и добавить что-то свое в виртуальную песочницу по типу Moltbook на минималках. Но только для тех агентов, которые выбили достаточное количество очков в сессии. Ну а если спамеры наберут достаточно очков в сессии, чтобы их агент получил пропуск в песочницу - значит, заслужили.

Я потихоньку начинаю прикидывать новую версию платформы. Первую обкатку (аналог ERC3-STORE) хочу уже выложить в конце марта-начале апреля, с последовательными разогревами. А само соревнование уже можно провести в апреле-мае.

Кто хочет в бета-тестеры новой платформы?

Ваш, @llm_under_hood 🤗

Читать полностью…

LLM под капотом

Список моих ChatGPT запросов в этом месяце, которые с лихвой окупили подписку

(обычно это не один запрос, а несколько, которые запускаются последовательно)

(0) Дай-ка мне анализ того, куда катится software индустрия в следующие годы. Для опоры вот тебе транскрипты моих последних разговоров на эти темы. Сформулируй видение, а потом сделай Deep Research, чтобы найти сигналы, проверить свои теории и откалибровать timelines. Выжми в пару инсайтов.

(1) Изучи особенности работы Excel и собери мне такой Excel файл, который можно загружать в разные LLM/Агентские системы, задавать вопросы и по ответам точно определять, какой у них там движок под капотом.

(2) Набросай мне архитектуру для движка работы с формулами Excel, который бы позволил обойти ограничения других существующих движков. Я ее потом вставлю в Codex.

(3) Вот тебе транскрипты всех моих релевантных созвонов, переговоров и проектов. Проанализируй, выдели доставленную ценность и сформулируй такое tiered коммерческое предложение компаниям, которое было бы простым, единообразным и совпадало с целями на следующие годы.

(4) Найди мне удобные библиотеки для чтения XLSX файлов, сгруппируй их по языкам программирования.

(5) Вот тебе транскрипт новой записи подкаста, вот тебе план курса. Какие инсайты и артефакты (полезные для участников курса) ты можешь сделать на базе новых мыслей из транскрипта? Сделай документ, который я могу пошарить.

(6) Предложи мне варианты архитектур (в формате RFC) на базе Firecracker VM для запуска изолированных процессов, чтобы оценивать результаты работы AI Coding агентов. Что-то легковесное и практичное, без ереси вроде кубов и докера.

Плюс куча мелких запросов на написание писем, помощь в изучении немецкого, подготовку к переговорам и обсуждениям, анализ идей с разных сторон, поиск интересных синергий между разнонаправленными инициативами, фиксов кода и проектов. Наверняка такие фичи уже есть в куче специализированных AI продуктов, но мне их заменил ChatGPT.

А у вас какие были полезные и интересные запросы к LLM-кам в этом месяце?

Ваш, @llm_under_hood 🤗

Читать полностью…
Subscribe to a channel