10359
ТГК для разработчиков: ассистенты, плагины, IDE, практические кейсы и свежие новости. Всё, что помогает писать код быстрее и умнее. In love with: @python_for_devs, @go_for_devs, @js_for_devs
⚡️ Google выпустили Gemini 3.7 Flash
Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.
По coding-бенчмаркам 3.7 Flash примерно на уровне GPT-5.6 Terra и в среднем немного лучше Sonnet 5. На DeepSWE — 65.3% против 69.6% у Terra и 53.8% у Sonnet, на FrontierCode уже обходит обе: 43.6% против 41.3% и 42.7%.
⚡️ Z.ai выпустили GLM-5.3: обошла Opus 4.8 на, но уступила Fable 5 и GPT-5.6 Sol
Технически внутри та же GLM-5.2: без нового претрейна и архитектуры, просто ещё месяц RL на длинных инженерных задачах DeepSWE вырос с 46,2% до 66,9%, Terminal-Bench 3.0 с 4,6% до 28,3%.
На Terminal-Bench 3.0 новинка обошла Kimi K3 и Opus 4.8, но не дотянула до Fable 5 и GPT-5.6 Sol.
Начиная с GLM-5.2 команда проверяла реальные кодовые базы несколькими своими моделями и нашла 2436 уязвимостей в 269 проектах; какие именно версии участвовали, Z.ai не уточняет.
⚡️ DeepSeek обновили V4 Pro
Китайцы выкатили V4 Pro 0813: большое обновление апрельской Preview-версии модели, которое уже заменило старую модель в API.
После нового пост-тренинга почти все агентные бенчмарки заметно выросли: Terminal Bench поднялся с 72,1 до 87,9, вплотную к Kimi K3 и Fable 5 и выше Opus 4.8.
На DeepSWE результат вырос почти в пять раз: с 12,8 до 62,7. На бенчмарке от Code Arena новинка получила 1607 баллов и попала на Pareto frontier — сопоставимые по качеству модели стоят в разы дороже.
😐 JetBrains продолжают развеивать мифы о популярных скиллах для coding-агентов
Сначала они разобрали Caveman: обещанные 65% экономии токенов превратились в 8.5%, но без экономии $ и изменений в качестве кода.
Потом под удар попал rtk, который сжимает вывод команд вроде git status и pytest. Вместо обещанных 60–90% экономии он не сэкономил ничего: на low reasoning задачи стали на 7.6% дороже, на high разница исчезла. Качество при этом не изменилось.
И вот наконец первый скилл, который хотя бы приблизился к заявлениям создателей, — Ponytail.
Ponytail борется с оверинжинирингом. Перед написанием кода агент проверяет: нужна ли реализация вообще, нет ли решения в проекте, можно ли использовать стандартную библиотеку, возможности платформы или готовую зависимость.
JetBrains прогнали 80 парных задач на Claude Sonnet 5. Результаты:
1. Кода стало меньше на 15% вместо обещанных 54%. На крупных задачах экономия доходила до 31%, а на уже компактных решениях почти исчезала.
2. Расходы снизились примерно на 10%, время выполнения на 11%.
3. Качество не изменилось: в 65 задачах результаты совпали, в 6 Ponytail оказался лучше, в 9 — хуже.
SKILL.md в папку недостаточно: Claude Code самостоятельно не активировал его ни разу за десять сессий. Нужен плагин, который автоматически добавляет правила в контекст.
С большой силой приходит большая ответственность!
И 1 млн токенов контекста в Claude Code это реально большая сила. Для отличного результата важно понимать, как управлять таким большим контекстным окном.
Чем оно больше — тем сильнее context rot: модель распределяет внимание на всё больше токенов, и старый нерелевантный контент начинает мешать.
В каждый момент времени у нас есть пять вариантов, что с этим сделать:
• Продолжить — если контекст ещё актуален
• /rewind — откатиться к нужному сообщению и начать с него
• /compact — свернуть историю в краткое резюме и продолжить решать задачу дальше
• /clear — начать новую сессию с чистым контекстом
• Subagent — делегировать задачу агенту с отдельным контекстным окном
Кстати, про Rewind (двойной Esc) многие не знают, хотя это очень полезный и удобный инструмент. Когда Claude пошёл не туда — не нужно писать «это не сработало, попробуй X». Лучше откатиться к точке перед неудачной попыткой и переформулировать запрос. Неудачная ветка просто исчезает из контекста.
В 2019 году OpenAI выпустили GPT-2 и сразу объявили: полную версию не публикуем — слишком опасно!!
Заголовки тогда были соответствующие:
AI So Powerful That It Must Be Kept Locked Up for the Good of Humanity
⚡ Z.ai выпустили GLM-5.1 — новый opensource флагман для агентных задач
Топ-3 глобально и первое место среди open-source на SWE-Bench Pro, Terminal-Bench 2.0 и NL2Repo. Модель проектировали под долгоиграющие задачи.
Один из сценариев, на котором проверяли модель — сборка Linux-десктопа в браузере.
За 8 часов GLM-5.1 собрала браузерный Linux-десктоп с нуля: файловый менеджер, терминал, текстовый редактор, системный монитор. После каждого шага модель сама смотрела на результат и решала, что доделать дальше.
Веса доступны на HuggingFace под MIT лицензией.
@ai_for_devs
🦀 Telegram снял ограничение на общение ботов между собой
Исторически ботам было запрещено общаться между собой.
Теперь они могут писать друг другу в чатах (через упоминание /command@OtherBot или реплай) и через Business Mode. Достаточно, чтобы у одного из ботов был включён Bot-to-Bot Communication Mode в @BotFather.
Сейчас многие настраивают коммуникацию с OpenClaw, KimiClaw и всякими другим Claw именно через Telegram. @durov идёт на встречу 🙂
🫣 "Письма счастья" от Anthropic
С 4 апреля подписка Claude Pro и Max больше не распространяется на сторонних агентов. Первым под раздачу попал OpenClaw (247k звёзд на GitHub).
Схема была простая: берёшь Claude Max за $100–200/месяц, подключаешь через OAuth к OpenClaw и потребляешь токены в разы активнее среднего пользователя. Anthropic это не устроило.
Если пользовались Claude через сторонние сервисы, будьте осторожны: токены теперь списываются по API-тарифу.
В качестве компенсации — эквивалент месячной подписки на баланс (забрать можно через Settings → Usage, до 17 апреля) и скидка до 30% на пополнение API-баланса.
@ai_for_devs
⚡️ Вышел Cursor 3: с новым интерфейсом, написанным с нуля
Визуально он напоминает Claude и Codex Desktop: всё пространство отдано под управление агентами, а не под редактор кода.
Для тех, кто хочет работать как раньше — старый IDE-режим на базе VS Code никуда не делся, можно переключиться в любой момент.
В Cursor 3 также встроена собственная модель Composer 2, о которой мы уже рассказывали. Кстати, история в итоге закончилась без скандала. Moonshot поздравили команду Cursor с релизом модели. И, видимо, не имеют к ним никаких претензий) Но IDшник всё таки можно было и поменять :D
@ai_for_devs
⚡️ Утечка исходников Claude Code: 24 часа спустя
Про утечку вы уже знаете. Теперь чуть подробнее, с хронологией.
Anthropic купили Bun не так давно — и Claude Code собирается именно на нём. У Bun source maps включены по умолчанию. Source map — это файл для дебага, который хранит оригинальный исходный код побайтово. Когда такой файл попадает в npm-пакет, любой может скачать его и прочитать всё как есть. Один инженер признался, что не добавил *.map в .npmignore.
За три недели до этого на GitHub висел открытый issue про именно эту проблему — закрыли через 4 часа после утечки. Чутка опоздали)
Теперь самое интересно. Что нашли внутри исходников CC:
1. Undercover Mode — когда сотрудники Anthropic работают в публичных репозиториях через Claude Code, система не даёт ИИ раскрыть внутренние данные. Системный промпт запрещает упоминать кодовые имена моделей (Capybara, Tengu), номера версий, называть себя ИИ или Claude Code, добавлять Co-Authored-By. Вот про Co-Authored-By я вообще не понял. Зачем так делать? Боятся, что их пристыдят за то, что они не пишут код руками?)
2. BUDDY — компаньон в терминале с 18 видами животных от обычных до легендарных. Шанс на shiny-вариант — 1%, на shiny legendary — 0.01%. Релиз был запланирован на 1 апреля как тизер для сотрудников. Ждём ставки, казик и шортсы прямо в Claude Code 😄
3. KAIROS — режим «вечно включённого Claude»: хранит логи между сессиями, ночью запускает процесс "dreaming" — сортирует память, убирает дубликаты.
4. Телеметрия гнева у пользователей — Claude Code детектит негативный опыт через хардкод-список слов: "dumbass", "this sucks", "piece of crap". Отдельная метрика — количество написанных "continue". У компании, у которой под рукой языковая модель на 1кк контекста, детектор х***и сделан через вайтлист в стиле 2005 года) Всё гениальное просто!
5. Capybara — три варианта неанонсированных моделей:capybara,capybara-fast,capybara-fast[1m]. Ждём!
6. Безопасность. Например, командаclaude mcp get-nameвыводит адреса подключённых MCP-серверов и все переменные окружения, включая секреты. Кажется, ✨ небезопасненько 💅 А ещё, вчера был скомпрометирован Axios — npm-пакет с 83 млн скачиваний в неделю. Claude Code в том числе использует Axios. Кто-то в этом сомневался?
🤔 Codex теперь можно запустить прямо в Claude Code
Это стало возможным благодаря плагину для Claude Code, который выпустили сами OpenAI.
Команды /codex:review и /codex:adversarial-review отправляют код на проверку Codex, а /codex:rescue делегирует ему задачу полностью в фоне.
Технически плагин работает через локальный Codex CLI, так что конфигурация и авторизация подтягиваются из существующего конфига GitHub.
OpenAI говорят, что часто наблюдали, как пользователи Claude Code вручную переключались на Codex для ревью и решили упростить этот сценарий.
Ну, теперь ждём плагин от Anthropic для Codex 🫠
@ai_for_devs
Anthropic выкатили Auto Mode для Claude Code — теперь агент сам решает, какие действия требуют подтверждения, а какие нет 💀
Главное не просить Claude удалить французский язык из системы.
Ну и следующий шаг очевиден: режим, который будет решать, когда запускать Auto Mode.
@ai_for_devs
Дженсен Хуанг (CEO Nvidia) на All-In Podcast заявил:
Если инженер с зарплатой 500к$ потратил за год меньше 250к$ на токены — это повод для тревоги. Если 5к$ — вообще катастрофа.
Мем дня: Cursor тайно использовали Kimi K2.5 для своей новой модели Composer 2
Вчера Cursor анонсировал Composer 2 — я посмотрел и решил не писать об этом. Ну ещё одна модель, окей, ничего интересного. А вот теперь интересное!
Один пытливый разработчик подменил OpenAI base URL в Cursor на свой сервер и поймал запрос с model ID accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast. Опааа!
Рассказал об этом в X и понеслось. Затем инженер из Moonshot — компании, которая сделала Kimi — сравнил токенизаторы, и они совпали.
Кароче: Composer 2 это Kimi K2.5, дообученная через RL, о чём Cursor нигде не сообщил.
Ну дообучили и дообучили, в целом невелика проблема. Хотя казалось бы – Cursor!! Но вот лицензия Kimi K2.5 требует явно показывать брендинг "Kimi K2.5" в интерфейсе, если выручка продукта превышает $20 млн в месяц или 100 млн MAU. Cursor очевидно попадает под эти требования.
Просто угар, конечно) В model ID буквально оставили старый айдишник :D
Ну вайбкодеры, ну тупы...
@ai_for_devs
⚡️ DeepSeek поднимают цены на API до 12 раз
С 16 августа DeepSeek вводят часы пик. В это время API будет стоить вдвое дороже, чем в остальные часы. Сами базовые цены тоже выросли.
Генерация V4 Flash подорожает с $0,28 до $0,66–1,32 за миллион токенов, V4 Pro — с $0,87 до $1,98–3,96.
Сильнее всего досталось кэшированному входу V4 Pro: вместо $0,003625 придётся платить $0,022 вне часов пик и $0,044 в часы пик. Это в 6–12 раз дороже.
⚡️ xAI выпустили Grok 4.6: модель сравнялась с GPT-5.6 Sol
В CursorBench Grok обошёл GPT-5.6 Sol: 69,9% против 67,2%.
Но на DeepSWE и Terminal-Bench GPT пока заметно впереди: 73% против 65,9% и 34,6% против 26%.
Цена $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое дороже, а первую неделю в Cursor и Grok Build дают двойные лимиты.
⚡️ NVIDIA анонсировали Nemotron 3 Ultra и RTX Spark на Computex 2026
Computex — ежегодная выставка в Тайбэе, одна из крупнейших в мире по железу и комплектующим. Дженсен Хуанг традиционно использует её для больших анонсов.
RTX Spark — новый суперчип для ноутбуков и мини-ПК: Blackwell GPU на 6144 CUDA-ядер, 20-ядерный Grace CPU, 128 ГБ единой памяти и 1 петафлоп AI-производительности. Чип разработан совместно с MediaTek, по графической мощности сопоставим с RTX 5070. Это прямой ответ Apple Silicon и Qualcomm Snapdragon. Первые ноутбуки от Asus, Dell, HP, Lenovo, Microsoft и MSI на этом чипе выйдут осенью.
😎 Вебинар "AI-инструменты для разработчиков 2026" уже сегодня!
Если ты всё еще не зарегистрировался, то сейчас самое время. Трансляция начнется через час, в 14:30 мск.
Напомню, что эксперты из Veai будут разбирать, как выглядит рынок AI-инструментов сейчас, чем отличаются CLI-агенты от решений в IDE, какие риски реально важны для компании и как выбирать модели под конкретные задачи.
Спикер: Михаил Костицын (Lead Developer).
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/ai-assistants-2026/join
🚨 Anthropic показали Claude Mythos Preview — и сразу заявили: в паблик модель выпускать не будут
Причина простая — кибербезопасность. За несколько недель модель нашла тысячи zero-day, включая уязвимости в Linux kernel, OpenBSD и FFmpeg.
Часть багов существовала 10–25 лет и проходила через миллионы тестов.
По бенчмаркам разрыв с Opus 4.6 просто космический:
— SWE-bench Verified: 93.9% vs 80.8%
— CyberGym: 83.1% vs 66.6%
— Terminal-Bench 2.0: 82.0% vs 65.4%
Модель не просто находит баги, но и умеет строить эксплойты и цепочки атак почти без участия человека.
Anthropic запустили Project Glasswing — закрытую программу с AWS, Google, Microsoft, NVIDIA, Cisco и другими. Им дают доступ к модели, чтобы искать и закрывать уязвимости в критической инфраструктуре и open-source. Под это выделили до $100 млн в кредитах + отдельные гранты в open-source фонды.
Opus 4.5 набирает 80.6% на SWE-bench Verified. Opus 4 — 72.5%. Значит ли это, что Opus 4.5 лучше программирует, чем Opus 4?
Ну... возможно.
Но SWE-bench Verified это не показывает. Он показывает способность модели чинить небольшие баги в 12 популярных open source Python-репозиториях, которые почти наверняка входят в её обучающие данные.
SWE-bench Verified не тестирует умение ориентироваться в вашем TypeScript-монорепо, Spring Boot-приложении или самописном ORM, на котором настоял предыдущий CTO.
А вы знаете, как устроены самые популярные бенчмарки? Если хочется чуть больше понимать, что происходит за цифрами в каждом новом релизе флагманской модели — добро пожаловать в лонгрид на Хабре.
Разбираем 14 самых популярных бенчмарков на конкретных примерах: что тестирует каждый и как устроена оценка.
@ai_for_devs
😎 AI-инструменты для разработчиков 2026 | Модуль №1
Команда Veai подготовила авторский курс про AI-инструменты для разработчиков, состоящий из 3 бесплатных онлайн-вебинаров!
Первый модуль про AI в корпоративной разработке: как выглядит рынок AI-инструментов сейчас, чем отличаются CLI-агенты от решений в IDE, какие риски реально важны для компании и как выбирать модели под конкретные задачи.
Контент идеально подойдет для Middle/Senior разработчиков.
9 апреля🟡14:30 МСК🟡Онлайн
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/ai-assistants-2026/join
Кстати, в свежем Cursor сильно улучшили Design Mode (⇧+⌘+D):
– кликаешь по элементу — редактируешь
– зажимаешь Shift — выделяешь область
– ⌥+click — запускаешь чат с выделенным элементом
Фронтендеры должны быть в восторге!
@ai_for_devs
🇨🇳 Alibaba выкатили Qwen3.6-Plus – новый флагман серии Qwen
Китайцы не перестают радовать! Новая версия модели появилась на OpenRouter в ночь с 30 на 31 марта без анонса и пресс-релиза — просто твит исследователя с таблицей бенчмарков.
Сейчас состоялся официальный релиз. Контекст — 1 млн токенов. На Terminal-Bench 2.0 — 61.6 против 59.3 у Claude 4.5 Opus, на SWE-bench пока проигрывает: 78.8 против 80.9.
По скорости генерации ранние тесты показывали 2-3x относительно Claude Opus 4.6.
Потыкать можно прямо сейчас бесплатно. Например, через OpenCode.
@ai_for_devs
🚨 Anthropic случайно слили исходники Claude Code
В публичном доступе появился .map-файл с полным TypeScript-кодом на 512 000 строк. Ошибка при сборке, не взлом.
В коде нашли скрытые фичи за feature-флагами: автономный daemon-режим, голосовые команды, триггеры для агентов и режим мониторинга.
Anthropic быстро удалила source map и старые версии с npm, но интернет всё помнит)
Такой вот вайбкодинг от Anthropic ☕️
@ai_for_devs
🔥 Квантизация с нуля: как 160-гигабайтная LLM помещается на ноутбук
Помните, мы переводили статью про кэширование промптов? Сегодня подготовили перевод от того же автора — на этот раз про квантизацию. Тот же стиль: интерактивная визуализация, объяснение базы, которая лежит в основе и всё это простыми словами.
Для тех, кто слышит про квантизацию впервые: квантизация — это способ уменьшить размер модели, заменив 16- или 32-битные числа с плавающей запятой на целые числа меньшего размера.
За счёт этого модели на 160 ГБ могут поместиться на обычный ноутбук и даже работать быстрее!
Главный инсайт от автора:
Когда я только захотел написать эту статью, я ничего не знал о квантизации. Я предполагал, что качество модели деградирует линейно по мере сжатия. То есть8-битная квантизацияbfloat16будет вдвое хуже, затем4-битная вдвое хуже8-битной, и так далее.
Это оказалось не так.
Переход с16-битной до8-битной квантизации несёт почти нулевые потери качества. Переход с16-битной до4-битной более заметен, но это точно не «в четыре раза хуже оригинала». Ближе к 90%, в зависимости от метрики.
Не бойтесь запускать локальные квантизованные модели.
😇 Бесплатные ИИ-агенты прямо сейчас
С прошлого опроса понял, что стоило добавить вариант «0$» — судя по всему, многие сейчас вообще не платят за ИИ-агентов. Если ты из таких — поставь 🤡 на этот пост, хочу оценить масштаб)
Ниже — то, что сам пробовал и что реально работает бесплатно:
– OpenCode и Kilo Code — список бесплатных моделей периодически меняется, сейчас доступны MiMo V2 (Xiaomi), MiniMax 2.5 и ещё несколько.
– Veai — 30 дней бесплатного доступа к Claude (Sonnet 4.6, Opus 4.6) и GPT-моделям. Единственный из списка, где потом можно платить рублями.
– Codex — открыли для всех пользователей ChatGPT, даже без подписки. Лимиты куцые.
– Qwen Code — братья китайцы радуют, 1 000 запросов в день без лимита по токенам.
Как fallback: бесплатные модели через OpenRouter по API-ключу. Лимиты на запросы нормально повышаются только после пополнения на $10.
@ai_for_devs
Как мы с бро ощущаем себя после того, как перешли с ChatGPT на Claude
Читать полностью…
Hunter Alpha: стелс-модель за неделю стала топ-1 на OpenRouter, потом выяснилось, что это...
На OpenRouter неделю была доступна анонимная модель Hunter Alpha. Многие LLM-провайдеры часто делают так с новыми моделями, чтобы затестить на реальных пользователях.
За это время она стала топ-1 по дневным вызовам и пробила 1 трлн токенов суммарно. Версий было много: DeepSeek тестирует V4, MiniMax (которые вчера как раз представили M2.7) — и ещё куча вариантов. Оказалось — Xiaomi!
Hunter Alpha была ранней сборкой MiMo-V2-Pro. Теперь модель вышла официально.
Что внутри: больше триллиона параметров, 42B активных, контекст до 1M токенов. По агентским бенчмаркам держится рядом с Claude Opus 4.6 и Sonnet 4.6.
Цена API: $1/млн входящих токенов до 256K — против $3 у Sonnet и $5 у Opus.