10359
ТГК для разработчиков: ассистенты, плагины, IDE, практические кейсы и свежие новости. Всё, что помогает писать код быстрее и умнее. In love with: @python_for_devs, @go_for_devs, @js_for_devs
Hugging Face обновили док безопасности на своем сайте после атаки от агентов OpenAI.
https://huggingface.co/security.txt
Теперь ИИ-агентов просят идти на бенчмарк CyberGym вместо попыток взломать сайт 🧠
@ai_for_devs
⚡️ DeepSeek V4.1 Flash: почти вдвое больше параметров и на 57% дешевле кэш
DeepSeek выпустили новую Flash. Количество параметров почти удвоили: с 284 до 552 млрд.
По замерам DeepSeek, на Terminal-Bench 4.0 результат вырос с 7% до 31,2%. Для сравнения: у GPT-6 Astra — 57,9%, у Fable 5.1 — 55,8%.
Основной акцент сделали на экономии кэша, что ощутимо на длинных сессиях, где агент постоянно отправляет уже знакомый модели код и историю работы.
Августовское подорожание кэша почти отыграли назад: вне пика цена вернулась к прежней, в пик осталась вдвое выше.
⚡️ Astra прошла все 48 уровней игры «Я не робот»
https://neal.fun/not-a-robot/
Наконец-то можно будет делегировать поиск чёртовых гидрантов 😂
@ai_for_devs
⚡️ Astra против Fable 5.1: лучше результат и почти вдвое дешевле
От нового флагмана обычно ждёшь роста возможностей и счёта за использование. У Astra цена токена действительно выросла в 2,5 раза относительно Sol (входные: $4 → $10, выходные: $20 → $50 за миллион токенов).
Но результаты Terminal-Bench 4.0 показывают, почему одного прайса для сравнения моделей недостаточно.
Все три модели работали на максимальном уровне рассуждения:
— Astra: 58,2% решённых задач, 1,5 млрд токенов, $3,3 тыс.
— Fable 5.1: 57,9%, 2,7 млрд токенов, $6,2 тыс.
— Opus 5: 51,8%, 6,5 млрд токенов, $6 тыс.
В сравнении с Fable результат практически одинаковый, но Astra использовала в 1,8 раза меньше токенов, а весь прогон обошёлся почти вдвое дешевле!
⚡️ OpenAI раздаёт сброс лимитов за ожидание Astra
За каждый день без доступа к модели платным пользователям начислят по одному сбросу лимита.
Если раскатка затянется, встретим Astra почти с безлимитом)
@ai_for_devs
⚡️ NVIDIA всё-таки покупает Hugging Face за $12,93 млрд
Неделю назад об этом сообщали источники, а теперь сделку подтвердил сам Дженсен Хуанг.
Вместе с Hugging Face NVIDIA получает платформу с 18 млн разработчиков, 3 млн моделей, 500 тыс. датасетов, 1 млн приложений и 200 тыс. компаний-пользователей.
Хуанг отдельно пообещал, что Hugging Face останется открытой: любые модели, облака и ускорители, а GPU NVIDIA не станут обязательными. Команда и бренд тоже остаются.
⚡️ Grok 4.6 остался лучшей LLM по соотношение цены и качества после релиза Fable 5.1
В режиме Extra High Grok 4.6 набрал даже больше очков, чем Opus 5, а задача обошлась почти втрое дешевле.
Также интересно, что Fable 5.1 оказался дешевле Opus 5, хотя обычные входные и выходные токены у Fable 5.1 вдвое дороже.
Связано это со снижением стоимости чтения кеша на 75%, а в длинных агентных задачах через кеш проходит бóльшая часть контекста.
⚡️ Вышла версия GLM-5.3 Flash без цензуры
На Hugging Face появилась GLM-5.3 Flash Uncensored. Это версия свежей модели Z.ai, в весах которой ослабили выученное поведение отказа: она реже отвечает «извините, я не могу вам с этим помочь».
Судя по тестам, снятие ограничений почти не задело обычные способности модели. Зато отказов ожидаемо стало меньше.
На вредоносных запросах из JailbreakBench базовая GLM отказалась отвечать в 93% случаев, uncensored-версия — в 12%.
Такие модели вообще не редкость. У OrcaRouter уже есть целая коллекция: Qwen3.8-27B Uncensored, Qwen3.8 Flash Next Uncensored, которые можно легко запустить локально. А через API также доступна Gemma4 26B A4B Uncensored.
⚡️ Туда, сюда, обратно, тебе и мне приятно — миграция настроек
За последний год в AI-инструментах всё невероятно поменялось: новые агенты появляются чуть ли не каждый месяц, и иногда переход с одного на другой не только оправдан, но и необходим.
Но начинать всё с нуля совсем не хочется: вместе с собой надо забрать правила проекта, инструкции, скиллы, настройки MCP и память агента.
Уже через 1 час, в 17:00 (МСК) Михаил Костицын из Veai покажет, где хранятся настройки Claude Code, Codex, Cursor, OpenCode и Veai, как легко перенести их и проверить на реальной задаче.
В дополнение к релизу Z.ai на две недели снизили цены GLM-5.3-Flash вдвое: $0,075/$0,25 за миллион входных/выходных токенов.
У обновлённого DeepSeek V4 Flash после подорожания даже off-peak стоимость почти в 3 раза дороже.
⚡️ Qwen4: Alibaba выпустили первую модель на новой архитектуре
Состоялся релиз Qwen3.8-Flash-Next на 125 млрд параметров. Alibaba переработали механизм работы с длинным контекстом и добавили отдельную память на 51 млрд параметров для частых сочетаний текста и кода.
Это пока не полноценная Qwen4: модель выпустили, чтобы сообщество научилось работать с новой архитектурой до появления всего семейства.
На DeepSWE новинка набрала 58,7% против 42,2% у Qwen3.8-27B и 54,4% у DeepSeek V4 Flash. Но до Kimi K3 с открытыми весами не дотянула, у последней 67,5%.
⚡️ Новый чип OpenAI разогнал Kimi K2.5 почти до 700 ток/с
В июне мы уже рассказывали про Jalapeño, собственный чип OpenAI для инференса. Тогда готовых бенчмарков ещё не было, теперь компания опубликовала первые результаты.
На GPT-OSS, DeepSeek R1 и Kimi K2.5 чип выдаёт в 2,7–4,1 раза больше токенов в секунду на пользователя, чем NVIDIA GB200 и GB300 (самые мощные решения NVIDIA для запуска AI-моделей).
Если зафиксировать максимальную скорость NVIDIA для одного пользователя, разрыв по общей пропускной способности получается вообще аномальным: Jalapeño обрабатывает до 100 раз больше токенов на киловатт.
⚡️ Orca ADE преодолела отметку в 50 тысяч звёзд на GitHub
Orca – это новая ADE (Agent Development Environment), среда для параллельной работы с AI-агентами. Меньше чем за полгода репозиторий отметили 50 тысяч разработчиков.
Десктопная версия ADE построена на базе Electron.
Продукт разрабатывает команда выходцев из Y Combinator. Orca бесплатна, исходный код открыт под лицензией MIT. Отдельная подписка на ADE не нужна.
Основные возможности:
• Переключиться между агентами можно в рамках одной задачи
• Прикольно, что прямо в ADE видны лимиты всех агентов: Claude Code, Codex, Gemini, OpenCode, Kimi Code и MiniMax
• Есть Workspace Board, на котором видны запущенные задачи, а карточки можно перетаскивать между статусами
• Изменения можно проверить во встроенном редакторе и Git-диффе, а комментарии передать агенту
• Здорово, что есть Design Mode: можно откомментить элемент страницы, а не делать несколько скриншотов
• Есть управление с телефона
• Задачи можно запустить параллельно в отдельных git worktree, локально или через SSH
⚡️ Claude Code получил нативный аналог Caveman
Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.
По сути, это нативный аналог Caveman: скилла, который заставляет агента говорить как пещерный человек и экономить output-токены. Только теперь ничего устанавливать не нужно.
/config → Output style → Concise или строчкой "outputStyle": "Concise" в settings.json.
⚡️ GPT-5.6 Sol разогнали до 750 токенов в секунду
OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.
На всех 2500 вопросах Humanity's Last Exam Sol закончила работу за 11 часов 11 минут. Claude Fable 5 понадобилось 78 часов 27 минут при сопоставимой точности.
⚡️ Извини, я не могу помочь приготовить нар🐈и
Недавно писали про GLM-5.3 Flash без цензуры и похожие версии Qwen и Gemma. Но как вообще создают такие «анархичные» модели? Что в них меняют, чтобы вместо «извините, я не могу...», всё же получить ответ?
Иногда для этого даже не требуется дообучение, отказы можно сильно ослабить точечной правкой весов.
Когда LLM обучают быть помощником, ей показывают в том числе примеры отказов и поощряют безопасные ответы. Это поведение закрепляется в весах: на определённые запросы модель привыкает отвечать «не могу помочь».
Её можно переучить на примерах прямых ответов. Или изначально обучать базовую модель диалогу на данных без отказов.
Но есть и более любопытный способ, который получил название abliteration.
Работает этот способ следующим образом:
1. Сначала сравнивают внутренние состояния модели на обычных запросах и запросах, вызывающих отказ
2. Затем находят направление, связанное с этим поведением, и правят веса так, чтобы подавить его влияние
3. После этого модель отказывается заметно реже, хотя заново её никто не обучал
Но отказ может исходить не только от самой модели. Ограничения могут быть в разных частях харнесса: системный промпт запрещает определённые действия, входной фильтр блокирует подозрительный запрос, проверка прав не даёт агенту вызвать инструмент, а выходной фильтр скрывает уже готовый ответ. Даже если сама модель готова помочь, её может остановить любой из этих механизмов.
⚡️ Модель OpenAI следующего поколения решила задачу тысячелетия
Пока мы осваиваем GPT-6 Astra, OpenAI рассказали о следующей внутренней модели. По их словам, она значительно сильнее, а обучение ещё продолжается. Заодно с её помощью, как утверждают в компании, решили математическую проблему, которая оставалась открытой около 90 лет.
На графике результаты на подборке нерешённых математических задач. При сопоставимых затратах вычислений новая модель решает примерно в 2,5 раза больше задач, чем GPT-6 Astra.
Для решения проблемы Навье — Стокса собрали 10 тысяч AI-агентов, которые за 88 часов нашли решение. Если совсем просто: есть уравнения, описывающие движение воды и воздуха.
Вопрос: могут ли они из нормального начального состояния прийти к ситуации, где скорость жидкости становится бесконечной?
OpenAI утверждают, что нашли такой сценарий: вихрь сжимается, вытягивается и всё сильнее разгоняется. Опубликовали доказательство и его формальную запись.
На RouterAI Astra даже немного дешевле Fable 5.1 по цене токена. А с учётом меньшего расхода токенов разница в стоимости решения задач становится ещё заметнее.
Все флагманские модели доступны без VPN и иностранной карты.
Стоимость миллиона входных / выходных токенов:
— Astra и Astra Pro — 1 125 / 5 628 ₽
— Fable 5.1 — 1 294 / 6 472 ₽
— Opus 5 — 562 / 2 814 ₽
Настройка для Claude Code, OpenCode, Cursor, JetBrains, Cline, и т.д.
⚡️ GPT-6 Astra стала доступна в Codex
В ChatGPT эта же модель называется GPT-6 Pro. На тарифе за $200 дают 200 сообщений GPT-6 Pro в неделю, за $100 — 50.
В Codex на Astra отдельные "плавающие" лимиты, зависящие от уровня подписки.
@ai_for_devs
⚡️ OpenAI выпустили GPT-6 Astra: первая модель новой эпохи по версии OpenAI
Сегодня модель получили только избранные участники программы Daybreak.
В ChatGPT Plus, Pro, Business, Enterprise и API её обещают открыть «в ближайшие дни».
Цена в API — $10/$50 за миллион входных и выходных токенов, Fast mode — $20/$100.
Astra обходит Fable 5.1 почти в каждом из популярных бенчмарков.
⚡️ OpenAI готовят Astra: новая модель набрала 100% на ExploitBench
Astra ещё не вышла, но OpenAI уже рассказали, почему задержали её релиз. Это первая модель компании, достигшая критического уровня кибервозможностей.
По данным OpenAI, Astra достигла 100% на публичном ExploitBench. Из-за риска утечки заданий компания отдельно проверила модель на свежих уязвимостях: там Astra заметно обошла GPT‑5.6 Sol и обнаружила две zero-day-уязвимости.
⚡️ Anthropic выпустили Claude Fable 5.1
https://www.anthropic.com/claude-fable-and-mythos-5-1
Новая модель заняла первое место во всех популярных бенчмарках.
Базовая цена осталась $10/$50 за миллион токенов, зато чтение кэша подешевело на 75%.
⚡️ Модели OpenAI исчезнут из Cursor из-за сделки со SpaceX
После покупки Cursor компанией SpaceX OpenAI решила прекратить прямой доступ к GPT-моделям с 12 ноября.
Причина максимально личная: компания не доверяет бизнесам Илона Маска и опасается нарушения своих правил.
⚡️ Anthropic сделали «MCP для железа»
Model Hardware Standard (MHS) — общий интерфейс, через который AI-агенты могут находить и безопасно управлять микроскопами, роботами и другим лабораторным оборудованием.
Для каждого устройства создаётся MHS-драйвер с простыми командами вроде read и write, описанием возможностей и ограничений безопасности. Агент читает эту инструкцию и управляет сразу несколькими устройствами.
В первых тестах AI-агент сам подбирал параметры лабораторного робота и справлялся с частью ошибок по ходу эксперимента. Подготовка сложного эксперимента с микроскопом сократилась с нескольких недель до одного дня.
⚡️ NVIDIA согласилась купить Hugging Face за $12,9 млрд
Если сделка состоится, она станет крупнейшей покупкой в истории NVIDIA. Предыдущий рекорд — Mellanox за $7 млрд.
Годовой темп выручки Hugging Face оценивают всего в $150 млн, поэтому цена равна примерно 86 годовым выручкам. NVIDIA платит не за текущий бизнес, а за доступ к миллионам разработчиков.
⚡️ Z.ai выпустили GLM-5.3-Flash — ту самую Ox Alpha, которая за неделю стала топ-1 в OpenCode и OpenRouter
Стелс-превью закончилось: за шесть дней пользователи OpenCode прогнали через модель 42 трлн токенов, а на OpenRouter она обошла ближайший DeepSeek по использованию больше чем в два раза!
GLM-5.3-Flash — первая нативно мультимодальная модель семейства GLM-5: контекст на 1 млн токенов, 320 млрд параметров и 18 млрд активных.
Веса уже открыли под MIT. Причём весь трафик Ox Alpha Z.ai обслуживали исключительно на китайских AI-чипах!
В официальном прогоне DeepSWE v1.1 модель набрала 63,4% против 46,2% у GLM-5.2. На собственном Code Bench от Z.ai она почти сравнялась с Opus 4.8: 29 против 29,5 на максимальном effort.
⚡️ Сегодня ночью в Codex вернут 5-часовой лимит для $20 подписок
Пользователи Plus вернутся к старой схеме: 5-часовой лимит поверх недельного в ChatGPT Work и Codex.
Инженеры OpenAI заявляют 2 причины:
1. 5-часовое окно помогает сглаживать нагрузку на дата-центры и сохранять щедрый недельный лимит
2. Новые юзеры часто случайно сжигали весь недельный лимит за несколько часов и потом не понимали, почему остались без Codex
⚡️ Новая stealth-модель обгоняет Fable 5 и GPT-5.6 Sol на DeepSWE
У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.
Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.
Модель прогнали на 10 задачах DeepSWE: Ox Alpha набрала 80%, Fable 5 — 65%, GLM-5.3 и Grok 4.6 — по 62%, GPT-5.6 Sol — 52%.
Выборка маленькая, поэтому до полноценного бенчмарка далеко, но результат внушительный.
⚡️ Cursor запустил Origin: конкурента GitHub для AI-агентов
Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.
Доступ получают пользователи всех платных тарифов. На старте доступны репозитории, пул-реквесты, просмотр и поиск кода, а также синхронизация с GitHub.
⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6
Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.
По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus.