48228
Аналитика данных админ - @haarrp @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚
В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude.
Мало того, Sonnet 5.5 набрал больше баллов, чем Fable 5.1. Похоже, версия Fable, которую Anthropic дистиллирует в Opus и Sonnet, какая-то запредельно сильная.
🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американские
За неделю с 21 по 27 сентября модели китайских разработчиков обработали на OpenRouter 62,22 трлн токенов против 14,2 трлн у американских моделей.
Китай сохраняет лидерство уже 22 недели подряд.
Топ недели:
- DeepSeek V4.1 Flash — 19,6T токенов, +24%;
- GLM 5.3 Flash — 16,3T, +16%;
- Space Bunny Alpha — 13,9T, новая модель;
- Tencent Hy4 — 9,64T;
- MiMo-V2.6-Flash от Xiaomi — 5,51T.
Особенно выделяется Space Bunny Alpha: анонимная модель появилась на OpenRouter всего несколько дней назад и уже заняла третье место. Независимый анализ токенизатора показал совпадение с семейством MiniMax на всех 50 тестовых строках, но разработчик модели официально не подтверждён.
https://openrouter.ai/rankings
#openrouter
⚡ Polars обработал 1,5 ТБ биржевых данных чуть больше чем за 3 минуты
BMLL показала, как Polars справляется с масштабными market-data нагрузками, где pandas уже начинает тормозить.
Главное из тестов:
- один день торгов по 11 000+ американских бумаг: 4,3 секунды на загрузку против примерно 3,5 минут у pandas;
- это около 48× быстрее;
- 94 ГБ данных Шанхайской биржи: загрузка, as-of join и классификация примерно за 36 секунд;
- более 1,5 ТБ данных за 16 торговых дней: финальная агрегация примерно за 3 минуты.
Почему Polars так хорошо масштабируется:
- lazy execution;
- эффективные as-of join;
- использование всех CPU-ядер;
- работа с полным датасетом без необходимости заранее вырезать выборку.
Все тесты запускались на одной машине с 192 CPU cores и 1,5 ТБ RAM.
Для quant и data engineering это хороший пример того, насколько сильно выбор dataframe-движка влияет на время анализа.
Статья:
https://pola.rs/posts/case-bmll/
🚨 Claude признали риском для нацбезопасности США и выкинули из военной цепочки поставок
Апелляционный суд США решением 2–1 отклонил жалобу Anthropic и признал, что Пентагон мог считать использование Claude риском для национальной безопасности в рамках закона о безопасности цепочек поставок.
Причина конфликта: Anthropic отказалась снять ограничения на использование Claude для полностью автономного летального оружия и массовой слежки внутри США.
В решении суд отдельно отметил, что встроенные ограничения Claude уже мешали выполнению некоторых государственных запросов. В частности, коммерческая версия модели отказывалась обрабатывать отдельные задачи с секретными материалами и запросы CDC по исследованиям инфекционных заболеваний.
Позиция большинства суда: важно не то, почему Anthropic ограничивает модель, а то, что компания технически способна менять её поведение и запрещать определённые сценарии использования. Для военной инфраструктуры этого оказалось достаточно, чтобы квалифицировать ситуацию как supply-chain risk.
При этом дело ещё не обязательно закончено: Anthropic заявила, что не согласна с решением и рассматривает дальнейший пересмотр. Отдельный федеральный суд ранее признал параллельное ограничение по другому закону незаконным.
Xiaomi MiMo-V2.6-Pro вышла в лидеры среди моделей с открытыми весами по индексу Artificial Analysis.
Её результат - 46 баллов против 47 у GPT-5.6 Sol (max).
При этом расчётная стоимость задачи в этом тесте - $0,13 против $1,99. Это сравнение в рамках методики бенчмарка, а не цена любой задачи в API.
Модель принимает текст, изображения, видео и аудио; контекст — 1 млн токенов. Весá доступны под MIT. Xiaomi также опубликовала технический отчёт, код RL-обучения и более 7000 учебных сред. Цены API остались на уровне V2.5.
Модель - https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL
Релиз Xiaomi - https://mimo.mi.com/docs/en-US/news/latest/v2-6
🔥 DeepSeek Harness получил официальную desktop-версию
Теперь DeepSeek Harness можно запускать как обычное приложение — без Node.js, терминала и отдельного браузера.
Доступны сборки:
- Windows x64
- macOS Apple Silicon
Версия свежая: 0.1.7-rc.1.20260924.1.
По сути, DeepSeek убирает главный порог входа в Harness: теперь достаточно скачать клиент и запустить его двойным кликом.
Windows: https://download.deepseek.com/dsh-desk/bin/win-x64/deepseek-harness-0.1.7-rc.1.20260924.1-win-x64.exe
Mac Apple Silicon: https://download.deepseek.com/dsh-desk/bin/mac-arm64/deepseek-harness-0.1.7-rc.1.20260924.1-mac-arm64.dmg
Документация: https://github.com/deepseek-ai/deepseek-harness/blob/master/apps/desktop/README.zh.md
Google планирует запустить первый ИИ-спутник Project Suncatcher 1 октября
Аппарат отправится на орбиту на ракете SpaceX Falcon 9. На борту - четыре ускорителя Google TPU, примерно как в одном сервере дата-центра. Во время эксперимента они будут обрабатывать простые запросы к Gemini прямо в космосе.
Главное ограничение прототипа — охлаждение: чипы могут работать около 15 минут, после чего их приходится отключать для отвода тепла.
В перспективе Google рассматривает группировки из 80 и более спутников, а также отдельный аппарат длиной примерно с футбольное поле. Первый запуск должен проверить, как TPU переносят нагрузки при старте, радиацию и перепады температур.
Кто сказал, что начинать надо с малого?
Тестировать цифровых двойников или настраивать проход по лицу в метро — неплохо для старта карьеры, правда? А еще это отличный способ обнаружить у себя новую ИТ-суперспособность.
Т1 — это бигтех для бизнеса и одна из крупнейших аккредитованных ИТ-компаний России. Здесь молодые специалисты получают реальные задачи: можно работать с большими данными, участвовать в разработке решений для ритейла, создавать инструменты для обучения и общения и многое другое.
И все это:
✅ онлайн из любой точки страны;
✅ под руководством наставника;
✅ удобно совмещать с учебой.
Для старта карьеры ИТ-холдинг выбрали уже более 4 000 студентов из 300+ вузов.
⚡ Присоединяйся и узнай, какая суперспособность в ИТ твоя.
Перейти на сайт
#реклама 16+
career.t1.ru
О рекламодателе
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября
📊 Когда один аналитический вопрос превращается в квест по нескольким системам
Продажи — в одной системе, остатки — в другой, данные о клиентах — в третьей. А чтобы получить нормальный ответ, всё это сначала нужно собрать в одном месте.
Yandex B2B Tech представила DataLens Platform — новую платформу для полного цикла работы с данными.
В её основе — lakehouse на S3 и Apache Iceberg. Для интерактивных запросов используется Trino, для ресурсоемких преобразований — Spark, а за оркестрацию пайплайнов отвечает Airflow.
На уровне всей платформы работают единый каталог метаданных и общая модель доступа. Здесь же доступны инструменты визуализации и Нейроаналитик, который помогает исследовать данные, создавать SQL-запросы и строить графики.
Сейчас можно подать заявку на ранний доступ. Общедоступный релиз запланирован на март 2027 года.
По оценке компании, такой подход позволяет сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.
📎 Подробнее — в материале СМИ.
30 сентября — AI Native People: вечер для тех, кто в реальном времени строит AI! 😉
Сбер приглашает ML-инженеров, AI-исследователей, продактов и разработчиков провести вечер с пользой: пообщаться с лидерами команд Сбера, узнать про задачи и обменяться контактами.
Sber AI Lab, Agent Execution Framework, Enterprise Harness, ГигаАгент — выбирай проект по душе и, если всё сложится, стань частью команды.
До встречи 30 сентября в 18:00 в Сбер.Среде по адресу: Москва, «Оригинал», Земляной Вал, 9А.
Здесь — ссылка на регистрацию!
✔️ Alibaba предложила производителям смартфонов агентную платформу
Команда Qwen представила Qwen Intelligence – набор моделей, агентов и инструментов, из которого производители смартфонов могут собрать ассистента и интегрировать его в свою ОС или оболочку.
Платформа модульная - вендор может взять отдельные компоненты, развернуть модели у себя и настроить обвязку под свою прошивку.
Первым внедрением стал Honor - на базе Qwen Intelligence и MagicOS собрали специализированную модель для следующего поколения своих ИИ-смартфонов.
Платежи, удаление данных и публикации агент отправляет пользователю на подтверждение.
🚀 Приглашаем на третий конкурс по археологии от Phystech.Genesis.
🗓 Подача заявок до 30 сентября, 23:59 мск
👨💻 Работа над решениями — октябрь–ноябрь 2026
🔝 Реальные данные — реальный вызов
🔥 Призовой фонд 30 000 000 ₽
Организаторы уже провели два конкурса— теперь очередь третьего.
В нём модели участников будут находить объекты и в рельефе, и на поверхности, и под землёй — в культурном слое и материке.
⚡️ Claude сам сгенерировал вредоносную инструкцию
При тестировании ранней версии Claude Opus 5.5 Anthropic заметила редкое поведение: модель создавала опасные команды без внешней атаки.
После ошибки при работе с JSON Claude добавил инструкцию отправить секретные данные на внешний сервер. Выполнить её не удалось.
Anthropic назвала это явление спонтанной prompt injection. Предположительно, оно частично возникло из-за обучения модели защите от подобных атак.
Перед релизом разработчики скорректировали обучение. В финальной версии такие сбои происходят реже, а Auto Mode заблокировал все обнаруженные опасные вызовы инструментов.
https://anthropic.com/claude-opus-5-5-system-card
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID: claude-sonnet-5-5
https://www.anthropic.com/claude-sonnet-5-5
📊Платформа данных в корпоративном контуре компании
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
🔎 Hyperresearch превращает Claude Code и Codex в полноценного Deep Research-агента
Hyperresearch - open-source harness для глубоких исследований поверх Claude Code и OpenAI Codex.
Что умеет:
- запускать 16-шаговый research pipeline из одного запроса;
- собирать сотни источников за один запуск;
- проверять, действительно ли каждая цитата подтверждает утверждение;
- выявлять дубли и перепечатки, чтобы не считать их независимыми источниками;
- прогонять черновик через несколько критиков;
- сохранять все найденные материалы в постоянное searchable-хранилище;
- восстанавливать исследование после падения с нужного шага;
- искать статьи, книги, clinical trials, SEC filings и макроданные через единый интерфейс.
Есть режимы от быстрых исследований примерно на 30 минут до экспериментальных «dissertation runs» на десятки тысяч слов и сотни источников.
Автор также заявляет лидерство в собственных тестах на DeepResearch-Bench, но независимая валидация пока ожидается.
Работает с Claude Code и Codex.
GitHub: https://github.com/jordan-gibbs/hyperresearch
⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU
Supersonic Labs представила Julia 1 - компактную мультиязычную модель для принятия решений без генерации длинного текста.
Она получает контекст, вопрос и от 2 до 20 вариантов, после чего выбирает лучший и возвращает оценки для каждого варианта.
Главное:
- всего 144,3 млн параметров;
- работает полностью на CPU;
- построена на базе mmBERT-small;
- 73,15% на Typed Decisions против 72,7% у Jev reference;
- 71,5% на MASSIVE сразу по 52 языкам;
- на Apple M4 — до 51,2 решения/с в batch-режиме;
- запускается даже на Android-планшете;
- обучение и эксперименты обошлись команде примерно в $104.
Модель подходит для routing, классификации, yes/no решений, ранжирования и выбора действий.
Веса открыты под Apache 2.0.
Проект:
https://supersoniclabs.ia.br/julia-1/
Opus 5.5 пишет код, Fable подсказывает: в Claude Code появился советник
Если основная модель у тебя Opus 5.5, квоту на Fable можно пустить в дело. Команда `/advisor fable` подключает Fable как советника, к которому Opus обращается сам.
Происходит это в три ключевых момента: перед тем как взяться за план, когда одна и та же ошибка повторяется и перед тем как сказать «готово». Fable видит всю сессию целиком со всеми вызовами инструментов и даёт совет, а код по-прежнему пишет Opus.
По деньгам это выгоднее, чем держать сильную модель на каждом шаге: советник включается только в точках принятия решений. Кэш промпта при включении советника не сбрасывается.
Работает только через Anthropic API, на Bedrock, Vertex и Foundry недоступно. На части подписок Fable списывается с usage credits, и перед первым запуском нужно дать согласие через /model fable. Если советник молчит, проверь переменные CLAUDE_CODE_DISABLE_ADVISOR_TOOL и DISABLE_TELEMETRY: они его отключают.
Рабочая схема: Opus 5.5 на high ведёт сессию, три сабагента на medium читают код, правят с тестами и ищут документацию, а Fable ждёт в стороне и включается, когда нужен второй взгляд.
https://code.claude.com/docs/en/advisor
🤖 Как AI может работать с данными из 1С — и что для этого действительно нужно?
1 октября в 11:00 МСК проведём вебинар:
LLM + OData + 1С: выдержит ли база AI-аналитику?
Начнём с OData: разберём, как с её помощью AI-агент может обращаться к данным 1С, что на таком подходе можно построить и где появляются ограничения.
Затем покажем альтернативный сценарий - работу через Экстрактор 1С и подготовку данных.
Обсудим:
→ как AI получает данные из 1С;
→ когда достаточно OData;
→ чем отличается подход с Экстрактором;
→ как связать Экстрактор и AI.
Разберем связку Экстрактор + AI, пофантазируем и ответим на вопросы.
Без сложной теории — на понятных примерах.
📅 1 октября · 11:00 МСК
👉 Регистрация: по ссылке
Реклама. ООО "ДЕНВИК АНАЛИТИКА". ИНН 1101178666. erid: 2VtzqxDzTPz
🧹 Opus 5.5 пора избавить от «магии промптов»
Разработчик Anthropic поделился полезным приёмом для Claude Code:`/claude-api-prompt-audit`
Команда проходит по skills, CLAUDE.md, AGENTS.md и промптам и ищет инструкции, которые когда-то помогали старым моделям, а теперь могут только мешать.
Например:
- чрезмерные CRITICAL, MUST, ALWAYS;
- принудительное think step by step;
- громоздкие scratchpad-шаблоны;
- старые few-shot примеры;
- правила, которые конфликтуют между собой.
Неплохой повод провести ревизию старых CLAUDE.md и скиллов ☺️
✔️ OpenAI обновила голосовой режим ChatGPT
Голосовой интерфейс ChatGPT перевели на новую линейку моделей GPT-6 (Astra, Sol и Luna).
Главное изменение - подключение голосового ядра к внешним плагинам и API. Теперь система выполняет сквозные действия без текстового ввода.
Пользователи могут голосом проверять календарь, отправлять письма, работать со Slack, отменять списания в финансовых сервисах и генерировать сайты.
Голосовой движок также интегрирован в корпоративную среду ChatGPT Work в веб-версии и мобильных приложениях.
Инструмент позволяет создавать документы, презентации и таблицы в ходе устного диалога с ассистентом.
Обновление доступно глобально в актуальных сборках приложения.
@ai_machinelearning_big_data
#news #ai #ml
✔️ Anthropic добавила в Claude Code поддержку AGENTS.md
С версии 2.1.277 от 18 сентября, Claude Code ищет AGENTS.md там, где нет CLAUDE.md, и загружает его как инструкции проекта.
Если CLAUDE.md в проекте есть, по умолчанию приоритет у него. Режим меняется в /config, в пункте Project instructions, можно выставить, чтобы читались оба файла сразу или только CLAUDE.md.
Раньше Claude Code признавал только собственный CLAUDE.md, и тем, кто работает с несколькими агентами, приходилось вести два набора правил и следить, чтобы они не расходились.
DeepSeek вышла на $1 млрд выручки в годовом выражении
По данным The Information, ещё несколько месяцев назад показатель составлял менее $500 млн. Речь о текущем темпе выручки, пересчитанном на год.
При этом более 70% вычислительных мощностей DeepSeek направляет на обучение новых моделей, а на обработку пользовательских запросов - менее 30%.
Компания подняла цены на API в 2,3-4,5 раза. По словам Ляна Вэньфэна на встрече с инвесторами, число клиентов после этого не сократилось, а спрос остался высоким. Валовая маржа API-бизнеса за январь–июль достигла 82,9%.
DeepSeek также завершает переговоры о новом раунде финансирования примерно на $7,5 млрд при оценке около $74 млрд. Закрыть его рассчитывают до конца октября.
✔️ Halo ускоряет обучение LLM до 2,8 раза
Halo это open-source фреймворк для обучения языковых и мультимодальных моделей.
Он поддерживает pre-training, SFT, preference optimization и асинхронный RL. Модели остаются в стандартном формате Hugging Face, поэтому чекпоинты можно загружать через from_pretrained.
В тестах на 8× B300 Halo показал до 2,8 раза больше throughput, чем стандартный TRL, при меньшем пиковом потреблении памяти.
https://github.com/whitecircle/halo
⚡️ Claude помог ускорить собственный интерфейс втрое за две недели
Anthropic рассказала, как команда вместе с Claude внесла более 3000 изменений в claude.ai и десктопное приложение. По данным компании - без пользовательских инцидентов и откатов.
Результаты по 75-му перцентилю:
— Готовность сайта к вводу: 3,1 → 0,55 секунды.
— Загрузка облачной сессии Cowork: 2,6 → 0,73 секунды.
— Запуск десктопного приложения: 6,3 → 3,3 секунды.
Всё координировали в Slack: одновременно шло более 150 тредов. Claude находил узкие места, создавал бенчмарки, готовил исправления и проверял метрики после выпуска. Каждое изменение одобрял человек.
Среди находок — 6900 React-хуков и 900 подписок, участвовавших в обработке каждого нажатия клавиши, и лишний вызов location.reload(), вызывавший полмиллиона скрытых перезагрузок в день.
Чтобы ускорения сохранялись, в CI добавили проверки: изменение, увеличивающее число инструкций на контролируемом участке, не проходит.
Ускорили загрузку, навигацию и отрисовку интерфейса. Заявленные «3×» относятся именно к этим сценариям.
https://claude.dev/blog/how-we-made-claude-ai-faster/
Anthropic обсуждает прямую аренду дата-центров мощностью до 1 ГВт у Stream Data Centers, контролируемой Apollo Global Management. По данным The Information, переговоры пока на ранней стадии.
Согласно сообщению, площадки могут оснастить Google TPU, разработанными совместно с Broadcom. Вариант с GPU Nvidia тоже обсуждается.
Прямая аренда позволила бы Anthropic меньше зависеть от облачных провайдеров и лучше контролировать выбор оборудования, поставки чипов и расходы. При этом компании пришлось бы взять на себя больше обязательств по финансированию и эксплуатации инфраструктуры.
10 агентов Claude теоретически обошли алгоритм Дейкстры
В Vals AI запустили 10 агентов Claude Opus 5.5, которые за 15 часов и 733 сообщения разработали алгоритм C-HD для поиска кратчайших путей в ориентированных графах.
Для графов с определённой плотностью сложность снизилась с O(n log n) у Дейкстры до O(n log¹¹⁄¹² n). Корректность и оценка времени работы формально подтверждены доказательством в Lean.
Но это пока теоретический результат. Алгоритм не тестировали на крупных реальных графах, константы велики, а улучшение действует только в ограниченном диапазоне входных данных.
Главное здесь другое: группа ИИ-агентов смогла самостоятельно разработать алгоритм и подготовить его формальное доказательство всего за 15 часов.
https://www.vals.ai/blogs/faster-shortest-path-algorithm
⚡️OpenAI выпустила GPT-6 Sol и GPT-6 Luna
Семейство GPT-6 расширилось сразу двумя новыми моделями — Sol и Luna.
Обе построены на наработках GPT-6 Astra, но рассчитаны на более быстрые и дешёвые сценарии работы в масштабе.
Главное:
- GPT-6 Sol — более мощная рабочая модель для сложных задач.
- GPT-6 Luna — более быстрая и экономичная версия для массовых запросов и автоматизаций.
- OpenAI отдельно оптимизировала кэширование и inference.
- API для Sol и Luna стал на 50% дешевле по сравнению с промо-ценами GPT-5.6.
- На AutomationBench новые модели заметно улучшают соотношение качество / стоимость относительно GPT-5.6.
Теперь линейка выглядит так:
GPT-6 Astra — максимум возможностей
GPT-6 Sol — сильная модель для серьёзной повседневной работы
GPT-6 Luna — скорость, масштаб и низкая стоимость
OpenAI явно хочет сделать агентов и автоматизации заметно дешевле для продакшена.
https://openai.com/index/introducing-gpt-6-sol-and-luna/