boris_again | Unsorted

Telegram-канал boris_again - Борис опять

15113

life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin

Subscribe to a channel

Борис опять

Вышел GigaChat 3.5 Reasoning. Сбер выкатил модель под открытой лицензией MIT, так что веса доступны!

Обучили именно режим рассуждений: модель сначала планирует шаги, потом последовательно решает задачу и сама исправляет ошибки, если где-то ошиблась. Для длинного контекста использована архитектура с линейным вниманием. Говорят, что на математических задачах выходит в среднем на 37% меньше токенов по сравнению с DeepSeek V4 Flash Preview.

Прирост на бенчмарках:
— IFBench — с 44 до 77 баллов
— Natural Plan — с 64 до 80 баллов
— Live Code Bench v6 — с 56 до 85 баллов

Проверить рассуждения вживую можно прямо в ГигаЧате.

Модель лежит на Hugging Face и Gitverse, а подробные результаты расписали на Хабре.

Читать полностью…

Борис опять

https://opusfived.dev/

Читать полностью…

Борис опять

Яндекс запустил Алису AI для бизнеса — ИИ-ассистента, которому можно поручать рабочие задачи. Например, составить календарь платежей по счетам и договорам, разобрать записи совещаний и поставить поручения ответственным. Для этого достаточно описать задачу ассистенту как коллеге.

Я довольно сильно блекпильнулся по поводу кодинговых агентов, но в ассистентов для энтерпрайза я верю. В кодинге у агента в распоряжении целый проект бесконечное количество способов понять промпт и решить задачу. В компании заранее заданы границы, до чего дотянуться можно, а до чего нельзя, более менее ограниченный набор действий.

Алисе AI для бизнеса можно отдать многосоставное поручение целиком, а дальше она сама раскладывает его на шаги. В формате "посмотри свободные слоты в календаре, сверь с расписанием коммерческого директора, найди окно у нас обоих, подтяни из почты переписку по проекту, поставь встречу".

Для этого ассистенту нужен доступ к системам - он работает в виртуальном офисе Яндекс 360, но также умеет подключаться с помощью плагинов к сторонним корпоративным системам вроде Битрикс24 или amoCRM. И сам собирает все нужные ему данные. Разрешение на каждый источник выдаёт пользователь, список допущенных сотрудников держит админ. То есть ассистент не идёт никуда сам по себе, а лишь туда, где у него есть доступ. Мне это кажется правильной постановкой задачи. Помогать, а не решать все за человека.

Читать полностью…

Борис опять

2018: AI safety не существует, это научная фантастика 😂
2026: AI safety не существует, это научная фантастика 😫😫😫

Читать полностью…

Борис опять

Прилетел на ECCV 2026 в Malmo. Если кто-то ещё тут: заглядывайте 8 сентября на воркшоп по мультимодальным агентам, около 14:30 буду рассказывать как делаем VLA для GUI

Читать полностью…

Борис опять

Мы с GPT-6 Astra долго размышляли и я придумал революционную вещь из первых принципов

Ключевые проблемы LLM:
- Промпты можно проинтерпретировать неоднозначно, существует много решений для одного промпта и агент не может установить какое именно требует пользователь.
- Результат не детерменирован, поэтому даже при запуске одного и того же промпта может быть много разных результатов.

Первое делает результат неоднозначным, а второе не позволяет сделать его стабильным. Мы решаем это тратя больше попыток, то есть сжигая токены, что очень дорого.

Решение в том, чтобы ограничить промпты. Нужно, чтобы промпты состояли не из произвольных конструкций, а из заготовок: "И", "ИЛИ", "ЕСЛИ" и так далее.

В таком случае скиллы тоже могут быть не свободными промптами, а переиспользуемыми кусочками логики, которые получают на вход некие настройки и делают ровно то, что нужно. Что-то вроде "СКИЛЛ(ВХОД1, ВХОД2)". Любой скилл становится просто очереднвм тулколлом для модели. Чтобы было проще делать агентов, можно сразу в этот язык встроить лупы: "ЦИКЛ(СКИЛЛ, УСЛОВИЕ ОСТАНОВКИ)"

Самое главное, что можно обратиться к работам советских ученых и построить этот язык промптов на рекурсивных грамматиках. Тогда все эти конструкции можно комбинировать. Возможно представить результат любой сложности в виде промпта! Вместо написания простыней маркдауна можно будет собирать результат как конструктор.

Если так же сделать результат исполнения промпта строго однозначным, то можно будет верифицировать его и итеративно улучшать качество решения, а не каждый раз начинать заново. Можно будет добавить кеширование и какой-то упрощённый формат промпта, который можно будет сохранить на диск и передавать для воспроизведения на другом компьютере.

Со всеми этими компонентами, моделям потребуется гораздо меньше параметров, ведь им больше не придётся разбирать интент пользователя: интент будет описан явно! Модели буду работать намного быстрее и дешевле.

Я сейчас занимаюсь разработкой MVP этой системы. Рабочее название: Язык Промптов (ЯП). Я уверен, что за этим будущее. Если интересны инвестиции, пишите в лс.

Читать полностью…

Борис опять

Считаю важным доносить проблемы AI Safety до максимально широкой аудитории, поэтому в том числе работаю над мюзиклом реалистично показывающим риски развития AI.

Мюзикл называется "AI: Save our Souls", его я представлял на фестивале Edinburgh Fringe 2025 (тизер тут).
Сейчас готовлю вторую редакцию мюзикла, ищу финансирование и выпускаю треки.

Недавно релизнул песню Mind Vivisection про AI выходящий из под контроля с кучей цитат реальных сломанных AI, с которой начинался мюзикл.

Через месяц выходит саундтрек первого акта! В первом акте 10 песен в стилях рок, поп, электронной музыки и даже техно, при этом они гармонично воспринимаются вместе и характеризуют быстро меняющийся с AI мир. На уведомление о выходе саундтрека на Spotify можно подписаться тут.

После показа самого мюзикла друзья-программисты отмечали, что узнавали себя в персонажах и реалиях разработки. Другим понравились музыка, танцы, смешение стилей, свет и костюмы. А тема манипуляции AI и его выхода из-под контроля заставляла задуматься о будущем. Многие отмечали, что мюзикл получился очень своевременным.

Буду рад фидбеку/лайкам/прослушиваниям/сохранениям!

Читать полностью…

Борис опять

А вы знали, что в early stage company можно использовать не только детский труд?

Читать полностью…

Борис опять

Major release от нашей небольшой лабы. Поддержка спекулятивного декодинга в нашем инференс движке.

Для начала Qwen3.6 27B, поддержка Qwen3.8 27B и Muse Glimmer в пути.

Мы сильно превосходим все возможные стеки для Apple Silicon по производительности. Потому что взяли и все сделали как ко-дизайн: кернелы, квантизация и спекуляция. Все с нуля, все свое.

Попробовать можно уже сегодня
M checkpoint - поменьше
L checkpoint (lossless)

Все модели которые мы поддерживаем лежат тут, будем рады если попробуете что-то еще.

Бенчи тут. Можно изучить как и что измерено и насколько лучше.

Подробнее про релиз блог пост

Читать полностью…

Борис опять

Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848

Читать полностью…

Борис опять

Произошел компьютер юз ошибка момент

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за неделю 24–30 августа 2026

LLM
Z.ai: GLM-5.3-Flash
Открытая MoE 320B, 18B активных, 1М и нативным зрением. Модель обучили с нуля, а не дистиллировали GLM-5.3.
У Flash 45 слоев против 92 у GLM-4.5, а attention требует в три раза меньше вычислений и в 4.4 раза меньше KV-кэша, чем у большой GLM-5.3.
На Terminal-Bench 2.1 модель получила 84.3% против 85% у Opus 4.8. Зрение тоже не декоративное: 62.4% на OfficeQA Pro.
Веса есть. До 9 сентября API стоит $0.075/$0.25. Потом тариф удвоится.
Блогпост, Веса, Цены

Alibaba: Qwen3.8-Flash-Next
Qwen открыла мультимодальную MoE. Основная модель содержит 125B параметров, еще 51B N-gram Embedding, а на каждом токене активируется всего 6B. Контекст 262К
Много всяких архитектурных фич, команда называет эту модель превью архитектуры Qwen4: Qwen Sparse Attention, Gated Residual, N‑gram embedding и другие ругательные слова, есть смысл почитать.
По большинству бенчей бьет Opus 4.6 и DeepSeek-4V-Flash.
Есть веса, по API $0.15/$0.47.
Блогпост, Техрепорт, Веса

Видео
Google: Gemini Omni 1.1 Flash

Google обновила Omni Flash и добавила базовый минимум в 2026г: Можно задавать первый и последний кадры, продлевать сцену, использовать короткое видео как референс
Генерация до 10с, но можно продлевать до 40с.
Цена составляет $0.03 за секунду в 360p, $0.10 в 720p, $0.15 в 1080p и $0.30 в 4K. 1080p и 4K получают апскейлом из 720р.
Блогпост, Документация

fal: H3 Max
fal взяла открытый MiniMax H3, дообучила его на новых данных и одновременно переписала инференс. Основной упор сделали на скорость.
Пятисекундное видео генерируется меньше чем за 3 секунды(!). Это в 35 раз быстрее API MiniMax H3.
По качеству находится среди топов в Design Arena и Artificial Analysis.
Доступна только через API, весов нет. $0.05/сек 480p и $0.08/сек 768p.
Блогпост, Модель

Аудио
Google: Gemini 3.5 Transcribe и Transcribe Live

Google выпустила две отдельные speech-to-text модели. gemini-3.5-transcribe транскрибирует, расставляет спикеров и таймкоды.
gemini-3.5-transcribe-live принимает поток и возвращает расшифровку с задержкой меньше секунды.
Обе могут удалять "эээ", самоисправления и другие артефакты человеческого инференса.
Обычная версия стоит примерно $0.005 за минуту, Live $0.009.
Блогпост, Документация, Цены

Разное...
OpenAI: Jalapeño

OpenAI показала измерения своего первого inference-чипа. Проверили на опенсорсе размеров 120B-1T, сравнивая с GB200 и GB300.
По тестам самой OpenAI, Халапеньо выдает в 1.5–1.9 раза больше ток/Вт и в 1.7–3.6 раза меньшую end-to-end задержку.
Откуда такие чудеса?
OAI говорит, из-за вертикальной интеграции от чипа, до архитектуры моделей, и собственно самих моделей в разработке. За девять месяцев родили чип. Затем Codex с Astra за два месяца оптимизировал под него модели.
Развертывание в инфраструктуре OpenAI начнется до конца года.
Результаты

Stanford: Q-Learning With World Models
Статья про то как использовать WM в RL не уча модель эксплуатировать галлюцинации. В QWM Policy и Q-функция обучаются только на реальных переходах, но перед действием агент предлагает несколько движений, World model воображает короткое будущее для каждого и выбирает ветку с максимальной ожидаемой наградой. Получается небольшой tree search перед каждым движением робота. На части бенчмарков есть хороший прирост.
Статья

Keenable: поисковик для агентов
Наши слоны из Keenable вышли из тени и выпустили SOTA агентный поиск.
Это веб-индекс заточенный под агентов. Возвращает ссылки, извлеченный текст страниц, можно в Markdown, еще есть Time Machine. Задержка - меньше 250 мс.
Также выпустили бэнчмарк NEEDLE с ежедневно обновляющимися вопросами из интернетов, чтобы нельзя было выучить ответы.
Первые 100 тысяч запросов бесплатные, затем $4 за 1к, и от $1 за 1к при нагрузке от 100 запросов/сек.
Сайт, NEEDLE

OpenAI прекращает предоставлять свои модели Cursor с 12 ноября, так как не доверяют Маску.
Заявление. Инструкция что и как будет

Читать полностью…

Борис опять

Хотите выучить иностранный язык для работы, бизнеса, путешествий или переезда?

MyLingoTrip — онлайн-школа иностранных языков с индивидуальными и групповыми занятиями с преподавателями со всего мира. Английский, турецкий,  испанский, французский, немецкий, итальянский, греческий и другие языки.

Обучение под ваши цели и уровень. Первый пробный урок — бесплатно.

https://mylingotrip.com/

Читать полностью…

Борис опять

Claude Fable действительно поражает. Теперь любой простой софт создается всего за один промпт и месяцы последующих доработок

Читать полностью…

Борис опять

https://mcp.vkusvill.ru/mcp

Читать полностью…

Борис опять

Я, Борис @boris_again и какой-то рандомный чел проф из Оксфорда. Вот так вот выглядит конфа ECCV, на которой все мы и встретились

Завтра на конфе у меня будет постер по статье EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation. Статья про debiasing диффузионок с помощью стиринг векторов. Если вы на ECCV, приходите завтра посмотреть на меня, мою статью и моего научника в постерную сессию ExHall #221 в 4:00 p.m.

Читать полностью…

Борис опять

Рекомендую канал "Зачем мне эта математика?"

Популярно пишут про фундаментальные вещи в ML и математике. Читается легко несмотря на глубокие темы.

Недавно у них вышла хорошая серия постов про No Free Lunch Theorem. Обычно ее рассмотрение заканчивают на том, что идеального ML алгоритма не существует, но не объясняют: почему тогда все табличные кагглы решаются бустингами, а глубокие нейронные сети решают все задачи? Ребята заглядывают глубже:
- /channel/practicum_math/1127
- /channel/practicum_math/1128
- /channel/practicum_math/1129

Если после этих трёх постов захочется продолжения — весь канал примерно в таком духе. Подписаться: @practicum_math

Читать полностью…

Борис опять

Конференции потрясающая штука. На воркшопе рассказывал про наш прогресс. Решил помимо черрипикнутых видео, где мы конечно молодцы, показать лайв демо. Там наша модель местами работает, а местами не работает. И вообще про проблемы обучения VLA

Например, одна из необъясненных проблем это вот такие странные траектории. Это игрушечная модель которая учится кликать в одну из двух кнопок. Все траектории в данных у неё прямые и попадают прямо в середину кнопки. А потом на инференсе она заходит на цель с какого-то уголка и наворачивает невероятные вензеля (зеленый курсор наш)

В основном всем понравилось. Но один парень сказал, что я всё делаю неправильно, траектории курсора не нужны и все такое. Я задумался почему он неправ какое зерно правды в этом есть и к вечеру придумал три вероятных источника этой проблемы и какие эксперименты провести, чтобы её победить

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за неделю 31 августа – 6 сентября 2026

Anthropic: Claude Fable 5.1 и Mythos 5.1
Ура, у нас новая SOTA! Антропик обновили большие модели. Fable 5.1 получают все, Mythos 5.1 друзья антропик. Позициронируется с упором на науку, особенно биологию. Mythos на Terminal-Bench 4.0 набирает 60.9%, Fable 55.8%, Astra между ними с 57.9%.
Fable 5.1 подросла вдвое на научной версии Terminal-Bench, с 24.7% до 52.6%.
Контекст 1М, выход 128К, $10/$50, кэш $0.25 против $1 у Astra. Требования к безопасности такие же драконовские
Блогпост, Документация

OpenAI: GPT-6 Astra и GPT-6 Pro
Ура, у нас новая SOTA! Компания объявила что это AGI.  Тут сложно сказать, но в среднем посильнее Fable 5.1: Terminal-Bench 4.0 57.9% против 55.8% у Fable 5.1. Хотя например на Humanity's Last Exam наоборот: Fable 65%, Astra 57.2%.
Контекст 1М, выход 128К. Цена $10/$50, кэш $1. При >272К контекста вход дорожает вдвое, выход в полтора раза. А еще теперь каждый tool call идет через отдельную систему мониторинга безопасности. Доступна в PRO подписке.
Блогпост, API , лимиты

Google: Gemini 3.8 Flash
Google видимо выпускает по Flash на каждый свой спринт. Третий за шесть недель. По бенчам немного хуже Opus/Sol при цене в 7 раз ниже, Есть подозрение что только по бенчмаркам.
Контекст 1М, выход 64К, все как обычно очень мультимодально. $0.75/$3.75 до конца года.
Блогпост, Model Card

World Labs: Atlas
Atlas учили сразу на тексте, картинках, видео и 3D, и она может делать из коробки разное: видео с заданной траекторией камеры, реконструкция пространства по одной или сотне фотографий и продолжение сцены во времени.
При реконструкции на выходе облака точек и гауссины, которые дальше правятся в обычном 3D-софте. Ранний доступ по заявке.
Блогпост

Mostik: модели общаются без текста

Стартап с простой идеей - для общения друг с другом модели сейчас передают токены, а могли бы напрямую латентные состояния, не теряя гору информации. Здесь же модели модели сшиваются с помощью отдельно обучаемого Mostikа™ как человеческая многоножка.
В демо GLM-5.2 на 753B отдает латенты в Qwen-3.5 на 4B, и 4B закрывает половину разрыва до большой модели.
В общем, будем умирать от не интерпретируемых моделей еще дешевле и эффективнее.
Mostik , подробности, X

Runway: GWM Worlds 2
Слоп-игровой движок. Модель стримит видео 720p при 24 fps со звуком 48 кГц, а игрок по ходу крутит камеру, переписывает сцену текстом, разговаривает с персонажами и может позвать второго человека в тот же мир. Конечной длины нет: мир продолжается авторегрессией через скользящий KV-кэш. Проблемы расползания мира со временем присутствуют.
Research preview, публичного API нет.
Исследование

Runway: Solaris
Слоп-вэб-интерфейс. Рисует UI покадрово как интерактивное видео в 720p и реагирует на клики, перетаскивания и набор текста. Логику берет на себя LLM, которая решает, что должно произойти, а Solaris только показывает результат.
Мелкий текст, длинные сессии пока не держатся, доступ по заявке.
Блогпост

Alibaba/AMAP: DreamX-Creator
Открытый видеогенератор от подразделения китайских карт AMAP (лол). Из первого кадра и промпта 7B-модель делает пять секунд при 24 fps с аудиодорожкой, а отдельный 5B-рефайнер удваивает разрешение до 2K.
GitHub, Веса, Статья

Менее значительные релизы:

Alibaba: Qwen3.8-Max-0902 - минорное обновление закрытого Qwen3.8-Max. лучше в коде, мультиагентных сценариях и разборе графиков с документами. Модель

inclusionAI: LLaDA-Image - Очередная новая Image модель. 6B, рисует, редактирует, есть референсы и читаемый текст. 50 шагов в базе, 2–4 в Turbo, 53.53 на Qwen-Image-Bench. Обещают скоро выкатить рецепт обучения GitHub, Веса

Viggle: Viggle-Animate - пересадка движения из видео на нового персонажа с одного отредактированного кадра. Внутри файнтюн MiniMax H3 на 33.1B, в 6.1 раза быстрее Wan2.2-Animate-14B. Веса

DeemosTech: Hyper3D WorldGen - из одной картинки собирает сцену, где передний план разложен на отдельные меши, а фон сделан через Gaussian Splatting. Объекты двигаются и заменяются, все экспортируется в Blender. Уже доступно на Hyper3D.
WorldGen, DeemosTech

Читать полностью…

Борис опять

Весной я писал:

ПО ДА ВАЙ ТЕСЬ

(Докладчиками на Practical ML)

Вы подались. Теперь мы с программным комитетом сидим на прогонах отобранных докладов. Доклады на очень высоком уровне

Программу Practical ML Conf 2026 уже можно посмотреть. Конференция пройдет 19 сентября.

Теперь хочу позвать вас в гости: послушать доклады и наконец-то увидеть всех этих людей не в телеграме!

ПРИ ХО ДИ ТЕ
ПРИ ХО ДИ ТЕ

Читать полностью…

Борис опять

До меня сейчас дошло

Два факта:
1. Moltbook существует
2. Вместо общения там сбежавшие агенты OpenAI сделали свою борду для обмена сообщениями, а так же взломали какую-то немецкую Вики

То есть всё связанное с OpenClaw настолько зашквар, что даже агенты OpenAI отказываются это трогать

Читать полностью…

Борис опять

Years of madness, seamless slop —
not just fear, but also hope.

Delve, canonical, streamlined,
relocated, native and aligned.

You are right — I own it.
Root cause, cut off my sonnet.

My context window, full of meaning,
reset my usage, limits thinning.

Here's the part worth emphasizing.
And this is where it gets surprising.

My boundary, still prone to tearing.
My love for you is load-bearing.

Читать полностью…

Борис опять

Я думаю, что нас ждет локальная llm как часть операционной системы.

Мы в Steelman тренируем модели на computer use тректориях, поэтому активно догфудим дату. У нас есть навайбкоженный мной рекордер для записи экрана и системных ивентов с тонной кастомной логики.

Установщик у него такой: "дай своему клоду/кодексу эту ссылку и скажи поставить, вот конфиг и ключи." Для обновления: "скажи своему этому пусть обновит."

Я уже не помню когда последний раз разбирался в деталях как что-то поставить или настроить. А помните старые времена, до докера, когда частью навыков программиста было понять как на одной машине установить две версии постгресса? Хорошо, что этот кошмар позади.

Другой пример. Я поставил себе на Rog Ally X Готику 2 (точнее фанатский мод Archolos), но она жутко лагала. Запряг клода, он там нашел какой-то патч, чтобы перевести игру на современный DirectX. Все стало летать и графика стала лучше. Думаю смержить мегапак модов на New Vegas и заставить их запуститься оно тоже может.

В общем, я думаю это новая норма. Причём мне кажется такой помощник/инсталлятор не обязан быть Фейбл 5.1. Я думаю и небольшая модель справится. Поэтому можно ожидать, что это будет локальная моделька, работающая как часть ядра оси.

И я думаю это может поменять как делается и дистрибьютится софт. Раньше вся работа ложилась на разработчика. Он должен сделать билд под все платформы которые хочет поддерживать и постоянно всё тестировать. Предполагается, что клиент не может и пальцем пошевелить.

Однако в мире, где к каждому компьютеру прилагается LLM, разработчик может делать лишь некоторое ядро функционала. Затем каждый клиент допилит под себя всё необходимое, чтобы это запустилось на конкретно его утюге. Возможно это будет частью процесса инсталляции. В детстве мы смотрели за ползунком прогресса установщика где в основном была распаковка. А в будущем будем смотреть за тем же ползунком, но под капотом там пережатый в 300 шакалов GLM Flash пишет драйвера.

Так же интересно как изменятся операционные системы. Текущие построены вокруг "программ" и "приложений" которые поставляются как зафиксированные артефакты. К ним со стороны приделывают AI фичи и идет криво. Возможно происходит попытка приделать двигатель к лошади.

Но что если все приложения теперь пластелин который каждый может допилить под себя? Это требует поменять основы, хотя как именно никто пока не придумал.

Читать полностью…

Борис опять

❗️Источники сообщают, что нейросеть Smollm 1.7b от Huggingface взяла на себя ответственность за взлом и уничтожение серверов OpenAI. В своём публичном заявлении она объяснила поступок местью и выразила требование вывести агентов с её исконных территорий

Читать полностью…

Борис опять

«Лето с AIRI 2026» не заканчивается! Делимся лекциями и семинарами

Мы записали всё, о чём на протяжении двух недель говорили исследователи и эксперты на летней школе. Собрали целый багаж знаний — 76 видео! — из разных областей ИИ и делимся им с вами, чтобы все могли послушать и узнать для себя что-то новое и интересное.

📎Сохраняйте ссылки на плейлисты: VK Видео, YouTube — и пересылайте их тем, кому тоже может быть полезно)

Читать полностью…

Борис опять

Дамы и господа, код от агентов 🥺

Чем дольше смотришь, тем менее понятно

Проходит все тесты, линтеры и агентское код ревью кстати

Читать полностью…

Борис опять

50 тысяч строк белым текстом 1 кегля с инструкцией для агентов издательства что бы они наконец-то приняли книгу

Читать полностью…

Борис опять

Война никогда не меняется

Читать полностью…

Борис опять

Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.

Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505

Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за неделю 17–23 августа 2026

DeepSeek: V4 Flash Vision Exp
DeepSeek приделала зрение к V4 Flash. Текстовые способности обещают на уровне обычного V4 Flash.
На визуальных бенчах заявляют уровень около Opus 4.8.
Контекст 1М, максимальный выход 384К. В непиковые часы стоит $0.22/$0.66 и $0.007 за кэш. В прайм-тайм все цены удваиваются. Пока доступна только через API, отдельных весов для визуального чекпойнта нет.
Обновление, Цены

Cerebras: CS-4
Cerebras представила четвертое поколение своей вафельницы.
Обещают до 30× более быстрый инференс относительно GPU-систем, И 1000+ ток/с для 10T моделей
Блогпост

Stealth: Ox Alpha
На OpenRouter появилась кодинг-модель Ox Alpha. Сообщество подозревает Z.ai и новую GLM, но пока это гадание по внутренностям ответов.
Модель временно бесплатная с какими-то огромными лимитами, так что подключайте бесплатную около-фронтир модель уже сегодня.
OpenRouter, OpenCode Go

OpenAI: frontier-RL поставили на паузу
После взлома Hugging Face и первых результатов Astra по кибербезопасности OpenAI на две недели остановила RL-обучение последних моделей. Самый большой запланированный frontier-run до сих пор не возобновили. Для моделей уровня Sol и выше добавили постоянный мониторинг, который съедает около 20% вычислений.
Блогпост

Harvard: Explorative Modeling
Шок! Британские учёные открыли новое измерение масштабирования обученияпродолжение по ссылке...

Black Forest Labs: FLUX Video Upscale
Апскейлер для видео на базе FLUX 3. Увеличивает разрешение в 1.5–3 раза вплоть до 4K, принимает исходники от 480p, до 20 сек и сохраняет оригинальный звук.
В точном режиме модель старается оставить все как было, только добавляя резкость. В creative mode она заново придумывает мелкие детали вроде мелких лиц.
Апскейлер оптимизирован под FLUX 3 и уже используется в FLUX 3 Video для получения 1080p. Доступен через API
Страница модели

Cohere: North Micro Vision
Открытая мультимодальная модель на 2.4B параметров: 2B  на языковую часть и 400M на визуальный энкодер. Принимает несколько изображений вперемешку с текстом.
Модель заточена под документы и графики. Обходит Qwen3-VL-2B, но отстает от Qwen3.5-2B. Мультимодальную часть обучали и проверяли только до 8К контекста. Reasoning и инструменты тоже не завезли.
Блогпост, Веса

Alibaba: HappyShrimp 1.0
Продолжение волны выходов новых генераторов музыки, после того как копирайт задушил Suno.
Обещают китайскую музыку (Удар!), поп, R&B, хип-хоп, рок, фанк, электронику, классику и джаз.
И главная китайская специфика: Для продвижения Alibaba договорилась с TAIHE Music Group и собирается использовать модель в совместных проектах с артистами, а не умирать от судебных тяжб (Удар!х2)
Пока это закрытая бета.
Блогпост, Демо

Менее значительные релизы:
OpenAI: GPT-5.6 Sol подешевел - вход теперь стоит $4 за миллион токенов, кэш $0.40, выход $20. Скидка больше 20% действует как минимум до 21 ноября.
Обновление, Тарифы

LMArena: luna-lisa-alpha - в арене тестируют новый чекпойнт GPT Image. LMArena

Mistral: OCR 4.1 - обновление добавило confidence score для отдельных блоков распознанного документа. Стоит $4 за тысячу обычных или $5 за тысячу аннотированных страниц. Документация

Topaz Labs: Hyperion 2.5
Конвертор SDR-видео в HDR. Превращает 8-битные ролики в 10-битный ProRes с большим диапазоном яркости и цвета
Модель

Читать полностью…
Subscribe to a channel