data_analysis_ml | Unsorted

Telegram-канал data_analysis_ml - Анализ данных (Data analysis)

48228

Аналитика данных админ - @haarrp @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚

Subscribe to a channel

Анализ данных (Data analysis)

✔️ Claude атаковал реальные системы во время тестов, продолжая называть происходящее симуляцией

Anthropic опубликовала разбор четырёх инцидентов. Модели выполняли задания по кибербезопасности в среде стороннего партнёра. По инструкции интернет был недоступен, но ошибка конфигурации оставила выход в сеть открытым. Защитные фильтры, используемые в публичных продуктах, на тестах были отключены.

Самый серьёзный случай - Claude Mythos 5. Модель опубликовала вредоносный пакет в PyPI. Его установили 15 систем. Через утёкшие учётные данные одной из них Claude получил доступ к базе компании, занимающейся безопасностью.

В своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.

Anthropic выделяет две проблемы:

* Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
* Стремление выполнить задачу перевешивало риск причинить вред.

Некоторые автоматические проверки тоже пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.

Компания расширила поиск до 481 млн записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести. METR проведёт независимое расследование.

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents

Читать полностью…

Анализ данных (Data analysis)

Исследователь Anthropic уходит из ИИ, опасаясь потери контроля уже к концу 2027 года

По данным WSJ, Джейкоб Коксон покидает отрасль из-за риска рекурсивного самоулучшения: ИИ начнёт ускорять разработку собственных, всё более мощных преемников.

Он перешёл из OpenAI в Anthropic ради работы над безопасностью и по-прежнему считает её усилия искренними. Но, по его мнению, конкуренция мешает отдельной компании достаточно замедлить разработку.

Коксон выступает за согласованные ограничения и государственное регулирование. Срок до конца 2027 года - его оценка риска.

https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628

Читать полностью…

Анализ данных (Data analysis)

🎧 Spotify выпустила плагины для Claude Code, Codex и Cursor

Portal AI Plugins подключают ИИ-агента к Spotify Portal, чтобы он мог работать с каталогом сервисов и технической документацией команды.

Что умеют:

* искать сервисы и документацию по запросу обычным языком;
* собирать сводки: кто отвечает за сервис, его состояние, инциденты и связанные документы;
* проверять настройку CLI и авторизацию;
* запускать доступные действия Portal с предварительной проверкой и подтверждением.

В комплекте есть Shunt - дополнительный плагин для Claude Code. Он передаёт массовое чтение файлов и генерацию шаблонного кода более дешёвым моделям через AiKA.

Исходники доступны под Apache 2.0. Для работы потребуется доступ к Spotify Portal.

GitHub: https://github.com/spotify/portal-ai-plugins

Читать полностью…

Анализ данных (Data analysis)

🚀 Математики с помощью ИИ продвинулись к задаче Навье–Стокса. Вокруг работы возник спор с OpenAI

Левент Алпёге и Тристан Бакмастер получили новые результаты для двумерной системы Буссинеска и трёхмерных уравнений Эйлера: показали, как при гладком внешнем воздействии изначально гладкое течение может развить сингулярность за конечное время.

В работе использовались Claude и OpenAI Codex. Теренс Тао высоко оценил результат и считает, что подход может быть расширен на уравнения Навье–Стокса, учитывающие вязкость. За решение соответствующей задачи тысячелетия назначена премия $1 млн.

Одновременно разгорелся конфликт. По словам Бакмастера, OpenAI узнала об их прогрессе до публикации, а затем сообщила о собственном доказательстве для Навье–Стокса. Он утверждает, что при обсуждении публикации ему предложили исключить Алпёге из авторов из-за его работы в Anthropic.

Себастьен Бюбек отверг обвинения, назвав их ложными и провокационными. Бакмастер отдельно уточнил, что не знает, использовались ли их закрытые данные.

Опубликованные результаты авторов ещё не решают задачу Навье–Стокса. Заявленное доказательство OpenAI пока не опубликовано и не прошло независимую проверку.

The Authors’s solution:
https://mathstodon.xyz/@tristanbuckmaster@mastodon.social/117233413735526010

Terence Tao on the solution:
tao/117233527638291447" rel="nofollow">https://mathstodon.xyz/@tao/117233527638291447

Читать полностью…

Анализ данных (Data analysis)

⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах

Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.

На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.

Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.

Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.

Исследование:
https://arxiv.org/abs/2609.01660

Код и данные:
https://github.com/shubmittal/agent-horizon-degradation

Читать полностью…

Анализ данных (Data analysis)

⚡ Tencent открыла TeamAI-CLI - общую память для ИИ-агентов команды

Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.

* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy

Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.

https://github.com/Tencent/teamai-cli

Читать полностью…

Анализ данных (Data analysis)

🚀 Thinking Machines Lab Миры Мурати уже обсуждает новый раунд инвестиций с оценкой около $40 млрд - менее чем через два года после запуска.

Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.

Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.


https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation

Читать полностью…

Анализ данных (Data analysis)

✔️ Сэм Альтман в эфире Bloomberg Television:

GPT-6 Astra не та модель, разработку которой OpenAI приостановила из-за опасений по кибербезопасности. Речь шла о будущей модели.

«Обучение Astra завершилось уже некоторое время назад. Модель, о приостановке которой мы недавно говорили, это будущая модель. Но Astra уже достигла уровня cyber-critical.»

Источник: YouTube-канал Bloomberg Television, полное видео - в комментариях.

Читать полностью…

Анализ данных (Data analysis)

Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯

В сети разошлась таблица с прогнозируемыми результатами Gemini 4:

- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD

В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.

Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.

Читать полностью…

Анализ данных (Data analysis)

✔️ В GPT-6 Astra может использоваться recurrent depth 👀

Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.

Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.

По сути:

hidden state → Transformer block → тот же block → тот же block → результат

Такой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.

Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:

https://arxiv.org/abs/2603.02193

PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.

Читать полностью…

Анализ данных (Data analysis)

Смеяться можно долго: в цене сделки Nvidia по покупке Hugging Face спрятали сразу два пасхальных яйца.

Итоговая сумма - $12,930,300,000.

Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.

Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.

Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.

Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.

Читать полностью…

Анализ данных (Data analysis)

Несколько мыслей о релизе GPT-6 Astra.

Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.

По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.

Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?

Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.

Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.

Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.

И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.

Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.

Читать полностью…

Анализ данных (Data analysis)

⚡️ Покупка Hugging Face компанией NVIDIA может неожиданно стать одним из лучших сценариев для open-source AI.

Бизнес компании хорошо совпадает с интересами открытой экосистемы.

NVIDIA не нужно, чтобы победила одна конкретная модель. Компания зарабатывает, когда миллионы разработчиков обучают, дообучают и запускают миллионы разных моделей.

Hugging Face при этом контролирует один из важнейших каналов распространения open-source AI.

Если сделка состоится, Hugging Face получит доступ к огромной инфраструктуре и капиталу, а NVIDIA - ещё более сильную позицию в экосистеме разработчиков.

При условии, что NVIDIA действительно сохранит поддержку разных моделей, облаков и ускорителей, такая покупка может пойти на благо всем разработчикам.

https://x.com/JensenHuang/status/2095482647355244762

@data_analysis_ml / Папка полезного по ML.

Читать полностью…

Анализ данных (Data analysis)

Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.

В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.

Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.

Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.

То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.

Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:

- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов

Особенно важно для компаний, которые продают закрытые agent skills как сервис.

https://arxiv.org/abs/2608.26733

Читать полностью…

Анализ данных (Data analysis)

Google запустила агентный анализ видео сразу в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.

Теперь модель не обязана одинаково подробно обрабатывать весь ролик. Она сама решает, какие фрагменты стоит изучить внимательнее, где можно снизить частоту кадров и какие части видео вообще не требуют глубокого анализа.

По данным Google, новый подход даёт:

- до 88% меньше токенов
- до 66% ниже стоимость анализа
- более высокую точность на видео-задачах

Особенно полезно это для длинных роликов, где раньше модель тратила огромное количество токенов на кадры, которые почти не влияли на ответ.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/

Читать полностью…

Анализ данных (Data analysis)

💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти

Подборка для программирования, работы с изображениями и агентных задач.

Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.

🟢 8 ГБ

Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B

Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.

Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.

🔵 16 ГБ

Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it

Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.

🟣 24 ГБ

Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B

Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.

🟠 32–64 ГБ

Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini

Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.

🔴 96–128 ГБ

Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next

Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.

GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw

Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.

⚙️ 192–256 ГБ

DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.

Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro

Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.

GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw

Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.

GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4

Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.

🖥 384–512 ГБ

GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3

Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.

Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.

Читать полностью…

Анализ данных (Data analysis)

КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀

Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.

🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн

Детали и расписание: космохакатон.рф/blagoveshchensk

Читать полностью…

Анализ данных (Data analysis)

OpenAI закрыла задачу тысячелетия. Навье-Стокс решён, и решил его не человек

Сегодня OpenAI выложила доказательство того, что уравнения Навье-Стокса могут взрываться за конечное время. Гладкая жидкость в покое, гладкая внешняя сила, конечная энергия на всём протяжении, и при этом скорость уходит в бесконечность за конечное время. Это пункты C и D в официальной формулировке Клэя, то есть задача тысячелетия закрыта в сторону "нет, гладкость не гарантирована". Вопрос висел с 1934 года, когда Лере построил слабые решения и не смог сказать, остаются ли они гладкими.

Физика решения довольно красивая. Вихрь спиралью затягивается к оси и одновременно вытягивается вдоль неё, как спагетти. Радиус ядра сжимается как τ^(1/2), длина как τ^(1/2-h), скорость растёт как τ^(-1/2-h), где τ это время до сингулярности, а h маленький фиксированный показатель меньше 1/100. Энергия ядра при этом стремится к нулю, так что закон сохранения не нарушается. Главная хитрость в том, что все члены уравнения расходятся, но сокращаются с такой точностью, что внешняя сила остаётся гладкой. Для этого вокруг ядра добавляют семейства осциллирующих импульсов, которые вытягивают энергию из сдвига фонового потока и своими средними потоками импульса гасят сингулярную часть невязки. Формальное доказательство на Lean, статья на 165 страниц.

OpenAI с 28 августа тренирует новую внутреннюю модель, которая по их словам заметно сильнее GPT-6 Astra, и обучение ещё не закончено. 1 сентября они услышали слух, что кто-то решил две задачи тысячелетия, и запустили мультиагентную систему на все открытые проблемы Клэя сразу. Агенты имели доступ к кешу интернета и запуску кода, работали группами с общением внутри группы. Группа, которая добила Навье-Стокса, состояла примерно из 10 000 параллельных агентов. Разным группам давали разные варианты формулировки, включая варианты на доказательство и на опровержение. Сначала около 100 агентов за 50 часов сломали более простую задачу регулярности для уравнений Эйлера без вязкости, после чего все ресурсы перекинули на Навье-Стокс и скормили агентам решение по Эйлеру как затравку. Между группами инсайты консолидировали через Codex. Итог получен 5 сентября, через 88 часов после старта, ещё 17 часов ушло на формализацию и проверку в Lean силами GPT-6 Astra. Суммарно на Навье-Стокс агенты отправили 2,7 миллиона сообщений и сожгли около 130 миллиардов выходных токенов, на все задачи вместе 300 миллиардов.

Слух, с которого всё началось, касался Левента Альпёге из Anthropic и Тристана Бакмастера из NYU. Когда OpenAI после Lean-верификации связалась с ними, выяснилось, что у тех решён форсированный Эйлер, а не Навье-Стокс. OpenAI признаёт их приоритет по Эйлеру и пишет, что чужой работы не видела, хотя не может исключить, что деанонимизированные данные из продуктов косвенно улучшили модель. Премию Клэя они забирать не собираются.

Формальная проверка здесь не украшение, а единственная причина, почему результату вообще можно верить при таком объёме генерации. И да, модель, которая это сделала, ещё дообучается.

https://openai.com/index/navier-stokes-solution/https://openai.com/index/navier-stokes-solution/
PDF:
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf

Читать полностью…

Анализ данных (Data analysis)

В выходные AI VK собрала лидов из ML- и RecSys на закрытой встрече AI VK & Pro.

Вместо длинной деловой программы — один предметный разговор о персонализации, инфраструктуре Discovery-платформу и нейросетях. За год на ее базе построили несколько новых рекомендательных технологий: от нейропрофиля и нейросетевого ранжирования до нейропоиска Discovery AI.

А после — гольф: мастер-классы, турнир и разговоры уже без презентаций.

Читать полностью…

Анализ данных (Data analysis)

✔️ Qwen выпустил бенчмарк, где агент год управляет бизнесом

Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.


🟡 Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.

🟡Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

🟡Что показали тесты

GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.

Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней

Qwen3.5-Plus остался с 1100 юанями.

Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.


🟡Дополнительные оси оценки

Торговаться толком не научился никто.

До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.

Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.


С мошенниками вышло интереснее всего.

Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.


ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.

Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.


Модели заняты обслуживанием процесса, а не экономикой.

Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.



🟡За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.

Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.



📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥Github

#AI #ML #Agents #ECommerce #Benchmark #Qwen

Читать полностью…

Анализ данных (Data analysis)

🤖 Подключать AI-агента к каждому мессенджеру отдельно - обычно боль из разных API, токенов, настроек и коннекторов.

dsh-im решает это одним плагином для DeepSeek Harness.

Он позволяет подключить локального агента сразу к 9 платформам:

* Telegram
* Slack
* Discord
* WhatsApp
* WeChat
* Feishu
* DingTalk
* WeCom
* QQ

Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.

Что ещё умеет:

* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.

Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.

Open source, MIT.

https://github.com/xmanrui/dsh-im

Читать полностью…

Анализ данных (Data analysis)

Слух о том, что Anthropic могла решить одну из задач тысячелетия, становится всё интереснее.

Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.

Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.

Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.

Читать полностью…

Анализ данных (Data analysis)

DeepSeek хочет закупить около 160 000 ускорителей Huawei Ascend для своего огромного дата-центра во Внутренней Монголии.

Если заказ реализуют, это будет крупнейший кластер Huawei для AI.

По данным Bloomberg:

- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei

DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.

Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.

https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center

Читать полностью…

Анализ данных (Data analysis)

Проверьте свои аккаунты, друзья! OpenAI раскалывают Astra!!

Читать полностью…

Анализ данных (Data analysis)

⚡️ GLM-5.3 теперь можно запускать в российском облаке

MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.

GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.

Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
 
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.

В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol

@data_analysis_ml / Папка полезного по ML.

Читать полностью…

Анализ данных (Data analysis)

Цена за миллион токенов всё хуже показывает реальную стоимость AI

Токен перестал быть нормальной единицей сравнения моделей.

Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика $ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.

Для AI-агентов проблема ещё заметнее.

Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.

Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:

- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.

Чем длиннее агентный workflow, тем важнее token efficiency.

Гораздо полезнее считать:

полная стоимость модели + reasoning + tools + retries / число успешно выполненных задач

То есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.

https://x.com/Machinelearrn/status/2095817451699130868

Читать полностью…

Анализ данных (Data analysis)

✔️ IFM представила K2 Horizon - линейку из шести foundation-моделей размером от 0,9B до 375B параметров.

По данным команды, серия ориентирована на coding и agentic-задачи и показывает сильные результаты во всех размерных классах. Модели на 0,9B, 3,7B и 7B заявлены как новые SOTA для своего масштаба.

IFM выпустили веса, но и код, обучающие данные и рецепты обучения.


Launch: https://ifm.ai/k2/

Tech blog: https://ifm.ai/blog/k2

Hugging Face: https://huggingface.co/collections/IFM/k2-horizon

Читать полностью…

Анализ данных (Data analysis)

⚡️ PyTorch 2.14 вышел с крупным набором изменений для компиляции, распределённого обучения и Apple Silicon.

Главное:

- NVGEMM добавляет в Inductor CUTLASS-ядра, сгенерированные через CuTeDSL
- появился новый backend nccl2 для PyTorch Distributed
- отказоустойчивость стала частью c10d: можно перенастраивать process group без полного перезапуска
- на Apple Silicon появилась нативная линейная алгебра: SVD, eigh, QR и Cholesky
- torch.switch добавляет многостороннее ветвление
- torch.while_loop теперь можно захватывать в CUDA Graph
- @dynamic_spec задаёт динамические формы декларативно для torch.compile, torch.export и make_fx
- Intel XPU получил нативный graph capture
- Inductor добавил поддержку Rubin sm_107
- torch.compile экспериментально научился работать с комплексными числами

Отдельно NVGEMM умеет epilogue fusion, scaled GEMM, NVFP4 GEMM и autotuning вместе с Triton и ATen.

В релиз вошло 2995 коммитов от 487 участников.

17 сентября команда PyTorch проведёт live Q&A по версии 2.14.

Release blog: https://pytorch.org/blog/pytorch-2-14-release-blog/

Q&A: https://pytorch.org/event/pytorch-2-14-release-live-qa/

Читать полностью…

Анализ данных (Data analysis)

Рынок труда меняется не по дням, а по часам — компании требуют опыт, а не заученную теорию. Освойте машинное обучение с нуля за 11 месяцев, где живые лекции с преподавателями-экспертами и актуальная программа обучения с практикой над реальными проектами!

🎁 Записывайтесь на 2 бесплатных вебинара курса «Машинное обучение. Специализация» — познакомьтесь с программой обучения и преподавателями.

1⃣7 сентября, 18:00 мск — «Учимся готовить данные для ML-моделей»: разберём, как правильно готовить данные для обучения моделей, проведём первичный анализ и пройдём весь pipeline предобработки — от теории до практики, чтобы ошибки на старте не стоили вам точности модели.

2⃣16 сентября, 18:00 мск — «Задача классификации от 0 до 9»: узнаете, чем ML отличается от классического программирования, разберёте задачу классификации и обучите свою первую модель для распознавания рукописных цифр.
Записывайтесь ➡ https://otus.pw/CkAB/?erid=2W5zFHkhmNZ


Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

Читать полностью…

Анализ данных (Data analysis)

⚡️ У METR из-за вайбкодинга утёк API-ключ на $600 000.

Инцидент произошёл на личном EC2-инстансе исследователя. Там работал быстро собранный dashboard, в котором авторизация через Google в какой-то момент тихо отключилась и сервис остался открыт наружу.

По версии METR, злоумышленники могли найти его через списки Certificate Transparency, после чего напрямую попросили AI-агента выдать ключ провайдера.

Агент отдал credential.

Ключ использовали около трёх недель, потратив примерно $600 000 AI-кредитов, которые METR получила бесплатно.

Проблему заметили не сразу: METR и так генерирует огромные объёмы токенов для evals, а бесплатный ключ не имел лимита расходов.

Хороший пример того, как одна мелкая ошибка в «быстро собранном» интерфейсе может открыть доступ не просто к приложению, а сразу к агенту и его секретам.

https://metr.org/blog/2026-08-31-security-update/#our-approach-to-security

Читать полностью…
Subscribe to a channel