4255
❤️☠️🤗 идейная миграция небытия
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.
Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"
Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.
По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
В общем - есть такая игра - kerbal space program ака симулятор "а всмысле оно взорвалось и не долетело" , а есть Juno new origins - более сэндбоксная и процедурная версия + больше опций для CAD design. А ещё можно програмировать ваши ракеты и делать всякие смешные штуки - авто выход на орбиту, стыковку и прочее.
Я дал Клод коду написать мод который позволяет клоду(любому) пользоваться функционалом редактора и местного языка программирования и
закинул задачку - сделать ракету и посадочный модуль который долетит до местной Луны и вернётся назад и оставил на ночь фейбл доедать остатки лимита, посмотрим что выйдет
Tldr: дистилл чтобы улучшать капибилити работает только на фулл ризонинге, на суммаризованном не работает.
https://arxiv.org/abs/2606.05988v1
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
Близится конец мая — а значит, и неделя Data Fest 😎
В этом году в Белграде пройдут целых два дня: в начале и в конце Data Fest недели
📅 24 мая — Яндекс Белград
• 8 докладов по трекам: Agentic LLM, Practical ML, CV
• Плюс утренняя активность, нетворкинг и афтепати
🗣 Язык: RU (в основном) / EN
👉 Регистрация (скоро закончится!)
📅 31 мая — Факультет ФОН
• 24 спикера по трекам: LLM, Speech, Robotics и другие
• Сбор гостей с 12:00, программа скоро появится
🗣 Язык: EN
👉 Регистрация
❗ Регистрация на каждое событие отдельно
На входе: письмо-приглашение и документ
// Другие города и онлайн площадки датафеста тут
Увидимся 😎
QClaw-4B — это языковая модель, дообученная для агентных задач и работы с инструментами в рамках OpenClaw-совместимых фреймворков. Основана на Qwen3.5-4B.
Несмотря на компактный размер, модель достигает результатов уровня значительно более крупных моделей — на ClawBench набрала 84.8 / 100 (Pass Rate 73.5%), вплотную к Kimi K2.5 и GLM-4.5. На Ru-Arena-General — 80.7% winrate, SOTA в классе ≤4B.
🔗 Карточка модели: https://huggingface.co/LakoMoor/QClaw-4B
🔗 GGUF (llama.cpp / Ollama / LM Studio): https://huggingface.co/LakoMoor/QClaw-4B-GGUF
⚖️ Лицензия: apache-2.0
Отдельная благодарность @lovedeathtransformers за ресурсы под обучение и прогон бенчмарков
Нео-банк PLATA только что закрыл Series C, стоит 5 миллиардов и активно нанимает хороших инженеров.
Команда очень быстро растет. Мало легаси, много свободных зон ответственности и возможностей построить что-то с нуля.
Вилки: от $6к/мес gross
Локации: Мексика, Сербия, Казахстан, Барселона, Кипр, Ремоут
Senior Data Scientist [Risk]
- Делать модели для кредитного скоринга. Выбирать кому выдавать кредиты, кому повышать лимиты плюс много сопутствующих задач.
- Не только бустинги. Все средства хороши и новые подходы приветствуются. Например, в проде рисков уже есть GNN.
- Опыт в банках или финансах не требуется: нужна лишь сильная база и хороший опыт в ML.
ML Engineer Middle+/ Senior [AI Team]
- ASR и TTS - много задач про речь и звук.
- OCR, классификаторы и зоопарк различных DL задач.
- Строить решения на основе глубоких нейронных сетей от начала и до конца, от подготовки данных до оптимизации инференса.
- Опыт с обучением, тюном или инференсом LLM будет большим плюсом.
AI Engineer Middle+ / Senior [AI Team]
- Автоматизировать с помощью LLM и агентов всё, что автоматизируется.
- RAG, чат-боты, голосовые агенты, OCR.
- Проводить качественные A/B и эвалы, чтобы оценивать эффективность решений не только по вайбам.
- Быть хорошим Python программистом и системно подходить к инжинирингу решений на основе LLM.
Плюшки для всех ролей:
- Помощь с релокацией в один из хабов.
- Медстраховка независимо от локации.
- Компенсация затрат на образование и спорт.
- Минимум типичной для банков бюрократии
https://www.instagram.com/reel/DVO9KqfjNcP/?utm_source=ig_web_copy_link&igsh=NTc4MTIwNjQ2YQ==
Читать полностью…
Знакомьтесь со спикерами OpenTalks.AI-2026!
Тема AI-агентов сейчас - главный мейнстрим индустрии. И желательно не просто агентов, а таких, которые сами будут вести научные исследования и создавать еще более мощных агентов!) И конечно на конференции будет целый трек про них! 😎
Татьяна Шаврина (LLama team, ну вы сами понимаете где она работает)) сделает обзор AI-агентов в целом и для научных задач в частности, а Андрей Устюжанин (Constructor University) расскажет про их AI-агента, который не только строит гипотезы, читает литературу и делает выкладки, но еще и сам экперименты потом ставит! Рома Доронин (Optic) расскажет про то, как устроена биофарма и где там AI-агенты реально востребованы, а Андрей Кузьминых (Andre AI) расскажет про AI-агентов нового поколения!
В общем - будет много интересных и актуальных докладов и нетворка по теме агентов! А еще будут темы про GenAI, LLM, RL, CV, интеллект и сознание! Но про них мы еще напишем отдельно! 👻А еще есть промокод RD20 для подписчиков
Полная программа конференции и регистрация.
Открытые хорошие ллм не из китая?
Liquid.ai булочки мои, строятся челами из UK, строят MoEшки Deepseek образные, ставят на эффективную утилизацию ресурсов и маленькие модели(самая большая 8Ba1), куча удачных архитектурных решений позволяют выдавать на Galaxy s24 аж 60tps.
По метрикам модель неплохая, на уровне qwen1.7b, и чуть хуже qwen3 4b
blog
#промо #промо #промо
⚪️ White Circle
Всем привет, мы делаем лучшую AI safety платформу, чтобы модельки не делали rm -rf без вашего ведома
Про нас:
- Подняли 💸 $10m 💸, инвесторы — топы OpenAI, Anthropic, Deepmind, Mistral, HuggingFace, etc
- Команда из 10 человек с офисом в самом центре Парижа
- Обрабатываем десятки миллионов API запросов в месяц
- 🍴 100-500к USD
Вакансии:
1. FullStack Engineer
Typescript, React, Nextjs, Nodejs, Tailwind, GraphQL, ClickHouse
2. DevOps Engineer
AWS / GCP, Terraform, k8s, Kafka, ClickHouse, Prometheus, Grafana, DataDog, HPC
3. AI Engineer
MoE, multimodality (audio / images), Megatron, distributed training, Triton
📨 CV → https://forms.gle/XysjrjHgxiRicGsb6
Старшая версия по вайбу потупее чем glm air, младшая on par с qwen 30ba3, но сильно хуже на русском.
Читать полностью…
https://huggingface.co/blog/reachy-mini
Вау, первый робот от huggingface, открытый и с возможностью запускать в нем hf spaces!!!
О4мини хуже чем о3мини, скелетрон вернётся с другими смешными новостями когда выйдут
Читать полностью…
https://fxtwitter.com/justalexwortega/status/2075058087334232358?s=46
Читать полностью…
Если Orbit Wars завершился и вы теперь, как и я, рефлексируете на тему 'почему они, а не я', то я сделал за вас всю работу
Читать полностью…
Flipper One — нам нужна ваша помощь
Мы наконец готовы рассказать про Flipper One — проект, над которым корпим уже много лет и который несколько раз полностью переделывали с нуля. Это очень сложный проект как экономически, так и технически. Поэтому сегодня мы выходим в паблик не с триумфальным анонсом, а чтобы рассказать все как есть. Скажем честно — нам тупо страшно и нам нужна ваша помощь.
https://habr.com/ru/companies/flipperdevices/articles/1033162/
— Вот мой новый коддинг сетап. Как вам?
— Ух ты, красивый, вы только посмотрите.
— Только вчера допилил конфиг. Cursor с Claude Sonnet 4.6 в Agent Mode, .cursorrules на четыреста строк под наш монорепо, индексация через Voyage-3, MCP-серверы для Linear и Notion. Pre-commit с biome и tsc --noEmit. Фолбек на Codex CLI, когда Claude уходит в loop на третьей итерации.
— Отлично, Бейтман, но всё это пустяки. Смотри. Claude Code в headless на каждый PR, четыре sub-agent’а в отдельных git worktree: planner, implementer, test-writer, reviewer. CLAUDE.md в трёхуровневой иерархии — workspace, repo, package — с автогенерацией из docstring’ов. Двенадцать кастомных Skills во внутреннем registry: рефакторинги, миграции схем, апгрейды зависимостей, переписывание легаси с Promise.then на async/await — каждый со своими evals и версионированием. PostToolUse хуки гоняют pytest в Modal-сэндбоксе. Бюджет токенов через OTLP в Grafana, алерты в Slack когда какой-нибудь агент жжёт больше пяти баксов на тикет.
— Красиво. Высший класс. (Не думал, что у него столько вкуса. Не могу поверить, что Брайсу больше понравился стек Ван-Пата.)
— Но постойте. Вы ещё ничего не видели. Devin для долгих автономных задач, Factory Droids для миграций по сорок репозиториев за раз, Pi Agent от Imbue как code reviewer на критичные пути — все три оркестрируются через LangGraph, который роутит подзадачи по сложности и SLA. Skills у Claude Code собраны в композитный meta-skill: один тикет триггерит цепочку из шести skill’ов с автоматическим composition через progressive disclosure. RAG не на эмбеддингах — на CodeQL-графе. Verifier-агент на отдельной Opus-инстансе судит каждый коммит против спеки. End-to-end spec-driven: тикет в Linear → spec в Notion → Pi Agent пишет acceptance criteria → Devin имплементирует → Droid мигрирует зависимости → Claude Code ревьюит → мердж, без человека в цикле для P2 и ниже. Tracing в Langfuse, eval-сьют на собственном бенче ночью на каждый bump модели.
— Очень красиво… А покажи-ка сетап Пола Алена.
…О боже. Это же… один Claude Code в чистом tmux. Без Cursor. Без Devin. Без Pi Agent. Без Factory. Без LangGraph. CLAUDE.md ровно на восемьдесят строк, выверенный вручную за неделю, без единой AI-генерации… Один Skill. Один. Называется ship-it.md, сорок строк, описывает как они релизят. Других нет — он говорит, что остальное модель и так знает… Никаких sub-agent’ов. Никаких хуков. В settings.json выключено всё кроме Read, Edit и Bash с белым списком из шести команд. Plan mode по умолчанию… И — погодите — у него даже MCP не подключен. Ни одного сервера. Он говорит, агенту хватает gh и psql в bash’е… Боже, и subscription у него Pro за двадцать долларов. Не Max. Не Team. Pro. Он укладывается в лимиты.
надевай свое лучшее платье мы садимся пиратить
Читать полностью…
очень ищу CTO/CEO/headof ai aviasales личку, помогите /channel/alexwortega
Читать полностью…
OPUS 4.6 В С Е - ВЫШЕЛ GLM5
лаба при AIRI z.ai релизнули ЛУЧШУЮ опенсурс модель - GLM5, основанная на архитектуре гигачата и доученная новейшим фреймворком Global Obivios Inet Descriptive Aligment наша модель отстает от топовых моделей на жалкие проценты при этом доступна Б Е С П Л А Т Н О
жаль только не зарепортили меру
я считаю всем надо хотя бы раз в своей жизни репортить меру
docs.z.ai/guides/llm/glm-5
https://www.anthropic.com/engineering/building-c-compiler
много ли вы знаете людей которые в состоянии написать c compiler(даже хуевый)? я не очень много
<End 2025>
OpenBrain focuses on AIs that can speed up AI research.
> Дропнули нейрослоп at scale
They want to win the twin arms races against China (whose leading company we’ll call “DeepCent”)16and their U.S. competitors. The more of their research and development (R&D) cycle they can automate, the faster they can go. So when OpenBrain finishes training Agent-1, a new model under internal development, it’s good at many things but great at helping with AI research.17 By this point “finishes training” is a bit of a misnomer; models are frequently updated to newer versions trained on additional data or partially re-trained to patch some weaknesses.18
The same training environments that teach Agent-1 to autonomously code and web-browse also make it a good hacker.
> Ну хороший хакер хз, но в целом и на 3.7 курсор работал хорошо, тут ну... Сомнительно.
Moreover, it could offer substantial help to terrorists designing bioweapons, thanks to its PhD-level knowledge of every field and ability to browse the web.
> Сделали тупой классификатор поверх аутпута чтобы припятствывать биооружию, emergent safety не случилось (опять)
#промо #промо #промо
⚪️ White Circle
Всем привет, мы делаем лучшую AI safety платформу, чтобы модельки не делали rm -rf без вашего ведома
Про нас:
- Подняли 💸 $10m 💸, инвесторы — топы OpenAI, Anthropic, Deepmind, Mistral, HuggingFace, etc
- Команда из 10 человек с офисом в самом центре Парижа
- Обрабатываем десятки миллионов API запросов в месяц
- 🍴 100-500к USD
Вакансии:
1. FullStack Engineer
Typescript, React, Nextjs, Nodejs, Tailwind, GraphQL, ClickHouse
2. AI Engineer
MoE, multimodality (audio / images), Megatron, distributed training, Triton
3. AI Engineer
Redteaming, agents, rlhf - если у вас нет опыта на mle, но есть опыт swe и построения всякого промптового - позиция для вас
📨 CV → https://forms.gle/XysjrjHgxiRicGsb6
6 месяцев назад, CEO антропика говорил, что 90% кода будет писаться LLM уже через 6 месяцев
Кажется, не получилось, ждем новых предсказаний ☕️
Источник
https://youtu.be/qf4cIvrBVCE?si=hIZxf0GpBG0grNSV
Читать полностью…
SageAttention1-2
Ускоряет перемножение матриц за счет сниежения точности до 8бит, используют разделения перемножения и множат по блокам, каналам, токенам одновременно используя матрички маленькой размерности+квантуют до 8бит.
paper
github
Мальчик: метрики FLOPS, скорость перемножения, утилизация
Мужчина:
Офигеть, JB сделали кодоагента!
Блог