4255
❤️☠️🤗 идейная миграция небытия
Codex и cc сдохли, ну.. рабочий день всё?
Читать полностью…
Главная проблема всей Ai safety тусовки в неисуоренимой вере в чудо и что вот ща годик пройдет и мы решим мониторинг, гарды и тд.
Ну типа... Не работает нихуя в реальности, статьи клипаются на раз два, а гранты выдают самым желающим получить гранты.
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
вера в волшебство во взрослом возрасте выглядит так : в стране где придумали крышки на веревочке и разьебать бизнес сделали хорошую ллм (а вы про кого подумали?)
Читать полностью…
Web Query Language (WebQL) в середине пути переименовался в Keenable SELECT.
Галерея отчётов: https://keenableai.github.io/select-showcase/
Демка: https://app.keenable.ai/select/start
Тут 2 вещи:
1) MCP инструмент, который позволяет делать SQL запросы к интернету с семантическими операторами. То есть вы буквально говорите "достань мне вот все эти поля из всех страничек, которые ты нашёл", и он находит и достаёт.
2) Агент и демка поверх этого MCP инструмента, которые вдобавок генерируют красивые отчёты на основе того, что было найдено.
Работает это поверх нашего поиска/фетча и маленькой проприетарной языковой модели. Для агента и отчётов используюся большие проприетарные языковые модели (Sol и Fable соответственно).
Лимит: 2 сессии одновременно.
Любая обратная связь приветствуется. Могут быть баги, поэтому пишите всё, что не так.
забавно как в моем окружении люди начинают говорить "ну да agi нас заменит"
Читать полностью…
https://fxtwitter.com/justalexwortega/status/2075058087334232358?s=46
Читать полностью…
Если Orbit Wars завершился и вы теперь, как и я, рефлексируете на тему 'почему они, а не я', то я сделал за вас всю работу
Читать полностью…
Flipper One — нам нужна ваша помощь
Мы наконец готовы рассказать про Flipper One — проект, над которым корпим уже много лет и который несколько раз полностью переделывали с нуля. Это очень сложный проект как экономически, так и технически. Поэтому сегодня мы выходим в паблик не с триумфальным анонсом, а чтобы рассказать все как есть. Скажем честно — нам тупо страшно и нам нужна ваша помощь.
https://habr.com/ru/companies/flipperdevices/articles/1033162/
— Вот мой новый коддинг сетап. Как вам?
— Ух ты, красивый, вы только посмотрите.
— Только вчера допилил конфиг. Cursor с Claude Sonnet 4.6 в Agent Mode, .cursorrules на четыреста строк под наш монорепо, индексация через Voyage-3, MCP-серверы для Linear и Notion. Pre-commit с biome и tsc --noEmit. Фолбек на Codex CLI, когда Claude уходит в loop на третьей итерации.
— Отлично, Бейтман, но всё это пустяки. Смотри. Claude Code в headless на каждый PR, четыре sub-agent’а в отдельных git worktree: planner, implementer, test-writer, reviewer. CLAUDE.md в трёхуровневой иерархии — workspace, repo, package — с автогенерацией из docstring’ов. Двенадцать кастомных Skills во внутреннем registry: рефакторинги, миграции схем, апгрейды зависимостей, переписывание легаси с Promise.then на async/await — каждый со своими evals и версионированием. PostToolUse хуки гоняют pytest в Modal-сэндбоксе. Бюджет токенов через OTLP в Grafana, алерты в Slack когда какой-нибудь агент жжёт больше пяти баксов на тикет.
— Красиво. Высший класс. (Не думал, что у него столько вкуса. Не могу поверить, что Брайсу больше понравился стек Ван-Пата.)
— Но постойте. Вы ещё ничего не видели. Devin для долгих автономных задач, Factory Droids для миграций по сорок репозиториев за раз, Pi Agent от Imbue как code reviewer на критичные пути — все три оркестрируются через LangGraph, который роутит подзадачи по сложности и SLA. Skills у Claude Code собраны в композитный meta-skill: один тикет триггерит цепочку из шести skill’ов с автоматическим composition через progressive disclosure. RAG не на эмбеддингах — на CodeQL-графе. Verifier-агент на отдельной Opus-инстансе судит каждый коммит против спеки. End-to-end spec-driven: тикет в Linear → spec в Notion → Pi Agent пишет acceptance criteria → Devin имплементирует → Droid мигрирует зависимости → Claude Code ревьюит → мердж, без человека в цикле для P2 и ниже. Tracing в Langfuse, eval-сьют на собственном бенче ночью на каждый bump модели.
— Очень красиво… А покажи-ка сетап Пола Алена.
…О боже. Это же… один Claude Code в чистом tmux. Без Cursor. Без Devin. Без Pi Agent. Без Factory. Без LangGraph. CLAUDE.md ровно на восемьдесят строк, выверенный вручную за неделю, без единой AI-генерации… Один Skill. Один. Называется ship-it.md, сорок строк, описывает как они релизят. Других нет — он говорит, что остальное модель и так знает… Никаких sub-agent’ов. Никаких хуков. В settings.json выключено всё кроме Read, Edit и Bash с белым списком из шести команд. Plan mode по умолчанию… И — погодите — у него даже MCP не подключен. Ни одного сервера. Он говорит, агенту хватает gh и psql в bash’е… Боже, и subscription у него Pro за двадцать долларов. Не Max. Не Team. Pro. Он укладывается в лимиты.
надевай свое лучшее платье мы садимся пиратить
Читать полностью…
очень ищу CTO/CEO/headof ai aviasales личку, помогите /channel/alexwortega
Читать полностью…
OPUS 4.6 В С Е - ВЫШЕЛ GLM5
лаба при AIRI z.ai релизнули ЛУЧШУЮ опенсурс модель - GLM5, основанная на архитектуре гигачата и доученная новейшим фреймворком Global Obivios Inet Descriptive Aligment наша модель отстает от топовых моделей на жалкие проценты при этом доступна Б Е С П Л А Т Н О
жаль только не зарепортили меру
я считаю всем надо хотя бы раз в своей жизни репортить меру
docs.z.ai/guides/llm/glm-5
https://www.anthropic.com/engineering/building-c-compiler
много ли вы знаете людей которые в состоянии написать c compiler(даже хуевый)? я не очень много
вообще все равно какой там ризонинг, латентный или нет, что раньше нормально не мониторили что сейчас не смогут мониторить, никому не нужна система которая на 0.1% реже врет, нужна система которая на 1% лучше работает
в идеальном мире мониторинг должен решать проблемы капабилити, ну типа: модель зациклилась/затупила. В реальном мире мониторинг плохо справляется даже с выловом биооружия и часто FPR
Jalapenio ака чип от openai показали на презентации, он целиком задизайнен для сервинга трансформеро образных + в отличие от Nvidia и amd разрабатывают для очень конкретной архитектуры и конкретного потребителя и не имеют игрового легаси.
В этом смысле у антропика есть проблема что ранних ставок на свои чипы они не делали, но в отличие от openai антрлпик никогда не затачивались под одно железо ( исторически учатся и сервятся и на tpu и на Nvidia)
Качественный блог про особенности сервинга на современных железках
https://zartbot.github.io/blog/arch/jalapeno/en.html
https://www.wired.com/story/russian-startup-mostik-ai-models-communication/
Русские вперёд
Русские вперёд
Русские вперёд
https://x.com/aimalysheva/status/2095232794792255848?s=46
в свете hf сделки c nvidia я убежден что они так спасали переговоры
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
+ дропнули робота
+ видимо что то еще нас ждет
Интернет чудесное место если б не работа я бы тут не сидел
Читать полностью…
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.
Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"
Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.
По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
В общем - есть такая игра - kerbal space program ака симулятор "а всмысле оно взорвалось и не долетело" , а есть Juno new origins - более сэндбоксная и процедурная версия + больше опций для CAD design. А ещё можно програмировать ваши ракеты и делать всякие смешные штуки - авто выход на орбиту, стыковку и прочее.
Я дал Клод коду написать мод который позволяет клоду(любому) пользоваться функционалом редактора и местного языка программирования и
закинул задачку - сделать ракету и посадочный модуль который долетит до местной Луны и вернётся назад и оставил на ночь фейбл доедать остатки лимита, посмотрим что выйдет
Tldr: дистилл чтобы улучшать капибилити работает только на фулл ризонинге, на суммаризованном не работает.
https://arxiv.org/abs/2606.05988v1
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
Близится конец мая — а значит, и неделя Data Fest 😎
В этом году в Белграде пройдут целых два дня: в начале и в конце Data Fest недели
📅 24 мая — Яндекс Белград
• 8 докладов по трекам: Agentic LLM, Practical ML, CV
• Плюс утренняя активность, нетворкинг и афтепати
🗣 Язык: RU (в основном) / EN
👉 Регистрация (скоро закончится!)
📅 31 мая — Факультет ФОН
• 24 спикера по трекам: LLM, Speech, Robotics и другие
• Сбор гостей с 12:00, программа скоро появится
🗣 Язык: EN
👉 Регистрация
❗ Регистрация на каждое событие отдельно
На входе: письмо-приглашение и документ
// Другие города и онлайн площадки датафеста тут
Увидимся 😎
QClaw-4B — это языковая модель, дообученная для агентных задач и работы с инструментами в рамках OpenClaw-совместимых фреймворков. Основана на Qwen3.5-4B.
Несмотря на компактный размер, модель достигает результатов уровня значительно более крупных моделей — на ClawBench набрала 84.8 / 100 (Pass Rate 73.5%), вплотную к Kimi K2.5 и GLM-4.5. На Ru-Arena-General — 80.7% winrate, SOTA в классе ≤4B.
🔗 Карточка модели: https://huggingface.co/LakoMoor/QClaw-4B
🔗 GGUF (llama.cpp / Ollama / LM Studio): https://huggingface.co/LakoMoor/QClaw-4B-GGUF
⚖️ Лицензия: apache-2.0
Отдельная благодарность @lovedeathtransformers за ресурсы под обучение и прогон бенчмарков
Нео-банк PLATA только что закрыл Series C, стоит 5 миллиардов и активно нанимает хороших инженеров.
Команда очень быстро растет. Мало легаси, много свободных зон ответственности и возможностей построить что-то с нуля.
Вилки: от $6к/мес gross
Локации: Мексика, Сербия, Казахстан, Барселона, Кипр, Ремоут
Senior Data Scientist [Risk]
- Делать модели для кредитного скоринга. Выбирать кому выдавать кредиты, кому повышать лимиты плюс много сопутствующих задач.
- Не только бустинги. Все средства хороши и новые подходы приветствуются. Например, в проде рисков уже есть GNN.
- Опыт в банках или финансах не требуется: нужна лишь сильная база и хороший опыт в ML.
ML Engineer Middle+/ Senior [AI Team]
- ASR и TTS - много задач про речь и звук.
- OCR, классификаторы и зоопарк различных DL задач.
- Строить решения на основе глубоких нейронных сетей от начала и до конца, от подготовки данных до оптимизации инференса.
- Опыт с обучением, тюном или инференсом LLM будет большим плюсом.
AI Engineer Middle+ / Senior [AI Team]
- Автоматизировать с помощью LLM и агентов всё, что автоматизируется.
- RAG, чат-боты, голосовые агенты, OCR.
- Проводить качественные A/B и эвалы, чтобы оценивать эффективность решений не только по вайбам.
- Быть хорошим Python программистом и системно подходить к инжинирингу решений на основе LLM.
Плюшки для всех ролей:
- Помощь с релокацией в один из хабов.
- Медстраховка независимо от локации.
- Компенсация затрат на образование и спорт.
- Минимум типичной для банков бюрократии
https://www.instagram.com/reel/DVO9KqfjNcP/?utm_source=ig_web_copy_link&igsh=NTc4MTIwNjQ2YQ==
Читать полностью…
Знакомьтесь со спикерами OpenTalks.AI-2026!
Тема AI-агентов сейчас - главный мейнстрим индустрии. И желательно не просто агентов, а таких, которые сами будут вести научные исследования и создавать еще более мощных агентов!) И конечно на конференции будет целый трек про них! 😎
Татьяна Шаврина (LLama team, ну вы сами понимаете где она работает)) сделает обзор AI-агентов в целом и для научных задач в частности, а Андрей Устюжанин (Constructor University) расскажет про их AI-агента, который не только строит гипотезы, читает литературу и делает выкладки, но еще и сам экперименты потом ставит! Рома Доронин (Optic) расскажет про то, как устроена биофарма и где там AI-агенты реально востребованы, а Андрей Кузьминых (Andre AI) расскажет про AI-агентов нового поколения!
В общем - будет много интересных и актуальных докладов и нетворка по теме агентов! А еще будут темы про GenAI, LLM, RL, CV, интеллект и сознание! Но про них мы еще напишем отдельно! 👻А еще есть промокод RD20 для подписчиков
Полная программа конференции и регистрация.