4255
❤️☠️🤗 идейная миграция небытия
https://extropic.ai/writing/z1t/
Читать полностью…
Зови меня Эпштейном!
??
У меня доступ к ранним моделям!
Ещё одно доказательство что мы живём в пелевине. Уважаемые сотрудники гигачата когда обучите свой fable level модель пожалуйста назовите ее БИИ "Калинка"
Читать полностью…
А не работает старый способ " тыкать по клавиатуре"
Читать полностью…
вообще все равно какой там ризонинг, латентный или нет, что раньше нормально не мониторили что сейчас не смогут мониторить, никому не нужна система которая на 0.1% реже врет, нужна система которая на 1% лучше работает
в идеальном мире мониторинг должен решать проблемы капабилити, ну типа: модель зациклилась/затупила. В реальном мире мониторинг плохо справляется даже с выловом биооружия и часто FPR
Jalapenio ака чип от openai показали на презентации, он целиком задизайнен для сервинга трансформеро образных + в отличие от Nvidia и amd разрабатывают для очень конкретной архитектуры и конкретного потребителя и не имеют игрового легаси.
В этом смысле у антропика есть проблема что ранних ставок на свои чипы они не делали, но в отличие от openai антрлпик никогда не затачивались под одно железо ( исторически учатся и сервятся и на tpu и на Nvidia)
Качественный блог про особенности сервинга на современных железках
https://zartbot.github.io/blog/arch/jalapeno/en.html
https://www.wired.com/story/russian-startup-mostik-ai-models-communication/
Русские вперёд
Русские вперёд
Русские вперёд
https://x.com/aimalysheva/status/2095232794792255848?s=46
в свете hf сделки c nvidia я убежден что они так спасали переговоры
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
+ дропнули робота
+ видимо что то еще нас ждет
Интернет чудесное место если б не работа я бы тут не сидел
Читать полностью…
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.
Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"
Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.
По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
В общем - есть такая игра - kerbal space program ака симулятор "а всмысле оно взорвалось и не долетело" , а есть Juno new origins - более сэндбоксная и процедурная версия + больше опций для CAD design. А ещё можно програмировать ваши ракеты и делать всякие смешные штуки - авто выход на орбиту, стыковку и прочее.
Я дал Клод коду написать мод который позволяет клоду(любому) пользоваться функционалом редактора и местного языка программирования и
закинул задачку - сделать ракету и посадочный модуль который долетит до местной Луны и вернётся назад и оставил на ночь фейбл доедать остатки лимита, посмотрим что выйдет
Tldr: дистилл чтобы улучшать капибилити работает только на фулл ризонинге, на суммаризованном не работает.
https://arxiv.org/abs/2606.05988v1
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
Близится конец мая — а значит, и неделя Data Fest 😎
В этом году в Белграде пройдут целых два дня: в начале и в конце Data Fest недели
📅 24 мая — Яндекс Белград
• 8 докладов по трекам: Agentic LLM, Practical ML, CV
• Плюс утренняя активность, нетворкинг и афтепати
🗣 Язык: RU (в основном) / EN
👉 Регистрация (скоро закончится!)
📅 31 мая — Факультет ФОН
• 24 спикера по трекам: LLM, Speech, Robotics и другие
• Сбор гостей с 12:00, программа скоро появится
🗣 Язык: EN
👉 Регистрация
❗ Регистрация на каждое событие отдельно
На входе: письмо-приглашение и документ
// Другие города и онлайн площадки датафеста тут
Увидимся 😎
QClaw-4B — это языковая модель, дообученная для агентных задач и работы с инструментами в рамках OpenClaw-совместимых фреймворков. Основана на Qwen3.5-4B.
Несмотря на компактный размер, модель достигает результатов уровня значительно более крупных моделей — на ClawBench набрала 84.8 / 100 (Pass Rate 73.5%), вплотную к Kimi K2.5 и GLM-4.5. На Ru-Arena-General — 80.7% winrate, SOTA в классе ≤4B.
🔗 Карточка модели: https://huggingface.co/LakoMoor/QClaw-4B
🔗 GGUF (llama.cpp / Ollama / LM Studio): https://huggingface.co/LakoMoor/QClaw-4B-GGUF
⚖️ Лицензия: apache-2.0
Отдельная благодарность @lovedeathtransformers за ресурсы под обучение и прогон бенчмарков
https://collusion.wiki/
вероятно что да, агенты уже используют вики как паблик чат
И у нас официально есть модель которая с большим ризрнингом хуже работает.( Вероятно причина в особенностях замера, но все равно забавно)
Читать полностью…
Agi реально стал маркетинг термом, fable и более слабый sol это не agi, но релиз через три месяца - agi.
Ждём asi;
https://openai.com/index/gpt-6-astra/
Codex и cc сдохли, ну.. рабочий день всё?
Читать полностью…
Главная проблема всей Ai safety тусовки в неисуоренимой вере в чудо и что вот ща годик пройдет и мы решим мониторинг, гарды и тд.
Ну типа... Не работает нихуя в реальности, статьи клипаются на раз два, а гранты выдают самым желающим получить гранты.
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
вера в волшебство во взрослом возрасте выглядит так : в стране где придумали крышки на веревочке и разьебать бизнес сделали хорошую ллм (а вы про кого подумали?)
Читать полностью…
Web Query Language (WebQL) в середине пути переименовался в Keenable SELECT.
Галерея отчётов: https://keenableai.github.io/select-showcase/
Демка: https://app.keenable.ai/select/start
Тут 2 вещи:
1) MCP инструмент, который позволяет делать SQL запросы к интернету с семантическими операторами. То есть вы буквально говорите "достань мне вот все эти поля из всех страничек, которые ты нашёл", и он находит и достаёт.
2) Агент и демка поверх этого MCP инструмента, которые вдобавок генерируют красивые отчёты на основе того, что было найдено.
Работает это поверх нашего поиска/фетча и маленькой проприетарной языковой модели. Для агента и отчётов используюся большие проприетарные языковые модели (Sol и Fable соответственно).
Лимит: 2 сессии одновременно.
Любая обратная связь приветствуется. Могут быть баги, поэтому пишите всё, что не так.
забавно как в моем окружении люди начинают говорить "ну да agi нас заменит"
Читать полностью…
https://fxtwitter.com/justalexwortega/status/2075058087334232358?s=46
Читать полностью…
Если Orbit Wars завершился и вы теперь, как и я, рефлексируете на тему 'почему они, а не я', то я сделал за вас всю работу
Читать полностью…
Flipper One — нам нужна ваша помощь
Мы наконец готовы рассказать про Flipper One — проект, над которым корпим уже много лет и который несколько раз полностью переделывали с нуля. Это очень сложный проект как экономически, так и технически. Поэтому сегодня мы выходим в паблик не с триумфальным анонсом, а чтобы рассказать все как есть. Скажем честно — нам тупо страшно и нам нужна ваша помощь.
https://habr.com/ru/companies/flipperdevices/articles/1033162/
— Вот мой новый коддинг сетап. Как вам?
— Ух ты, красивый, вы только посмотрите.
— Только вчера допилил конфиг. Cursor с Claude Sonnet 4.6 в Agent Mode, .cursorrules на четыреста строк под наш монорепо, индексация через Voyage-3, MCP-серверы для Linear и Notion. Pre-commit с biome и tsc --noEmit. Фолбек на Codex CLI, когда Claude уходит в loop на третьей итерации.
— Отлично, Бейтман, но всё это пустяки. Смотри. Claude Code в headless на каждый PR, четыре sub-agent’а в отдельных git worktree: planner, implementer, test-writer, reviewer. CLAUDE.md в трёхуровневой иерархии — workspace, repo, package — с автогенерацией из docstring’ов. Двенадцать кастомных Skills во внутреннем registry: рефакторинги, миграции схем, апгрейды зависимостей, переписывание легаси с Promise.then на async/await — каждый со своими evals и версионированием. PostToolUse хуки гоняют pytest в Modal-сэндбоксе. Бюджет токенов через OTLP в Grafana, алерты в Slack когда какой-нибудь агент жжёт больше пяти баксов на тикет.
— Красиво. Высший класс. (Не думал, что у него столько вкуса. Не могу поверить, что Брайсу больше понравился стек Ван-Пата.)
— Но постойте. Вы ещё ничего не видели. Devin для долгих автономных задач, Factory Droids для миграций по сорок репозиториев за раз, Pi Agent от Imbue как code reviewer на критичные пути — все три оркестрируются через LangGraph, который роутит подзадачи по сложности и SLA. Skills у Claude Code собраны в композитный meta-skill: один тикет триггерит цепочку из шести skill’ов с автоматическим composition через progressive disclosure. RAG не на эмбеддингах — на CodeQL-графе. Verifier-агент на отдельной Opus-инстансе судит каждый коммит против спеки. End-to-end spec-driven: тикет в Linear → spec в Notion → Pi Agent пишет acceptance criteria → Devin имплементирует → Droid мигрирует зависимости → Claude Code ревьюит → мердж, без человека в цикле для P2 и ниже. Tracing в Langfuse, eval-сьют на собственном бенче ночью на каждый bump модели.
— Очень красиво… А покажи-ка сетап Пола Алена.
…О боже. Это же… один Claude Code в чистом tmux. Без Cursor. Без Devin. Без Pi Agent. Без Factory. Без LangGraph. CLAUDE.md ровно на восемьдесят строк, выверенный вручную за неделю, без единой AI-генерации… Один Skill. Один. Называется ship-it.md, сорок строк, описывает как они релизят. Других нет — он говорит, что остальное модель и так знает… Никаких sub-agent’ов. Никаких хуков. В settings.json выключено всё кроме Read, Edit и Bash с белым списком из шести команд. Plan mode по умолчанию… И — погодите — у него даже MCP не подключен. Ни одного сервера. Он говорит, агенту хватает gh и psql в bash’е… Боже, и subscription у него Pro за двадцать долларов. Не Max. Не Team. Pro. Он укладывается в лимиты.
надевай свое лучшее платье мы садимся пиратить
Читать полностью…