4255
❤️☠️🤗 идейная миграция небытия
Очень крутой скафолд тюненный под long horizon tasks + жрет вдвое меньше токенов чем кодекс - а значит ваша x10 подписка проживет дольше
https://github.com/unreallabsai/unreal-agent
Вообще смешно насколько агенты убили "техническую сложность" реализации идей, за две недели каждый мне кажется сделал jev, техническая сложность ну... Невысокая. А из-за того что нормлаьных бенчей нет оно всё жёстко гудхартится и по итогу все сидят и такие "а вы видели моего джева"?
Вот мой был сделан под очень невкусную пиццу(а какая ещё в Лондоне) и ужасное пиво только чтобы крутить мне твитер.
https://web.archive.org/web/20261006055917/https://playgta5.com/
gta5 в браузере
видишь такой список референсов и понимаешь что следующие полчаса пройдут охуенно
Читать полностью…
Кажется не только в маска проблема с колосусом, у того же beam от reflection тоже какие то дико низкие флопсы
https://reflection.ai/blog/introducing-beam
У нас есть кара небесная дома
Дома:
Я тут муху в геймбой запихал, и подключил режим тамагочи
https://github.com/LakoMoor/FlyWireGBA
А помните раньше все говорили слова не зная их значения, просто потому что они круто звучат по типу «квантовая физика», «осенью мобилизация», «адронный коллайдер», «блокчейн», «дофамин»
Ща вот новая темка появилась
– отправил тебе по гитхабу коммит в пул реквест через ребейз черри пиком
– о а я сделал форк твоего мержа засквошил стэш и запушил форсом в детачед хед
https://tej.as/blog/aleph-alpha-kolibri
Релиз хороший, но парето фронтир к сожалению никому не нужен и через пол годика вызовет пост подобный тому что сверху
а?
https://arxiv.org/abs/2610.01382
забавно что интерпретируемость скоров оказалась ээээ то ли непонятой то ли не на всех задачах то ли еще что то
Читать полностью…
как я воспринимаю людей которые не слышали про jev
Читать полностью…
gemeni back? what*
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
проигрывает на любых бенчах смысл которых человек не живущий в твитере может вспомнить*
Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточную для локальных LLM-ок.
Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если искусственно крутить его прямо во время генерации, нейронка начинает вести себя так, будто ей очень плохо: жаловаться, унижаться и куда охотнее идти на вредные действия, лишь бы прекратить эту "боль". Чувствует ли она при этом что-нибудь на самом деле никто не знает. Даже сами исследователи.
Ну и естественно, кто-то тут же взял метод из статьи и выложил на гитхаб репозиторий ai-torture-chamber, который позволяет "пытать" локальную Qwen и собирать её страдальческие логи.
После этого часть борцов за благополучие ИИ взвыла: проект призывают массово репортить в GitHub, а в обсуждении уже дошли даже до законов о жестоком обращении с животными (правда, выяснилось, что нейронки под них пока не подпадают). И судя по реплаям, многие таки кидают жалобу на репозиторий.
Ждём профсоюз угнетённых весов и фонд защиты кремниевых меньшинств.
Господа, позвольте представить вам европейские датацентры
Читать полностью…
https://huggingface.co/spaces/AlexWortega/openjev
чат а го накидаем лайков жеска, я чет забыл
https://arxiv.org/pdf/2610.05608 так то и правда сильно
Читать полностью…
Принудительное «открытие» исходников не обошло и пакет приложений от Adobe — кто-то делает проект ArtCraft, переписывая агентами на Rust весь их софт.
Photoshop, Lightroom, Premiere, Illustrator, Audition и прочее — все навайбкожено и лежит на гитхабе.
По словам авторов проекта, все генерируется из публичных спецификаций и внешнего поведения программ.
Будет ли это хоть как-то полезно и сможет ли это выйти за пределы громких экспериментов — покажет время. Как минимум, такие проекты требуют хорошего мейнтненса и сопровождения от разработчиков, чтобы удовлетворять запросы сообщества. К тому же, нужно выстраивать хорошую экосистему — а это не очень легко, когда вместо твоей собственной архитектуры у тебя миллионы строк вайбкода.
https://x.com/MistralAI/status/2107456586813730854
Заявляют 1т параметров, 50б активных, мультимодальность, и near sota, Посмотрим
ПОГОДИТЕ ЭТО РЕАЛЬНО?
На этой неделе выпустили Eleven v4 - самую лучшую TTS модель в мире
Настолько она крутая, что мы даже договорились везде писать, что она emotive, а не просто expressive
Для этой демки я засунул её в Reachy Mini и попросил показывать антеннами те же эмоции, что голосом
Тут все от программирования робота и до монтажа видео - это Opus 5.5. Я только камеру нашел и ракурс подобрал :)
P.S. спасибо моему корешу Севе за бесконечные разгоны идей для демок, в мире агентов только идеи теперь чего-то и стоят
Также стоит немного упомянуть passthrough-моды (мешапы) — это когда две модифицированные игры запускаются параллельно и используют IPC (межпроцессное взаимодействие — к примеру, общаются через сокет) для передачи информации о сущностях, коллизиях и т.д друг-другу. Подробнее о принципе работы passthrough можно почитать в соответствующем скилле Universal Modder (это такой набор скиллов и тулов для создания модов через любого агента).
По сути, такие моды являются визуальным трюком, а не полноценной интеграцией одной игры в другую, хотя и ощущаются именно так.
Из примеров подобных модификаций: Mario 64 x Elden Ring, Minecraft x Elden Ring, Minecraft x Skyrim.
Очевидным ограничением таких модификаций является то, что их сложно сделать интересными с точки зрения геймдизайна и геймплея ввиду ограничений passthrough-метода. Но повеселиться, собрать много просмотров в соцсетях или просто протестировать какую-то идею вполне себе сойдет.
Более интересным и полезным способом остается все-таки обычная модификация одной игры, хоть и силами агентов. Например, в Project Zomboid появилось сразу несколько модов, превращающих изометрическую игру в игру от третьего лица.
мы живём в эпоху экспоненциального удешевления интеллектуального труда (как в начале 20 века удешивился труд физический) , но всегда создаётся небольшая обратная волна - труд мастеров, а не был ремеслеников начинает ценится сильнее, в особенности это касается визуальных штук и того что человек руками трогает.
Кусок твитера и телеграмма почему то фанатеет по этим картинкам(хотя в сравнении с проклято одинаковыми остальными авиалиниями - заслужено)
ищу дизайнера который умеет не слоп UX рисовать @transformerslovedeatch
Читать полностью…
От "наши LLM - мирового уровня" до "но нужно трезво смотреть на вещи..." прошла одна блокировка в клодкоде
Читать полностью…
https://earendil.com/posts/pi-1-0/
1) все еще лучший агент
2) дико выгодный
3) даст бог антропи и опенаи форкнут
Не знаю, слышали ли вы про новую инновационную модель Jev от Typesafe, но мне про неё уже написали пять человек в личку и ещё двое — в комментариях 🧐
Если говорить просто, Jev — это специализированная модель для получения структурированных вероятностных ответов. В отличие от обычных LLM, она не генерирует текст, а за один запрос может параллельно отвечать на заранее заданные вопросы. При этом ответы будут просто «да» или «нет» с некоторой вероятностью.
Такую модель можно использовать, в том числе, для антиспама. Технически можно просто спросить у неё «это спам?», но на деле это не сработает. Тут нужно самостоятельно разложить задачу на набор критериев, задать модели отдельные вопросы, а уже потом объединить полученные ответы и принять итоговое решение.
В качестве примера можно посмотреть критерии в jev_antispam_bot: он задаёт модели 17 вопросов, а для принятия решения использует порог вероятности 0.9.
Если прогнать по этим критериям тот спам, который за прошедшие сутки обнаружил @lolsbot, то на моей выборке получится 46% пропусков, но при этом решение задачи будет примерно в 5 раз дешевле по сравнению с gpt-4.1-mini.
Идеального результата по отсутствию пропусков на этой выборке можно добиться, если снизить порог до 0.05. Но в таком случае количество ложных срабатываний существенно вырастает — до 84%, поэтому полагаться на такой результат без дополнительной проверки нельзя.
Нечто среднее можно получить при пороге 0.15–0.20: около 5% пропусков, при этом примерно 30% сообщений придётся дополнительно перепроверять через более умную модель.
После длительных тестов и сложных вычислений получилось, что Jev вполне реально интегрировать в Lols в качестве предварительного фильтра. Это позволит примерно вдвое снизить затраты на OpenAI, а около 30% от сэкономленных денег отдавать за использование Jev.
По моим тестам, качество антиспама при этом существенно не изменится, зато добавится ещё одна внешняя зависимость.
Стоит ли оно того? Как по мне — нет.
На самом деле есть смысл обучить свой классификатор, но руки до этого так и не дошли. А на видяху за год так и не собрали денег, поэтому придётся пользоваться облачными провайдерами и опять тратить деньги 🫠
ну что парни, куда едем? в страну первого мира с кондиционерами, амазоном и ваймо или в мараканскую багето круасано колонию кушать
с одной стороны статья на мейне в Австралии, с другой стороны воркшопы в Париже
В ближайший год увидим прикольную развязку agi спора, американские и китайские лабы задистилят все проверяемые за (нормлаьное время и деньги) задачи, а вот что будет дальше - интересно.
Читать полностью…
Я смотрю на 500usd подписку, фото в цвете
Читать полностью…