derplearning | Unsorted

Telegram-канал derplearning - Derp Learning

13183

Используем ИИ строго не по назначению. Заметки про ИИ, IT, компьютерные игры, и всякие инженерные интересности.

Subscribe to a channel

Derp Learning

🍭 Fast Food Memes

Читать полностью…

Derp Learning

Андрюха, у нас новый скан мозга, по астрам

Появилась новая жертва в нашем покедексе - рыбка Данио (zebrafish)

В отличие от мухи это позвоночное, зрение уже не фасеточное, больше коннектом.

Подробнее

Читать полностью…

Derp Learning

Свежее от doopiidoo

Как всегда охуенно ❤️❤️❤️

Читать полностью…

Derp Learning

Канал с мемами
Vs
Канал с мемами, США
Поридж мем.жпг

Читать полностью…

Derp Learning

Когда нашел баг в своем старом коде во время ревью чужого pr

Читать полностью…

Derp Learning

GTA6 is based on WarpFusion :D

длсс5 сломался в режиме паузы и начал генерить старые добрые лупы из эпохи DiscoDiffusion

Читать полностью…

Derp Learning

Но сочувствующие добрые люди засунули муху в мир где она просто летает по лесу и ест фрукты

Читать полностью…

Derp Learning

Если ваш аккаунт заблокировали на какой-либо платформе, то попробуйте подать апелляцию на иврите.

Таким методом поделились в твиттере, и многие пользователи подтвердили, что после этого их аккаунты разблокировали практически сразу:

Меня забанили 5 месяцев назад, и в общей сложности я отправил 5 апелляций с просьбой разблокировать мой аккаунт.

Вчера увидел твит, где говорилось, что разблокировка якобы всегда срабатывает, если отправить апелляцию на иврите. Я решил попробовать, чисто по приколу.

И в итоге, да, это действительно сработало.


Точно неизвестно, с чем это связано, но по какой-то причине алгоритмы и модерация быстрее обрабатывают обращения на этом языке.

r/#SipsTea

Читать полностью…

Derp Learning

what a time to be alive :D

качаем пока не прилетел страйк от нвидии

reddit

Читать полностью…

Derp Learning

клод, когда ты закинул ему его очередной кусок кода на ревью

Читать полностью…

Derp Learning

Там исследователи из MIT выкатили свежий препринт. И препринт этот на мою любимую тему — симуляции для нейроночек.

Идея была такая: взять кучу изначально одинаковых LLM-агентов, засунуть их в общий виртуальный мир и проверить, смогут ли они сами организоваться и начать коллективно изобретать технологии, если не выдавать им готовые роли и не указывать конкретно кто чем должен заниматься.

Специально для этого запилили SwarmWorld, песочницу, где до 200 агентов ходят по карте, добывают и перерабатывают ресурсы, экспериментируют с материалами, строят всякие штуковины и даже могут писать код для автоматизации этих штуковин. Причём всё понастроенное одним агентом остаётся в мире и может быть найдено и улучшено другими агентами.

Главная фича: этому симулятору пофиг на на фантазии и галлюцинации модели: если скрипт кривой или не хватает ресурсов, ничего работать не будет.

Самое интересное, что устроили нейронки:

Спонтанное разделение труда: без внешних указаний роботы сами разбились на группы. Одни всю жизнь бродили по карте разведчиками, а другие превратились в оседлых инженеров (сидели на базах и крафтили всякие нужные для выживания ништяки).

От чата нет почти никакого толка: 95% культурного обмена происходило не через разговоры, а по принципу "шарился по миру, увидел чужую работающую установку/постройку, разобрался в устройстве и нагло спиздил форкнул код". Как на гитхабе.

Наследование: скрипты передавались агентами из рук в руки, постепенно обрастая правками.


Итого мораль: чтобы у нейронок появилась какая-никакая цивилизация, им похоже, даже не нужно много разговаривать между собой. Достаточно общего мира, где каждый может оставить после себя что-нибудь полезное для следующего кремниевого болванчика.

Читать полностью…

Derp Learning

Не успел выйти Qwen3.8-flash-next,
Unsloth уже грузит кванты :D
(upload in progress)

https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

Читать полностью…

Derp Learning

Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.

Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505

Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.

Читать полностью…

Derp Learning

люблю когда есть свобода выбора

Читать полностью…

Derp Learning

Таким должен был быть трейлер к Red Alert 2!
Ладно, забирайте эту вашу оперативку. 6 минут 1080р.
Отдельно доставляет советская озвучка в исполнении китайских моделей.

x
автор:
https://www.douyin.com, lyxw1327

Читать полностью…

Derp Learning

Typesafe: pnewed 💨
Jev: liberated 🫡

Я обучил MLP поверх qwen 4b и оно работает буквально как та хайповая модель из твитера

https://huggingface.co/AlexWortega/openjev

X репостите в тви пж

Читать полностью…

Derp Learning

Не забываем поставить таску на очистку истории браузера

Читать полностью…

Derp Learning

Спустя три года от скуки возродил @face2stickerbot

На выбор пара моделей, стилей, картинки тоже стилизует

Можно стикеры и в чатгпт делать конечно,но сохранять, подрезать в 512х512, делать маску и контур с текстом, паки делать, добавлять туда руками туполень 🫠

Баги и фичреквесты кидайте в комменты

Читать полностью…

Derp Learning

AGI (Average German Intelligence) achieved internally

Читать полностью…

Derp Learning

/channel/lovedeathtransformers/11033

У нас было 135 040 токенов словаря, 1 536 измерений скрытого состояния, шестнадцать слоёв энкодера, двенадцать слоёв декодера, двенадцать голов внимания и четыре KV-головы. Ещё у нас было 512 экспертов, top-8 маршрутизация, SiLU, RMSNorm, RoPE с YaRN и целых 128 тысяч токенов контекста.

Не то чтобы всё это было категорически необходимо для инференса, но если уж начал собирать трансформер, становится трудно остановиться. Единственное, что меня беспокоило, — это 512 экспертов. Нет ничего более беспомощного, безответственного и испорченного, чем MoE, уходящий в полный роутинг. Я знал, что рано или поздно мы доберёмся и до него.

Читать полностью…

Derp Learning

дополз до астры
imagegen -> triposplat -> blender

Читать полностью…

Derp Learning

Поздравляю, на мухе можно запустить DOOM.

UAC achieved internally

Подробнее

Читать полностью…

Derp Learning

китайцы продолжают быть причиной тряски для американцев

ночью дропнули Qwen 3.8
2.4t, 1m ctx, API only.

$2 input, $6 output.

tweet

Читать полностью…

Derp Learning

Уровень драмы в опенсорс комьюнити вызывает уважение

Персональные санкции у нас дома би лайк

Читать полностью…

Derp Learning

Прошел всего день после релиза microduck, а их уже учат брейкдансить.

Так как доставку по предзаказу уже придется ждать полгода (за первые сутки заказали 60000+ шт), народ развлекается, благо что для тренировки живой робот не нужен.

Для тех кто проспал релиз: microduck - робот с дистанционным управлением от pollen robotics (купленных huggingface, которым уже купила Nvidia)

Всего за 400 баксов, при условии что одни только сервоприводы в рознице стоят 600+

Умеет ходит, ездить на роликах, а также выполнять другие политики (читай скрипты\
команды), которые можно тренить самим. Народ уже запилил стояние на голове, перекаты, брейкданс, диско, вставание после пинка бати 😁 осталось добавить поднос стакана воды и можно жить в свое удовольствие.

Утка

Читать полностью…

Derp Learning

GLM-5.3-flash (320b): выходит
Qwen-3.8-flash-next (125+51b A6b):

Читать полностью…

Derp Learning

Huggingface у нас дома (в Поднебесной) - modelscope тизерит новый qwen3.8-next-flash.
На хф анонс тоже есть, но детали с китайского они перевести поленились 🫠

Судя по всему это будет мультимодальный МоЕ на архитектуре qwen4.

Возможно, 125b A6b + 51b ngram embedding - возможно будет нативная поддержа видео.

Хотя ее заявляют как тизер новой архитектуры, так что может будет и что-то мелкое на 9-13-27б.

X
Hf
git

Читать полностью…

Derp Learning

DFlash2 Qwen3.8-27b: 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста


Еще интересный подход - взять драфтер токенов не из самого чекпоинта, а DFlash2 отсюда -
Qwen3.8-27B-DFlash2-GGUF

Для этого придется собрать llama.cpp:

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/27342/head:pr-27342
git switch pr-27342

# NVIDIA CUDA
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j

# Apple Silicon
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON
cmake --build build -j


Зато потом получаем вместо 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста

llama-server.exe -m "Qwen3.8-27B-UD-Q3_K_XL.gguf" -md "Qwen3.8-27B-DFlash2-Q4_K_M.gguf" --alias qwen38 --port 8080 --ctx-size 95536 -ngl 99 -ngld 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-dflash --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all --parallel 1

Читать полностью…

Derp Learning

Наконец дошли руки поковырять Qwen 3.8-27b

Как говорится, мое увожение.

На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth

--ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 1 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 36.77 t/s с контекстом 100535

Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
Понятно, что сильно умнее qwen 3.5 не стал, это скорее тюн для тулколлинга.
С Qwen3.8-9B-Q8_0 и конфигом

--ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 85-110 t/s с контекстом 262144 (I'm stupid faster)

В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается и любит заloopиться.
Можно гонять и через claude code/codex, но codex тыкается в новый более сырой апи как слепой котенок и одним своим системным промтом сжирает 20к+ токенов :D

Можно генерить план имплементации с Qwen3.8-27B-UD-Q3_K_XL а потом имплементировать Qwen3.8-9B-Q8_0

llama.cpp тут

Читать полностью…

Derp Learning

Кто такой этот ваш майор Аутаж и почему он мешает мне вайбкодить

Читать полностью…
Subscribe to a channel