52806
по всем вопросам @haarrp @itchannels_telegram - 🔥 best it channels @ai_machinelearning_big_data -ML @ArtificialIntelligencedl -AI @datascienceiot - ml 📚 @pythonlbooks -📚books
🚀 Django 6.1 вышел: меньше магии, больше контроля
Новая версия Django приносит улучшения для production-приложений и работы с базой данных.
Главное новшество — новый подход к загрузке данных моделей.
Теперь можно контролировать, когда Django делает дополнительные запросы:
from django.db import models
books = Book.objects.fetch_mode(
models.FETCH_PEERS
)
FETCH_ONE — загружать данные только для текущего объекта;FETCH_PEERS — догружать данные сразу для группы объектов;RAISE — запрещать неожиданные запросы и ловить проблемы заранее.
XY - новая open-source библиотека визуализации от команды Reflex. Она пытается объединить удобство Matplotlib с интерактивностью браузерных графиков и производительностью Rust.
Для больших датасетов Rust-ядро XY вычисляет только то, что реально можно показать при текущем разрешении экрана. При приближении данные уточняются и появляются исходные точки.
import xy
chart = xy.line_chart(
xy.line(
[1, 2, 3, 4, 5],
[120, 180, 165, 240, 310]
)
)
chart
import xy.pyplot as plt
fig, ax = plt.subplots()
ax.plot(x, y)
plt.show()
Python API
↓
ColumnStore
↓
Rust compute
↓
binary buffers
↓
WebGL2 / Canvas
pip install xy
🔥 Harbor - единый фреймворк для тестирования и улучшения AI-агентов
Сравнивать Claude Code, OpenHands, Codex CLI и других агентов сложно: у каждого свои команды, окружения и форматы результатов.
Harbor превращает это в единый воспроизводимый пайплайн. Он позволяет запускать разные модели и coding-агентов на одинаковых задачах в изолированных контейнерах.
Что умеет Harbor:
- тестировать разные модели и AI-агенты;
- запускать Terminal-Bench, SWE-Bench и Aider Polyglot;
- создавать собственные бенчмарки и окружения;
- параллельно проводить тысячи экспериментов;
- собирать rollouts для RL-оптимизации;
- работать локально через Docker или в облачных sandbox-сервисах.
Установка:
uv tool install harbor
harbor run \
--dataset terminal-bench@2.0 \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
🚀 Neo4j без сервера: GraphForge запускает полноценный Cypher прямо внутри Python-скрипта
GraphForge занимает редкую нишу между NetworkX и серверными графовыми БД. Вы получаете встроенный графовый движок на Rust, полный openCypher и хранение проекта в обычной директории.
Что внутри:
- четыре независимых слоя на Rust: parser → IR → planning → execution;
- результаты сразу возвращаются как Apache Arrow Table;
- данные легко передаются в Pandas и Polars;
- постоянное хранение построено на Parquet;
- встроены PageRank, Louvain и гибридный текстово-векторный поиск;
- Python- и Node.js-биндинги работают поверх одного движка.
from graphforge import GraphForge
graph = GraphForge("research/")
result = graph.execute("""
MATCH (a)-[:CITES]->(b)
RETURN a.title, b.title
""")
print(result.to_pandas())
🖥 NVIDIA открыла бесплатный доступ к мощным ИИ-моделям через API
В каталоге NVIDIA NIM можно использовать DeepSeek V4, GLM 5.2, Kimi K2.6, Nemotron и десятки других моделей без оплаты каждого запроса.
Подключение занимает несколько минут:
1. Открываем NVIDIA NIM и создаём бесплатный аккаунт NVIDIA Developer.
2. Выбираем модель и нажимаем Get API Key.
3. Копируем ключ.
4. В Cursor, Cline, OpenCode или другом совместимом клиенте указываем endpoint:
https://integrate.api.nvidia.com/v1
🔥 Claude Thermos снижает расходы Claude Code, не давая prompt cache «остыть»
Когда основной агент ждёт subagent дольше пяти минут, кеш контекста может истечь. После возвращения Claude приходится заново кодировать всю историю диалога по повышенному тарифу. В длинных сессиях это могут быть сотни тысяч токенов.claude-thermos запускает Claude Code через локальный прокси и периодически отправляет минимальный запрос с max_tokens: 1.
Он не генерирует полезный ответ, а просто обновляет TTL кеша. Когда subagent заканчивает работу, основной агент читает дешёвый кеш вместо полной перезаписи контекста.
Запуск:
uvx claude-thermos
🚀 LoopX удерживает ИИ-агента в одной задаче более 200 часов
Главная проблема долгих агентных сценариев - ограниченный контекст. Модель забывает решения, теряет цель, повторяет работу и не понимает, что делать после ожидания, ревью или смены сессии.
LoopX выносит состояние за пределы LLM и хранит его в отдельной контрольной плоскости:
- цель и ограничения;
- текущие задачи и ответственных;
- решения, требующие участия человека;
- доказательства выполненной работы;
- квоты и расписание запусков;
- handoff для восстановления после смены модели, сессии или хоста.
Каждый запуск агента ограничен конкретным шагом. После выполнения он записывает результат, доказательства и следующую задачу. Затем LoopX решает: продолжать, ждать внешнего события или запросить решение человека.
В открытых демонстрациях циклы исправления Issue/PR в OpenViking и AutoML-эксперимента сохраняли состояние более 200 часов. Это время всей траектории с ожиданием, ревью и повторными запусками, а не непрерывная работа модели.
По сути, LoopX - это Kanban-доска, превращённая в систему выполнения для агентов. Её состояние напрямую определяет следующий допустимый шаг.
Поддерживаются Codex, Claude Code, Cursor, OpenCode и собственные рантаймы. Проект распространяется по лицензии MIT.
https://github.com/huangruiteng/loopx
#AI #AIAgents #OpenSource #Codex #ClaudeCode #Automation
🐍 Python-совет: как объединить списки разной длины и не потерять данные
Обычный zip() останавливается на самом коротком списке:
numbers = [1, 2, 3, 4, 5]
letters = ["a", "b", "c"]
print(list(zip(numbers, letters)))
# [(1, 'a'), (2, 'b'), (3, 'c')]
from itertools import zip_longest
result = zip_longest(
numbers,
letters,
fillvalue="нет значения",
)
print(list(result))
[
(1, "a"),
(2, "b"),
(3, "c"),
(4, "нет значения"),
(5, "нет значения"),
]
zip(numbers, letters, strict=True)
🚀 NVIDIA открыла единый фреймворк для обучения и запуска world models
Cosmos Framework объединяет полный цикл работы с моделями Cosmos 3: обучение, дообучение, инференс и онлайн-сервинг.
Что внутри:
• распределённое обучение через FSDP, TP, CP и PP
• импорт и экспорт Hugging Face safetensors
• поддержка JSONL, WebDataset и LeRobot
• инференс через Diffusers, Transformers и vLLM
• batch-генерация и сервер на Ray + Gradio
• готовые Agent Skills для Claude Code, Codex CLI и Cursor
Cosmos 3 работает с текстом, изображениями, видео, аудио и последовательностями действий. Фреймворк рассчитан на разработку моделей для робототехники, автономных систем и симуляции физического мира.
Примеры обучения протестированы на 8× H100 80 ГБ, а облегчённую Cosmos3-Nano можно запускать на одной GPU.
🔗 https://github.com/NVIDIA/cosmos-framework
🐍 collections.Counter: больше, чем подсчёт частот
Большинство используют Counter только ради most_common(), хотя у него есть куда более интересные возможности.
from collections import Counter
a = Counter("abracadabra")
b = Counter("barbecue")
a + b
a - b
a & b # минимальные значения
a | b # максимальные значения
clean = +a
a.total()
list(a.elements())
One Day Offer: заходи в команду, которая двигает финансы на терабайтах данных! 🔥
На связи блок «Финансы» в Сбере! Мы строим системы, которые автоматизируют казначейство, риск‑менеджмент, отчётность — и добавляем AI для точных прогнозов.
На One Day Offer мы хотим найти коллег сразу в 3 продуктовые команды. Базовый стек и уровень задач одинаковы — выбирай направление по душе:
✔️ BigData: Spark (batch+streaming), сложные SQL‑оптимизации, DWH/Data Lake.
✔️ Микросервисы: Python (FastAPI/Django), API, интеграции с системами.
От тебя ждём: Python от 5 лет, экспертный SQL, PySpark, SOLID/asyncio, HDFS/Kafka.
👉 Регистрируйся по ссылке. Встречаемся 8 августа!
Сложный индустриальный ML, работа с генеративными подсказками, уровни дообучения и агентский Cotype — на E-CODE 2026 трек ML&DS снова впечатляет.
Программа ещё пополняется. Но уже сейчас понятно, что успевшая заслужить высокоранговую славу конференция Ozon Tech снова станет одним из ключевых событий в индустрии.
Осталось только пройти модерацию, чтобы убедиться лично: https://ecode.ozon.tech/. Ну, и дать огня на вечеринках, конечно!
🔥 За одну неделю вышло сразу 6 интересных open-weight моделей
Пока все ждут веса Kimi K3 и Ling 3.0, в LLM Architecture Gallery Себастьяна Расчки появилось несколько свежих архитектур.
1. Nanbeige 4.2 3B
Всего 3B non-embedding параметров, но используется Looped Transformer: один и тот же стек слоёв проходит дважды. Больше эффективной глубины без удвоения весов.
https://huggingface.co/Nanbeige/Nanbeige4.2-3B
2. Laguna S 2.1
118B MoE, только 8B активных параметров, 48 слоёв и контекст 1M токенов. Сделана Poolside с упором на coding agents и длинные задачи.
https://huggingface.co/poolside/Laguna-S-2.1
3. Motif-3-Beta
Огромный 314B-A13B MoE: 384 routed experts, 8 активируются на токен, контекст 256K.
https://huggingface.co/Motif-Technologies/Motif-3-Beta
4. Solar Open 2
250B-A15B MoE от Upstage с 1M контекстом. Архитектура чередует три linear-attention слоя с одним обычным softmax-attention слоем. Модель рассчитана на длинные agentic workflows.
https://www.upstage.ai/blog/en/solar-open-2
5. Antares 1B
Компактная security-модель Cisco для анализа репозиториев и поиска потенциально уязвимого кода. Основана на Granite и дообучена под agentic terminal workflows.
https://huggingface.co/fdtn-ai/antares-1b
6. BTL-3
Rank-32 LoRA для Qwen3.6-27B, заточенная под coding agents и tool calling. Авторы заявляют 95,1% HumanEval и 88,5% BFCL v4 AST.
https://huggingface.co/badtheorylabs/BTL-3
Полная галерея архитектур:
https://sebastianraschka.com/llm-architecture-gallery/
🖥 Git bisect - для поиска багов
Когда баг появился где-то между сотнями коммитов, не нужно проверять историю вручную.
Запускаем:
git bisect start
git bisect bad
git bisect good <старый_рабочий_коммит>
git bisect good
git bisect bad
git bisect run pytest
Hugging Face собрала open-source стек для локальных голосовых агентов
Репозиторий speech-to-speech содержит модульный пайплайн с низкой задержкой:VAD → STT → LLM → TTS
Каждый компонент можно заменить. Для распознавания речи поддерживаются Parakeet TDT, Whisper, Faster Whisper и Paraformer. Для генерации голоса доступны Qwen3-TTS, Kokoro, Pocket TTS, ChatTTS и MMS.
LLM можно запускать через облачный OpenAI-совместимый API либо локально через Transformers, MLX, vLLM или llama.cpp. Весь стек способен работать на собственном железе без передачи аудио внешнему сервису.
Сервер поддерживает протокол OpenAI Realtime и WebSocket-эндпоинт /v1/realtime. Это позволяет подключать существующие клиенты с потоковой передачей аудио, транскрипцией, прерыванием ответа и tool calling.
Запуск:
pip install speech-to-speech
speech-to-speech
🚀 LLMs-from-scratch пробил 100 000 звёзд на GitHub - и это уже одна из лучших практических баз по устройству современных LLM.
Проект Себастьяна Рашки показывает весь путь с нуля - без магии высокоуровневых библиотек:
- токенизация и attention;
- pretraining;
- классификация;
- instruction fine-tuning;
- LoRA, DPO и evaluation;
- KV cache и оптимизация памяти;
- эффективная загрузка весов.
Причём репозиторий давно вышел за рамки «соберём маленький GPT».
Там уже есть реализации Llama, Qwen, Gemma и OLMo с нуля, а также современные архитектурные техники:
- GQA;
- MLA;
- Sliding Window Attention;
- Gated DeltaNet;
- DeepSeek Sparse Attention;
- cross-layer KV sharing;
- Mixture-of-Experts.
Самое полезное - уменьшенные версии моделей можно запускать локально и подключать к тем же training scripts, чтобы реально экспериментировать с архитектурой, а не только читать статьи.
Рашка продолжит добавлять новые варианты attention и архитектуры, а RL и Reasoning From Scratch развивает в отдельных репозиториях.
Если хочется не просто использовать LLM через API, а действительно понять, что происходит внутри трансформера - это один из тех репозиториев, которые стоит пройти руками.
🔗 github.com/rasbt/LLMs-from-scratch
#AI #LLM #MachineLearning #DeepLearning #OpenSource
Prime Agent - новый open-source coding harness для задач, которые продолжаются часами или даже несколькими сессиями.
Вместо десятков отдельных инструментов модель получает один постоянный IPython-кernel. Через Python она может:
- искать информацию во всей истории диалога;
- вызывать системные инструменты;
- запускать субагентов параллельно;
- сохранять промежуточные данные вне активного контекста;
- возвращаться к старым агентам после сжатия истории;
- превращать удачные решения в память и повторно используемые навыки.
Разработчики описывают подход так:
> Контекст становится переменной, а делегирование субагентам - вызовом функции внутри REPL.
Агент может написать код, найти нужный фрагмент истории и обработать данные программно.
Есть и механизм /refine: Prime Agent анализирует собственную траекторию и может обновлять вспомогательные промпты, память, навыки и настройки субагентов. Изменения сохраняются между сессиями и при необходимости откатываются.
По собственным тестам Prime Intellect, связка Prime Agent + Opus 5 набрала 95,5% на ARC-AGI-3 - немного выше указанного авторами бенчмарка результата экспертов в 95,4%.
В предварительном EmulatorBench агент также смог с нуля написать на Rust работающие эмуляторы SEGA Genesis и Game Boy Color без доступа к готовым реализациям.
Prime Agent распространяется под MIT-лицензией и работает на macOS и Linux.
Важный нюанс: это не изолированная песочница. Агент запускает сгенерированный код с правами текущего пользователя, поэтому тестировать его безопаснее в отдельной копии репозитория.
GitHub:
https://github.com/PrimeIntellect-ai/prime-agent
Подробности:
https://www.primeintellect.ai/blog/prime-agent
Займи слот ИТ-Пикником от Т-Банка
8 августа — время отложить ноутбуки и встретиться офлайн на ИТ-Пикнике от Т-Банка в музее-заповеднике «Коломенское». Вот сколько всего запланировано:
— научпоп-лекции;
— мастер-классы;
— дискуссии об ИИ и больших языковых моделях;
— доклады о кибербезопасности;
— примеры, как данные из логов становятся решениями;
— много музыки — Сream Soda, IOWA, LAB Антона Беляева и другие артисты.
Бери с собой друзей, супругов и детей — каждый найдет себе что-то по душе.
Зарегистрироваться и узнать больше можно здесь
Открыли регистрацию на E-CUP 2026 Students 🎓
В этом сезоне — только для студентов. Будет интересно тем, кто изучает ML / DS / big data / аналитику данных.
Сможете ускорить модель по поиску дубликатов на 20%? Получится создать классификатор для модерации товаров? Сумеете предсказать поведение покупателя?
Как минимум — попробуете и получите фидбэк от тех, кто делает это в Ozon Tech каждый день. Как максимум — разделите призовой фонд в 7 200 000 ₽ в торжественной атмосфере конференции E-CODE.
Нетривиальные задачи, нетворк с ведущими специалистами индустрии, кастомный мерч и шанс масштабно усилить портфолио — это про E-CUP 2026 Students.
Больше подробностей и регистрация ↩️
🔴 Завтра тестовое собеседование на Middle Python с разработчиком из Авито
Уже завтра вечером в 19:00 по мск приходи онлайн на открытое собеседование, чтобы посмотреть на настоящее интервью на Middle Python-разработчика.
Как это будет:
📂 Даня, старший разработчик в Авито, будет задавать реальные вопросы и задачи разработчику-добровольцу
📂 Даня будет комментировать каждый ответ респондента, чтобы дать понять чего от вас ожидает собеседующий на интервью
📂 В конце можно будет задать любой вопрос Дане
Это бесплатно. Эфир проходит в рамках менторской программы от ШОРТКАТ для Python-разработчиков, которые хотят повысить свой грейд, ЗП и прокачать скиллы.
Переходи в нашего бота, чтобы получить ссылку на эфир → @shortcut_py_bot
Реклама.
О рекламодателе.
One Day Offer для Python-разработчиков!💚
15 августа открываем двери в команду Agent Execution Framework ⚡️
Коллеги создают платформу для GenAI‑агентов в банке — делают так, чтобы ИИ реально работал в серьёзных финпроцессах: с безопасностью, нагрузкой и пользой.
Чем предстоит заниматься:
✔️ развивать backend на Python
✔️ подключать LLM, инструменты, базы знаний и RAG
✔️ строить пайплайны оценки качества агентов
✔️ участвовать в архитектуре и ревью кода
Встречаемся 15 августа онлайн.
Регистрируйся по ссылке
🎬 Seedance 2.0 превратили в полноценную операционную систему для ИИ-режиссёра
Seedance 2.0 Skill OS - открытый набор навыков и пайплайнов, который помогает создавать видео не через набор слов вроде «cinematic, epic, beautiful», а через режиссёрскую постановку сцены.
Система определяет драматическую задачу эпизода и согласует под неё:
— движение камеры и характер объектива;
— свет, композицию и действия персонажей;
— звук, диалоги и темп;
— роли изображений, видео и аудиореференсов;
— переходы между несколькими связанными клипами.
Есть отдельные модули для text-to-video, image-to-video, продолжения роликов, первого и последнего кадров, устранения проблем и сохранения персонажей между сценами.
Для длинных историй инструмент анализирует реальный финал готового клипа и только после этого пишет промпт для следующего, поэтому сюжет не разваливается из-за расхождения генерации с первоначальным планом.
Также внутри есть готовые процессы для раскадровки, монтажа, цветокоррекции, локализации, звука и финального контроля качества. Поддерживается работа на русском языке. Проект распространяется под MIT License.
GitHub:
https://github.com/Emily2040/seedance-2.0
One Day Offer для Python-разработчиков!💚
15 августа открываем двери в команду Agent Execution Framework ⚡️
Коллеги создают платформу для GenAI‑агентов в банке — делают так, чтобы ИИ реально работал в серьёзных финпроцессах: с безопасностью, нагрузкой и пользой.
Чем предстоит заниматься:
✔️ развивать backend на Python
✔️ подключать LLM, инструменты, базы знаний и RAG
✔️ строить пайплайны оценки качества агентов
✔️ участвовать в архитектуре и ревью кода
Встречаемся 15 августа онлайн.
Регистрируйся по ссылке
Управляй реальными устройствами с помощью кода.
Попробуй себя в треке по программированию роботов на True Tech Champ 2026 и поборись за 7 500 000 руб.
Начать проще, чем кажется: зарегистрируйся, собери команду или объединись с другими участниками на платформе и пройди квалификационный этап до 13 сентября. В онлайн-симуляторе тебе предстоит запрограммировать робособаку и робота-манипулятора для доставки груза через полосу препятствий. Количество попыток не ограничено, а еще тебя будет ждать серия обучающих вебинаров.
Лучшие команды пройдут в финал и будут программировать реальных роботов на офлайн-полигоне 22 октября на большой сцене.
Масштабный финал объединит борьбу за призовой фонд в 7 500 000 руб., выступления хедлайнеров, доклады спикеров и активности для всех гостей мероприятия.
Успей зарегистрироваться и пройти квалификацию до 13 сентября.
Реклама. ООО "МВС". ИНН 7707767501. erid: 2W5zFJomh13
🎙 Kyutai открыла готовый стек для потоковых голосовых агентов
Delayed Streams Modeling — репозиторий с моделями и примерами для streaming STT и TTS. Аудио обрабатывается частями: агент начинает распознавать речь и генерировать ответ, не дожидаясь окончания записи.
Что внутри:
• потоковая транскрибация с временными метками для каждого слова
• модель 1B EN/FR с задержкой около 0,5 секунды и semantic VAD
• английская модель 2.6B с задержкой около 2,5 секунды
• PyTorch-ноутбуки для экспериментов
• Rust-сервер с WebSocket для продакшена
• MLX-реализация для Mac и iPhone
• streaming TTS, который принимает текст и сразу выдаёт звук частями.
На H100 разработчики заявляют обработку до 400 одновременных STT-потоков, а Rust-сервер на L40S обслуживает 64 подключения быстрее реального времени.
Лицензии разделены по компонентам: Python и web — MIT, Rust backend — Apache 2.0, веса STT — CC BY 4.0.
🔗 https://github.com/kyutai-labs/delayed-streams-modeling
🔥 `Agents-cli` от Google - полный конвейер разработки AI-агентов из терминала
Инструмент добавляет coding-агентам вроде Claude Code, Codex и Antigravity CLI готовые навыки для работы с Google ADK и облачной инфраструктурой. Сам agents-cli моделью или отдельным coding-агентом не является.
Что умеет:
• создавать каркас агентного проекта
• запускать агента локально
• генерировать датасеты для eval
• оценивать и сравнивать трассы
• находить типичные причины ошибок
• автоматически оптимизировать промпты
• добавлять RAG, CI/CD и observability
• деплоить в Cloud Run, GKE или Agent Runtime
• публиковать агента в Gemini Enterprise
Для локальной разработки Google Cloud необязателен — достаточно Gemini API через AI Studio. Для облачного деплоя уже потребуется собственный проект Google Cloud.
Установка:
uvx google-agents-cli setup
npx skills add google/agents-cli
ProtoLink - лёгкий Python-фреймворк для мультиагентных систем с A2A в основе
ProtoLink строит архитектуру вокруг самих агентов, а не цепочек вызовов LLM. Каждый агент имеет собственные capabilities, tools, lifecycle и может напрямую передавать задачи другим агентам через Agent-to-Agent (A2A).
Что есть внутри:
* OpenAI, Anthropic, Gemini, DeepSeek, Ollama, llama.cpp и другие модели;
* native Python tools и MCP;
* HTTP, SSE, WebSocket и gRPC;
* SQLite state и хранение запусков;
* telemetry через Langfuse и LangSmith;
* auth, policies, approvals, budgets и replay;
* Pipeline, Parallel, Router и Graph для детерминированных workflow.
Фреймворк local-first: можно поднять агента вообще без API-ключа и облачной модели, а затем подключить Ollama или другой backend без переписывания tools и логики взаимодействия. Базовый пакет зависит только от Pydantic.
GitHub:
https://github.com/nMaroulis/protolink
Лицензия: MIT.
CLI-Anything: как дать AI-агентам руки для обычных приложений
Идея простая: CLI-Anything генерирует командные интерфейсы для реального софта, чтобы агент мог не «тыкать мышкой», а вызывать понятные команды.
Так можно управлять CAD-инструментами, 3D-редакторами, редакторами субтитров, браузером, Blender, FreeCAD, GIMP, Inkscape, Obsidian, Kdenlive, OBS и другими приложениями. В репозитории уже есть десятки agent-harness’ов под разные программы.
Как это выглядит:
* агент получает задачу
* вызывает CLI
* приложение делает работу
* результат можно проверить и повторить
Есть и CLI-Hub: установка через pip install cli-anything-hub, дальше можно ставить готовые CLI через cli-hub install <name>.
GitHub: https://github.com/HKUDS/CLI-Anything
PyPI закрыл опасную лазейку в старых релизах
Теперь PyPI запрещает загружать новые файлы в релиз спустя 14 дней после его публикации. Старую версию пакета больше нельзя внезапно дополнить новым wheel или архивом.
Ограничение защищает от атаки, при которой злоумышленник крадёт токен публикации и добавляет вредоносный файл в давно стабильный релиз. Часть пользователей могла бы скачать заражённую сборку, хотя номер версии остался прежним.
Изменение затронет мало проектов: среди 15 000 популярных пакетов лишь 56 добавляли wheel для Python 3.14 позже установленного срока.
Разработчикам теперь придётся выпускать новую версию пакета, даже когда нужно лишь добавить сборку для свежей версии Python. В будущем PyPI планирует формально разделить релизы на открытые и закрытые через Upload 2.0 API.
https://blog.pypi.org/posts/2026-07-22-releases-now-reject-new-files-after-14-days/
⚡️ VGGT: превращает набор фотографий в геометрию 3D-сцены
Обычно реконструкция сцены требует отдельной связки для оценки камер, глубины и отслеживания точек. VGGT получает изображения и предсказывает всё это одной feed-forward моделью.
На вход можно подать один кадр, несколько снимков или сотни ракурсов. На выходе модель строит:
- внутренние и внешние параметры камер
- карты глубины
- плотные карты 3D-точек
- траектории выбранных точек между кадрами
Результаты можно экспортировать в формат COLMAP, дополнительно обработать через bundle adjustment и использовать в пайплайнах NeRF или Gaussian Splatting через gsplat.
Запуск занимает несколько строк:
model = VGGT.from_pretrained("facebook/VGGT-1B").to(device)
images = load_and_preprocess_images(image_names).to(device)
with torch.no_grad():
predictions = model(images)