voicestuff | Unsorted

Telegram-канал voicestuff - Voice stuff

1780

Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o

Subscribe to a channel

Voice stuff

На этом Интерспич 2026 подошёл к концу.

Расскажите какие статьи вас заинтересовали.

Думал клода натравить пару статей воспроизвести, но теперь сам без клода.

Читать полностью…

Voice stuff

Turn taking доклад. Можете по qr коду и статью и гитхаб найти.

Оказывается то, что можно смотреть на вероятность EOS токена была целая статья - TurnGPT.

Тут же ребята используют эмбеддинги из Mimi, обучают новую проекцию и тюнят лору на qwen.

Читать полностью…

Voice stuff

Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый.

Читать полностью…

Voice stuff

Раскрыл загадку FeruzaSpeech

Я долго смотрел на фамилию Povey в этой работе и думал что он опубликовал что-то под псевдонимом потому что его мол забанили от публикаций.

Я с ним пообщался и он сказал что это работа его жены и дочери. Как минимум, подтверждает его отношение к этой работе.

https://arxiv.org/abs/2410.00035

Читать полностью…

Voice stuff

Ну и последний постер на сегодня о том как голосовые модели воспринимают speaker similarity

Читать полностью…

Voice stuff

Крутой постер о том что вместо того чтобы делать липсинк по сгенерированной речи, можно делать синтез речи по заданному движению губ 🤯

Работает? - спросите вы. чекните демки. работает вполне себе!

https://lipadapter.github.io/

Читать полностью…

Voice stuff

Если вы вдруг не знали что обучая модель акцентам и эмоциям одновременно, она скорее всего всё напутает, то вам целая статья об этом.

Читать полностью…

Voice stuff

Тут про RL в TTS поверх автометрики, которая хорошо коррелирует с human preference

Я не нашёл презентующего, но мне интересно что такое ChatScorer

upd: ChatScorer это wavlm + трансформер с головой на предсказание качества

Читать полностью…

Voice stuff

прикиньте. кстати, слышал про анонимизацию спикеров и там выясняется что SpeakerID модельки помимо тембра (f0) выучивают еще и стиль речи и из-за этого даже после voice-conversion могут узнать спикера

Читать полностью…

Voice stuff

Recent advances in Speech-Language ASR

полный зал, при этом очень сложно слушать чела

но:
- можно использовать голосовые префиксы перед каждой репликой в speech llm
- Speculative decoding работает в ASR тоже
- SpeechKV - можно сжимать не входную последовательность, а сам KV-кеш (работает и на ллм)
- и что там на слайдах

Читать полностью…

Voice stuff

Продолжаем. Быстрый pitch-extraction

Читать полностью…

Voice stuff

Если хотите много цитирований, то можно постить не решения, а структуру для eval.

Например хотим сделать лучшую систему, которая бы при переводе аудио сохраняла бы неуверенность, паузы, мычания или, наоборот, уверенность повествования. Создаём датасет, бенчмарк и лидерборд по этой задачке и публикуем на Interspeech. Все, кто будут решать, будут вас цитировать. Можно цитирующих ещё и нанимать.

И это тоже ресёрч.

Читать полностью…

Voice stuff

какой-то неизвестный ещё и вписал туда мой прошлый стартап прикиньте

Читать полностью…

Voice stuff

первый час конференции и я уже нашёл русский след здесь

Читать полностью…

Voice stuff

3157 статей опубликовано. Для этого использовали 2275 ревьюеров. Ничего себе сколько ресурса требуется!

В этом году впервые использовали AI-review. И лиды-ревьюеры могли перепроверять вместе с AI. Оценку 5 никто не поставил. Все ревьюеры были очень недовольны тем как статьи обозреваются через AI.

Читать полностью…

Voice stuff

Ещё одна статья по turn taking. там заметка такая что можно параллельно и ждать end of sentence и начинать генерировать ответ. А выдать ответ уже когда мы подтвердим end of utterance. Спасают полсекунды таким образом.

Читать полностью…

Voice stuff

2 модных слова в бизнесе:

Moat - ров. То, что вас отличает и защищает от конкурентов

wedge - клин. то, чем вы врываетесь в рынок существующий и занимаете своё место

Читать полностью…

Voice stuff

Доброе утро. Есть советы?

Читать полностью…

Voice stuff

Увиделся с автором Yodas v3. Спросил лучше ли качество в этой версии и как они хранят данные

https://youtube.com/shorts/6MuEMX_DLY4?si=CTq35vCH6iQltsFA

Читать полностью…

Voice stuff

UDD TTS

Есть такая штука: Jump Diffusion. Составляем спектрограмму, и удаляем из неё кадры. Во время обучения просим модель воспроизвести пропущенные кадры.

Теперь, во время инференса вставляем кадры, предсказанные текст энкодером и запускам диффузию, которая сама выберет какие кадры куда добавить.

Такая вот льтернатива duration prediction.

Читать полностью…

Voice stuff

Как мы слышим себя?

25 людям дали ползунки с разными фильтрами и выяснили, что самые главные:
- low shelf фильтр - увеличивает громкость частот до 600Гц
- питч ниже, но только у мужчин (мы хотим слышать себя с более низким голосом оказывается)

Читать полностью…

Voice stuff

допиливаем InstructTTS

Читать полностью…

Voice stuff

Можно ли ЛЛМкой исправить ошибки распознавания low-resource языков?

- Да

Читать полностью…

Voice stuff

Greek low resource?

Обучают модельку на 20 часах данных. Мне кажется, 20 часов речи можно записать и самостоятельно если язык настолько уж редкий.

Читать полностью…

Voice stuff

мой докладыч про Dialogs

https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations

ссылка на статью: https://www.isca-archive.org/interspeech_2026/shigabeev26_interspeech.html

Читать полностью…

Voice stuff

Coding Is Not Solved (🔥 Score: 157+ in 1 hour)

Link: https://readhacker.news/s/762Yn
Comments: https://readhacker.news/c/762Yn

Читать полностью…

Voice stuff

AnimeScore 🥰

Читать полностью…

Voice stuff

Крутая идея использовать диффузию для ASR. По метрикам показывают паритет с whisper и paraket. На длинных последовательностях RTF растет медленнее чем на AR/NAR системах. Но всё равно очень медленно.

Читать полностью…

Voice stuff

Повею наконец-то дали ISCA Fellow

Читать полностью…

Voice stuff

55TB аудиодаты 🙀

с Yodas непросто работать, но он реально огромный. А количество и качество данных - всё ещё очень хороший способ поднять качество.

https://arxiv.org/abs/2609.29448

(подглядел у Николая Шмырёва)

https://huggingface.co/datasets/espnet/yodas3

Читать полностью…
Subscribe to a channel