1780
Канал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o
На этом Интерспич 2026 подошёл к концу.
Расскажите какие статьи вас заинтересовали.
Думал клода натравить пару статей воспроизвести, но теперь сам без клода.
Turn taking доклад. Можете по qr коду и статью и гитхаб найти.
Оказывается то, что можно смотреть на вероятность EOS токена была целая статья - TurnGPT.
Тут же ребята используют эмбеддинги из Mimi, обучают новую проекцию и тюнят лору на qwen.
Кореец показывает статью, где всего 7М параметров и качество лучше, чем у ReDimNet. Пришли Ваня Яковлев и Ростик Макаров - авторы ReDimNet и обнаружили что это тот же redimnet, только перезавёрнутый.
Читать полностью…
Раскрыл загадку FeruzaSpeech
Я долго смотрел на фамилию Povey в этой работе и думал что он опубликовал что-то под псевдонимом потому что его мол забанили от публикаций.
Я с ним пообщался и он сказал что это работа его жены и дочери. Как минимум, подтверждает его отношение к этой работе.
https://arxiv.org/abs/2410.00035
Ну и последний постер на сегодня о том как голосовые модели воспринимают speaker similarity
Читать полностью…
Крутой постер о том что вместо того чтобы делать липсинк по сгенерированной речи, можно делать синтез речи по заданному движению губ 🤯
Работает? - спросите вы. чекните демки. работает вполне себе!
https://lipadapter.github.io/
Если вы вдруг не знали что обучая модель акцентам и эмоциям одновременно, она скорее всего всё напутает, то вам целая статья об этом.
Читать полностью…
Тут про RL в TTS поверх автометрики, которая хорошо коррелирует с human preference
Я не нашёл презентующего, но мне интересно что такое ChatScorer
upd: ChatScorer это wavlm + трансформер с головой на предсказание качества
прикиньте. кстати, слышал про анонимизацию спикеров и там выясняется что SpeakerID модельки помимо тембра (f0) выучивают еще и стиль речи и из-за этого даже после voice-conversion могут узнать спикера
Читать полностью…
Recent advances in Speech-Language ASR
полный зал, при этом очень сложно слушать чела
но:
- можно использовать голосовые префиксы перед каждой репликой в speech llm
- Speculative decoding работает в ASR тоже
- SpeechKV - можно сжимать не входную последовательность, а сам KV-кеш (работает и на ллм)
- и что там на слайдах
Если хотите много цитирований, то можно постить не решения, а структуру для eval.
Например хотим сделать лучшую систему, которая бы при переводе аудио сохраняла бы неуверенность, паузы, мычания или, наоборот, уверенность повествования. Создаём датасет, бенчмарк и лидерборд по этой задачке и публикуем на Interspeech. Все, кто будут решать, будут вас цитировать. Можно цитирующих ещё и нанимать.
И это тоже ресёрч.
какой-то неизвестный ещё и вписал туда мой прошлый стартап прикиньте
Читать полностью…
первый час конференции и я уже нашёл русский след здесь
Читать полностью…
3157 статей опубликовано. Для этого использовали 2275 ревьюеров. Ничего себе сколько ресурса требуется!
В этом году впервые использовали AI-review. И лиды-ревьюеры могли перепроверять вместе с AI. Оценку 5 никто не поставил. Все ревьюеры были очень недовольны тем как статьи обозреваются через AI.
Ещё одна статья по turn taking. там заметка такая что можно параллельно и ждать end of sentence и начинать генерировать ответ. А выдать ответ уже когда мы подтвердим end of utterance. Спасают полсекунды таким образом.
Читать полностью…
2 модных слова в бизнесе:
Moat - ров. То, что вас отличает и защищает от конкурентов
wedge - клин. то, чем вы врываетесь в рынок существующий и занимаете своё место
Увиделся с автором Yodas v3. Спросил лучше ли качество в этой версии и как они хранят данные
https://youtube.com/shorts/6MuEMX_DLY4?si=CTq35vCH6iQltsFA
UDD TTS
Есть такая штука: Jump Diffusion. Составляем спектрограмму, и удаляем из неё кадры. Во время обучения просим модель воспроизвести пропущенные кадры.
Теперь, во время инференса вставляем кадры, предсказанные текст энкодером и запускам диффузию, которая сама выберет какие кадры куда добавить.
Такая вот льтернатива duration prediction.
Как мы слышим себя?
25 людям дали ползунки с разными фильтрами и выяснили, что самые главные:
- low shelf фильтр - увеличивает громкость частот до 600Гц
- питч ниже, но только у мужчин (мы хотим слышать себя с более низким голосом оказывается)
Можно ли ЛЛМкой исправить ошибки распознавания low-resource языков?
- Да
Greek low resource?
Обучают модельку на 20 часах данных. Мне кажется, 20 часов речи можно записать и самостоятельно если язык настолько уж редкий.
мой докладыч про Dialogs
https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations
ссылка на статью: https://www.isca-archive.org/interspeech_2026/shigabeev26_interspeech.html
Coding Is Not Solved (🔥 Score: 157+ in 1 hour)
Link: https://readhacker.news/s/762Yn
Comments: https://readhacker.news/c/762Yn
Крутая идея использовать диффузию для ASR. По метрикам показывают паритет с whisper и paraket. На длинных последовательностях RTF растет медленнее чем на AR/NAR системах. Но всё равно очень медленно.
Читать полностью…
55TB аудиодаты 🙀
с Yodas непросто работать, но он реально огромный. А количество и качество данных - всё ещё очень хороший способ поднять качество.
https://arxiv.org/abs/2609.29448
(подглядел у Николая Шмырёва)
https://huggingface.co/datasets/espnet/yodas3