Vocoder-Projected Feature Discriminator

2508.17874v2 cs.SD, cs.AI, cs.LG, eess.AS, stat.ML 2025-08-28

Авторы:

Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo

Резюме на русском

#### Контекст Текстовые распознавания речи (TTS) и голосовые преобразования (VC) широко используются в сфере искусственного интеллекта для генерирования речи. Основной задачей в этих областях является получение качественных аудио сигналов из текстовых данных. Одним из ключевых элементов этих процессов являются акустические признаки, такие как мел-спектрограммы, которые легко обучаются и требуют меньшего объема ресурсов. Однако при преобразовании этих признаков в аудио сигналы через вокодер возникают значительные затраты времени и памяти, особенно при использовании методов, таких как диффузионное обучение. Эта проблема влияет на эффективность и экономичность реализации TTS и VC. Мы предлагаем новую модель, которая уменьшает эти затраты, сохраняя высокое качество генерируемых аудио сигналов. #### Метод Мы предлагаем **Vocoder-Projected Feature Discriminator (VPFD)** — новую архитектуру, использующую вокодер для проекции признаков на аудио сигналы. Метод основывается на двух основных компонентах: вокодер-проектор и искусственной нейронной сети с адверсарным обучением. Вокодер-проектор преобразует мел-спектрограммы в временной сигнал с помощью одного этапа увеличения разрешения. Это позволяет эффективно применять адверсарный тренинг, не требуя значительного времени и памяти. Модель обучается с помощью бинарного адверсарного тренинга, где дискриминатор сравнивает генерируемый сигнал с реальным. Это приводит к уменьшению времени обучения и потребления памяти. #### Результаты Мы провели эксперименты на различных данных, включая диффузионное обучение в VC. Наши результаты показали, что VPFD демонстрирует высокое качество генерируемых аудио сигналов, сравнимое с дискриминаторами, работающими непосредственно с волновыми сигналами. Однако VPFD гораздо эффективнее по ресурсам: обучение стало быстрее в 9.6 раз, а потребление памяти уменьшилось в 11.4 раз в сравнении с традиционными методами. Эти результаты доказывают эффективность и экономичность нашего подхода. #### Значимость Метод VPFD может быть применен в различных областях, таких как текстовые распознавания речи, голосовые преобразования, синтез речи и музыкальная генерация. Он обеспечивает высокое качество генерируемых сигналов с значительной экономией ресурсов. Это может привести к более эффективной реализации TTS и VC в ситуациях, где ресурсы ограничены. Будущие исследования будут сфокусированы на расширении возможностей VPFD для других типов акустических признаков и улучшении его парамет

Abstract

In text-to-speech (TTS) and voice conversion (VC), acoustic features, such as mel spectrograms, are typically used as synthesis or conversion targets owing to their compactness and ease of learning. However, because the ultimate goal is to generate high-quality waveforms, employing a vocoder to convert these features into waveforms and applying adversarial training in the time domain is reasonable. Nevertheless, upsampling the waveform introduces significant time and memory overheads. To address this issue, we propose a vocoder-projected feature discriminator (VPFD), which uses vocoder features for adversarial training. Experiments on diffusion-based VC distillation demonstrated that a pretrained and frozen vocoder feature extractor with a single upsampling step is necessary and sufficient to achieve a VC performance comparable to that of waveform discriminators while reducing the training time and memory consumption by 9.6 and 11.4 times, respectively.

Ссылки и действия

Читать на arXiv Скачать PDF

Дополнительные ресурсы:

Vocoder-Projected Feature Discriminator

Авторы:

Резюме на русском

Abstract

Ссылки и действия

Связанные статьи

FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversari...

Vocoder-Projected Feature Discriminator

Навигация