End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation

Mots clés générés par l'IA : Robustesse Invariance Séparation multi-canal Transform-Average-Concatenate Faisceaux temporel

Points clés générés par l'IA

  • Le problème important dans la séparation de la parole à l'aide de microphones ad hoc est d'assurer la robustesse du système par rapport aux emplacements et au nombre de microphones.
  • Les techniques classiques de formation de faisceaux basées sur l'optimisation satisfont ces exigences par définition.
  • Pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte.
  • Transform-Average-Concatenate (TAC) est un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre.
  • TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc.
  • TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique.
Accédez également à nos autres résultats générés par IA : Résumé complet, Résumé vulgarisé, Article de type blog; ou posez des questions sur cet article à notre Assistant IA.

Auteurs : Yi Luo, Zhuo Chen, Nima Mesgarani, Takuya Yoshioka

ICASSP 2020
Licence : CC BY-NC-SA 4.0

Résumé : An important problem in ad-hoc microphone speech separation is how to guarantee the robustness of a system with respect to the locations and numbers of microphones. The former requires the system to be invariant to different indexing of the microphones with the same locations, while the latter requires the system to be able to process inputs with varying dimensions. Conventional optimization-based beamforming techniques satisfy these requirements by definition, while for deep learning-based end-to-end systems those constraints are not fully addressed. In this paper, we propose transform-average-concatenate (TAC), a simple design paradigm for channel permutation and number invariant multi-channel speech separation. Based on the filter-and-sum network (FaSNet), a recently proposed end-to-end time-domain beamforming system, we show how TAC significantly improves the separation performance across various numbers of microphones in noisy reverberant separation tasks with ad-hoc arrays. Moreover, we show that TAC also significantly improves the separation performance with fixed geometry array configuration, further proving the effectiveness of the proposed paradigm in the general problem of multi-microphone speech separation.

Soumis à arXiv le 30 Oct. 2019

Posez des questions sur cet article à notre assistant IA

Vous pouvez aussi discutez avec plusieurs papiers à la fois ici.

Instructions pour utiliser l'assistant IA ?

Résultats du processus de synthèse de l'article arXiv : 1910.14104v3

Le problème important dans la séparation de la parole à l'aide de microphones ad hoc est d'assurer la robustesse du système par rapport aux emplacements et au nombre de microphones. Le premier exige que le système soit invariant à des indexations différentes des microphones avec les mêmes emplacements, tandis que le second nécessite une capacité à traiter des entrées avec des dimensions variables. Les techniques classiques de formation de faisceaux basées sur l'optimisation satisfont ces exigences par définition, tandis que pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte. Dans cet article, nous proposons Transform-Average-Concatenate (TAC), un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre. Basée sur le réseau filter-and-sum (FaSNet), un système de formation de faisceaux temporels end-to-end récemment proposé, nous montrons comment TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc. De plus, nous montrons que TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique, ce qui prouve l'efficacité du paradigme proposé pour résoudre le problème général de la séparation multi microphone.
Créé le 12 Jui. 2023

Évaluez la qualité du contenu généré par l'IA en votant

Note : 0

Pourquoi avons-nous besoin de votes ?

Les votes sont utilisés pour déterminer si nous devons réexécuter nos outils de synthèse. Si le compte atteint -10, nos outils peuvent être redémarrés.

Le résumé précédent a été créé il y a plus d'un an et peut être réexécuté (si nécessaire) en cliquant sur le bouton Exécuter ci-dessous.

Articles similaires résumés avec nos outils d'IA

Naviguez à travers encore plus d'articles similaires en utilisant une

représentation arborescente

Recherchez des articles similaires (en version bêta)

En cliquant sur le bouton ci-dessus, notre algorithme analysera tous les articles de notre base de données pour trouver le plus proche en fonction du contenu des articles complets et pas seulement des métadonnées. Veuillez noter que cela ne fonctionne que pour les articles pour lesquels nous avons généré des résumés et que vous pouvez le réexécuter de temps en temps pour obtenir un résultat plus précis pendant que notre base de données s'agrandit.

Avertissement : Notre outil de synthèse basé sur l'IA et l'assistant virtuel fournis sur ce site Web peuvent ne pas toujours fournir des résumés complets ou des réponses exactes. Nous vous encourageons à examiner attentivement et à évaluer le contenu généré pour vous assurer de sa qualité et de sa pertinence par rapport à vos besoins.