End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation

Mots clés générés par l'IA : Robustesse Invariance Séparation multi-canal Transform-Average-Concatenate Faisceaux temporel

Points clés générés par l'IA

Le problème important dans la séparation de la parole à l'aide de microphones ad hoc est d'assurer la robustesse du système par rapport aux emplacements et au nombre de microphones.
Les techniques classiques de formation de faisceaux basées sur l'optimisation satisfont ces exigences par définition.
Pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte.
Transform-Average-Concatenate (TAC) est un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre.
TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc.
TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique.

Accédez également à nos autres résultats générés par IA : Résumé complet, Résumé vulgarisé, Article de type blog; ou posez des questions sur cet article à notre Assistant IA.

Auteurs : Yi Luo, Zhuo Chen, Nima Mesgarani, Takuya Yoshioka

arXiv: 1910.14104v3 - DOI (eess.AS)

ICASSP 2020

Licence : CC BY-NC-SA 4.0

Résumé : An important problem in ad-hoc microphone speech separation is how to guarantee the robustness of a system with respect to the locations and numbers of microphones. The former requires the system to be invariant to different indexing of the microphones with the same locations, while the latter requires the system to be able to process inputs with varying dimensions. Conventional optimization-based beamforming techniques satisfy these requirements by definition, while for deep learning-based end-to-end systems those constraints are not fully addressed. In this paper, we propose transform-average-concatenate (TAC), a simple design paradigm for channel permutation and number invariant multi-channel speech separation. Based on the filter-and-sum network (FaSNet), a recently proposed end-to-end time-domain beamforming system, we show how TAC significantly improves the separation performance across various numbers of microphones in noisy reverberant separation tasks with ad-hoc arrays. Moreover, we show that TAC also significantly improves the separation performance with fixed geometry array configuration, further proving the effectiveness of the proposed paradigm in the general problem of multi-microphone speech separation.

Soumis à arXiv le 30 Oct. 2019

Posez des questions sur cet article à notre assistant IA

Vous pouvez aussi discutez avec plusieurs papiers à la fois ici.

Instructions pour utiliser l'assistant IA ?

Résultats du processus de synthèse de l'article arXiv : 1910.14104v3

Résumé Complet
Points clés
Résumé vulgarisé
Article de blog

Le problème important dans la séparation de la parole à l'aide de microphones ad hoc est d'assurer la robustesse du système par rapport aux emplacements et au nombre de microphones. Le premier exige que le système soit invariant à des indexations différentes des microphones avec les mêmes emplacements, tandis que le second nécessite une capacité à traiter des entrées avec des dimensions variables. Les techniques classiques de formation de faisceaux basées sur l'optimisation satisfont ces exigences par définition, tandis que pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte. Dans cet article, nous proposons Transform-Average-Concatenate (TAC), un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre. Basée sur le réseau filter-and-sum (FaSNet), un système de formation de faisceaux temporels end-to-end récemment proposé, nous montrons comment TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc. De plus, nous montrons que TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique, ce qui prouve l'efficacité du paradigme proposé pour résoudre le problème général de la séparation multi microphone.

- Le problème important dans la séparation de la parole à l'aide de microphones ad hoc est d'assurer la robustesse du système par rapport aux emplacements et au nombre de microphones.
- Les techniques classiques de formation de faisceaux basées sur l'optimisation satisfont ces exigences par définition.
- Pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte.
- Transform-Average-Concatenate (TAC) est un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre.
- TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc.
- TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique.

Résumé: Les microphones peuvent être utilisés pour séparer les sons, mais cela peut être difficile si les microphones sont placés à différents endroits. Il existe des techniques pour résoudre ce problème, mais certaines méthodes d'apprentissage en profondeur ne les prennent pas en compte. Transform-Average-Concatenate (TAC) est une méthode qui peut aider à séparer les sons même avec plusieurs microphones. TAC fonctionne bien dans des situations bruyantes et réverbérantes et avec différents arrangements de microphones. Définitions: - Microphone: un appareil qui convertit le son en signal électrique. - Robuste: capable de résister aux changements ou aux défis. - Optimisation: processus d'amélioration ou de maximisation d'un système. - Apprentissage en profondeur end-to-end : une méthode d'apprentissage automatique où un modèle apprend directement à partir des données brutes sans prétraitement manuel. - Permutation de canal : changer l'ordre des signaux audio provenant de différents canaux/microphones. - Séparation multi-canal invariante au nombre : séparer plusieurs sources sonores à partir de plusieurs canaux/microphones sans connaître le nombre exact de sources sonores. - Réverbération : écho prolongé et diffus du son dans une pièce

Le problème de la séparation multi-microphone

L'utilisation de microphones ad hoc pour la séparation de la parole pose un défi important: assurer une robustesse du système par rapport aux emplacements et au nombre des microphones. Le premier exige que le système soit invariant à des indexations différentes des microphones avec les mêmes emplacements, tandis que le second nécessite une capacité à traiter des entrées avec des dimensions variables. Les techniques classiques de formation de faisceaux basée sur l'optimisation satisfont ces exigences par définition, mais pour les systèmes d'apprentissage en profondeur end-to-end, ces contraintes ne sont pas entièrement prises en compte.

Transform-Average-Concatenate (TAC)

Dans cet article, nous proposons Transform-Average-Concatenate (TAC), un paradigme simple pour une permutation de canal et une séparation multi-canal invariante au nombre. Basée sur le réseau filter-and-sum (FaSNet), un système de formation de faisceaux temporels end-to-end récemment proposé, nous montrons comment TAC améliore considérablement les performances de séparation pour divers nombres de microphones dans des tâches bruyantes et réverbérantes avec des matrices ad hoc. De plus, nous montrons que TAC améliore également considérablement les performances de séparation avec une configuration fixe d'array géométrique, ce qui prouve l'efficacité du paradigme propos

Créé le 12 Jui. 2023

Évaluez la qualité du contenu généré par l'IA en votant

Note : 0

Le résumé précédent a été créé il y a plus d'un an et peut être réexécuté (si nécessaire) en cliquant sur le bouton Exécuter ci-dessous.