A method, apparatus and system for processing audio data
By combining the sound source location and identity recognition results of audio data with short-term and long-term voiceprint features, the problem of recognizing multiple speakers in multi-point video conferences was solved, achieving accurate audio data classification and recognition.
Patent Information
- Authority / Receiving Office
- CN · China
- Patent Type
- Patents(China)
- Current Assignee / Owner
- Filing Date
- 2020-09-25
- Publication Date
- 2026-04-03
AI Technical Summary
In multi-point video conferencing, existing voiceprint recognition systems struggle to accurately identify multiple speakers, especially in free-flowing conversation scenarios. Furthermore, channel differences during voiceprint registration and recognition contribute to insufficient accuracy.
By acquiring the sound source location information and identity recognition results of audio data, and combining them with facial recognition methods, accurate classification of audio data can be achieved. Speaker identification is performed by combining short-term and long-term voiceprint features, without the need for pre-registration of voiceprint features.
It achieves accurate audio data classification in multi-person speaking scenarios, improves the accuracy and efficiency of speech data recognition, and reduces dependence on channel differences.
Smart Images

Figure CN114333853B_ABST
Abstract
Citation Information
Patent Citations
Method, device and system for sorting voice conference minutes
CN102968991A
Method and device for generating conference record and conference terminal
CN110232925A
Voice user interface display method and conference terminal
CN111258528A