A Multimodal Data Scene Recognition Method Based on Multi-level Interactive Fusion
By employing a multi-level interactive fusion method, non-visual data and visual data are fused in a multi-modal manner. This multi-level interactive fusion method for scene recognition solves the problem of insufficient visual data in autonomous driving and improves the accuracy and speed of scene recognition.
Patent Information
- Application Number
- CN202211597492.8
- Authority / Receiving Office
- CN · China
- Patent Type
- Patents(China)
- Current Assignee / Owner
- Filing Date
- 2022-12-12
- Publication Date
- 2025-10-28
- Estimated Expiration
- 2042-12-12
AI Technical Summary
In existing autonomous driving technologies, scene recognition mainly relies on visual data, lacking the supplementation of non-visual data and multi-level fusion, resulting in insufficient recognition accuracy and speed.
This paper proposes a multi-level interactive fusion method to integrate non-visual and visual data in a multimodal manner. Non-visual data is used to assist decision-making. The method adopts a multi-modal data scene recognition method based on multi-level interactive fusion, including feedforward neural network, two-stage attention mechanism, multi-layer spatiotemporal attention network and self-attention mechanism, to extract 2D and 3D features, and optimize feature interaction through contrastive learning loss.
It improves the accuracy and speed of autonomous driving scene recognition, reduces information redundancy, and enhances the ability to comprehensively describe scenes.