2017声音场景分类和事件检测比赛,难点在哪里

写的比较普遍问题
重叠事件检测和一般的非重叠事件检测,我们知道最大的区别就在于重叠,如果不重叠,随便现在什么模型RF、SVM、CNN、RNN、DNN等结合人工特征MFCC、mel-energy都能去得相对的很好结果。
为什么声音事件重叠后就难了呢?
1、重叠事件声源的非线性叠加,而不是简单的线性叠加,加上背景噪声动态多样,真实环境下噪声动态变化,不同的音频录制的地点不同也有很大差异,噪声就更复杂了。导致重叠部分声源更加复杂,现有的手工特征(底层特征)对这些事件的区分度不大了。
还有以前特征使用的语音特方面特征:mfcc、mel-energy,针对声音事件的特征有待研究。
2、事件重叠,事件方法研究。

■网友
【2017声音场景分类和事件检测比赛,难点在哪里】 我觉得难点在于数据。Train set和test set的数据不是同一时间录制,导致过拟合现象普遍存在。


    推荐阅读