Mel倒谱
光谱图
计算机科学
语音识别
卷积神经网络
机制(生物学)
学习迁移
情绪识别
人工智能
倒谱
模式识别(心理学)
特征提取
认识论
哲学
作者
Jung-Hyun Lee,Ui Nyoung Yoon,Jo Geun Sik
出处
期刊:정보과학회논문지
[Korean Institute of Information Scientists and Engineers]
日期:2020-07-31
卷期号:47 (7): 665-673
被引量:2
标识
DOI:10.5626/jok.2020.47.7.665
摘要
기존의 음성 기반 감정 인식 연구는 단일한 음성 특징값을 사용한 경우와 여러 가지 음성 특징값을 사용한 경우로 분류할 수 있다. 단일한 음성 특징값을 사용한 경우는 음성의 강도, 배음 구조, 음역 등 음성의 다양한 요소를 반영하기 어렵다는 문제가 있다. 여러 가지 음성 특징값을 사용한 경우에는 머신러닝 기반의 연구들이 다수를 차지하는데, 딥러닝 기반의 연구들에 비해 상대적으로 감정 인식 정확도가 낮다는 단점이 있다. 이러한 문제를 해결하기 위해 멜-스펙트로그램(Mel-Spectrogram)과 MFCC(Mel Frequency Cepstral Coefficient)를 음성 특징값으로 사용한 합성곱 신경망(Convolutional Neural Network) 기반의 음성 감정 인식 모델을 제안하였다. 제안하는 모델은 학습 속도 및 정확도 향상을 위해 전이학습과 어텐션(Attention)을 적용하였으며, 77.65%의 감정 인식 정확도를 달성하여 비교 대상들보다 높은 성능을 보였다.
科研通智能强力驱动
Strongly Powered by AbleSci AI