← 返回首页
AI · 深度学习
CatMeowCNN
基于情感神经科学的猫叫声智能识别系统,基于 Panksepp 七情绪理论,通过深度学习实现猫叫声情感分类与识别。
94.2%识别准确率
7情绪分类
2.8k训练样本
CNN模型架构
项目概述
CatMeowCNN 是一个基于卷积神经网络的猫叫声情感识别系统。项目以 Panksepp 情感神经科学理论为基础,将猫叫声分为七个情绪维度:探索(SEEKING)、愤怒(RAGE)、恐惧(FEAR)、欲望(LUST)、关怀(CARE)、悲伤(PANIC)和玩耍(PLAY)。
通过对猫叫声进行 Mel 频谱图特征提取,结合深度卷积神经网络进行训练和分类,实现了高精度的猫叫声情感识别。
核心特性
- 基于 Mel 频谱图的声学特征提取
- 7 类 Panksepp 情绪维度分类
- 数据增强提升泛化能力
- 端到端深度学习流水线
- 实时推理能力
- 可视化注意力热图
数据集分布
数据集包含来自多个来源的猫叫声录音,经过预处理和标注。数据增强技术(时间拉伸、音高偏移、背景噪声添加)被用于扩充训练集,提高模型的泛化能力。训练集/验证集/测试集按 7:2:1 比例划分。
处理流水线
1. 音频采集从多源采集猫叫声原始音频,统一采样率为 22050Hz
2. 预处理去除静音段、归一化、分段切片(2秒/段)
3. 特征提取计算 Mel 频谱图(128 Mel 频带,FFT窗口 2048)
4. 数据增强时间拉伸、音高偏移、背景噪声混合
5. 模型训练CNN 架构训练,Adam 优化器,早停策略
6. 评估与部署混淆矩阵分析,模型量化,ONNX 导出
模型架构
Input128×87×1
→
Conv2D32@3×3
→
MaxPool2×2
→
Conv2D64@3×3
→
MaxPool2×2
→
Conv2D128@3×3
→
GlobalAvgpooling
→
Dense256 units
→
Dropout0.5
→
Output7 classes
模型指标
准确率94.2%测试集
精确率 (Weighted)93.8%宏平均
召回率 (Weighted)94.1%宏平均
F1-Score94.0%加权平均
七情结分类
基于 Panksepp 情感神经科学理论的七情结分类体系
🔍
SEEKING
探索
探索
😠
RAGE
愤怒
愤怒
😨
FEAR
恐惧
恐惧
❤️
LUST
欲望
欲望
🤗
CARE
关怀
关怀
😢
PANIC
悲伤
悲伤
🎮
PLAY
玩耍
玩耍