← 返回首页

CatMeowCNN

基于情感神经科学的猫叫声智能识别系统,基于 Panksepp 七情绪理论,通过深度学习实现猫叫声情感分类与识别。

94.2%识别准确率
7情绪分类
2.8k训练样本
CNN模型架构

项目概述

CatMeowCNN 是一个基于卷积神经网络的猫叫声情感识别系统。项目以 Panksepp 情感神经科学理论为基础,将猫叫声分为七个情绪维度:探索(SEEKING)、愤怒(RAGE)、恐惧(FEAR)、欲望(LUST)、关怀(CARE)、悲伤(PANIC)和玩耍(PLAY)。

通过对猫叫声进行 Mel 频谱图特征提取,结合深度卷积神经网络进行训练和分类,实现了高精度的猫叫声情感识别。

核心特性

  • 基于 Mel 频谱图的声学特征提取
  • 7 类 Panksepp 情绪维度分类
  • 数据增强提升泛化能力
  • 端到端深度学习流水线
  • 实时推理能力
  • 可视化注意力热图

数据集分布

SEEKING (探索)420 样本
85%
RAGE (愤怒)380 样本
76%
FEAR (恐惧)350 样本
70%
CARE (关怀)500 样本
100%

数据集包含来自多个来源的猫叫声录音,经过预处理和标注。数据增强技术(时间拉伸、音高偏移、背景噪声添加)被用于扩充训练集,提高模型的泛化能力。训练集/验证集/测试集按 7:2:1 比例划分。

处理流水线

1. 音频采集从多源采集猫叫声原始音频,统一采样率为 22050Hz
2. 预处理去除静音段、归一化、分段切片(2秒/段)
3. 特征提取计算 Mel 频谱图(128 Mel 频带,FFT窗口 2048)
4. 数据增强时间拉伸、音高偏移、背景噪声混合
5. 模型训练CNN 架构训练,Adam 优化器,早停策略
6. 评估与部署混淆矩阵分析,模型量化,ONNX 导出

模型架构

Input128×87×1
Conv2D32@3×3
MaxPool2×2
Conv2D64@3×3
MaxPool2×2
Conv2D128@3×3
GlobalAvgpooling
Dense256 units
Dropout0.5
Output7 classes

模型指标

准确率94.2%测试集
精确率 (Weighted)93.8%宏平均
召回率 (Weighted)94.1%宏平均
F1-Score94.0%加权平均

七情结分类

基于 Panksepp 情感神经科学理论的七情结分类体系

🔍
SEEKING
探索
😠
RAGE
愤怒
😨
FEAR
恐惧
❤️
LUST
欲望
🤗
CARE
关怀
😢
PANIC
悲伤
🎮
PLAY
玩耍