鸟类物种音频频谱图数据集(CUB-200 对齐版)包含 9,270 张频谱图图像,覆盖 200 个北美鸟类物种(199 个有数据),与 CUB-200-2011 图像基准对齐,采用相同的类别 ID 和物种名称。音频录音来自 Xeno-canto 和 eBird 开源资料库。数据集适用于多模态鸟类分类、基于 ImageNet 预训练模型的迁移学习以及音视频特征融合研究。
数据集简介
数据集概述
数据集按照 CUB-200-2011 的命名规范组织,文件夹格式为 {class_id:03d}.{Species_Name}(类别 ID 范围 1-200),每个物种文件夹包含该物种的所有频谱图图像。频谱图生成遵循标准化流程:音频重采样至 22,050 Hz 单声道,静音移除(丢弃峰值振幅低于全局最大值 1/4 的帧),信号分割为 10 秒无重叠窗口(最后一个窗口不足 10 秒时零填充),使用汉宁窗进行短时傅里叶变换(窗口大小 512,50% 重叠),频率掩蔽保留 100 Hz – 16,000 Hz 范围,对数功率转换,最终渲染为 224×224 像素 RGB PNG 图像(使用 viridis 色彩映射)。超过 10 秒的录音生成多个分段图像(命名为 _seg0、_seg1 等)。数据集包含 metadata.csv(每张频谱图的文件路径、类别 ID、物种名、录音 ID、分段编号)和完整的频谱图生成脚本(audio_to_spectrogram.py),确保数据可复现性。
该数据集为多个鸟类学和机器学习研究方向提供支持,核心应用包括纯音频鸟类物种分类(将频谱图作为图像输入)、与 CUB-200-2011 图像数据集配对的多模态学习研究、基于 ImageNet 预训练 CNN 的迁移学习实验以及音视频特征融合框架开发。研究人员可以训练深度学习模型从声学特征识别鸟类物种,开发跨域深度特征组合方法整合视觉和听觉信息提升分类准确率,或探索自监督学习和对比学习技术在多模态生物声学数据中的应用。数据集的统计特征显示物种数据分布不均(192 个物种数据充足,7 个物种数据量少于 10 张,1 个物种完全缺失),为研究长尾分布下的分类算法、少样本学习和数据增强技术提供了真实场景。通过提供与经典视觉基准对齐的音频频谱图数据,该数据集推动了多模态生物多样性监测、自动化物种识别系统、生态声学研究以及野外鸟类调查智能化工具的发展。
数据集来源
该数据集从 Xeno-canto 和 eBird 开源鸟类声音资料库收集音频录音,覆盖 200 个北美鸟类物种(与 CUB-200-2011 图像数据集对齐),通过标准化音频处理流程(22,050 Hz 重采样、静音移除、10 秒分段、短时傅里叶变换、频率掩蔽、对数功率转换)生成 9,270 张 224×224 像素 RGB 频谱图图像,专为多模态鸟类物种分类研究而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-57
文件大小:827M
原创声明:本数据集为整理作品