☰
多平台多类型网络欺凌文本识别与分类数据集
2026/10/6 3:34:57 网站建设 项目流程

摘要:该数据集面向网络欺凌自动检测任务,汇集了来自Twitter、维基百科讨论页和YouTube等不同来源的社交媒体文本。

数据集概述

该数据集面向网络欺凌自动检测任务,汇集了来自Twitter、维基百科讨论页和YouTube等不同来源的社交媒体文本。样本按照是否包含欺凌行为进行标注,并涵盖仇恨言论、攻击性表达、侮辱、毒性内容、种族主义和性别歧视等多种网络不良行为,可为跨平台内容安全模型的训练和评估提供数据支持。

数据结构与关键特征

数据集由多个经过解析的CSV文件组成,包括攻击性、攻击行为、毒性、Twitter综合数据、Twitter种族主义、Twitter性别歧视、YouTube及Kaggle来源数据。各文件保存平台文本及其相应类别标签,既包含欺凌与非欺凌二分类信息,也反映不同类型的有害语言。数据具有来源平台多样、表达方式复杂、类别定义存在差异及文本噪声较多等特点,适合开展跨数据源联合建模与泛化能力研究。

应用价值与研究方向

该数据集可用于网络欺凌识别、仇恨言论检测、毒性评论过滤、社交平台内容审核及网络环境风险预警。研究方向包括传统机器学习与Transformer文本分类、多任务和多标签学习、跨平台领域适应、类别不平衡处理、隐晦攻击识别、对抗鲁棒性、模型可解释性及实时审核系统开发;还应关注数据偏差、群体公平性、语境误判和用户隐私保护,避免模型对特定身份群体或语言表达产生不合理歧视。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-588
文件大小:64M
原创声明:本数据集为整理作品

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询