垃圾邮件、正常邮件与钓鱼信息数据集

发布时间:2026/8/3 16:53:47
垃圾邮件、正常邮件与钓鱼信息数据集 垃圾邮件、正常邮件与钓鱼信息数据集是一个包含约 515,000 条文本消息的多类别 NLP 数据集分为正常消息Ham0、垃圾消息Spam1和钓鱼消息Phishing2三类。数据集已完成标准化预处理小写转换、去标点、去停用词、文本规范化整合自多个公开数据源并统一标签格式适用于垃圾邮件过滤、钓鱼检测和文本分类研究支持传统机器学习朴素贝叶斯、SVM、逻辑回归和深度学习模型LSTM、BERT。数据集简介数据集概述数据集采用简洁的二列结构text 列包含消息内容label 列标注消息类别0/1/2 编码。三个类别具有明确的语义区分正常消息Ham 指合法、有用的日常通信内容如个人对话、工作邮件或正常通知垃圾消息Spam 指未经请求的推广性或无关消息如商业广告、营销邮件或骚扰信息钓鱼消息Phishing 指欺诈性或诈骗性消息旨在窃取敏感信息、诱导点击恶意链接或进行金融欺诈。数据集的预处理流程确保了文本的一致性所有文本转换为小写以消除大小写差异移除标点符号减少噪声清除停用词如 the、is、and 等降低维度并突出关键词整体文本标准化提升特征提取质量。这种预处理后的数据格式特别适合 TF-IDF 向量化、词袋模型和词嵌入技术为下游分类任务提供了即用型数据资源。该数据集为网络安全、信息过滤和 NLP 研究领域提供多方面应用支持核心应用包括垃圾邮件检测系统开发、钓鱼攻击识别模型训练、电子邮件和短信自动分类、NLP 文本分类项目实践以及网络安全威胁分析研究。研究人员和开发者可以利用该数据集训练传统机器学习分类器朴素贝叶斯、逻辑回归、SVM实现高效的文本过滤开发深度学习模型LSTM、BERT、Transformer捕捉复杂的语义模式和上下文信息或构建集成学习系统结合多种算法优势提升检测准确率。数据集的三类别设计使其能够同时处理一般垃圾信息过滤和高风险钓鱼攻击检测为邮件服务提供商、即时通讯平台、企业安全系统和个人隐私保护工具提供了数据基础。通过支持多类别分类任务该数据集有助于开发更精细的消息过滤策略、降低误判率、提升用户体验并为理解垃圾消息和钓鱼攻击的语言特征、演化模式以及防御策略提供实证研究平台。数据集来源该数据集整合自多个公开数据源包含约 515,000 条文本消息经过统一的预处理流程小写转换、标点符号移除、停用词清理、文本标准化和标签格式标准化正常消息、垃圾消息、钓鱼消息三类编码为 0/1/2专为垃圾邮件过滤和钓鱼检测的机器学习与 NLP 研究项目而创建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-56文件大小64M原创声明本数据集为整理作品