药物评论预测数据集(情感分析)

发布时间:2026/8/4 3:50:41
药物评论预测数据集(情感分析) 摘要药物评论预测数据集是一个大规模情感分析数据集包含超过 200,000 条用户评论覆盖 2,000 多种药物和不同健康状况具有 7 个属性特征。数据集使用 NLTK VADER 情感分析工具生成负面、中性、积极和综合评分通过概率阈值0.5/0.5进行二元分类积极/消极体验。研究采用多种监督学习模型朴素贝叶斯、决策树、LDA 等构建自动化评论分类系统帮助制药公司改进药物并支持决策。数据集简介数据集概述数据集包含 7 个属性特征涵盖药物信息、用户评论文本、健康状况、评分等维度为药物评论分析提供多角度信息。超过 2,000 种药物的覆盖范围使数据集具有广泛的药物类别代表性200,000 条观测记录提供了充足的训练样本。用户评论文本是核心特征包含丰富的情感表达、用药体验描述和药效反馈信息。通过 VADER 情感分析工具从原始文本中提取四个情感维度评分负面分数、中性分数、积极分数和综合分数compound score这些量化指标为后续的机器学习分类提供了结构化输入特征。该数据集支持药物评论情感分析、用户体验分类、药效反馈挖掘、制药决策支持以及自然语言处理研究等多个应用方向。研究目标是创建一个无缝系统能够使用最优准确率模型清洗、处理和分类数以万计的评论同时支持单条评论的实时预测。通过自动化情感分类制药公司可以快速识别药物的优势和问题领域、监测特定药物的用户满意度趋势、发现需要改进的药物特性并根据用户反馈优化药物配方或使用指南。数据集的大规模和多样性使其适用于深度学习模型如 LSTM、BERT、传统机器学习算法对比研究、特征工程优化以及领域适应性迁移学习实验为药物警戒、患者反馈管理和数据驱动的药物开发提供技术支撑。数据集来源该数据集包含超过 200,000 条用户药物评论观测记录覆盖 2,000 多种针对不同健康状况的药物具有 7 个属性特征和大量用户体验文本使用 NLTK VADER 情感分析工具生成负面、中性、积极和综合评分专为药物评论情感分类和制药决策支持研究而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-62文件大小47M原创声明本数据集为整理作品