侧边栏壁纸
  • 累计撰写 66 篇文章
  • 累计创建 48 个标签
  • 累计收到 2 条评论

目 录CONTENT

文章目录

机器学习经典数据集35+

  1. Iris(鸢尾花数据集):模式识别领域最经典的入门级表格数据集,包含150个样本,3种鸢尾花各50个。每份样本包含花萼长度、花萼宽度、花瓣长度、花瓣宽度4个数值型特征,通常用于多分类任务(Setosa、Versicolour、Virginica)及聚类算法演示。

  2. 乳腺癌数据集(威斯康星州诊断性乳腺癌):经典的医学二分类数据集,包含569个恶性/良性细胞样本,每个样本由30个从细胞核图像中提取的实数值特征构成(如半径、纹理、周长等)。常用于逻辑回归、支持向量机等分类器的性能测试。

  3. MNIST(手写数字数据集):计算机视觉领域的“Hello World”,包含70000张28×28像素的灰度图像,涵盖0-9共10个数字类别(训练集60000张,测试集10000张)。该数据集规模适中,是测试神经网络和深度学习基础架构的标准基准。

  4. Bike Sharing Dataset(自行车共享数据集):基于美国首都华盛顿特区自行车租赁系统的真实时序数据,包含按小时和按日统计的租赁数量。特征涵盖季节、天气、温度、湿度、节假日等,常用于回归预测(预测租赁量)及时间序列分析。

  5. Penguins(企鹅数据集):由Palmer Station科考站收集的南极企鹅观测数据,包含3种企鹅(阿德利、巴布亚、帽带)共344个样本。特征包括喙长、喙深、鳍状肢长度和体重,常作为鸢尾花数据集的现代替代品,用于多分类和可视化教学。

  6. Wine(葡萄酒数据集):UCI经典化学分析数据集,包含意大利同一产区3个不同品种葡萄酒的178个样本,通过13种化学成分(如酒精、苹果酸、灰分、黄酮类等)进行表征。常被用于多分类、特征选择及聚类分析。

  7. VGG-Face2 数据集(人脸图像数据集):大规模人脸识别基准数据集,包含约9000余位名人的超过300万张面部图像,每张图像在姿态、光照和表情上具有高度多样性。该数据集基于深度卷积神经网络(如VGGFace)设计,广泛应用于人脸验证、识别与属性分析。

  8. 波士顿住房数据集(BostonHousing):经典回归分析数据集,包含美国波士顿地区506个街区的房屋价格中位数(目标变量),特征涵盖犯罪率、房产税、师生比、房间数等13个社会经济指标。(注:该数据集因存在伦理问题已在部分库中弃用,但仍广泛应用于回归教学。)

  9. MovieLens 数据集:推荐系统领域最常用的电影评分数据集,包含用户对电影的评分记录(如100K、1M、10M等不同规模版本),附带电影元数据(类型、年份)及用户属性(年龄、职业)。主要应用于协同过滤、矩阵分解及个性化推荐算法评估。

  10. aclImdb 数据集(大型电影评论数据集):情感分析领域的标准文本数据集,包含50000条来自IMDb的电影评论(训练集与测试集各25000条),正负标签分布均衡。每条评论为英文长文本,常用于词向量、循环神经网络及Transformer模型的二分类情感判别。

  11. 糖尿病数据集(diabetes):通常指sklearn内置的糖尿病进展数据集,包含442个糖尿病患者的10项生理指标(年龄、性别、体质指数、血压及6项血清测量值),目标变量为一年后疾病进展的量化数值,适用于回归任务;广义上也可指皮马印第安人糖尿病二分类数据集。

  12. cal_housing(加利福尼亚房价数据集):基于1990年美国加州人口普查数据构建的回归数据集,包含20640个街区样本,特征包括街区中位数收入、房龄、平均房间数、平均卧室数、人口、纬度和经度等8个属性,目标为房价中位数,常用于地理空间回归与机器学习入门实践。

  13. 20 Newsgroups(20类新闻文本数据集):经典的NLP多分类文本数据集,收集了约20000篇新闻组文档,均匀分布于20个不同主题(如计算机、宗教、政治、体育等)。主要用于文本分类、主题建模和文档聚类,是评估传统TF-IDF与词嵌入方法的基准。

  14. UCI 经典数据集:泛指加州大学欧文分校机器学习存储库(UCI Machine Learning Repository)中收录的各类经典表格数据合集。该仓库收录了数百个不同领域(生物、物理、金融等)的真实数据集,是机器学习领域算法评测的黄金标准来源。

  15. 毒蘑菇数据集(mushroom):包含8124个假想蘑菇样本的二分类数据集,类别为可食用或有毒。特征包括22个分类属性(如菌盖形状、菌褶颜色、气味、栖息地等),其中“气味”是强区分特征,常用于决策树、随机森林等分类器的规则提取演示。

  16. 海伦约会数据集(约会网站配对数据):源自《Machine Learning in Action》书籍的实战数据,包含1000个约会对象样本。特征为“每年获得的飞行常客里程数”、“玩视频游戏所耗时间百分比”和“每周消费的冰淇淋公升数”,标签为海伦对约会对象的喜好程度(不喜、一般、非常喜欢),常用于KNN分类。

  17. spambase_csv.csv(垃圾邮件数据集):UCI的经典二分类邮件过滤数据集,包含4601封邮件,其中约39%为垃圾邮件。特征为57个连续实数值,统计了特定单词和字符(如“免费”、“!”)在邮件中的出现频率,是朴素贝叶斯分类器的经典应用场景。

  18. Kaggle猫狗大战(Dogs vs. Cats):Kaggle平台著名的计算机视觉入门挑战赛数据集,包含25000张猫和狗的图像(训练集各12500张)。该数据集用于训练卷积神经网络以区分猫和狗,是学习图像预处理、数据增强和迁移学习的理想起点。

  19. Fashion-MNIST 数据集:由Zalando公司提供的服装图像分类数据集,作为原始MNIST的直接替代品。包含70000张28×28的灰度图像,覆盖T恤、牛仔裤、套头衫、鞋子等10类时尚商品,难度高于MNIST,更能体现现代深度学习算法的实际性能。

  20. 吴恩达机器学习相关数据集:源自Coursera著名课程《Machine Learning》配套编程练习的特定数据,涵盖多个小型经典场景,例如ex1的人口与利润单变量回归、ex2的考研录取逻辑回归、ex3的手写数字多分类及ex7的K-means与PCA数据,非常适合系统性理解算法底层原理。

  21. CIFAR-10 数据集:广泛使用的彩色图像分类数据集,包含60000张32×32的RGB图像,均匀分布于10个互斥类别(飞机、汽车、鸟、猫、鹿、狗、蛙、马、船、卡车)。相比MNIST,其图像分辨率较低且类别内变化较大,是测试轻量级CNN模型的典型基准。

  22. HIGGS 数据集:粒子物理学领域的大型二分类数据集,由模拟高能物理实验产生,包含1100万个样本和28个特征。其中前21个特征为运动学属性,后7个为派生特征,目标是从背景噪声中识别希格斯玻色子信号,常用于测试机器学习模型在大规模数据上的处理能力。

  23. machinelearninginaction(机器学习实战配套数据):随畅销书《Machine Learning in Action》一同发布的实战代码依赖数据,涵盖了书中各章节的演示文件,例如用于分类的约会数据、用于回归的钓鱼数据以及用于降维的半导体数据等,便于读者边学边练。

  24. MS-COCO(微软上下文常见对象数据集):计算机视觉领域最具影响力的多任务大型数据集之一,包含超过33万张图片,对80个常见物体类别进行了精确的实例级分割标注和边界框标注,并附有自然语言描述字幕。广泛用于目标检测、语义分割、关键点检测及图像描述生成。

  25. Adult 数据集(美国人口普查收入数据集):经典的二分类表格数据集,包含48842条美国居民记录,特征包括年龄、工作性质、教育程度、职业、性别、种族、每周工作时长等14个属性。目标为预测年收入是否超过5万美元,常用于逻辑回归、决策树及公平性/偏见分析。

  26. ImageNet(大规模视觉识别挑战赛数据集):计算机视觉发展史上的里程碑数据集,按照WordNet层次结构组织,包含超过1400万张高分辨率标注图像,覆盖超过20000个类别。其子集(ILSVRC-2012)包含1000类、120万张训练图像,是深度卷积神经网络(如AlexNet、ResNet)的试金石。

  27. 水下声源定位-深海垂直阵-数据集:面向水声信号处理与海洋工程的专业数据集,通常由深海布放的垂直水听器阵列采集,记录不同距离和深度的水下声源(如船只、海洋生物或人工信号)传播数据。该数据主要用于波束形成、匹配场定位和声源测距等信号处理算法的研究。

  28. 电离层数据集(Ionosphere):基于加拿大鹅湾雷达系统回波数据的二分类数据集,包含351个样本,每个样本有34个连续型特征(描述雷达脉冲信号的相位和功率信息),标签为“好”(结构良好)或“差”(结构异常)。常用于神经网络与特征选择算法的验证。

  29. Amazon Alexa Reviews(亚马逊Alexa评论数据集):电子商务与智能语音助手领域的文本情感分析数据集,包含约3000条针对亚马逊Alexa产品的用户评论及对应的1-5星评分。该数据集可用于多分类情感分析、方面级意见挖掘及文本关键词提取。

  30. YouTube-8M 数据集:大规模多标签视频分类数据集,包含约800万个YouTube视频URL及其对应的机器生成标签,覆盖4716个分类实体(如“吉他”、“汽车”、“猫”)。该数据以视频级别的音频/视觉特征向量形式提供(而非原始视频),用于多标签分类、视频理解及大规模分布式训练。

  31. 垃圾短信分类器数据集:典型的NLP二分类短文本数据集,通常包含约5574条英文手机短信(Ham为非垃圾短信,Spam为垃圾短信)。特征为短信内容的词频或字符特征,非常适合用于演示朴素贝叶斯、支持向量机等算法在文本过滤中的应用。

  32. Sentiment140 dataset with 1.6 million tweets(Twitter情绪分析数据集):大规模社交媒体情感分析数据集,包含160万条经过处理的推文。原始数据利用表情符号(如“:) ”和“:(”)作为远程监督的标签(积极/消极),已去除超链接、用户名等噪声。该数据体量庞大,适用于深度学习、词嵌入及分布式情感分类研究。

  33. Wheat Seeds Dataset.txt(小麦种子数据集):UCI中的小型农业表格数据集,包含来自3个不同小麦品种的210粒种子样本。每粒种子通过X射线检测提取出7个几何形态特征(如面积、周长、紧密度、长度、宽度、不对称系数和核槽长度),常用于多分类、聚类及小样本学习。

  34. RMB_data(纸币验证数据集):面向金融防伪领域的分类数据集,通常包含对人民币(或其他纸币)真伪进行判别的样本。特征可能来源于纸币的尺寸、荧光反应、磁性或数字图像纹理等属性,目标为二分类(真钞/假钞),是模式识别在金融安全中的典型应用。

  35. LabelMe 数据集:由MIT计算机视觉实验室创建的大型开源图像注释数据集,包含数十万张自然场景图片,并提供了丰富的多边形边框标注、对象分割掩码和标签信息。它比PASCAL VOC更灵活多样,广泛用于语义分割、场景理解及弱监督学习算法的数据支撑。

0

评论区