1. 首页
  2. Blog
  3. 令爷收藏

50个最佳机器学习公共数据集

外国自媒体mlmemoirs根据github、福布斯、CMU官网等信息,整理了一张50个最佳机器学习公共数据集的榜单,为大家分享一下~

外国自媒体mlmemoirs根据github、福布斯、CMU官网等信息,整理了一张50个最佳机器学习公共数据集的榜单,为大家分享一下~

提前说下须知:

一、寻找数据集的意义

根据CMU的说法,寻找一个好用的数据集需要注意一下几点:

数据集不混乱,否则要花费大量时间来清理数据。

数据集不应包含太多行或列,否则会难以使用。

数据越干净越好,清理大型数据集可能非常耗时。

应该预设一个有趣的问题,而这个问题又可以用数据来回答。

二、去哪里找数据集

  • Kaggle:爱竞赛的盆友们应该很熟悉了,Kaggle上有各种有趣的数据集,拉面评级、篮球数据、甚至西雅图的宠物许可证。
    https://www.kaggle.com/
  • UCI机器学习库:最古老的数据集源之一,是寻找有趣数据集的第一站。虽然数据集是用户贡献的,因此具有不同的清洁度,但绝大多数都是干净的,可以直接从UCI机器学习库下载,无需注册。
    http://mlr.cs.umass.edu/ml/
  • VisualData:分好类的计算机视觉数据集,可以搜索~
    https://www.visualdata.io/

好了,下面就是那50个数据集了,由于后期加上了一些补充,所以总数已经超过了50。

三、机器学习数据集

图片

情绪分析

自然语言处理

UCI的Spambase:一个大型垃圾邮件数据集,对垃圾邮件过滤非常有用。
https://archive.ics.uci.edu/ml/datasets/Spambase

自动驾驶

临床

  • MIMIC-III:MIT计算生理学实验室的公开数据集,标记了约40000名重症监护患者的健康数据,包括人口统计学、生命体征、实验室测试、药物等维度。
    https://mimic.physionet.org/

四、一般数据集

除了机器学习专用的数据集,还有一些其他的一般数据集,可能很有趣~

公共政府数据集

金融与经济

备注:有一些网址需要科学上网才能打开。

暂时手头没有工具怎么办?先收藏呀!

原创文章,作者:曾确令,如若转载,请注明出处:https://www.zengqueling.com/gzjjqxxggsjj/

联系我们

15602395067

在线咨询:点击这里给我发消息

邮件:eden7@qq.com

工作时间:周一至周五,9:30-18:30,节假日休息

QR code