Julie Joyce发文列出了 20 种被广泛认可的免费数据源,其中信息涵盖天文地理、政法医经等,比较全面。不过数据源中的大部分数据集都采集的美国信息,也有少部分是关于其他国家或全球的,你尽可从中筛选自己需要的数据集。
Google Dataset Search
https://datasetsearch.research.google.com
它可以让你搜索到已经根据 schema.org 标准进行正确标记的可用数据集。你可以看到所有搜索结果,每个结果包括数据集名称、最近更新时间、数据集简介等。
Google Trends
https://trends.google.com/trends/explore
使用这个工具,你可以搜索关键字并查看有关它们的各种信息,包括按照时间的搜索热度、按照地区的搜索热度、相关主题、相关搜索等。你可以选择不同的选项,包括要查看的国家,将其缩小到各个类别,或将搜索范围限制在所有网站、图片、新闻、购物或 YouTube 上。
U.S. Census Bureau
你可以从这个数据集中获得与人口、经济和地理相关的信息,也可以按主题或搜索进行浏览。如果你需要统计内容,这会是一个很好用的工具。它们有一些很好的可视化效果,你也可以将其嵌入到内容中。
EU Open Data Portal
https://data.europa.eu/euodp/en/data/
该数据集中的可用数据包括地理、金融、统计学、选举结果、法案、犯罪、交通、健康、环境和科学研究等信息,这是一个既可搜索又可浏览的平台。
美国 Data.gov
https://www.data.gov/
作为美国政府开放数据的主页,该网站允许使用者访问联邦、州、地方和部落政府提供的各种主题信息。
英国 Data.gov
https://data.gov.uk/
与美国的 Data.gov 类似,该网站允许访问各种主题的数据。这些数据由中央政府、地方当局和公共机构提供。
Health Data
https://healthdata.gov/
该网站可搜索的主题包括医疗设备、环境卫生、药物滥用、精神健康等等。
The World Factbook
https://www.cia.gov/library/publications/the-world-factbook/
该数据集包含 267 个国家和地区的信息,每周更新一次有关全球的信息。你可以选择要查看的国家,然后点击你喜欢的任何主题(如经济或交通)。该网站可检索,它还有一个关于世界领导人和一个关于 CIA Maps 的专栏。
Altmetric
https://www.altmetric.com/top100/2018/
该数据集中的有些数据是需要付费的,但它们还提供每年最热的前 100 篇文章,最新的是 2018 年的数据,可以往前搜索到 2013 年的数据。他们还提供一些免费工具。
Open Corporates
https://opencorporates.com/
这是全球最大的公司开放数据集,可以让你访问超过 1 亿家公司的信息。你可以按公司或高级职员进行搜索,并在需要的时候限制你的搜索范围。
国家海洋和大气管理局
(National Center for Environmental Information)
https://www.ncdc.noaa.gov/data-access
这个数据集涵盖地球物理学、大气和海洋数据。他们目前是世界上最大的气候和天气信息提供商。他们还提供了旧工具的链接,这些工具目前可能在网站上不可使用,但可用于其他地方。
https://www.reddit.com/r/datasets/
虽然你需要注册,但它是免费的。你可以搜索数据集并查找提供信息和请求信息的人。总的来说,Reddit 也是一个寻找信息并了解行业趋势的好地方。
Kaggle 数据集
https://www.kaggle.com/datasets
它目前有将近 16,000 个数据集,你可以找到从运动队球员统计到洛杉矶停车任何范畴的数据。
NASA 的 Earth Data
https://earthdata.nasa.gov/?_fsi=BqJ6IiI5
它包含了美国宇航局的地球观测数据,其中包含如 NC 地表温度和碳通量等信息。
Pew Internet
https://www.pewresearch.org/internet/datasets/?_fsi=BqJ6IiI5
如果你需要的是社会学数据,这是一个很好的数据源。你还可以通过浏览找到一些有趣的文章。虽然需要注册才能查看和下载数据集,但它也是免费的。
疾病控制由于预防中心
(Centers for Disease Control and Prevention)
https://www.cdc.gov/datastatistics/index.html
该网站包括各种健康主题,可让你访问大量可浏览和可搜索的数据。甚至可以通过各种与主题相关的网站创建自己过滤的数据集。
美国劳工统计局
(Bureau of Labor Statistics)
你可以在这里找到有关美国劳动力市场活跃度、工作条件和价格变化的数据。
Five Thirty Eight
https://data.fivethirtyeight.com/
这个网站有关于政治、体育、科学、健康、经济和文化方面的数据。
Group Lens
https://grouplens.org/datasets/
它包含几个可用的数据集,这些数据集对特定的项目很有用。一些数据集已有十多年的历史。你可以在这里得到很多关于书籍和电影的信息。
GitHub 上的 BuzzFeed News
这个网站给你提供了来自 Buzzfeed 的数据。如果你想了解 2016 年至 2018 年期间的假新闻,那么这就是一个不错的选择。
猜你喜欢
数据仓库系统(含OLAP重点讲解)
R语言排名第8 | 2020 年 7 月编程语言排行榜
数据分析师统计学必知必会知识点汇总!
必备!25个非常优秀的可视化图形,有画法
降维咋搞?11 种经典降维算法