quange123456

各种数据集汇总——转载而来

【第一波】

目前系统整理了一些网上开放的免费科研数据集，以下是分类列表以及下载地址，供高校和科研机构免费下载和使用。

金融

美国劳工部统计局官方发布数据
上证A股日线数据，1999.12.09 至 2016.06.08，前复权，1095支股票
深证A股日线数据，1999.12.09 至 2016.06.08，前复权，1766支股票
深证创业板日线数据，1999.12.09 至 2016.06.08，前复权，510支股票
MT4平台外汇交易历史数据
Forex平台外汇交易历史数据
几组外汇交易逐笔（Ticks）数据
美国股票新闻数据【Kaggle数据】
美国医疗保险市场数据【Kaggle数据】
美国金融客户投诉数据【Kaggle数据】
Lending Club 网贷违约数据【Kaggle数据】
信用卡欺诈数据【Kaggle 数据】
某个金融产品实时交易数据【Kaggle数据】
美国股票数据XBRL【Kaggle数据】
纽约股票交易所数据【Kaggle数据】

交通

2013年纽约出租车行驶数据
Udacity自动驾驶数据
纽约 Uber 接客数据【Kaggle数据】
英国车祸数据（2005-2015）【Kaagle数据】
芝加哥汽车超速数据【Kaggle数据】

商业

Amazon 食品评论数据【Kaggle数据】
Amazon 无锁手机评论数据【Kaggle数据】
美国视频游戏销售和评价数据【Kaggle数据】
Kaggle 各项竞赛情况数据【Kaggle数据】

推荐系统

Netflix 电影评价数据
MovieLens 20m 电影推荐数据集
WikiLens
Jester
HetRec2011
Book Crossing
Large Movie Review

医疗健康

人识别物体时大脑核磁共振影像数据
人理解单词时大脑核磁共振影像数据
心脏病心房图像及标注数据
细胞病理识别
FIRE 视网膜眼底病变图像数据
食物营养成分数据【Kaggle数据】
EGG 大脑电波形状数据【Kaggle数据】

图像数据

综合图像

Visual Genome 图像数据
Visual7w 图像数据
COCO 图像数据
SUFR 图像数据
ILSVRC 2014 训练数据（ImageNet的一部分）
PASCAL Visual Object Classes 2012 图像数据
PASCAL Visual Object Classes 2011 图像数据
PASCAL Visual Object Classes 2010 图像数据
80 Million Tiny Image 图像数据【数据太大仅有介绍】
ImageNet【数据太大仅有介绍】

场景图像

Street Scences 图像数据
Places2 场景图像数据
UCF Google Street View 图像数据
SUN 场景图像数据
The Celebrity in Places 图像数据

Web标签图像

HARRISON 社交标签图像
NUS-WIDE 标签图像
Visual Synset 标签图像
Animals With Attributes 标签图像

人形轮廓图像

MPII Human Shape人体轮廓数据
Biwi Kinect Head Pose 头部姿势数据
上半身人像数据
INRIA Person 数据集

视觉文字识别图像

Street View House Number 门牌号图像数据
MNIST 手写数字识别图像数据
3D MNIST 数字识别图像数据【Kaggle数据】
MediaTeam Document 文档影印和内容数据

特定一类事物图像

著名的猫图像标注数据
Caltech-UCSD Birds200 鸟类图像数据
Stanford Car 汽车图像数据
Cars 汽车图像数据
MIT Cars 汽车图像数据
Stanford Cars 汽车图像数据
Food-101 美食图像数据
17_Category_Flower 图像数据
102_Category_Flower 图像数据
UCI Folio Leaf 图像数据
Labeled Fishes in the Wild 鱼类图像
美国 Yelp 点评网站酒店照片
CMU-Oxford Sculpture 塑像雕像图像
Oxford-IIIT Pet 宠物图像数据

材质纹理图像

CURET 纹理材质图像数据
ETHZ Synthesizability 纹理图像数据
KTH-TIPS 纹理材质图像数据
Describable Textures 纹理图像数据

物体分类图像

COIL-20 图像数据
COIL-100 图像数据
Caltech-101 图像数据
Caltech-256 图像数据
CIFAR-10 图像数据
CIFAR-100 图像数据
STL-10 图像数据
LabelMe_12_50k图像数据
NORB v1.0 图像数据
NEC Toy Animal 图像数据
iCubWorld 图像分类数据
Multi-class 图像分类数据
GRAZ 图像分类数据

人脸图像

IMDB-WIKI 500k+ 人脸图像、年龄性别数据
Labeled Faces in the Wild 人脸数据
Extended Yale Face Database B 人脸数据
Bao Face 人脸数据
DC-IGN 论文人脸数据
300 Face in Wild 图像数据
BioID Face 人脸数据
CMU Frontal Face Images
FDDB_Face Detection Data Set and Benchmark
NIST Mugshot Identification Database
Faces in the Wild 人脸数据
CelebA 名人人脸图像数据
VGG Face 人脸图像数据

姿势动作图像

HMDB_a large human motion database
Human Actions and Scenes Dataset

指纹识别

NIST FIGS 指纹识别数据

其它图像数据

Visual Question Answering 图像数据

视频数据

综合视频

DAVIS_Densely Annotated Video Segmentation 数据
YouTube-8M 视频数据集【数据太大仅有介绍】
YouTube 网站视频备份【数据太大仅有介绍】

人类动作视频

Microsoft Research Action 人类动作视频数据
UCF50 Action Recognition 动作识别数据
UCF101 Action Recognition 动作识别数据
UT-Interaction 人类动作视频数据
UCF iPhone 运动中传感器数据
UCF YouTube 人类动作视频数据
UCF Sport 人类动作视频数据
UCF-ARG 人类动作视频数据
HMDB 人类动作视频
HOLLYWOOD2 人类行为动作视频数据
Recognition of human actions 动作视频数据
Motion Capture 动作捕捉视频数据
SBU Kinect Interaction 肢体动作视频数据

行人检测视频

UCSD Pedestrian 行人视频数据
Caltech Pedestrian 行人视频数据
ETH 行人视频数据
INRIA 行人视频数据
TudBrussels 行人视频数据
Daimler 行人视频数据

密集人群视频

Crowd Counting 高密度人群图像
Crowd Segmentation 高密度人群视频数据
Tracking in High Density Crowds 高密度人群视频

其它视频

Fire Detection 视频数据

音频数据

综合音频

Google Audioset 音频数据【数据太大仅有介绍】

语音识别

Sinhala TTS 英语语音识别
TIMIT 美式英语语音识别数据
LibriSpeech ASR corpus 语音数据
Room Impulse Response and Noise 语音数据
ALFFA 非洲语音数据

自然语言处理

RCV1英语新闻数据
20news 英语新闻数据
First Quora Release Question Pairs
JRC Names各国语言专有实体名称
Multi-Domain Sentiment V2.0
LETOR 信息检索数据
Yale Youtube Vedio Text
斯坦福问答数据【Kaggle数据】
美国假新闻数据【Kaggle数据】
NIPS会议文章信息数据（1987-2016）【Kaggle数据】
2016年美国总统选举辩论数据【Kaggle数据】

社会数据

希拉里邮件门泄露邮件
波士顿 Airbnb 公开数据【Kaggle数据】
世界各国经济发展数据【Kaagle数据】
世界大学排名芝加哥犯罪数据（2001-2017）【Kaagle数据】
世界范围显著地震数据（1965-2016）【Kaagle数据】
美国婴儿姓名数据【Kaagle数据】
全世界鲨鱼袭击人类数据【Kaagle数据】
1908年以来空难数据【Kaagle数据】
2016年美国总统大选数据【Kaagle数据】
2013年美国社区统计数据【Kaagle数据】
欧洲足球运动员赛事表现数据【Kaagle数据】
美国环境污染数据【Kaagle数据】
美国H1-B签证申请数据【Kaggle数据】
IMDB五千部电影数据【Kaggle数据】
2015年航班延误和取消数据【Kaggle数据】
凶杀案报告数据【Kaggle数据】
人力资源分析数据【Kaggle数据】
某人基因序列数据【Kaggle数据】
美国费城犯罪数据【Kaggle数据】
安然公司邮件数据【Kaggle数据】
历史棒球数据【Kaggle数据】
美联航 Twitter 用户评论数据【Kaggle数据】
波士顿 Airbnb 公开数据【Kaggle数据】

处理后的科研和竞赛数据

NIPS 2003 属性选择竞赛数据http://dataju.cn/Dataju/web/datasetInstanceDetail/370
台湾大学林智仁教授处理为 LibSVM 格式的分类建模数据 http://dataju.cn/Dataju/web/datasetInstanceDetail/296
Large-scale 分类建模数据http://dataju.cn/Dataju/web/datasetInstanceDetail/297
几个UCI 中 large-scale 分类建模数据http://dataju.cn/Dataju/web/datasetInstanceDetail/298
Social Computing http://dataju.cn/Dataju/web/datasetInstanceDetail/299
Data Repository 社交网络数据http://dataju.cn/Dataju/web/datasetInstanceDetail/300
猫和狗分类识别竞赛数据【Kaggle竞赛】http://dataju.cn/Dataju/web/datasetInstanceDetail/318
DSTL 卫星图像识别竞赛数据【Kaggle竞赛】http://dataju.cn/Dataju/web/datasetInstanceDetail/328
根据手机应用软件使用行为预测用户性别年龄竞赛数据【Kaggle竞赛】 http://dataju.cn/Dataju/web/datasetInstanceDetail/332
人脸关键点标定竞赛数据【Kaggle竞赛】 http://dataju.cn/Dataju/web/datasetInstanceDetail/331
Kaggle竞赛数据合辑（部分竞赛数据）http://dataju.cn/Dataju/web/datasetInstanceDetail/368

【第二波】

ImageNet挑战赛中超越人类的计算机视觉系统
微软亚洲研究院视觉计算组基于深度卷积神经网络（CNN）的计算机视觉系统，在ImageNet 1000挑战中首次超越了人类进行对象识别分类的能力。他们的系统在ImageNet 2012分类数据集中的错误率已降低至4.94%。
这个数据集包含约120万张训练图像、5万张验证图像和10万张测试图像，分为1000个不同的类别。
该研究团队由微软亚洲研究院研究员孙剑、何恺明以及来自西安交通大学和中国科学技术大学的实习生张祥雨和任少卿组成。

百度网盘里有Imagenet数据下载(有140G以上)：链接：http://pan.baidu.com/s/1pJT8kLd 密码：12kx

======================================
公开的海量数据集 Public Research-Quality Datasets

海量数据（又称大数据）已经成为各大互联网企业面临的最大问题，如何处理海量数据，提供更好的解决方案，是目前相当热门的一个话题。类似MapReduce、 Hadoop等架构的普遍推广，大家都在构建自己的大数据处理，大数据分析平台。

相应之下，目前对于海量数据处理人才的需求也在不断增多，此类人才可谓炙手可热！越来越多的开发者把目光转移到海量数据的处理上。但是不是所有人都能真正接触到，或者有机会去处理海量数据的，所以就需要一些公开的海量数据集来研究。

在Quora上有人就问到，如何获取海量数据集。此问题得到了很多人的关注。具体可以看看回答，数据集的种类多种多样，有化学分析，基因遗传等等，从中你肯定能得到自己想要个数据集。
Where can I get large datasets open to the public?

首先说说几个收集数据集的网站：
1、Public Data Sets on Amazon Web Services (AWS)
http://aws.amazon.com/datasets
Amazon从2008年开始就为开发者提供几十TB的开发数据。

2、Yahoo! Webscope
http://webscope.sandbox.yahoo.com/index.php

3、Konect is a collection of network datasets
http://konect.uni-koblenz.de/

4、Stanford Large Network Dataset Collection
http://snap.stanford.edu/data/index.html

再就是说说几个跟互联网有关的数据集：
1、Dataset for "Statistics and Social Network of YouTube Videos"
http://netsg.cs.sfu.ca/youtubedata/

2、1998 World Cup Web Site Access Logs
http://ita.ee.lbl.gov/html/contrib/WorldCup.html
这个是1998年世界杯期间的数据集。从1998/04/26 到 1998/07/26 的92天中，发生了 1,352,804,107次请求。

3、Page view statistics for Wikimedia projects
http://dammit.lt/wikistats/

4、AOL Search Query Logs - RP
http://www.researchpipeline.com/mediawiki/index.php?title=AOL_Search_Query_Logs

5、livedoor gourmet
http://blog.livedoor.jp/techblog/archives/65836960.html

海量图像数据集：
1、ImageNet
http://www.image-net.org/
包含1400万的图像。

2、Tiny Images Dataset
http://horatio.cs.nyu.edu/mit/tiny/data/index.html
包含8000万的32x32图像。

3、 MirFlickr1M
http://press.liacs.nl/mirflickr/
Flickr中的100万的图像集。

4、 CoPhIR
http://cophir.isti.cnr.it/whatis.html
Flickr中的1亿600万的图像

5、SBU captioned photo dataset
http://dsl1.cewit.stonybrook.edu/~vicente/sbucaptions/
Flickr中的100万的图像集。

6、Large-Scale Image Annotation using Visual Synset(ICCV 2011)
http://cpl.cc.gatech.edu/projects/VisualSynset/
包含2亿图像

7、NUS-WIDE
http://lms.comp.nus.edu.sg/research/NUS-WIDE.htm
Flickr中的27万的图像集。

8、SUN dataset
http://people.csail.mit.edu/jxiao/SUN/
包含13万的图像

9、MSRA-MM
http://research.microsoft.com/en-us/projects/msrammdata/
包含100万的图像，23000视频

10、TRECVID
http://trecvid.nist.gov/

Stack Overflow Dump Files
7.3G stackoverflow.com-Posts.7z
573.1K stackoverflow.com-Tags.7z
153.0M stackoverflow.com-Users.7z
2.2G stackoverflow.com-Comments.7z

截止目前好像还没有国内的企业或者组织开放自己的数据集。希望也能有企业开发自己的数据集给研究人员使用，从而推动海量数据处理在国内的发展！

2014/07/07 雅虎发布超大Flickr数据集 1亿的图片+视频
http://yahoolabs.tumblr.com/post/89783581601/one-hundred-million-creative-commons-flickr-images-for

============================================
数据挖掘数据集下载资源

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

2、几个实用的测试数据集下载的网站
http://www.fs.fed.us/fire/fuelman/
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.phys.uni.torun.pl/~duch/software.html
在下面的网址可以找到reuters数据集：http://www.research.att.com/~lewis/reuters21578.html
该网址有各种数据集：http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类，还有一个数据集是可以用的，即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

3、UCI收集的机器学习数据集
ftp://pami.sjtu.edu.cn/
http://www.ics.uci.edu/~mlearn//MLRepository.htm

4、statlib
http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm
http://lib.stat.cmu.edu/

5、关于基金的数据挖掘的网站
http://www.gotofund.com/index.asp

http://lans.ece.utexas.edu/~strehl/

6、进行文本分类&WEB
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

http://www.w3.org/TR/WD-logfile-960221.html
http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog
http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.web-caching.com/traces-logs.html
http://www-2.cs.cmu.edu/webkb
http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf
http://www.cs.cornell.edu/projects/kddcup/index.html

7、时间序列数据的网址
http://www.stat.wisc.edu/~reinsel/bjr-data/

8、apriori算法的测试数据
http://www.almaden.ibm.com/cs/quest/syndata.html

9、数据生成器的链接
http://www.cse.cuhk.edu.hk/~kdd/data_collection.html
http://www.almaden.ibm.com/cs/quest/syndata.html
10、关联：
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

11、WEKA：
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
1。A jarfile containing 37 classification problems, originally obtained from the UCI repository
http://prdownloads.sourceforge.net/weka/datasets-UCI.jar
2。A jarfile containing 37 regression problems, obtained from various sources
http://prdownloads.sourceforge.net/weka/datasets-numeric.jar
3。A jarfile containing 30 regression datasets collected by Luis Torgo
http://prdownloads.sourceforge.net/weka/regression-datasets.jar

12、癌症基因：
http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

13、金融数据：
http://lisp.vse.cz/pkdd99/Challenge/chall.htm

14、一个很好的资源网址为：http://kdd.ics.uci.edu/，里面包含的数据资源按应用领域划分的。

============================================================================================

1、Public Data Sets on Amazon Web Services (AWS)
http://aws.amazon.com/datasets
Amazon从2008年开始就为开发者提供几十TB的开发数据。