《UCI数据集和源代码》
UCI数据集是一个常用的标准测试数据集,下载地址在
http://www.ics.uci.edu/~mlearn/MLRepository.html
我的主页上也有整理好的一些UCI数据集(arff格式):
http://lamda.nju.edu.cn/yuy/files/download/UCI_arff.zip
在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。如果你看的论文没有给出数据集的出处,请立即停止看这篇论文,并且停止看刊发这篇论文的期刊上的所有文章。因为可以断定这些文章质量很差。
关于源代码,网上有很多公开源码的算法包,例如最为著名的Weka,MLC++等。Weka还在不断的更新其算法,下载地址:
http://www.cs.waikato.ac.nz/ml/weka/
很多的机器学习的经典算法都在里面。而且公布源程序,易于修改。
如果作者没有公布源程序,可以到作者主页找找,也可以写信给作者要,一般论文开头都会有作者的email地址。写信的时候要注意要很有礼貌,否则作者,尤其是著名学者,很有可能不会理睬。如果算法简单,可以自己实现。
关于论文的下载,如果能够访问电子图书馆是最好的,很多学校都买了IEEE, Elsevier, Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:
http://www.cs.washington.edu/research/jair/home.html
http://www.jmlr.org/
如果能访问的免费期刊太少,可以到CiteSeer上搜索(http://citeseer.ist.psu.edu/ ),上面搜集了很多免费论文(但是要注意,论文的质量参差不齐),或者用Googlewww.google.com )搜索。
再嘱咐两点,要做研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有一定要看高质量的论文。
《数据挖掘的数据集资源》
大家做数据挖掘研究时,常常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:http://www.kdnuggets.com/datasets/
还有另外一个很好的资源网址为:http://kdd.ics.uci.edu/ ,里面包含的数据资源如下(按应用领域划分):
Direct Marketing
KDD CUP 1998 Data
GIS
Forest CoverType
Indexing
Corel Image Features
Pseudo Periodic Synthetic Time Series
Intrusion Detection
KDD CUP 1999 Data
Process Control
Synthetic Control Chart Time Series
Recommendation Systems
Entree Chicago Recommendation Data
Robots
Pioneer-1 Mobile Robot Data
Robot Execution Failures
Sign Language Recognition
Australian Sign Language Data
High-quality Australian Sign Language Data
Text Categorization
20 Newsgroups Data
Reuters-21578 Text Categorization Collection
NSF Research Awards Abstracts 199 0-2003
World Wide Web
Microsoft Anonymous Web Data
MSNBC Anonymous Web Data
Syskill Webert Web Data
转:http://blogger.org.cn/blog/more.asp?name=DMman&id=24043
1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b
2、几个实用的测试数据集下载的网站
http://www.cs.toronto.edu/~roweis/data.html
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.phys.uni.torun.pl/~duch/software.html
在下面的网址可以找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html
以下网址上有各种数据集:
http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类,还有一个数据集是可以用的,即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果
可能有一些不能访问,但是总有能访问的吧:
UCI收集的机器学习数据集
ftp://pami.sjtu.edu.cn/
http://www.ics.uci.edu/~mlearn//MLRepository.htm
statlib
http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm
http://lib.stat.cmu.edu/
样本数据库
http://kdd.ics.uci.edu/
http://www.ics.uci.edu/~mlearn/MLRepository.html
关于基金的数据挖掘的网站
http://www.gotofund.com/index.asp
http://lans.ece.utexas.edu/~strehl/
reuters数据集
http://www.research.att.com/~lewis/reuters21578.html
各种数据集:
http://kdd.ics.uci.edu/summary.data.type.html
http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html
http://lib.stat.cmu.edu/datasets/
http://dctc.sjtu.edu.cn/adaptive/datasets/
http://fimi.cs.helsinki.fi/data/
http://www.almaden.ibm.com/software/quest/Resources/index.shtml
http://miles.cnuce.cnr.it/~palmeri/datam/DCI/
进行文本分类&WEB
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
http://www.w3.org/TR/WD-logfile-960221.html
http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog
http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.web-caching.com/traces-logs.html
http://www-2.cs.cmu.edu/webkb
http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf
http://www.cs.cornell.edu/projects/kddcup/index.html
时间序列数据的网址
http://www.stat.wisc.edu/~reinsel/bjr-data/
apriori算法的测试数据
http://www.almaden.ibm.com/cs/quest/syndata.html
数据生成器的链接
http://www.cse.cuhk.edu.hk/~kdd/data_collection.html
http://www.almaden.ibm.com/cs/quest/syndata.html
关联:
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData
WEKA:
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
1。A jarfile containing 37 classification problems, originally obtained from the UCI repository
http://prdownloads.sourceforge.net/weka/datasets-UCI.jar
2。A jarfile containing 37 regression problems, obtained from various sources
http://prdownloads.sourceforge.net/weka/datasets-numeric.jar
3。A jarfile containing 30 regression datasets collected by Luis Torgo
http://prdownloads.sourceforge.net/weka/regression-datasets.jar
癌症基因:
http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi
金融数据:
http://lisp.vse.cz/pkdd99/Challenge/chall.htm
另一个人提供的
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.phys.uni.torun.pl/~duch/software.html
在下面的网址可以找到reuters数据集
http://www.research.att.com/~lewis/reuters21578.html
以下网址上有各种数据集:
http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类,还有一个数据集是可以用的,即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
Download the Financial Data (~17.5M zipped file, ~67M unzipped data)
Download the Medical Data (~2M zipped file, ~6M unzipped data)
http://lisp.vse.cz/pkdd99/Challenge/chall.htm
kdnuggets 相关链接数据集(借花献佛了):
http://www.kdnuggets.com/datasets/index.html
你也可以到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017
察看kdnuggets 数据集资源的详细介绍。
数据挖掘相关比赛以及数据集
2005 University of California data mining contest , predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005.
k-means聚类(使用数据集:iris)
12-29UCI数据集(数据挖掘)
11-14从0到1学好区块链开发,一年编程经验学完月薪可达40K+
立即申请试学,成为时代颠覆者
UCI数据集整理(附论文常用数据集)
2.7万
摘要:UCI数据集作为标准测试数据集经常出现在许多机器学习的论文中,为了更方便使用这些数据集有必要对其进行整理,这里整理了论文中经常出现的数据集,并详细介绍如何使用MATLAB将数据集文件整...来自: 桥上风景楼上的你
优化机器学习不平衡数据集的八大策略
2642
什么是不平衡数据不平衡对于分类问题来说是指数据集中样本的类别不平均。比如, 对于一个样本总数为100的二分类问题来说,80个样本被标为类别1,剩下的20个样本被标为类别2.这是一个不平衡的数据集,因为...来自: lime1991的专栏
常见聚类数据集人工数据和UCI数据都有
01-26一些用于聚类和分类问题的数据集
150
毕业设计时简单研究了聚类和分类问题,整理了一下用到的数据集,有需要的可以参考一下。。。 聚类数据集信息 序号 数据集 记录数 特征数 类别 简单分布 是否有ove...来自: 绳子的博客
聚类分析常用数据集
03-26聚类算法之K-means算法-UCI数据集上的java实现
3473
本文主要分析了K-means聚类算法的基本原理,时间复杂度以及优缺点,最后用UCI数据集进行了测试,包含java实现代码,适合初学者参考。...来自: 笑*容的博客
聚类分析、机器学习及数据挖掘中常用数据集
09-02Weka训练数据集.arff大合集
6712
Weka是机器学习中的一个非常好的开源工具,对于熟悉Java的同学们来说是一个非常好的选择。Weka几乎包含了所有常见机器学习算法的Java实现,Weka中支持的数据格式主要是arff,虽然weka官...来自: jiajia333666的博客
文章热词
相关热词
uci聚类测试数据集
下载
09-15
该文件有六百条数据,每100条是一类。可用于聚类的测试。... *详细原因: 取 消 提 交 uci聚类测试数据集 3积分 立即下载 ...
UCI数据集数据的分析 ——葡萄酒数据
1485
1、前言 葡萄酒是一种成分复杂的酒精饮料,不同产地、年份和品种的葡萄酒成分不同,这也是导致质量差异过大的重要因素。至今,质量评价主要还是依靠专家的感官。味道是最难理解的一种感官,因此用味蕾评价...来自: X_dmword的博客
UCI数据集
下载
09-19
是arff 格式的数据,应该非常有用,可以测试一些数据挖掘分类算法的准确度,对学习...常见聚类数据集人工数据和UCI数据都有 97 2018-01-26 chenguangchun1993 VIP...
如何使用UCI数据集
4865
UCI数据集是一个常用的机器学习标准测试数据集。 地址: http://www.ics.uci.edu/~mlearn 以Iris鸢尾花数据集为例: 1.Iris数据集在右边方框【Most...来自: 绳子的博客
UCI数据集使用
2.1万
UCI数据库目前共有187个数据集,其数目还在不断增加,UCI数据集是一个常用的标准测试数据集。 UCI数据可以使用Matlab的dlmread或textread读取,不过,需要先将不是数字的类别用...来自: 小倔驴
宝贵数据集——用于数据挖掘、机器学习、文本挖掘
2328
1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b2、几个实用的测试数据集下载的网站 http://www.cs.toronto.edu/~roweis/data...来自: XingLiu's Blog
开放数据集
5697
商业敏感数据虽然难以获取,但好在仍有相当多有用数据可公开访问。它们中的不少常用来作为特定机器学习问题的基准测试数据。常见的有以下几个: UCL机器学习知识库 包括近300个不同大小和类...来自: ForestCat的专栏
zz 数据挖掘, 机器学习的测试数据集 - 美国UCI数据集
974
UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集: h...来自: 精力极有限,人生极短暂
数据挖掘常用的心脏病数据(From UCI)
3001
http://archive.ics.uci.edu/ml/machine-learning-databases/statlog/heart/ 该数据经常作为数据挖掘的示例。 This databas...来自: wonder的地下室
UCI数据集与相关论文和源代码
1427
UCI 数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好...来自: mayanyun2013的专栏
用机器学习算法对UCI上的三个数据集做预测
02-07《UCI数据集和源代码》
1076
UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集(arf...来自: Mittens 的专栏
arff数据集全集
08-25python中使用k-means对鸢尾花数据集聚类
5695
代码和结果:import matplotlib.pyplot as plt import numpy as np from sklearn.cluster import KMeans from...来自: masbbx123的博客
聚类测试数据
08-15ML:教你聚类并构建学习模型处理数据(附数据集)
309
本文将根据41个描述性分类特征的维度,运用无监督主成分分析(PCA)和层次聚类方法对观测进行分组。将数据聚类可以更好地用简单的多元线性模型描述数据或者识别更适合其他模型的异常组。此方法被编写在pyth...来自: weixin_40581617的博客
数据挖掘聚类分析技术实验常用真实数据集
03-19UCI数据集和源代码
5703
UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集: h...来自: 学习亦游戏
UCI数据集数据的分析(补充)——葡萄酒数据
505
1、提出问题 在前面,我们已经学了影响红白葡萄酒质量的相关因素以及两种酒的物理化学性质的差异。那么我们该怎么运用物理化学性质来确定一种酒是红葡萄酒还是白葡萄酒呢?2、分析问题 根据前面的...来自: X_dmword的博客
对adult数据集建立朴素贝叶斯模型评估并可视化(awk+hive+java+mysql+echarts)
1609
总结下这段时间的收获 分为三部分 linux echarts 数据挖掘 最近做了个课设,要给adult数据集建立合适的分类器,并对分类器评估 分享一下成果,有好多问题完成后才知道,仅供和我一样的初学...来自: 呵少侠的博客
聚类算法实践(五)——真实Dataset测试
2927
在之前的文章里,讨论了一些聚类算法的基本思路,并针对人为构造的数据进行了测试。然而,真实的数据毕竟不同于人工数据。在对现实数据进行聚类的时候,有时候不知道哪些特征才是最关键的,因此多少会掺杂一些无关的...来自: Entropy
K-means聚类数据.rar
11-16二维聚类数据集
09-30常用聚类分析数据集
07-01adult数据集分析
02-15[035]Java实现SVM对乳腺癌检测数据分类分析
1679
背景简介:最近在做SVM分类的学习,查看网上大多相关内容都是SVM原理介绍、推导和用终端命令行使用svm-train,svm-predict。具体数据分析实现很少。通过查找资料发现了一个很好的开发库L...来自: friendpengyou的专栏
【Python数据挖掘课程】五.线性回归知识及预测糖尿病实例
1.3万
今天主要讲述的内容是关于一元线性回归的知识,Python实现,包括以下内容: 1.机器学习常用数据集介绍 2.什么是线性回顾 3.LinearRegre...来自: 杨秀璋的专栏
机器学习案例——鸢尾花数据集分析
1655
前几天把python基础知识过了一遍,拿了这个小例子作为练手项目,这个案例也有师兄的帮助,记录完,发现代码贴的很多,文章有点长,为了节省篇幅,有一些说明就去掉了,毕竟鸢尾花数据集比较经典,网上...来自: 刘小绪同学的博客
聚类
1.5万
4、聚类 聚类分析提供由个别数据对象到数据对象所指派到簇的抽象。此外,一些聚类技术使用簇原型(即代表簇中其他对象的数据对象)来刻画簇的特征。聚类分析是研究发现最具有代表性的簇原型的技术。回归和P...来自: rosenor1的博客
多视图聚类数据集mfeat
09-08四种主流聚类方法
3.4万
四种聚类方法之比较 2015-07-29 SOTON数据分析 聚类分析是一种重要的人类行为,早在孩提时代,一个人就通过不断改进下意识中的聚类模式来学会如何区分猫狗、动物植物。目前在许多领域都...来自: Alex_luodazhi的博客
【分享】联合聚类算法标准测试数据集
1533
该数据集为A. Lomet等人提供的,可作为联合聚类算法的标准测试数据集,可针对不同的聚类数目、规模、聚类任务难度等进行对比验证分析,可应用于协同过滤算法等的测试。 数据堂免费提供数据...来自: 数据堂-科研数据共享平台
聚类常用数据集
12-29常用UCI数据集
06-04机器学习UCI数据库
1.6万
http://archive.ics.uci.edu/ml/ 数据库是加州大学欧文分校(UniversityofCaliforniaIrvine)提出的用于机器学习的数据库,这个数据库目前共有...来自: loadstar_kun的专栏
UCI 机器学习数据集(分类)
7758
113 Data SetsUCI数据集NameData TypesDefault TaskAttribute Types# Instances# AttributesYear来自: BeachBOY的完美世界
用朴素贝叶斯对wine数据集分类
7766
该实验的数据集是MostPopular Data Sets(hits since 2007)中的wine数据集,这是是对在意大利同一地区生产的三种不同品种的酒,做大量分析所得出的数据。这些数据包括了三...来自: 图像处理与模式识别
UCI 数据集
1781
filename='.\iris\iris.data';%使用 , 分割符分割每列数据; ‘'headerlines’:表示忽略前N行,从N+1行开始读取数据集 [attrib1, attrib2, ...来自: dataningwei的博客
重叠聚类数据集
07-28聚类、分类所用数据集
09-06没有更多推荐了,返回首页