转:UCI数据集和源代码&数据挖掘的数据集资源

《UCI数据集和源代码》

UCI数据集是一个常用的标准测试数据集,下载地址在

http://www.ics.uci.edu/~mlearn/MLRepository.html

我的主页上也有整理好的一些UCI数据集(arff格式):

http://lamda.nju.edu.cn/yuy/files/download/UCI_arff.zip

在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。如果你看的论文没有给出数据集的出处,请立即停止看这篇论文,并且停止看刊发这篇论文的期刊上的所有文章。因为可以断定这些文章质量很差。

关于源代码,网上有很多公开源码的算法包,例如最为著名的Weka,MLC++等。Weka还在不断的更新其算法,下载地址:

http://www.cs.waikato.ac.nz/ml/weka/

很多的机器学习的经典算法都在里面。而且公布源程序,易于修改。

如果作者没有公布源程序,可以到作者主页找找,也可以写信给作者要,一般论文开头都会有作者的email地址。写信的时候要注意要很有礼貌,否则作者,尤其是著名学者,很有可能不会理睬。如果算法简单,可以自己实现。

关于论文的下载,如果能够访问电子图书馆是最好的,很多学校都买了IEEE, Elsevier, Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:

http://www.cs.washington.edu/research/jair/home.html

http://www.jmlr.org/

如果能访问的免费期刊太少,可以到CiteSeer上搜索(http://citeseer.ist.psu.edu/ ),上面搜集了很多免费论文(但是要注意,论文的质量参差不齐),或者用Googlewww.google.com )搜索。

再嘱咐两点,要做研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有一定要看高质量的论文。

《数据挖掘的数据集资源》

大家做数据挖掘研究时,常常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:http://www.kdnuggets.com/datasets/

还有另外一个很好的资源网址为:http://kdd.ics.uci.edu/ ,里面包含的数据资源如下(按应用领域划分):

Direct Marketing

  KDD CUP 1998 Data

GIS

  Forest CoverType

Indexing

  Corel Image Features

  Pseudo Periodic Synthetic Time Series

Intrusion Detection

  KDD CUP 1999 Data

Process Control

  Synthetic Control Chart Time Series

Recommendation Systems

  Entree Chicago Recommendation Data

Robots

  Pioneer-1 Mobile Robot Data

  Robot Execution Failures

Sign Language Recognition

  Australian Sign Language Data

  High-quality Australian Sign Language Data

Text Categorization

  20 Newsgroups Data

  Reuters-21578 Text Categorization Collection

  NSF Research Awards Abstracts 199 0-2003

World Wide Web

  Microsoft Anonymous Web Data

  MSNBC Anonymous Web Data

  Syskill Webert Web Data

 转:http://blogger.org.cn/blog/more.asp?name=DMman&id=24043

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

2、几个实用的测试数据集下载的网站

http://www.cs.toronto.edu/~roweis/data.html

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果

可能有一些不能访问,但是总有能访问的吧:

UCI收集的机器学习数据集

ftp://pami.sjtu.edu.cn/

http://www.ics.uci.edu/~mlearn//MLRepository.htm

statlib

http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm

http://lib.stat.cmu.edu/

样本数据库

http://kdd.ics.uci.edu/

http://www.ics.uci.edu/~mlearn/MLRepository.html

关于基金的数据挖掘的网站

http://www.gotofund.com/index.asp

http://lans.ece.utexas.edu/~strehl/

reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html

http://lib.stat.cmu.edu/datasets/

http://dctc.sjtu.edu.cn/adaptive/datasets/

http://fimi.cs.helsinki.fi/data/

http://www.almaden.ibm.com/software/quest/Resources/index.shtml

http://miles.cnuce.cnr.it/~palmeri/datam/DCI/

进行文本分类&WEB

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

http://www.w3.org/TR/WD-logfile-960221.html

http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog

http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.web-caching.com/traces-logs.html

http://www-2.cs.cmu.edu/webkb

http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf

http://www.cs.cornell.edu/projects/kddcup/index.html

时间序列数据的网址

http://www.stat.wisc.edu/~reinsel/bjr-data/

apriori算法的测试数据

http://www.almaden.ibm.com/cs/quest/syndata.html

数据生成器的链接

http://www.cse.cuhk.edu.hk/~kdd/data_collection.html

http://www.almaden.ibm.com/cs/quest/syndata.html

关联:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

WEKA:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

1。A jarfile containing 37 classification problems, originally obtained from the UCI repository

http://prdownloads.sourceforge.net/weka/datasets-UCI.jar

2。A jarfile containing 37 regression problems, obtained from various sources

http://prdownloads.sourceforge.net/weka/datasets-numeric.jar

3。A jarfile containing 30 regression datasets collected by Luis Torgo

http://prdownloads.sourceforge.net/weka/regression-datasets.jar

癌症基因:

http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

金融数据:

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

 

另一个人提供的

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

Download the Financial Data (~17.5M zipped file, ~67M unzipped data)

Download the Medical Data (~2M zipped file, ~6M unzipped data)

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

kdnuggets 相关链接数据集(借花献佛了):

http://www.kdnuggets.com/datasets/index.html

你也可以到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017

察看kdnuggets 数据集资源的详细介绍。

数据挖掘相关比赛以及数据集

2005 University of California data mining contest , predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005.

ILP 2005 Challenge , on the prediction of functional classes of genes.  KDD Cup 2005 , on classifying internet user search queries, deadline July 8.  Data Mining Cup 2005 (Chemnitz, Germany) , for students; topic: How data mining can ascertain the risk of loss of payments and reduce this risk.  KDD Cup 2004 , focuses on data-mining for a several performance criteria using datasets from bioinformatics and quantum physics.  InfoVis 2004 Contest , The History of InfoVis.  DATA MINING CUP 2004 (Chemnitz, Germany) , for students.  InfoVis 2003 Contest: Visualization and Pair Wise Comparison of Trees , results announced Sep 5, 2003.  KDD Cup 2003 , focuses on problems motivated by network mining and the analysis of usage logs.  DATA MINING CUP 2003 (Chemnitz, Germany) . The task is to identify spam emails before they reach the user′s mailbox.  KDD Cup 2002 , focus on data mining in molecular biology.  Student Data Mining Cup (2002) , Chemnitz University and Prudential Systems.
 
下载 

k-means聚类(使用数据集:iris)

12-29
使用java语言在数据集iris上实现k-means聚类
下载 

UCI数据集(数据挖掘)

11-14
很全的uci数据集,格式为arff,希望有用

从0到1学好区块链开发,一年编程经验学完月薪可达40K+

立即申请试学,成为时代颠覆者

UCI数据集整理(附论文常用数据集)

 2.7万

摘要:UCI数据集作为标准测试数据集经常出现在许多机器学习的论文中,为了更方便使用这些数据集有必要对其进行整理,这里整理了论文中经常出现的数据集,并详细介绍如何使用MATLAB将数据集文件整...来自: 桥上风景楼上的你

优化机器学习不平衡数据集的八大策略

 2642

什么是不平衡数据不平衡对于分类问题来说是指数据集中样本的类别不平均。比如, 对于一个样本总数为100的二分类问题来说,80个样本被标为类别1,剩下的20个样本被标为类别2.这是一个不平衡的数据集,因为...来自: lime1991的专栏

下载 

常见聚类数据集人工数据和UCI数据都有

01-26
这里面是机器学习里面聚类所需的数据集,分为人工的二维数据集,如月牙形,双螺旋型等,和UCI真实数据集,是我搜集好久才弄出来的,有一些二维数据集是自己生成的,提供给大家做算法实验。

一些用于聚类和分类问题的数据集

 150

毕业设计时简单研究了聚类和分类问题,整理了一下用到的数据集,有需要的可以参考一下。。。 聚类数据集信息 序号 数据集 记录数 特征数 类别 简单分布 是否有ove...来自: 绳子的博客

下载 

聚类分析常用数据集

03-26
聚类分析常用的人工数据集,包括:UCI:wine、Iris、yeast,还有4k2_far、leuk72_3k等数据集。它们在聚类分析、数据挖掘、机器学习、模式识别领域经常用到。

聚类算法之K-means算法-UCI数据集上的java实现

 3473

本文主要分析了K-means聚类算法的基本原理,时间复杂度以及优缺点,最后用UCI数据集进行了测试,包含java实现代码,适合初学者参考。...来自: 笑*容的博客

下载 

聚类分析、机器学习及数据挖掘中常用数据集

09-02
在聚类分析、机器学习、数据挖掘中常用到的数据集,包括:UCI的数据集wine,yeast,iris等,还有USPS数据集,4k2_far,leuk72_3k数据集等。

Weka训练数据集.arff大合集

 6712

Weka是机器学习中的一个非常好的开源工具,对于熟悉Java的同学们来说是一个非常好的选择。Weka几乎包含了所有常见机器学习算法的Java实现,Weka中支持的数据格式主要是arff,虽然weka官...来自: jiajia333666的博客

文章热词
数据挖掘模型是什么 数据挖掘算法大全 excel 实现数据挖掘 数据挖掘数据缺失 数据挖掘的功能分类
相关热词
uci数据  uci端口  uci软件包  uci打不开  uci使用说明

博主推荐

 换一批
wonder4
wonder4

关注 639篇文章

Eastmount
Eastmount

关注 310篇文章

fengbingchun
fengbingchun

关注 729篇文章

uci聚类测试数据集

下载

09-15

该文件有六百条数据,每100条是一类。可用于聚类的测试。... *详细原因: 取  消 提  交 uci聚类测试数据集 3积分 立即下载 ...

UCI数据集数据的分析 ——葡萄酒数据

 1485

1、前言     葡萄酒是一种成分复杂的酒精饮料,不同产地、年份和品种的葡萄酒成分不同,这也是导致质量差异过大的重要因素。至今,质量评价主要还是依靠专家的感官。味道是最难理解的一种感官,因此用味蕾评价...来自: X_dmword的博客

UCI数据集

下载

09-19

是arff 格式的数据,应该非常有用,可以测试一些数据挖掘分类算法的准确度,对学习...常见聚类数据集人工数据和UCI数据都有 97 2018-01-26 chenguangchun1993 VIP...

如何使用UCI数据集

 4865

UCI数据集是一个常用的机器学习标准测试数据集。 地址: http://www.ics.uci.edu/~mlearn 以Iris鸢尾花数据集为例: 1.Iris数据集在右边方框【Most...来自: 绳子的博客

UCI数据集使用

 2.1万

UCI数据库目前共有187个数据集,其数目还在不断增加,UCI数据集是一个常用的标准测试数据集。 UCI数据可以使用Matlab的dlmread或textread读取,不过,需要先将不是数字的类别用...来自: 小倔驴

宝贵数据集——用于数据挖掘、机器学习、文本挖掘

 2328

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b2、几个实用的测试数据集下载的网站 http://www.cs.toronto.edu/~roweis/data...来自: XingLiu's Blog

开放数据集

 5697

商业敏感数据虽然难以获取,但好在仍有相当多有用数据可公开访问。它们中的不少常用来作为特定机器学习问题的基准测试数据。常见的有以下几个: UCL机器学习知识库 包括近300个不同大小和类...来自: ForestCat的专栏

zz 数据挖掘, 机器学习的测试数据集 - 美国UCI数据集

 974

UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集: h...来自: 精力极有限,人生极短暂

数据挖掘常用的心脏病数据(From UCI)

 3001

http://archive.ics.uci.edu/ml/machine-learning-databases/statlog/heart/ 该数据经常作为数据挖掘的示例。 This databas...来自: wonder的地下室

UCI数据集与相关论文和源代码

 1427

UCI 数据集是一个常用的标准测试数据集,下载地址在   http://www.ics.uci.edu/~mlearn/MLRepository.html    我的主页上也有整理好...来自: mayanyun2013的专栏

下载 

用机器学习算法对UCI上的三个数据集做预测

02-07
1. 在UC Irvine Machine Learning数据集上选择三个数据 2. 编写一种机器学习算法预测结果,并使用十次、十折交叉验证 3. 撰写报告,包含对数据集、算法、结果的描述以及源代码

《UCI数据集和源代码》

 1076

UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集(arf...来自: Mittens 的专栏

下载 

arff数据集全集

08-25
目录列表: 2dplanes.arff abalone.arff ailerons.arff Amazon_initial_50_30_10000.arff anneal.arff anneal.OR

python中使用k-means对鸢尾花数据集聚类

 5695

代码和结果:import matplotlib.pyplot as plt import numpy as np from sklearn.cluster import KMeans from...来自: masbbx123的博客

下载 

聚类测试数据

08-15
two_cluster、three_cluster、five_cluster为不同簇数的点集,适用于Kmeans聚类 spiral、Twomoons、ThreeCircles分别为螺旋分布、月牙分布、

ML:教你聚类并构建学习模型处理数据(附数据集)

 309

本文将根据41个描述性分类特征的维度,运用无监督主成分分析(PCA)和层次聚类方法对观测进行分组。将数据聚类可以更好地用简单的多元线性模型描述数据或者识别更适合其他模型的异常组。此方法被编写在pyth...来自: weixin_40581617的博客

下载 

数据挖掘聚类分析技术实验常用真实数据集

03-19
全部为txt文档数据,数据挖掘聚类分析技术,算法实验过程中,经常用到的经典UCI、UPSP等真实数据集,常用于算法的实验验证。文档中注有相应的数据量、属性等信息,可直接进行使用。

UCI数据集和源代码

 5703

UCI数据集是一个常用的标准测试数据集,下载地址在 http://www.ics.uci.edu/~mlearn/MLRepository.html 我的主页上也有整理好的一些UCI数据集: h...来自: 学习亦游戏

UCI数据集数据的分析(补充)——葡萄酒数据

 505

1、提出问题     在前面,我们已经学了影响红白葡萄酒质量的相关因素以及两种酒的物理化学性质的差异。那么我们该怎么运用物理化学性质来确定一种酒是红葡萄酒还是白葡萄酒呢?2、分析问题    根据前面的...来自: X_dmword的博客

对adult数据集建立朴素贝叶斯模型评估并可视化(awk+hive+java+mysql+echarts)

 1609

总结下这段时间的收获 分为三部分 linux echarts 数据挖掘 最近做了个课设,要给adult数据集建立合适的分类器,并对分类器评估 分享一下成果,有好多问题完成后才知道,仅供和我一样的初学...来自: 呵少侠的博客

聚类算法实践(五)——真实Dataset测试

 2927

在之前的文章里,讨论了一些聚类算法的基本思路,并针对人为构造的数据进行了测试。然而,真实的数据毕竟不同于人工数据。在对现实数据进行聚类的时候,有时候不知道哪些特征才是最关键的,因此多少会掺杂一些无关的...来自: Entropy

下载 

K-means聚类数据.rar

11-16
详见博文:http://blog.csdn.net/hujingshuang/article/details/49867455
下载 

二维聚类数据集

09-30
用于聚类方法的数据集,包括不同数目的块状聚类、月牙形、同心环形及螺旋形分布,可用于Kmeans、谱聚类等聚类方法的测试。
下载 

常用聚类分析数据集

07-01
聚类分析常用的人工数据集,包括:UCI:wine、Iris、yeast,还有4k2_far、leuk72_3k等数据集。它们在聚类分析、数据挖掘、机器学习、模式识别领域经常用到。
下载 

adult数据集分析

02-15
adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基...

[035]Java实现SVM对乳腺癌检测数据分类分析

 1679

背景简介:最近在做SVM分类的学习,查看网上大多相关内容都是SVM原理介绍、推导和用终端命令行使用svm-train,svm-predict。具体数据分析实现很少。通过查找资料发现了一个很好的开发库L...来自: friendpengyou的专栏

【Python数据挖掘课程】五.线性回归知识及预测糖尿病实例

 1.3万

今天主要讲述的内容是关于一元线性回归的知识,Python实现,包括以下内容: 1.机器学习常用数据集介绍 2.什么是线性回顾 3.LinearRegre...来自: 杨秀璋的专栏

机器学习案例——鸢尾花数据集分析

 1655

    前几天把python基础知识过了一遍,拿了这个小例子作为练手项目,这个案例也有师兄的帮助,记录完,发现代码贴的很多,文章有点长,为了节省篇幅,有一些说明就去掉了,毕竟鸢尾花数据集比较经典,网上...来自: 刘小绪同学的博客

聚类

 1.5万

4、聚类 聚类分析提供由个别数据对象到数据对象所指派到簇的抽象。此外,一些聚类技术使用簇原型(即代表簇中其他对象的数据对象)来刻画簇的特征。聚类分析是研究发现最具有代表性的簇原型的技术。回归和P...来自: rosenor1的博客

下载 

多视图聚类数据集mfeat

09-08
该mfeat数据集主要用于多视图聚类算法研究,其中已经有标签,可以用于对最终聚类算法分出来的类簇进行评估。

四种主流聚类方法

 3.4万

四种聚类方法之比较 2015-07-29 SOTON数据分析 聚类分析是一种重要的人类行为,早在孩提时代,一个人就通过不断改进下意识中的聚类模式来学会如何区分猫狗、动物植物。目前在许多领域都...来自: Alex_luodazhi的博客

【分享】联合聚类算法标准测试数据集

 1533

该数据集为A. Lomet等人提供的,可作为联合聚类算法的标准测试数据集,可针对不同的聚类数目、规模、聚类任务难度等进行对比验证分析,可应用于协同过滤算法等的测试。    数据堂免费提供数据...来自: 数据堂-科研数据共享平台

下载 

聚类常用数据集

12-29
聚类常用数据集
下载 

常用UCI数据集

06-04
常用的UCI数据集,可直接用于机器学习,数据挖掘,直接实现

机器学习UCI数据库

 1.6万

http://archive.ics.uci.edu/ml/   数据库是加州大学欧文分校(UniversityofCaliforniaIrvine)提出的用于机器学习的数据库,这个数据库目前共有...来自: loadstar_kun的专栏

UCI 机器学习数据集(分类)

 7758

113 Data SetsUCI数据集NameData TypesDefault TaskAttribute Types# Instances# AttributesYear来自: BeachBOY的完美世界

用朴素贝叶斯对wine数据集分类

 7766

该实验的数据集是MostPopular Data Sets(hits since 2007)中的wine数据集,这是是对在意大利同一地区生产的三种不同品种的酒,做大量分析所得出的数据。这些数据包括了三...来自: 图像处理与模式识别

UCI 数据集

 1781

filename='.\iris\iris.data';%使用 , 分割符分割每列数据; ‘'headerlines’:表示忽略前N行,从N+1行开始读取数据集 [attrib1, attrib2, ...来自: dataningwei的博客

下载 

重叠聚类数据集

07-28
可直接在matlab中用,已经处理好! 20Newsgroup.mat emotions.mat scene.mat yeast2417.mat movie_taa.mat ……
下载 

聚类、分类所用数据集

09-06
做聚类、分类时很经典的测试数据集,可以很好的检测你所设计的算法。我所上传的数据集格式是.mat格式,用load命令就可以加载。

没有更多推荐了,返回首页

 
 

转载于:https://www.cnblogs.com/lm3306/p/9798572.html

你可能感兴趣的:(转:UCI数据集和源代码&数据挖掘的数据集资源)