【人工智能】鸢尾花数据集KMeans的C++实现

小王今天也要努力啊~

报告内容

一．问题描述

鸢尾花数据集是一个经典数据集，有四个维度，即花卉的四项特征：花萼长度、花萼宽度、花瓣长度、花瓣宽度，数据集同时对应给出了鸢尾花的种类（标签），共150条数据。已知三种不用的鸢尾花种类：Iris-setosa，Iris-versicolor，Iris-virginica（刚毛，变色，弗吉尼亚）。本项目需要在没有先验知识的情况下，只通过这四项特征判断鸢尾花的品种，实现无监督聚类。
本文将使用K-Means对Iris进行聚类分析，基于C++实现。

二．算法内容

K-Means算法是一种聚类算法，根据相似性原则，将具有较高相似度的数据对象划分至同一类簇，将具有较高相异度的数据对象划分至不同类簇。
K代表类簇个数，Means代表类簇内数据对象的均值（这种均值是一种对类簇中心的描述）K-Means算法是一种基于划分的聚类算法，以距离作为数据对象间相似性度量的标准，即数据对象间的距离越小，则它们的相似性越高，则它们越有可能在同一个类簇。数据对象间距离的计算有很多种，包括欧氏距离、曼哈顿距离、余弦距离、马氏距离等，K-Means中常用欧氏距离。

（一）算法描述

随机选择K个点（由数据集得出K=3）作为簇心；
计算数据集中各点与簇心的距离，选择距离最小的簇心，则该点属于这个簇心；
对各个簇通过求各点均值（Means）的方法重新求簇心
比较新簇心与旧簇心的距离，如果相差小于ZERO，则完成算法；否则，迭代次数加1，若迭代次数小于等于G，则返回2，若迭代次数大于G，则失败

算法流程图如下图所示：

（二）核心算法模块描述：（全部代码可见附录）

获得新的聚类中心

获得新簇中心有两种情况，第一种情况是当刚开始操作时，将随机选择三个数据点作为聚类中心，用时间随机种子和取余运算来确保选点的随机性。

srand((int)time(NULL));
x = rand()%length; 
y = rand()%length;
	z = rand()%length;

将各聚类中心的值分别放在center中保存：

for(i=0;i<CASE;i++){
     
		center[0][i]=table[x].feature[i];
	}

第二种情况时已有各簇并需要更新簇时，此时将计算被分得同一种类的各簇的四个属性值的平均值作为新簇的中心，流程图如下：

代码如下（由于本段代码有较多重复，完整代码详见附录）

	for(k=0; k!=length; k++){
     
		if(table[k].kind == 0){
     
			count1++;
			for(i=0; i<CASE; i++){
     
				centers[0][i]+=table[k].feature[i];
			}
		}
	}
	for(i=0 ; i <CASE; i++){
     
		centers[0][i]/=count1;
	}

在此模块中可以加上算法结束的一个终止条件，即聚类中心点不发生变化，但考虑到这个条件较为苛刻，本项目引入了参数ZERO表示一个接近于0的值（经实验后设为0.01，实验过程见下文），具体代码如下：

	for(i=0;i<K;i++){
     
		for(j=0;j<CASE;j++){
     
			difference = abs( centers[i][j]-center[i][j]);
			center[i][j]=centers[i][j];
		}
	}
if(difference<ZERO) return SUCCESS;       //曾经的终止条件 
		else return CONTINUE;

更新簇

更新簇的操作实际上是把每朵鸢尾花的种类重新分配。根据数据点到聚类中心的距离，比较发现离本数据点最近的聚类中心，则该数据点将被划分为此聚类中心代表的簇中。具体代码如下：

for(k=0;k!=length;k++){
                //计算每个点距离各簇中心的距离（欧氏距离） 
		for(i=0;i!=K;i++){
     
			for(j=0;j<CASE;j++){
     
				//欧式距离 
				table[k].distance[i] += sqrt(
					(center[i][j]-table[k].feature[j])
					*(center[i][j]-table[k].feature[j]));
				//曼哈顿距离
			/*	table[k].distance[i] += abs(center[i][j]-table[k].feature[j]);    */ 
			}
		}
		//寻找最小距离 
		float shortest = (table[k].distance[0] < table[k].distance[1]) 
							? table[k].distance[0]:table[k].distance[1];
		shortest = (shortest < table[k].distance[2]) 
							? shortest:table[k].distance[2];	
		for(i=0;i<K;i++){
     
			if(table[k].distance[i]==shortest){
     
				if(table[k].kind==i) count++;
				else table[k].kind=i;
			}
		}
	}

其中count记录了前后两次分簇相同的数据点的个数。在此部分中，可以加入算法结束的另一个终止条件：当各个数据点前后两次分簇情况都不发生变化。代码如下：

if(length == count ) return SUCCESS;
		else return CONTINUE;

（三）算法参数

K：由分析鸢尾花数据集已知，共有三种类别，所以K=3
CASE：已知四种不同属性，设置CASE=4
ZERO：根据几次调试将ZERO设为0.01。在调试过程中，发现：当ZERO小于0.01时（0.001、0.00001），迭代次数出现了缓慢增长，但输出正确率并没有发生很大改变；当ZERO大于0.01时（0.1），迭代次数没有较大变化，成功率的均值也较好，但出现了较大的振荡。
G：由测试得出，数据集往往在10代以内迭代完成，将G稍微放宽一点，设为20

三．运行结果及分析

输出数据从左向右依次为鸢尾花的四个特征（feature）、真实种类（truth_value）和聚类后所属种类（kind）。真实种类代表的数字和分类后所打标签数字可能不同（即可能1对映2，2对映0等），是初始随机分簇时的不同顺序造成的，并不影响最终效果。末尾三行输出是否成功，经历迭代次数和聚类正确率。部分运行结果截图如下：

由运行结果可得，绝大多数都聚类成功（测试并未出现聚类失败情况），在10代以内可以完成聚类，聚类成功率在80%以上。通过图片的联合分析，鸢尾花的三类中，处于左下角的一类（Iris-setosa，在代码中truth_value表示为0）聚类效果非常好，但右上角的两类（Iris-versicolor，在代码中truth_value表示为1；Iris-virginica，在代码中truth_value表示为2）由于距离较近，聚类效果欠佳。

1.距离：

对比欧式距离和曼哈顿距离，欧式距离效果更好：迭代次数起伏较大，从2代到大于50代不等；且正确率不稳定，从0.78到0.92不等。最终仍采用欧氏距离。

2.算法终止条件：

原算法：当新旧两个簇中心之间距离小于ZERO时，结束算法；限制改为当各点前后两次分簇相同时，结束算法。

随机测试实验发现改为新的终止条件后，平均迭代次数增加，平均正确率也提高了。

四．算法改进

1.关于初始聚类中心的改进

改进缘由：发现算法中正确率与迭代次数几乎无关（corr=0.095865），但正确率上下波动很大，故猜测主要原因是KMeans对初始聚类中心的选择敏感。
通过查阅资料，本项目使用KMeans++算法进行改进。该算法的核心思想是，在选择初始簇中心时，尽量选择距离较远的数据点作为聚类中心；一开始就足够分散，则不会出现病态初始化的问题了。
主要方法是：首先随机选择第一个聚类中心，然后以概率D_i/(sum(D_i))选择第i个数据点作为下一个聚类中心，依次重复，直到找到所有聚类中心。

但实际在操作时，概率事件在程序中是可以用随机数模拟的，这里以概率p选择下一个聚类中心正是利用了用随机数模拟概率事件的思想。首先统计所有点到每一个聚类中心的最近距离，这个距离存放在数组d中，所有最近距离的和为sum，随机从0~sum间选择一个数，出现两种情况，第一种：d[i]很大，记为dmax；第二种：d[i]很小，记为dmin，则sum - dmax比sum - dmin更容易打破大于0这个条件；同时，一旦大于0的条件被打破，就可以选择对应于d[i]的点作为我们的聚类中心。这就是以概率D_i/(sum(D_i))选择第i个数据点作为下一个聚类中心的具体实现。下面是KMeans++的部分代码：

template<typename Real, int Dim>
void KMeans<Real, Dim>::kpp(vector<KmPoint> &pts, vector<KmPoint> &cents){
     
		Real sum = 0;
		vector<Real> d;
		d.resize(pts.size());
		cents[0] = pts[rand() % pts.size()];
		vector<KmPoint> tmpCents;
		tmpCents.push_back(cents[0]);
		for(int k = 1; k < (int)cents.size(); ++k){
     
			sum = 0;
			for(int i = 0; i < (int)pts.size(); ++i){
     
				nearest(pts[i], tmpCents, d[i]);
				sum += d[i];
			}
			sum = randf(sum);
			for(int i = 0; i < (int)pts.size(); ++i){
     
				<strong>if((sum -= d[i]) > 0)	continue;</strong>
				cents[k] = pts[i];
				tmpCents.push_back(cents[k]);
				break;
			}
		}
		for(int i = 0; i < (int)pts.size(); ++i){
     
			int id = nearest(pts[i], cents, *(new Real));
			pts[i].setId(id);
		}
}

这部分有所引用，原博见参考网址

2.关于聚类方法的改进

改进缘由：分析得到鸢尾花右下角的聚类效果较好，但相邻两簇效果始终不如意，由于KMeans只能将类似圆形的聚类在一起，故尝试基于密度的DBSCAN和层次聚类agnes。
尝试前在网上搜索学习了一些前人的工作，发现在鸢尾花数据集上，Agnes效果与kmeans相差不大，但DBSCAN的效果不尽人意。
因而在实际操作中并没有尝试Agnes和DBSCAN的方法。
这部分有所引用，原博见参考网址

五．学习与收获

通过本次项目的实践，深入理解了KMeans具体实现方方面面的细节，在编写代码的过程中发现了许多之前单单在学习KMeans基本思路时并没有发现的问题，也收获到了许多新的东西。由于之前没有仔细看过KMeans的聚类效果，在调试成功后，其迭代次数之少与正确率之高超过了我的预期，让我感受到了这简单想法背后的大智慧。然而在Agnes和DBSCAN在鸢尾花上的实现后我更深层地意识到，对于不同的问题不同的数据集，需要有不同的方法有针对性地去解决，每种方法都有自己的适用范围。
在本节课程上，对人工智能领域的基本介绍，从身边的人工智能、人工智能的背景与发展史——三次浪潮迭起，到一些搜索算法、逻辑与推理相关知识，到进化算法、群智能优化和最后的机器学习，在这个领域下林林总总方方面面的接触，不管是概念领悟，还是算法思路的理解，甚至部分算法的实践，都让我感受到了人工智能的魅力与广阔的前景。用人工的方法在机器上实现的智能，人工智能是人类显性智慧的人工实现。通过这堂课，我明白了人工智能发展的历史和所处的地位，它始终处于计算机发展的最前沿。我相信人工智能在不久的将来会得到更深一步的实现，会创造出一个全新的人工智能世界。

六．参考文献及网址

鸢尾花数据集分析
https://www.jianshu.com/p/52b86c774b0b
鸢尾花数据的三种聚类：分散聚类kmeans层次聚类agnes密度聚类dbscan
https://blog.csdn.net/weixin_42134141/article/details/80413598
kmeans++算法的C++实现
https://blog.csdn.net/zhouliyang1990/article/details/25188267

完整代码

//		IrisDataSetK-Means demo02 

#include
#include
#include
#include
#include
#include
#include

#define K 3
#define CASE 4
#define G 50
#define ZERO 0.01
#define SUCCESS 1
#define CONTINUE 0

using namespace std;

class Iris{
     
	public:
		float feature[CASE];         //鸢尾花的四个特征（连续） 
		int truth_value;             //鸢尾花的真正种类 
		int kind;                    //聚类后的种类 
		float distance[K];           //每个点关于各簇中心的距离 
		void show(){
                      //显示输入数据 
			cout<<feature[0]<<"\t"<<feature[1]<<"\t"<<feature[2]<<"\t"
			    <<feature[3]<<"\t"<<truth_value<<endl;
		} 
};

class Cluster{
     
	
	private:
		vector<Iris> table;          //鸢尾花数据集 
		float center[K][CASE];       //三个簇中心位置 
		float difference;            //和上一个簇中心的距离 
		float result;                //正确率 
		
	public:
		void get_Data();
		void get_FirstCenter();
		void get_NewCenter();
		int Update_NewCluster();
		void success_rate();
		void show(int condition, int generation);
};

int get_truthvalue(string s){
     
	string s1,s2,s3;
	s1="Iris-setosa";
	s2="Iris-versicolor";
	s3="Iris-virginica";
	if(s==s1) return 0;
	if(s==s2) return 1;
	if(s==s3) return 2;
	}

void Cluster::get_Data(){
     
	
	ifstream infile;
	float temp=0;
	string s;
	int count=0;
	Iris individual;
	
	infile.open("D:\\iris.txt");
	if(!infile.is_open()){
     
		cout<<"Open file failure"<<endl;
	}
	
	while(infile.good() && !infile.eof()){
     
		
		count++;
		
		if(count%(CASE+1) == 0) {
     
			infile>>s;
			individual.truth_value=get_truthvalue(s);
			table.push_back(individual);
		}
		else{
     
			infile>>temp;
			individual.feature[count%(CASE+1)-1]=temp;
		}
	}
	
	infile.close();
	
}

void Cluster::get_FirstCenter(){
     
	
	srand((int)time(NULL));
	int length=table.size();
	int x,y,z;
	int i=0;
	x = rand()%length; 
	y = rand()%length;
	z = rand()%length;
	for(i=0;i<CASE;i++){
     
		center[0][i]=table[x].feature[i];
	}
	for(i=0;i<CASE;i++){
     
		center[1][i]=table[y].feature[i];	
	}
	for(i=0;i<CASE;i++){
     
		center[2][i]=table[z].feature[i];
	}
	
}

void Cluster::get_NewCenter(){
     
	
	int length = table.size();
	int count1=0,count2=0,count3=0;
	int i,j,k;
	float centers[K][CASE];
	for(k=0;k!=length;k++){
     
		if(table[k].kind == 0){
     
			count1++;
			for(i=0;i<CASE;i++){
     
				centers[0][i]+=table[k].feature[i];
			}
		}
		if(table[k].kind == 1){
     
			count2++;
			for(i=0;i<CASE;i++){
     
				centers[1][i]+=table[k].feature[i];
			}
		}
		if(table[k].kind == 2){
     
			count3++;
			for(i=0;i<CASE;i++){
     
				centers[2][i]+=table[k].feature[i];
			}
		}
	}
	for(i=0;i<CASE;i++){
     
		centers[0][i]/=count1;
	}
	for(i=0;i<CASE;i++){
     
		centers[1][i]/=count2;
	}
	for(i=0;i<CASE;i++){
     
		centers[2][i]/=count3;
	}
	for(i=0;i<K;i++){
     
		for(j=0;j<CASE;j++){
     
			difference = abs( centers[i][j]-center[i][j]);
			center[i][j]=centers[i][j];
		}
	}
	
	/*if(difference
}

int Cluster::Update_NewCluster(){
     
	
	int i,j,k;
	int count = 0;
	int length = table.size();
	for(k=0;k!=length;k++){
                //计算每个点距离各簇中心的距离（欧氏距离） 
		for(i=0;i!=K;i++){
     
			for(j=0;j<CASE;j++){
     
				//欧式距离 
				table[k].distance[i] += sqrt(
					(center[i][j]-table[k].feature[j])
					*(center[i][j]-table[k].feature[j]));
				//曼哈顿距离
			/*	table[k].distance[i] += abs(center[i][j]-table[k].feature[j]);*/ 
			}
		}
		//寻找最小距离 
		float shortest = (table[k].distance[0] < table[k].distance[1]) 
							? table[k].distance[0]:table[k].distance[1];
		shortest = (shortest < table[k].distance[2]) 
							? shortest:table[k].distance[2];	
		for(i=0;i<K;i++){
     
			if(table[k].distance[i]==shortest){
     
				if(table[k].kind==i) count++;
				else table[k].kind=i;
			}
		}
	}
	if(length == count ) return SUCCESS;
	else return CONTINUE;

}

void Cluster::success_rate(){
     

	int i,j,success=0;
	int length = table.size();
	int feature[K][K]={
     0};
	int key[K];
	
	for(i=0;i!=length;i++){
     
		if(table[i].truth_value == 0){
     
			if(table[i].kind == 0) feature[0][0]++;
			if(table[i].kind == 1) feature[0][1]++;
			if(table[i].kind == 2) feature[0][2]++;
		}
		else if(table[i].truth_value == 1){
     
			if(table[i].kind == 0) feature[1][0]++;
			if(table[i].kind == 1) feature[1][1]++;
			if(table[i].kind == 2) feature[1][2]++;
		}
		else if(table[i].truth_value == 2){
     
			if(table[i].kind == 0) feature[2][0]++;
			if(table[i].kind == 1) feature[2][1]++;
			if(table[i].kind == 2) feature[2][2]++;
		}
	}
	for(i=0;i!=K;i++){
     
		if(feature[i][0]>feature[i][1] && feature[i][0]>feature[i][2])
			key[i]=0;
		else if(feature[i][1]>feature[i][0] && feature[i][1]>feature[i][2])
			key[i]=1;
		else if(feature[i][2]>feature[i][0] && feature[i][2]>feature[i][0])
			key[i]=2;
	}

	for(j=0;j!=length;j++){
     
		if(table[j].kind == key[table[j].truth_value]) success++;
	}
	result=(float)success/length;

}

void Cluster::show(int condition, int generation){
     
	
	int length=table.size();
	int i,j;
	
	for(i=0;i!=length;i++){
     
		for(j=0;j!=CASE;j++){
     
			cout<<"\t"<<table[i].feature[j];
		}
		cout<<"\t"<<table[i].truth_value<<"\t"<<table[i].kind<<endl;
	}
	
	if(condition==SUCCESS){
     
		cout<<"SUCCESS!"<<endl;
		cout<<"Through "<<generation+1<<" generation(s)."<<endl;
		cout<<"Sucess_rate: "<<result;
	}
	if(condition==CONTINUE){
     
		cout<<"Not Convergence!"<<endl;
		cout<<"Sucess_rate: "<<result;
	}
}

int main(){
     
	
	Cluster clusters;
	int generation=0,condition=0;
	
	clusters.get_Data();                          //获取数据 
	clusters.get_FirstCenter();                   //随机取簇中心 
	for(generation=0;generation<G;generation++){
       //迭代 
		condition = clusters.Update_NewCluster(); //根据簇中心重新分簇 
		clusters.get_NewCenter();                 //根据新簇获得新的簇中心 
		clusters.success_rate();                  //计算成功分簇的百分比 
		if(condition==SUCCESS) break;             //如果簇不再改变则跳出循环 
	}
	clusters.show(condition,generation);          //显示结果 
}

以上内容为博主大作业

虽然辛苦，我还是会选择那种滚烫的人生（北野武）

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
c++ 的iostream 和 c++的stdio的区别和联系黄卷青灯77 c++算法开发语言 iostream stdio
在C++中，iostream和C语言的stdio.h都是用于处理输入输出的库，但它们在设计、用法和功能上有许多不同。以下是两者的区别和联系：区别1.编程风格iostream（C++风格）：C++标准库中的输入输出流类库，支持面向对象的输入输出操作。典型用法是cin（输入）和cout（输出），使用>操作符来处理数据。更加类型安全，支持用户自定义类型的输入输出。#includeintmain(){in
Goolge earth studio 进阶4——路径修改与平滑陟彼高冈yu Google earth studio 进阶教程旅游
如果我们希望在大约中途时获得更多的城市鸟瞰视角。可以将相机拖动到这里并创建一个新的关键帧。camera_target_clip_7EarthStudio会自动平滑我们的路径，所以当我们通过这个关键帧时，不是一个生硬的角度，而是一个平滑的曲线。camera_target_clip_8路径上有贝塞尔控制手柄，允许我们调整路径的形状。右键单击，我们可以选择“平滑路径”，这是默认的自动平滑算法，或者我们可
基于社交网络算法优化的二维最大熵图像分割智能算法研学社（Jack旭）智能优化算法应用图像分割算法 php 开发语言
智能优化算法应用：基于社交网络优化的二维最大熵图像阈值分割-附代码文章目录智能优化算法应用：基于社交网络优化的二维最大熵图像阈值分割-附代码1.前言2.二维最大熵阈值分割原理3.基于社交网络优化的多阈值分割4.算法结果：5.参考文献：6.Matlab代码摘要：本文介绍基于最大熵的图像分割，并且应用社交网络算法进行阈值寻优。1.前言阅读此文章前，请阅读《图像分割：直方图区域划分及信息统计介绍》htt
探索OpenAI和LangChain的适配器集成：轻松切换模型提供商 nseejrukjhad langchain easyui 前端 python
#探索OpenAI和LangChain的适配器集成：轻松切换模型提供商##引言在人工智能和自然语言处理的世界中，OpenAI的模型提供了强大的能力。然而，随着技术的发展，许多人开始探索其他模型以满足特定需求。LangChain作为一个强大的工具，集成了多种模型提供商，通过提供适配器，简化了不同模型之间的转换。本篇文章将介绍如何使用LangChain的适配器与OpenAI集成，以便轻松切换模型提供商
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
深入理解 MultiQueryRetriever：提升向量数据库检索效果的强大工具 nseejrukjhad 数据库 python
深入理解MultiQueryRetriever：提升向量数据库检索效果的强大工具引言在人工智能和自然语言处理领域，高效准确的信息检索一直是一个关键挑战。传统的基于距离的向量数据库检索方法虽然广泛应用，但仍存在一些局限性。本文将介绍一种创新的解决方案：MultiQueryRetriever，它通过自动生成多个查询视角来增强检索效果，提高结果的相关性和多样性。MultiQueryRetriever的工
121. 买卖股票的最佳时机薄荷糖的味道_fb40
给定一个数组，它的第i个元素是一支给定股票第i天的价格。如果你最多只允许完成一笔交易（即买入和卖出一支股票），设计一个算法来计算你所能获取的最大利润。注意你不能在买入股票前卖出股票。示例1:输入:[7,1,5,3,6,4]输出:5解释:在第2天（股票价格=1）的时候买入，在第5天（股票价格=6）的时候卖出，最大利润=6-1=5。注意利润不能是7-1=6,因为卖出价格需要大于买入价格。示例2:输入:
【JS】执行时长(100分) |思路参考+代码解析（C++） l939035548 JS 算法数据结构 c++
题目为了充分发挥GPU算力，需要尽可能多的将任务交给GPU执行，现在有一个任务数组，数组元素表示在这1秒内新增的任务个数且每秒都有新增任务。假设GPU最多一次执行n个任务，一次执行耗时1秒，在保证GPU不空闲情况下，最少需要多长时间执行完成。题目输入第一个参数为GPU一次最多执行的任务个数，取值范围[1,10000]第二个参数为任务数组长度，取值范围[1,10000]第三个参数为任务数组，数字范围
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Faiss Tips：高效向量搜索与聚类的利器焦习娜Samantha
FaissTips：高效向量搜索与聚类的利器faiss_tipsSomeusefultipsforfaiss项目地址:https://gitcode.com/gh_mirrors/fa/faiss_tips项目介绍Faiss是由FacebookAIResearch开发的一个用于高效相似性搜索和密集向量聚类的库。它支持多种硬件平台，包括CPU和GPU，能够在海量数据集上实现快速的近似最近邻搜索（AN
回溯算法-重新安排行程 chirou_ 算法数据结构图论 c++图搜索
leetcode332.重新安排行程这题我还没自己ac过，只能现在凭着刚学完的热乎劲把我对题解的理解记下来。本题我认为对数据结构的考察比较多，用什么数据结构去存数据，去读取数据，都是很重要的。classSolution{private:unordered_map>targets;boolbacktracking(intticketNum,vector&result){//1.确定参数和返回值//2
基于CODESYS的多轴运动控制程序框架：逻辑与运动控制分离，快速开发灵活操作 GPJnCrbBdl python 开发语言
基于codesys开发的多轴运动控制程序框架，将逻辑与运动控制分离，将单轴控制封装成功能块，对该功能块的操作包含了所有的单轴控制（归零、点动、相对定位、绝对定位、设置当前位置、伺服模式切换等等）。程序框架由主程序按照状态调用分归零模式、手动模式、自动模式、故障模式，程序状态的跳转都已完成，只需要根据不同的工艺要求完成所需的动作即可。变量的声明、地址的规划都严格按照C++的标准定义，能帮助开发者快速
C++ | Leetcode C++题解之第409题最长回文串 Ddddddd_158 经验分享 C++Leetcode 题解
题目：题解：classSolution{public:intlongestPalindrome(strings){unordered_mapcount;intans=0;for(charc:s)++count[c];for(autop:count){intv=p.second;ans+=v/2*2;if(v%2==1andans%2==0)++ans;}returnans;}};
C++菜鸟教程 - 从入门到精通第二节 DreamByte c++
一.上节课的补充(数据类型)1.前言继上节课,我们主要讲解了输入,输出和运算符,我们现在来补充一下数据类型的知识上节课遗漏了这个知识点,非常的抱歉顺便说一下,博主要上高中了,更新会慢,2-4周更新一次对了,正好赶上中秋节,小编跟大家说一句:中秋节快乐!2.int类型上节课,我们其实只用了int类型int类型,是整数类型,它们存贮的是整数,不能存小数(浮点数)定义变量的方式很简单inta;//定义一
Faiss：高效相似性搜索与聚类的利器网络·魚大数据 faiss
Faiss是一个针对大规模向量集合的相似性搜索库，由FacebookAIResearch开发。它提供了一系列高效的算法和数据结构，用于加速向量之间的相似性搜索，特别是在大规模数据集上。本文将介绍Faiss的原理、核心功能以及如何在实际项目中使用它。Faiss原理：近似最近邻搜索：Faiss的核心功能之一是近似最近邻搜索，它能够高效地在大规模数据集中找到与给定查询向量最相似的向量。这种搜索是近似的，
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
insert into select 主键自增_mybatis拦截器实现主键自动生成 weixin_39521651 insert into select 主键自增 mybatis delete返回值 mybatis insert返回主键 mybatis insert返回对象 mybatis plus insert返回主键 mybatis plus 插入生成id
前言前阵子和朋友聊天，他说他们项目有个需求，要实现主键自动生成，不想每次新增的时候，都手动设置主键。于是我就问他，那你们数据库表设置主键自动递增不就得了。他的回答是他们项目目前的id都是采用雪花算法来生成，因此为了项目稳定性，不会切换id的生成方式。朋友问我有没有什么实现思路，他们公司的orm框架是mybatis，我就建议他说，不然让你老大把mybatis切换成mybatis-plus。mybat
k均值聚类算法考试例题_k均值算法(k均值聚类算法计算题) 寻找你83497 k均值聚类算法考试例题
?算法：第一步：选K个初始聚类中心，z1(1),z2(1)，…，zK(1)，其中括号内的序号为寻找聚类中心的迭代运算的次序号。聚类中心的向量值可任意设定，例如可选开始的K个.k均值聚类：---------一种硬聚类算法，隶属度只有两个取值0或1，提出的基本根据是“类内误差平方和最小化”准则；模糊的c均值聚类算法：--------一种模糊聚类算法，是.K均值聚类算法是先随机选取K个对象作为初始的聚类
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
推荐算法_隐语义-梯度下降 _feivirus_ 算法机器学习和数学推荐算法机器学习隐语义
importnumpyasnp1.模型实现"""inputrate_matrix:M行N列的评分矩阵，值为P*Q.P:初始化用户特征矩阵M*K.Q:初始化物品特征矩阵K*N.latent_feature_cnt:隐特征的向量个数max_iteration:最大迭代次数alpha:步长lamda:正则化系数output分解之后的P和Q"""defLFM_grad_desc(rate_matrix,l
K近邻算法_分类鸢尾花数据集 _feivirus_ 算法机器学习和数学分类机器学习 K近邻
importnumpyasnpimportpandasaspdfromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.metricsimportaccuracy_score1.数据预处理iris=load_iris()df=pd.DataFrame(data=ir
Java面试题精选：消息队列(二) 芒果不是芒 Java面试题精选 java kafka
一、Kafka的特性1.消息持久化：消息存储在磁盘，所以消息不会丢失2.高吞吐量：可以轻松实现单机百万级别的并发3.扩展性：扩展性强，还是动态扩展4.多客户端支持：支持多种语言（Java、C、C++、GO、）5.KafkaStreams（一个天生的流处理）:在双十一或者销售大屏就会用到这种流处理。使用KafkaStreams可以快速的把销售额统计出来6.安全机制：Kafka进行生产或者消费的时候会
数据结构 | 栈和队列 TT-Kun 数据结构与算法数据结构栈队列 C语言
文章目录栈和队列1.栈：后进先出（LIFO）的数据结构1.1概念与结构1.2栈的实现2.队列：先进先出（FIFO）的数据结构2.1概念与结构2.2队列的实现3.栈和队列算法题3.1有效的括号3.2用队列实现栈3.3用栈实现队列3.4设计循环队列结论栈和队列在计算机科学中，栈和队列是两种基本且重要的数据结构，它们在处理数据存储和访问顺序方面有着独特的规则和应用。本文将详细介绍栈和队列的概念、结构、实
[Python] 数据结构详解及代码 AIAdvocate 算法 python 数据结构链表
今日内容大纲介绍数据结构介绍列表链表1.数据结构和算法简介程序大白话翻译,程序=数据结构+算法数据结构指的是存储,组织数据的方式.算法指的是为了解决实际业务问题而思考思路和方法,就叫:算法.2.算法的5大特性介绍算法具有独立性算法是解决问题的思路和方式,最重要的是思维,而不是语言,其(算法)可以通过多种语言进行演绎.5大特性有输入,需要传入1或者多个参数有输出,需要返回1个或者多个结果有穷性,执行
Python算法L5：贪心算法小熊同学哦 Python算法算法 python 贪心算法
Python贪心算法简介目录Python贪心算法简介贪心算法的基本步骤贪心算法的适用场景经典贪心算法问题1.**零钱兑换问题**2.**区间调度问题**3.**背包问题**贪心算法的优缺点优点：缺点：结语贪心算法（GreedyAlgorithm）是一种在每一步选择中都采取当前最优或最优解的算法。它的核心思想是，在保证每一步局部最优的情况下，希望通过贪心选择达到全局最优解。虽然贪心算法并不总能得到全
Dom 周华华 JavaScript html
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
【Spark九十六】RDD API之combineByKey bit1129 spark
1. combineByKey函数的运行机制 RDD提供了很多针对元素类型为(K,V)的API，这些API封装在PairRDDFunctions类中，通过Scala隐式转换使用。这些API实现上是借助于combineByKey实现的。combineByKey函数本身也是RDD开放给Spark开发人员使用的API之一首先看一下combineByKey的方法说明：
msyql设置密码报错：ERROR 1372 (HY000): 解决方法详解 daizj mysql 设置密码
MySql给用户设置权限同时指定访问密码时，会提示如下错误： ERROR 1372 (HY000): Password hash should be a 41-digit hexadecimal number；问题原因：你输入的密码是明文。不允许这么输入。解决办法：用select password('你想输入的密码');查询出你的密码对应的字符串，然后
路漫漫其修远兮吾将上下而求索周凡杨学习思索
王国维在他的《人间词话》中曾经概括了为学的三种境界古今之成大事业、大学问者，罔不经过三种之境界。“昨夜西风凋碧树。独上高楼，望尽天涯路。”此第一境界也。“衣带渐宽终不悔，为伊消得人憔悴。”此第二境界也。“众里寻他千百度，蓦然回首，那人却在灯火阑珊处。”此第三境界也。学习技术，这也是你必须经历的三种境界。第一层境界是说，学习的路是漫漫的，你必须做好充分的思想准备，如果半途而废还不如不要开始。这里，注
Hadoop(二)对话单的操作朱辉辉33 hadoop
Debug： 1、 A = LOAD '/user/hue/task.txt' USING PigStorage(' ') AS (col1,col2,col3); DUMP A; //输出结果前几行示例： (>ggsnPDPRecord(21),,) (-->recordType(0),,) (-->networkInitiation(1),,)
web报表工具FineReport常用函数的用法总结（日期和时间函数）老A不折腾 finereport 报表工具 web开发
web报表工具FineReport常用函数的用法总结（日期和时间函数）说明：凡函数中以日期作为参数因子的，其中日期的形式都必须是yy/mm/dd。而且必须用英文环境下双引号(" ")引用。 DATE DATE(year,month,day):返回一个表示某一特定日期的系列数。 Year:代表年，可为一到四位数。 Month:代表月份。
c++ 宏定义中的##操作符墙头上一根草 C++
#与##在宏定义中的--宏展开 #include <stdio.h> #define f(a,b) a##b #define g(a) #a #define h(a) g(a) int main() { &nbs
分析Spring源代码之，DI的实现 aijuans spring DI 现源代码
(转) 分析Spring源代码之，DI的实现 2012/1/3 by tony 接着上次的讲，以下这个sample [java] view plain copy print
for循环的进化 alxw4616 JavaScript
// for循环的进化 // 菜鸟 for (var i = 0; i < Things.length ; i++) { // Things[i] } // 老鸟 for (var i = 0, len = Things.length; i < len; i++) { // Things[i] } // 大师 for (var i = Things.le
网络编程Socket和ServerSocket简单的使用百合不是茶网络编程基础 IP地址端口
网络编程;TCP/IP协议网络:实现计算机之间的信息共享,数据资源的交换协议:数据交换需要遵守的一种协议,按照约定的数据格式等写出去端口:用于计算机之间的通信每运行一个程序，系统会分配一个编号给该程序，作为和外界交换数据的唯一标识 0~65535 查看被使用的
JDK1.5 生产消费者 bijian1013 java thread 生产消费者 java多线程
ArrayBlockingQueue：一个由数组支持的有界阻塞队列。此队列按 FIFO（先进先出）原则对元素进行排序。队列的头部是在队列中存在时间最长的元素。队列的尾部是在队列中存在时间最短的元素。新元素插入到队列的尾部，队列检索操作则是从队列头部开始获得元素。 ArrayBlockingQueue的常用方法：
JAVA版身份证获取性别、出生日期及年龄 bijian1013 java 性别出生日期年龄
工作中需要根据身份证获取性别、出生日期及年龄，且要还要支持15位长度的身份证号码，网上搜索了一下，经过测试好像多少存在点问题，干脆自已写一个。 CertificateNo.java package com.bijian.study; import java.util.Calendar; import
【Java范型六】范型与枚举 bit1129 java
首先，枚举类型的定义不能带有类型参数，所以，不能把枚举类型定义为范型枚举类，例如下面的枚举类定义是有编译错的 public enum EnumGenerics<T> { //编译错，提示枚举不能带有范型参数 OK, ERROR; public <T> T get(T type) { return null;
【Nginx五】Nginx常用日志格式含义 bit1129 nginx
1. log_format 1.1 log_format指令用于指定日志的格式，格式： log_format name(格式名称) type(格式样式) 1.2 如下是一个常用的Nginx日志格式： log_format main '[$time_local]|$request_time|$status|$body_bytes
Lua 语言 15 分钟快速入门 ronin47 lua 基础
- - 单行注释 - - [[ [多行注释] - - ]] - - - - - - - - - - - 1. 变量 & 控制流 - - - - - - - - - - num = 23 - - 数字都是双精度 str = 'aspythonstring'
java-35.求一个矩阵中最大的二维矩阵 ( 元素和最大 ) bylijinnan java
the idea is from: http://blog.csdn.net/zhanxinhang/article/details/6731134 public class MaxSubMatrix { /**see http://blog.csdn.net/zhanxinhang/article/details/6731134 * Q35 求一个矩阵中最大的二维
mongoDB文档型数据库特点开窍的石头 mongoDB文档型数据库特点
MongoDD: 文档型数据库存储的是Bson文档-->json的二进制特点：内部是执行引擎是js解释器，把文档转成Bson结构，在查询时转换成js对象。 mongoDB传统型数据库对比传统类型数据库：结构化数据，定好了表结构后每一个内容符合表结构的。也就是说每一行每一列的数据都是一样的文档型数据库：不用定好数据结构，
[毕业季节]欢迎广大毕业生加入JAVA程序员的行列 comsci java
一年一度的毕业季来临了。。。。。。。。正在投简历的学弟学妹们。。。如果觉得学校推荐的单位和公司不适合自己的兴趣和专业，可以考虑来我们软件行业，做一名职业程序员。。。软件行业的开发工具中，对初学者最友好的就是JAVA语言了，网络上不仅仅有大量的
PHP操作Excel – PHPExcel 基本用法详解 cuiyadll PHP Excel
导出excel属性设置//Include classrequire_once('Classes/PHPExcel.php');require_once('Classes/PHPExcel/Writer/Excel2007.php');$objPHPExcel = new PHPExcel();//Set properties 设置文件属性$objPHPExcel->getProperties
IBM Webshpere MQ Client User Issue (MCAUSER) darrenzhu IBM jms user MQ MCAUSER
IBM MQ JMS Client去连接远端MQ Server的时候，需要提供User和Password吗？答案是根据情况而定，取决于所定义的Channel里面的属性Message channel agent user identifier (MCAUSER)的设置。 http://stackoverflow.com/questions/20209429/how-mca-user-i
网线的接法 dcj3sjt126com
一、PC连HUB (直连线)A端：（标准568B）：白橙，橙，白绿，蓝，白蓝，绿，白棕，棕。 B端：（标准568B）：白橙，橙，白绿，蓝，白蓝，绿，白棕，棕。二、PC连PC （交叉线）A端：(568A)：白绿，绿，白橙，蓝，白蓝，橙，白棕，棕； B端：（标准568B）：白橙，橙，白绿，蓝，白蓝，绿，白棕，棕。三、HUB连HUB&nb
Vimium插件让键盘党像操作Vim一样操作Chrome dcj3sjt126com chrome vim
什么是键盘党？键盘党是指尽可能将所有电脑操作用键盘来完成，而不去动鼠标的人。鼠标应该说是新手们的最爱，很直观，指哪点哪，很听话！不过常常使用电脑的人，如果一直使用鼠标的话，手会发酸，因为操作鼠标的时候，手臂不是在一个自然的状态，臂肌会处于绷紧状态。而使用键盘则双手是放松状态，只有手指在动。而且尽量少的从鼠标移动到键盘来回操作，也省不少事。在chrome里安装 vimium 插件
MongoDB查询（2）——数组查询[六] eksliang mongodb MongoDB查询数组
MongoDB查询数组转载请出自出处：http://eksliang.iteye.com/blog/2177292 一、概述 MongoDB查询数组与查询标量值是一样的，例如，有一个水果列表，如下所示： > db.food.find() { "_id" : "001", "fruits" : [ "苹
cordova读写文件（1） gundumw100 JavaScript Cordova
使用cordova可以很方便的在手机sdcard中读写文件。首先需要安装cordova插件：file 命令为： cordova plugin add org.apache.cordova.file 然后就可以读写文件了，这里我先是写入一个文件，具体的JS代码为： var datas=null;//datas need write var directory=&
HTML5 FormData 进行文件jquery ajax 上传到又拍云 ileson jquery Ajax html5 FormData
html5 新东西：FormData 可以提交二进制数据。页面test.html <!DOCTYPE> <html> <head> <title> formdata file jquery ajax upload</title> </head> <body> <
swift appearanceWhenContainedIn:(version1.2 xcode6.4) 啸笑天 version
swift1.2中没有oc中对应的方法： + (instancetype)appearanceWhenContainedIn:(Class <UIAppearanceContainer>)ContainerClass, ... NS_REQUIRES_NIL_TERMINATION; 解决方法：在swift项目中新建oc类如下： #import &
java实现SMTP邮件服务器 macroli java 编程
电子邮件传递可以由多种协议来实现。目前，在Internet 网上最流行的三种电子邮件协议是SMTP、POP3 和 IMAP，下面分别简单介绍。　　◆ SMTP 协议　　简单邮件传输协议(Simple Mail Transfer Protocol,SMTP)是一个运行在TCP/IP之上的协议，用它发送和接收电子邮件。SMTP 服务器在默认端口25上监听。SMTP客户使用一组简单的、基于文本的
mongodb group by having where 查询sql qiaolevip 每天进步一点点学习永无止境 mongo 纵观千象
SELECT cust_id, SUM(price) as total FROM orders WHERE status = 'A' GROUP BY cust_id HAVING total > 250 db.orders.aggregate( [ { $match: { status: 'A' } }, { $group: {
Struts2 Pojo（六） Luob. POJO strust2
注意：附件中有完整案例 1.采用POJO对象的方法进行赋值和传值 2.web配置 <?xml version="1.0" encoding="UTF-8"?> <web-app version="2.5" xmlns="http://java.sun.com/xml/ns/javaee&q
struts2步骤 wuai struts
1、添加jar包 2、在web.xml中配置过滤器 <filter> <filter-name>struts2</filter-name> <filter-class>org.apache.st