weixin_30429201

《集体智慧编程》读书笔记2

最近重读《集体智慧编程》，这本当年出版的介绍推荐系统的书，在当时看来很引领潮流，放眼现在已经成了各互联网公司必备的技术。
这次边阅读边尝试将书中的一些Python语言例子用C#来实现，利于自己理解，代码贴在文中方便各位园友学习。

由于本文可能涉及到的与原书版权问题，请第三方不要以任何形式转载，谢谢合作。

第二部分聚类 - 发现群组

监督学习和无监督学习

利用样本输入和期望输出来学习如何预测的技术称为监督学习法。使用监督学习方法时，可以传入一组输入，应用程序可以根据此前学到的知识产生一个输出。
监督学习法包括如：神经网络、决策树、向量支持机及贝叶斯过滤等。
而这一部分介绍的聚类是无监督学习的一种。无监督学习算法是在一组数据中找寻某种数据结构，如聚类算法，其目标是采集数据并从中找出不同的群组。
其他无监督学习方法还包括负矩阵因式分解和自组织映射。

单词向量

聚类算法所需的数据是一组有相同的数值型属性的数据项，我们的操作正是基于这些属性。

对博客用户分类

这个示例所使用的数据集是一组指定的词汇在排名前120的博客的RSS中出现的次数，根据这个来对这些博客进行分类。这个数据的一小部分如下表所示：

	"china"	"kids"	"music"	"yahoo"
Gothamist	3	3	3	0
GigaOM	6	0	0	2
Quick Online Tips	0	2	2	22

根据单词出现的频度对博客聚类，可以分析出是否存在一类经常撰写相似主题的博客用户。
本文将略去构造这个数据源的过程，直接使用现成数据，可以在这里下载测试。这份文本中数据的格式与上面的表格差不多，只是以制表符作为分隔。后面所有代码都将基于这个格式的数据来实现。

这里稍微插一句构建测试数据的技巧，对于指定词汇的选择，可以使用一个范围如出现频率10%~50%进行过滤，这样可以去除像是the这样随处可见对聚类无意义的次，或是一些特别冷门的词，如合成词。排除这些干扰可以使后面的聚类结果更准确。

分级聚类

分级聚类通过连续不断地将最为相似的群组两两合并，来构造一个群组的层级结构。
具体方法是，先将单一元素，本例中就是博客，作为一个群组，在迭代过程中，分级聚类算法计算两个群组的距离（一开始时就是两个单一元素的距离），并将距离最近的两个群组合并为新群组，重复这个过程直到只剩一个群组。
按如上方式进行聚类，聚类的过程可以使用树状图来表示。树状图也可以体现构成聚类的元素之间间隔的远近，从而可以看出聚类中各元素间的相似程度，并以此指示聚类的紧密程度。

加载博客数据并进行聚类

下面的函数用于将上文提到的数据源加载到内存中用于聚类计算。

public Tuple,List,List>> Readfile(string filename)
{
    List lines = new List();
    using (var fs = new FileStream(filename, FileMode.Open))
    {
        var sr = new StreamReader(fs);
        while (!sr.EndOfStream)
        {
            var line = sr.ReadLine();
            if (!string.IsNullOrEmpty(line))
                lines.Add(line);
        }
    }
    if (lines.Count == 0)
        throw new Exception("文件为空");
    //第一行是列标题
    var colnames = lines[0].Trim()
        .Split(new[] {'\t'}, StringSplitOptions.RemoveEmptyEntries)
        .Skip(1).ToList();

    var rownames = new List();
    var data = new List>();
    foreach (var l in lines.Skip(1))
    {
        var p = l.Trim().Split(new[] {'\t'}, StringSplitOptions.RemoveEmptyEntries);
        // 每行第一列为行名
        rownames.Add(p[0]);
        // 剩余部分是行对应的数据
        data.Add(p.Skip(1).Select(float.Parse).ToList());
    }
    return Tuple.Create(rownames, colnames, data);
}

下一步来计算紧密度。由于一些博客比其他其他博客文章更多，或文章的长度比其他文章更长，这可能会导致这些博客比其他博客包含更多的词汇。我们使用皮尔逊相关度来确定这些博客的相关程度，由于皮尔逊相关度表示两组数据与某条直线的拟合程度，这样可以排除词汇量多少对相关性的影响（简单说，一个博客与另一个博客有差不多的相同词汇，但前者比后着的词汇数量更多，使用皮尔逊相关度计算两个博客的相关度依然会得出较高的结果）。这里的皮尔逊相关度计算函数接受两个博客词汇数列表作为参数，并返回这两个博客的相关度分值。

public float Person(List v1,List v2)
{
    //求和
    var sum1 = v1.Sum();
    var sum2 = v2.Sum();
    //求平方和
    var sum1Sq = v1.Sum(v => Math.Pow(v, 2));
    var sum2Sq = v2.Sum(v => Math.Pow(v, 2));
    //求乘积之和
    var pSum = v1.Select((v,i)=>v*v2[i]).Sum();
    //计算皮尔逊评价值
    var num = pSum - (sum1 * sum2 / v1.Count);
    var den = Math.Sqrt((sum1Sq - Math.Pow(sum1, 2) / v1.Count) * (sum2Sq - Math.Pow(sum2, 2) / v1.Count));
    if (den == 0) return 0;
    return 1 - num / (float)den;
}

由于在完全匹配的情况下，皮尔逊相关度的计算结果为1，而我们希望相关度高的两个元素“距离”更小，从而上面代码中使用1减去计算出的皮尔逊相关度。

接着我们构造一个数据结构来表示一个“聚类”。聚类可能是树中的叶节点，也可能事分支节点，对应我们的例子即可能是一个博客，也可能是几个博客聚类后的合并数据。

class BiCluster
{
    // 博客中词汇数量数组
    public List Vec { get; set; } 

    public BiCluster Left { get; set; }

    public BiCluster Right { get; set; }

    public int Id { get; set; }

    public float Distance { get; set; }
}

下面开始正式进入分类算法，分类算法以叶节点一级（即原始博客数据）聚类开始。函数的主循环中两两计算聚类相关度，以此找到最佳匹配。新生成的聚类的数据等于两个旧聚类求平均后的结果。然后重复这一过程直到只剩一个聚类。代码中一个优化的地方是保存每个配对的相关度计算结果，知道配对中的某一项被合并到另一个聚类中为止。

public BiCluster Hcluster(List> rows, Func, List, float> distance)
{
    var distances = new Dictionary();
    var currentclustid = -1;

    // 最开始的聚类就是数据集中的行
    var clust = rows.Select((data, i) => new BiCluster() {Vec = data, Id = i}).ToList();

    while (clust.Count>1)
    {
        var lowestpair = Tuple.Create(0, 1);
        var closest = distance(clust[0].Vec, clust[1].Vec);

        //遍历每一个配对，寻找最小距离
        for (int i = 0; i < clust.Count; i++)
        {
            for (int j = i+1; j < clust.Count; j++)
            {
                //用distances缓存相关度计算值
                var key = ((long)clust[i].Id << 32) + clust[j].Id;
                if(!distances.ContainsKey(key))
                    distances.Add(key, distance(clust[i].Vec,clust[j].Vec));
                var d = distances[key];
                if (d < closest)
                {
                    closest = d;
                    lowestpair = Tuple.Create(i, j);
                }
            }
        }

        // 计算两个聚类的平均值
        var mergevec = clust[lowestpair.Item1].Vec
            .Select((v, i) => (v + clust[lowestpair.Item2].Vec[i])/2f).ToList();

        // 建立新聚类
        var newcluster = new BiCluster()
        {
            Vec = mergevec,
            Left = clust[lowestpair.Item1],
            Right = clust[lowestpair.Item2],
            Distance = closest,
            Id = currentclustid
        };

        //不在原始集合中，id为负数
        --currentclustid;
        var leftCluster = clust[lowestpair.Item1];
        var rightCluster = clust[lowestpair.Item2];
        clust.Remove(leftCluster);
        clust.Remove(rightCluster);
        clust.Add(newcluster);
    }
    return clust.FirstOrDefault();
}

在前面设计的存储聚类的数据结构BiCluster中保存了构成当前的聚类的两个原始聚类，可以使用这个信息，通过递归重建所有的中间聚类和叶节点。
下面的代码就可以测试聚类的生成。

Tester c = new Tester();
var datas = c.Readfile("blogdata.txt");
var clust = c.Hcluster(datas.Item3, c.Person);

可以使用下面的代码可视化的显示聚类的过程：

static void PrintClust(BiCluster clust, List labels, int n = 0)
{
    // 缩进布局
    for (int i = 0; i < n; i++)
        Console.Write(" ");
    if (clust.Id < 0)                
        //分支
        Console.WriteLine("├");
    else Console.WriteLine($"{labels[clust.Id]}");

    ++n;
    if (clust.Left != null) PrintClust(clust.Left,labels, n);
    if (clust.Right != null) PrintClust(clust.Right,labels, n);
}

制表符├表示接下来的是两个子聚类。使用如下测试代码可以看到运行的效果：

PrintClust(clust,datas.Item1);

列聚类

上面我们以行进行聚类得到了博客的聚类结果，如果反过来以列进行聚类可以得到单词的聚类结果，从而可以知道那些单词常常被放在一起使用。举另一个常见的例子，在消费者购物清单的聚类中，如果按行聚类可以将那些有相似消费习惯的用户划分到一起，而如果按列聚类则可以把用户常一起购买的商品集合计算出来以用于捆绑销售或相关商品推荐。
把上面计算改为列聚类最简单的方式就是将数据集转置，通过下面的函数可以简单完成：

public List> RotatMatrix(List> data)
{
    var newdata = new List>();
    for (int i = 0; i < data[0].Count; i++)
    {
        newdata.Add(data.Select(d=>d[i]).ToList());
    }
    return newdata;
}

然后测试代码也要进行调整：

Tester c = new Tester();
var datas = c.Readfile("blogdata.txt");
var rdata = c.RotatMatrix(datas.Item3);
var clust = c.Hcluster(rdata, c.Person);
PrintClust(clust,datas.Item2);

由于本身这种分级聚类算法的效率不高，移上列举类函数计算时间明显增加。

K值聚类

前文介绍的分级聚类有两个明显缺点，在没有额外处理的情况下，数据并没有真正拆分到不同组（只是以一棵二叉树的形式存在），且计算量非常大。计算量大的原因一是要计算每个项两两之间的关系，二是在项合并后要重新计算合并后项和其他项之间的关系。这导致在处理大规模数据时计算非常缓慢（如上面的列聚类）。
这一节介绍的K值聚类与分级聚类完全不同，其是通过传入的希望得到的聚类数量来根据数据的结构状态确定聚类的大小。
具体来说K值聚类的方法是，随机确定k个（按需求传入）中心位置（表示聚类中心），然后将各项分配到最邻近的中心点。分配完成后，将聚类的中心移动到分配给该聚类中心的所有项的中心位置，然后再次进行分配过程，直到分配结果不再发生变化为止。

public Dictionary> Kcluster(List> rows, 
                                      Func, List, float> distance, int k = 4)
{
    // 确定每个点的最小值和最大值
    var ranges = new List();
    for (var i = 0; i < rows[0].Count; i++)
    {
        var min = rows.Min(r => r[i]);
        var max = rows.Max(r => r[i]);
        ranges.Add(new [] {min,max});
    }

    // 随机创建k个中心点
    var rnd = new Random();
    var clusters = new List>();
    var rowLength = rows[0].Count;
    for (int j = 0; j < k; j++)
    {
        var cluster = new List();
        for (int i = 0; i < rowLength; i++)
        {
            cluster.Add((float)rnd.NextDouble() * (ranges[i][1] - ranges[i][0]) + ranges[i][0]);
        }
        clusters.Add(cluster);
    }

    var lastmatches = new Dictionary>(); ;
    for (int t = 1; t <= 100; t++)
    {
        Console.WriteLine($"第{t}次迭代");
        var bestmatches = new Dictionary>();
        for (int i = 0; i < k; i++)
        {
            bestmatches.Add(i, new List());
        }

        //在每一行中寻找距离最近的中心点
        for (int j = 0; j < rows.Count; j++)
        {
            var row = rows[j];
            var bestmatch = 0;
            for (int i = 0; i < k; i++)
            {
                var d = distance(clusters[i], row);
                if (d < distance(clusters[bestmatch], row))
                    bestmatch = i;
                bestmatches[bestmatch].Add(j);
            }
        }

        // 如果结果与上一次相同，则整个过程结束
        if (CompareDic(bestmatches, lastmatches)) break;
        lastmatches = bestmatches;

        // 把中心点移到其所有成员的平均位置处
        for (int i = 0; i < k; i++)
        {
            var avgs = ArrayList.Repeat(0.0f, rows[0].Count).Cast().ToList();
            if (bestmatches[i].Count > 0)
            {
                foreach (var rowid in bestmatches[i])
                    for (int m = 0; m < rows[rowid].Count; m++)
                        avgs[m] += rows[rowid][m];
                for (int j = 0; j < avgs.Count; j++)
                    avgs[j] /= bestmatches[i].Count;
                clusters[i] = avgs;
            }
        }
        return bestmatches;
    }
    throw new Exception("超过最大迭代次数");
}

算法中用到的Dictionary比较方法如下：

private bool CompareDic(Dictionary> first, Dictionary> second)
{
    if (first == second) return true;
    if ((first == null) || (second == null)) return false;
    if (first.Count != second.Count) return false;

    foreach (var kvp in first)
    {
        List secondValue;
        if (!second.TryGetValue(kvp.Key, out secondValue)) return false;
        if (!kvp.Value.OrderBy(t => t).SequenceEqual(secondValue.OrderBy(t => t))) return false;
    }
    return true;
}

与分级聚类相比，这个算法产生最终结果所需要的迭代次数是非常少的。算法最终返回k组序列，其中每个序列表示一个聚类。
下面的代码可以测试上面算法：

可以明显感觉到，k值聚类算法比分级聚类算法快很多。

Tester c = new Tester();
var datas = c.Readfile("blogdata.txt");
var clust = c.Kcluster(datas.Item3, c.Person,k:10);
foreach (var ckvp in clust)
{
    Console.WriteLine($"聚类 {ckvp.Key} ：{string.Join(",",ckvp.Value.Select(i=>datas.Item1[i]))}");
}

附：Tanimoto系数

对于数据类型是1和0的集合类型（如一个用户喜欢某些商品的一部分，对于喜欢的物品记录为1，不喜欢的物品记为0），判断相关性的最佳办法就是Tanimoto系数。Tanimoto系数定义很简单，就是交集与并集的比率。下面的函数就可以很简单的实现这个算法：

public float Tanimoto(HashSet v1, HashSet v2)
{
    return 1.0f - (float) v1.Intersect(v2).Count()/v1.Union(v2).Count();
}

参数v1和v2是两个集合，集合中元素为bool类型表示0和1。返回值为0.0到1.0之间值，0.0表示两个人喜欢的物品完全相同，1.0表示两个人喜欢的物品完全相同。

转载于:https://www.cnblogs.com/lsxqw2004/p/6017552.html

系统学习Python——并发模型和异步编程：进程、线程和GIL
分类目录：《系统学习Python》总目录在文章《并发模型和异步编程：基础知识》我们简单介绍了Python中的进程、线程和协程。本文就着重介绍Python中的进程、线程和GIL的关系。Python解释器的每个实例都是一个进程。使用multiprocessing或concurrent.futures库可以启动额外的Python进程。Python的subprocess库用于启动运行外部程序（不管使用何种
Flask框架入门：快速搭建轻量级Python网页应用「已注销」 python-AI python基础网站网络 python flask 后端
转载：Flask框架入门：快速搭建轻量级Python网页应用1.Flask基础Flask是一个使用Python编写的轻量级Web应用框架。它的设计目标是让Web开发变得快速简单，同时保持应用的灵活性。Flask依赖于两个外部库：Werkzeug和Jinja2，Werkzeug作为WSGI工具包处理Web服务的底层细节，Jinja2作为模板引擎渲染模板。安装Flask非常简单，可以使用pip安装命令
Python Flask 框架入门：快速搭建 Web 应用的秘诀 Python编程之道 Python人工智能与大数据 Python编程之道 python flask 前端 ai
PythonFlask框架入门：快速搭建Web应用的秘诀关键词Flask、微框架、路由系统、Jinja2模板、请求处理、WSGI、Web开发摘要想快速用Python搭建一个灵活的Web应用？Flask作为“微框架”代表，凭借轻量、可扩展的特性，成为初学者和小型项目的首选。本文将从Flask的核心概念出发，结合生活化比喻、代码示例和实战案例，带你一步步掌握：如何用Flask搭建第一个Web应用？路由
python_虚拟环境阿_焦 python
第一、配置虚拟环境：virtualenv（1）pipvirtualenv>安装虚拟环境包（2）pipinstallvirtualenvwrapper-win>安装虚拟环境依赖包（3）c盘创建虚拟目录>C:\virtualenv>配置环境变量【了解一下】：（1）如何使用virtualenv创建虚拟环境a、cd到C:\virtualenv目录下：b、mkvirtualenvname>创建虚拟环境nam
Python爱心光波
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
Python流星雨 Want595 python 开发语言
文章目录系列文章写在前面技术需求完整代码代码分析1.模块导入2.画布设置3.画笔设置4.颜色列表5.流星类(Star)6.流星对象创建7.主循环8.流星运动逻辑9.视觉效果10.总结写在后面系列文章序号直达链接表白系列1Python制作一个无法拒绝的表白界面2Python满屏飘字表白代码3Python无限弹窗满屏表白代码4Python李峋同款可写字版跳动的爱心5Python流星雨代码6Python
算法学习笔记：17.蒙特卡洛算法 ——从原理到实战，涵盖 LeetCode 与考研 408 例题
在计算机科学和数学领域，蒙特卡洛算法（MonteCarloAlgorithm）以其独特的随机抽样思想，成为解决复杂问题的有力工具。从圆周率的计算到金融风险评估，从物理模拟到人工智能，蒙特卡洛算法都发挥着不可替代的作用。本文将深入剖析蒙特卡洛算法的思想、解题思路，结合实际应用场景与Java代码实现，并融入考研408的相关考点，穿插图片辅助理解，帮助你全面掌握这一重要算法。蒙特卡洛算法的基本概念蒙特卡
Python之七彩花朵代码实现 PlutoZuo Python python 开发语言
Python之七彩花朵代码实现文章目录Python之七彩花朵代码实现下面是一个简单的使用Python的七彩花朵。这个示例只是一个简单的版本，没有很多高级功能，但它可以作为一个起点，你可以在此基础上添加更多功能。importturtleastuimportrandomasraimportmathtu.setup(1.0,1.0)t=tu.Pen()t.ht()colors=['red','skybl
Python 脚本最佳实践2025版
前文可以直接把这篇文章喂给AI,可以放到AI角色设定里,也可以直接作为提示词.这样,你只管提需求,写脚本就让AI来.概述追求简洁和清晰：脚本应简单明了。使用函数(functions)、常量(constants)和适当的导入(import)实践来有逻辑地组织你的Python脚本。使用枚举(enumerations)和数据类(dataclasses)等数据结构高效管理脚本状态。通过命令行参数增强交互性
（Python基础篇）了解和使用分支结构 EternityArt 基础篇 python
目录一、引言二、Python分支结构的类型与语法（一）if语句（单分支）（二）if-else语句（双分支）（三）if-elif-else语句（多分支）三、分支结构的应用场景（一）提示用户输入用户名，然后再提示输入密码，如果用户名是“admin”并且密码是“88888”则提示正确，否则，如果用户名不是admin还提示用户用户名不存在,（二）提示用户输入用户名，然后再提示输入密码，如果用户名是“adm
（Python基础篇）循环结构 EternityArt 基础篇 python
一、什么是Python循环结构？循环结构是编程中重复执行代码块的机制。在Python中，循环允许你：1.迭代处理数据：遍历列表、字典、文件内容等。2.自动化重复任务：如批量处理数据、生成序列等。3.控制执行流程：根据条件决定是否继续或终止循环。二、为什么需要循环结构？假设你需要打印1到100的所有偶数：没有循环：需手动编写100行print()语句。print(0)print(2)print(4)
（Python基础篇）字典的操作 EternityArt 基础篇 python 开发语言
一、引言在Python编程中，字典（Dictionary）是一种极具灵活性的数据结构，它通过“键-值对”（key-valuepair）的形式存储数据，如同现实生活中的字典——通过“词语（键）”快速查找“释义（值）”。相较于列表和元组的有序索引访问，字典的优势在于基于键的快速查找，这使得它在处理需要频繁通过唯一标识获取数据的场景中极为高效。掌握字典的操作，能让我们更高效地组织和管理复杂数据，是Pyt
Python七彩花朵 Want595 python 开发语言
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
用OpenCV标定相机内参应用示例（C++和Python）
下面是一个完整的使用OpenCV进行相机内参标定（CameraCalibration）的示例，包括C++和Python两个版本，基于棋盘格图案标定。一、目标：相机标定通过拍摄多张带有棋盘格图案的图像，估计相机的内参：相机矩阵（内参）K畸变系数distCoeffs可选外参（R,T）标定精度指标（如重投影误差）二、棋盘格参数设置（根据自己的棋盘格设置）：棋盘格角点数：9x6（内角点，9列×6行）；每个
Anaconda 详细下载与安装教程
Anaconda详细下载与安装教程1.简介Anaconda是一个用于科学计算的开源发行版，包含了Python和R的众多常用库。它还包括了conda包管理器，可以方便地安装、更新和管理各种软件包。2.下载Anaconda2.1访问官方网站首先，打开浏览器，访问Anaconda官方网站。2.2选择适合的版本在页面中，你会看到两个主要的下载选项：AnacondaIndividualEdition：适用于
python中 @注解及内置注解的使用方法总结以及完整示例慧一居士 Python python
在Python中，装饰器（Decorator）使用@符号实现，是一种修改函数/类行为的语法糖。它本质上是一个高阶函数，接受目标函数作为参数并返回包装后的函数。Python也提供了多个内置装饰器，如@property、@staticmethod、@classmethod等。一、核心概念装饰器本质：@decorator等价于func=decorator(func)执行时机：在函数/类定义时立即执行装饰
Python中的静态方法和类方法详解
在Python中，`@staticmethod`和`@classmethod`是两种装饰器，它们用于定义类中的方法，但是它们的行为和用途有所不同。###@staticmethod`@staticmethod`装饰器用于定义一个静态方法。静态方法不接收类或实例的引用作为第一个参数，因此它不能访问类的状态或实例的状态。静态方法可以看作是与类关联的普通函数，但它们可以通过类名直接调用。classMath
Python中类静态方法：@classmethod/@staticmethod详解和实战示例
在Python中，类方法(@classmethod)和静态方法(@staticmethod)是类作用域下的两种特殊方法。它们使用装饰器定义，并且与实例方法(deffunc(self))的行为有所不同。1.三种方法的对比概览方法类型是否访问实例(self)是否访问类(cls)典型用途实例方法✅是❌否访问对象属性类方法@classmethod❌否✅是创建类的替代构造器，访问类变量等静态方法@stati
Python多版本管理与pip升级全攻略：解决冲突与高效实践码界奇点 Python python pip 开发语言 python3.11 源代码管理虚拟现实依赖倒置原则
引言Python作为最流行的编程语言之一，其版本迭代速度与生态碎片化给开发者带来了巨大挑战。据统计，超过60%的Python开发者需要同时维护基于Python3.6+和Python2.7的项目。本文将系统解决以下核心痛点：如何安全地在同一台机器上管理多个Python版本pip依赖冲突的根治方案符合PEP标准的生产环境最佳实践第一部分：Python多版本管理核心方案1.1系统级多版本共存方案Wind
基于Python的健身数据分析工具的搭建流程day1 weixin_45677320 python 开发语言数据挖掘爬虫
基于Python的健身数据分析工具的搭建流程分数据挖掘、数据存储和数据分析三个步骤。本文主要介绍利用Python实现健身数据分析工具的数据挖掘部分。第一步：加载库加载本文需要的库，如下代码所示。若库未安装，请按照python如何安装各种库（保姆级教程）_python安装库-CSDN博客https://blog.csdn.net/aobulaien001/article/details/133298
seaborn又一个扩展heatmapz qq_21478261 #Python可视化 matplotlib
推荐阅读：Pythonmatplotlib保姆级教程嫌Matplotlib繁琐？试试Seaborn！
NGS测序基础梳理01-文库构建（Library Preparation） qq_21478261 #生物信息生物学
本文介绍Illumina测序平台文库构建（LibraryPreparation）步骤，文库结构。写作时间：2020.05。推荐阅读：10W字《Python可视化教程1.0》来了！一份由公众号「pythonic生物人」精心制作的PythonMatplotlib可视化系统教程，105页PDFhttps://mp.weixin.qq.com/s/QaSmucuVsS_DR-klfpE3-Q10W字《Rg
AI音乐模拟器：AIGC时代的智能音乐创作革命 lauo 人工智能 AIGC 开源前端机器人
AI音乐模拟器：AIGC时代的智能音乐创作革命引言：AIGC浪潮下的音乐创作新范式在数字化转型的浪潮中，人工智能生成内容（AIGC）正在重塑各个创意领域。音乐产业作为创意经济的重要组成部分，正经历着前所未有的变革。据最新市场研究数据显示，全球AI音乐市场规模预计将从2023年的5.8亿美元增长到2030年的26.8亿美元，年复合增长率高达24.3%。这一快速增长的市场背后，是AI音乐技术正在打破传
Python 常用内置函数详解（七）：dir()函数——获取当前本地作用域中的名称列表或对象的有效属性列表
目录一、功能二、语法和示例一、功能dir()函数获取当前本地作用域中的名称列表或对象的有效属性列表。二、语法和示例dir()函数有两种形式，如果没有实参，则返回当前本地作用域中的名称列表。如果有实参，它会尝试返回该对象的有效属性列表。如果对象有一个名为__dir__()的方法，那么该方法将被调用，并且必须返回一个属性列表。dir()函数的语法格式如下：C:\Users\amoxiang>ipyth
pythonjson中list操作_Python json.dumps 特殊数据类型的自定义序列化操作
场景描述：Python标准库中的json模块，集成了将数据序列化处理的功能；在使用json.dumps()方法序列化数据时候，如果目标数据中存在datetime数据类型，执行操作时，会抛出异常：TypeError:datetime.datetime(2016,12,10,11,04,21)isnotJSONserializable那么遇到json.dumps序列化不支持的数据类型，该怎么办！首先，
Python 日期格式转json.dumps的解决方法 douyaoxin python json 开发语言
classDateEncoder(json.JSONEncoder):defdefault(self,obj):ifisinstance(obj,datetime.datetime):returnobj.strftime('%Y-%m-%d%H:%M:%S')elifisinstance(obj,datetime.date):returnobj.strftime("%Y-%m-%d")json.d
Python 爬虫实战：视频平台播放量实时监控（含反爬对抗与数据趋势预测）西攻城狮北 python 爬虫音视频
一、引言在数字内容蓬勃发展的当下，视频平台的播放量数据已成为内容创作者、营销人员以及行业分析师手中极为关键的情报资源。它不仅能够实时反映内容的受欢迎程度，更能在竞争分析、营销策略制定以及内容优化等方面发挥不可估量的作用。然而，视频平台为了保护自身数据和用户隐私，往往会设置一系列反爬虫机制，对数据爬取行为进行限制。这就向我们发起了挑战：如何巧妙地突破这些限制，同时精准地捕捉并预测播放量的动态变化趋势
Python技能手册 - 模块module 金色牛神 Python python windows 开发语言
系列Python常用技能手册-基础语法Python常用技能手册-模块modulePython常用技能手册-包package目录module模块指什么typing数据类型int整数float浮点数str字符串bool布尔值TypeVar类型变量functools高阶函数工具functools.partial()函数偏置functools.lru_cache()函数缓存sorted排序列表排序元组排序
Ubuntu基础（Python虚拟环境和Vue） aaiier ubuntu python linux
Python虚拟环境sudoaptinstallpython3python3-venv进入项目目录cdXXX创建虚拟环境python3-mvenvvenv激活虚拟环境sourcevenv/bin/activate退出虚拟环境deactivateVue安装Node.js和npm#安装Node.js和npm（Ubuntu默认仓库可能版本较旧，适合入门）sudoaptinstallnodejsnpm#验
苦练Python第9天：if-else分支九剑 python后端前端人工智能
苦练Python第9天：if-else分支九剑前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我，微信公众号：倔强青铜三。欢迎点赞、收藏、关注，一键三连！！！欢迎来到100天Python挑战第9天！今天我们不练循环，改磨“分支剑法”——ifelse三式：单分支、双分支、多分支，以及嵌套和三元运算符，全部实战演练，让
矩阵求逆（JAVA）利用伴随矩阵 qiuwanchi 利用伴随矩阵求逆矩阵
package gaodai.matrix; import gaodai.determinant.DeterminantCalculation; import java.util.ArrayList; import java.util.List; import java.util.Scanner; /** * 矩阵求逆(利用伴随矩阵) * @author 邱万迟
单例（Singleton）模式 aoyouzi 单例模式 Singleton
3.1 概述如果要保证系统里一个类最多只能存在一个实例时，我们就需要单例模式。这种情况在我们应用中经常碰到，例如缓存池，数据库连接池，线程池，一些应用服务实例等。在多线程环境中，为了保证实例的唯一性其实并不简单，这章将和读者一起探讨如何实现单例模式。 3.2
[开源与自主研发]就算可以轻易获得外部技术支持,自己也必须研发 comsci 开源
现在国内有大量的信息技术产品，都是通过盗版，免费下载，开源，附送等方式从国外的开发者那里获得的。。。。。。虽然这种情况带来了国内信息产业的短暂繁荣，也促进了电子商务和互联网产业的快速发展，但是实际上，我们应该清醒的看到，这些产业的核心力量是被国外的
页面有两个frame,怎样点击一个的链接改变另一个的内容 Array_06 UI XHTML
<a src="地址" targets="这里写你要操作的Frame的名字" />搜索然后你点击连接以后你的新页面就会显示在你设置的Frame名字的框那里 targerts="",就是你要填写目标的显示页面位置 ===================== 例如： <frame src=&
Struts2实现单个/多个文件上传和下载 oloz 文件上传 struts
struts2单文件上传：步骤01:jsp页面  　　<form action="fileUplo
推荐10个在线logo设计网站 362217990 logo
在线设计Logo网站。 1、http://flickr.nosv.org（这个太简单） 2、http://www.logomaker.com/?source=1.5770.1 3、http://www.simwebsol.com/ImageTool 4、http://www.logogenerator.com/logo.php?nal=1&tpl_catlist[]=2 5、ht
jsp上传文件香水浓 jsp fileupload
1. jsp上传 Notice： 1. form表单 method 属性必须设置为 POST 方法，不能使用 GET 方法 2. form表单 enctype 属性需要设置为 multipart/form-data 3. form表单 action 属性需要设置为提交到后台处理文件上传的jsp文件地址或者servlet地址。例如 uploadFile.jsp 程序文件用来处理上传的文
我的架构经验系列文章 - 前端架构 agevs JavaScript Web 框架 UI jQuer
框架层面：近几年前端发展很快，前端之所以叫前端因为前端是已经可以独立成为一种职业了，js也不再是十年前的玩具了，以前富客户端RIA的应用可能会用flash/flex或是silverlight，现在可以使用js来完成大部分的功能，因此js作为一门前端的支撑语言也不仅仅是进行的简单的编码，越来越多框架性的东西出现了。越来越多的开发模式转变为后端只是吐json的数据源，而前端做所有UI的事情。MVCMV
android ksoap2 中把XML(DataSet) 当做参数传递 aijuans android
我的android app中需要发送webservice ，于是我使用了 ksop2 进行发送，在测试过程中不是很顺利,不能正常工作.我的web service 请求格式如下 [html] view plain copy <Envelope xmlns="http://schemas.
使用Spring进行统一日志管理 + 统一异常管理 baalwolf spring
统一日志和异常管理配置好后，SSH项目中，代码以往散落的log.info() 和 try..catch..finally 再也不见踪影！统一日志异常实现类： [java] view plain copy package com.pilelot.web.util; impor
Android SDK 国内镜像 BigBird2012 android sdk
一、镜像地址： 1、东软信息学院的 Android SDK 镜像，比配置代理下载快多了。配置地址， http://mirrors.neusoft.edu.cn/configurations.we#android 2、北京化工大学的： IPV4:ubuntu.buct.edu.cn IPV4:ubuntu.buct.cn IPV6:ubuntu.buct6.edu.cn
HTML无害化和Sanitize模块 bijian1013 JavaScript AngularJS Linky Sanitize
一.ng-bind-html、ng-bind-html-unsafe AngularJS非常注重安全方面的问题，它会尽一切可能把大多数攻击手段最小化。其中一个攻击手段是向你的web页面里注入不安全的HTML，然后利用它触发跨站攻击或者注入攻击。考虑这样一个例子，假设我们有一个变量存
[Maven学习笔记二]Maven命令 bit1129 maven
mvn compile compile编译命令将src/main/java和src/main/resources中的代码和配置文件编译到target/classes中，不会对src/test/java中的测试类进行编译 MVN编译使用 maven-resources-plugin:2.6:resources maven-compiler-plugin:2.5.1:compile &nbs
【Java命令二】jhat bit1129 Java命令
jhat用于分析使用jmap dump的文件，，可以将堆中的对象以html的形式显示出来，包括对象的数量，大小等等，并支持对象查询语言。 jhat默认开启监听端口7000的HTTP服务，jhat是Java Heap Analysis Tool的缩写 1. 用法： [hadoop@hadoop bin]$ jhat -help Usage: jhat [-stack <bool&g
JBoss 5.1.0 GA:Error installing to Instantiated: name=AttachmentStore state=Desc ronin47
进到类似目录 server/default/conf/bootstrap，打开文件 profile.xml找到： Xml代码<bean name="AttachmentStore" class="org.jboss.system.server.profileservice.repository.AbstractAtta
写给初学者的6条网页设计安全配色指南 brotherlamp UI ui自学 ui视频 ui教程 ui资料
网页设计中最基本的原则之一是，不管你花多长时间创造一个华丽的设计，其最终的角色都是这场秀中真正的明星——内容的衬托我仍然清楚地记得我最早的一次美术课，那时我还是一个小小的、对凡事都充满渴望的孩子，我摆放出一大堆漂亮的彩色颜料。我仍然记得当我第一次看到原色与另一种颜色混合变成第二种颜色时的那种兴奋，并且我想，既然两种颜色能创造出一种全新的美丽色彩，那所有颜色
有一个数组，每次从中间随机取一个，然后放回去，当所有的元素都被取过，返回总共的取的次数。写一个函数实现。复杂度是什么。 bylijinnan java 算法面试
import java.util.Random; import java.util.Set; import java.util.TreeSet; /** * http://weibo.com/1915548291/z7HtOF4sx * #面试题#有一个数组，每次从中间随机取一个，然后放回去，当所有的元素都被取过，返回总共的取的次数。 * 写一个函数实现。复杂度是什么
struts2获得request、session、application方式 chiangfai application
1、与Servlet API解耦的访问方式。 a.Struts2对HttpServletRequest、HttpSession、ServletContext进行了封装，构造了三个Map对象来替代这三种对象要获取这三个Map对象，使用ActionContext类。 -----> package pro.action; import java.util.Map; imp
改变python的默认语言设置 chenchao051 python
import sys sys.getdefaultencoding() 可以测试出默认语言，要改变的话，需要在python lib的site-packages文件夹下新建： sitecustomize.py，这个文件比较特殊，会在python启动时来加载，所以就可以在里面写上： import sys sys.setdefaultencoding('utf-8') &n
mysql导入数据load data infile用法 daizj mysql 导入数据
我们常常导入数据！mysql有一个高效导入方法，那就是load data infile 下面来看案例说明基本语法： load data [low_priority] [local] infile 'file_name txt' [replace | ignore] into table tbl_name [fields [terminated by't'] [OPTI
phpexcel导入excel表到数据库简单入门示例 dcj3sjt126com PHP Excel
跟导出相对应的，同一个数据表，也是将phpexcel类放在class目录下，将Excel表格中的内容读取出来放到数据库中 <?php error_reporting(E_ALL); set_time_limit(0); ?> <html> <head> <meta http-equiv="Content-Type"
22岁到72岁的男人对女人的要求 dcj3sjt126com
22岁男人对女人的要求是：一，美丽，二，性感，三，有份具品味的职业，四，极有耐性，善解人意，五，该聪明的时候聪明，六，作小鸟依人状时尽量自然，七，怎样穿都好看，八，懂得适当地撒娇，九，虽作惊喜反应，但看起来自然，十，上了床就是个无条件荡妇。 32岁的男人对女人的要求，略作修定，是：一，入得厨房，进得睡房，二，不必服侍皇太后，三，不介意浪漫蜡烛配盒饭，四，听多过说，五，不再傻笑，六，懂得独
Spring和HIbernate对DDM设计的支持 e200702084 DAO 设计模式 spring Hibernate 领域模型
A：数据访问对象 DAO和资源库在领域驱动设计中都很重要。DAO是关系型数据库和应用之间的契约。它封装了Web应用中的数据库CRUD操作细节。另一方面，资源库是一个独立的抽象，它与DAO进行交互，并提供到领域模型的“业务接口”。资源库使用领域的通用语言，处理所有必要的DAO，并使用领域理解的语言提供对领域模型的数据访问服务。
NoSql 数据库的特性比较 geeksun NoSQL
Redis 是一个开源的使用ANSI C语言编写、支持网络、可基于内存亦可持久化的日志型、Key-Value数据库，并提供多种语言的API。目前由VMware主持开发工作。 1. 数据模型作为Key-value型数据库，Redis也提供了键（Key）和值（Value）的映射关系。除了常规的数值或字符串，Redis的键值还可以是以下形式之一： Lists （列表） Sets
使用 Nginx Upload Module 实现上传文件功能 hongtoushizi nginx
转载自： http://www.tuicool.com/wx/aUrAzm 普通网站在实现文件上传功能的时候，一般是使用Python，Java等后端程序实现，比较麻烦。Nginx有一个Upload模块，可以非常简单的实现文件上传功能。此模块的原理是先把用户上传的文件保存到临时文件，然后在交由后台页面处理，并且把文件的原名，上传后的名称，文件类型，文件大小set到页面。下
spring-boot-web-ui及thymeleaf基本使用 jishiweili spring thymeleaf
视图控制层代码demo如下： @Controller @RequestMapping("/") public class MessageController { private final MessageRepository messageRepository; @Autowired public MessageController(Mes
数据源架构模式之活动记录 home198979 PHP 架构活动记录数据映射
hello!架构一、概念活动记录（Active Record）：一个对象，它包装数据库表或视图中某一行，封装数据库访问，并在这些数据上增加了领域逻辑。对象既有数据又有行为。活动记录使用直截了当的方法，把数据访问逻辑置于领域对象中。二、实现简单活动记录活动记录在php许多框架中都有应用，如cakephp。 <?php /** * 行数据入口类 *
Linux Shell脚本之自动修改IP pda158 linux centos Debian 脚本
作为一名 Linux SA，日常运维中很多地方都会用到脚本，而服务器的ip一般采用静态ip或者MAC绑定，当然后者比较操作起来相对繁琐，而前者我们可以设置主机名、ip信息、网关等配置。修改成特定的主机名在维护和管理方面也比较方便。如下脚本用途为：修改ip和主机名等相关信息，可以根据实际需求修改，举一反三！ #!/bin/sh #auto Change ip netmask ga
开发环境搭建独浮云 eclipse jdk tomcat
最近在开发过程中，经常出现MyEclipse内存溢出等错误，需要重启的情况，好麻烦。对于一般的JAVA+TOMCAT项目开发，其实没有必要使用重量级的MyEclipse，使用eclipse就足够了。尤其是开发机器硬件配置一般的人。 &n