GoToPro

入门笔记：机器学习与建模

我常想，如果我重新开始学习，那么在入门机器学习之前，我希望自己先了解哪些信息？本文旨在以一种速览、直白的方式，向有意入门的新手分享一下我对机器学习的浅见。

常见的机器学习问题包括分类，聚类，回归，关联规则等。其中分类算法是最广泛使用，而二分类又是其中最常见的。一封邮件是否是垃圾邮件（正常邮件/垃圾邮件），一个病灶是否是良性（良性/恶性），一个用户是否会违约（违约/不违约），一张图片是否人脸肖像（人脸/非人脸），手写数字的机器识别（0~9的多分类），这些问题都在分类的范畴。

常见的分类算法有逻辑回归、决策树、随机森林、提升树等。在说到具体的算法使用之前，需要先明确几个关于机器学习的概念。

1、目标函数与损失函数（或称代价函数）

目标函数，顾名思义，就是模型优化的目标。

目标函数 = 损失函数 + 正则化项

模型优化的目标有两个：一是使得预测值和真实值之间的差距最小化，二是使得模型不要过于复杂（因为复杂的模型不够健壮，或者说容易过拟合，导致在真实环境中表现不佳）。损失函数用来衡量预测值与真实值之间的差距，正则化项用来控制模型的复杂度。所谓正则化，即为“规则化”，含义就是使用规则约束模型的复杂度。

综上，目标函数的目标，就是在一定约束条件下（即正则化）的损失函数最小化。或者用更直白的话说，就是在模型不要过于复杂的前提下，使得预测值和真实值之间的差距最小。

常用的目标函数有哪些呢？譬如平方损失函数，交叉熵函数等，通常这些不需要我们深究，算法会自动选择合适的函数。

2、因变量，自变量，训练集，测试集，跨期验证，交叉验证，正例，反例

因变量就是模型预测的值（或称y值，标签值，只有一个），自变量就是模型使用的值（或称x值，特征值，理论上可以是任意多个）。训练集是用来训练模型的数据集，测试集/验证集是用来测试模型有效性的数据集，经验上两者通常保持7：3左右的比重，但这个没有一定之规。跨期验证是一种特殊的验证集，意思是模型使用较老的数据进行训练，使用较新的数据进行验证，以验证模型随着时间推移是否仍然有效。

交叉验证，通常指K折交叉验证，是指将数据集按某种抽样方法分成K份，使得每一份都至少经过一次训练和测试。通常在数据较少时使用。

正例（或称1）、反例（或称0）指的是二分类的因变量。通常我们考察的值，称之为正例。譬如我们想找到一批用户中的违约用户，那么违约用户就是正例，未违约用户就是反例。但这个叫法没有一定之规，反着叫也无关大局。

3、过拟合，欠拟合

过拟合指模型为了适应训练数据而变得过于复杂，导致在测试集上表现较差；欠拟合则相反，因模型过于简单而导致表现较差。

过拟合是机器学习中最常见的问题之一，围绕这个问题有着各种或简单、或高阶的解决方式。为什么过拟合这么常见呢？如果说传统的编程是给出一系列规则，让机器照着规则去执行任务并得出结果，那么机器学习就是反过来的：它首先得到一系列结果（训练集），然后尝试从结果中发现规则。当机器进行训练时，如果不加以限制，往往会对数据中无关的信息做出过度的反应。例如，机器会发现根据用户的姓名来判断他是不是违约，准确率很高，但这没有任何实践意义，因为姓名只是一个人的代号，没有提供任何信息。把这样的模型运用到测试集中，会发现效果很差。这就是过拟合。

4、参数，超参数

参数指模型训练完成后，产生的一系列对应着各个特征的系数。某些情况下，这些参数是静态的，可以直接套用在公式上（如逻辑回归）或写在代码里，这种情形称之为“可解释”；某些情况下则没有静态的参数（如xgboost），称之为“不可解释”，或者“黑箱”。

超参数是指在模型训练之前，你必须先定义好的一系列参数，比如缺失值的处理方式等。调参是训练模型中重要的一环，一般会反复进行，因为如果有多个超参数，那么它们之间的组合数量是比较可观的，需要一定的经验。

5、模型的评价指标

如何评价一个模型好不好呢？简单来说就是看它在测试集上的表现。
怎么评价它在测试集上的表现？

比较直观的有准确率、精确率等。但受数据分布的影响，它们可能意义不大。比如一个数据集中有10个恶性肿瘤，9990个良性肿瘤，如果模型全部判断为良性肿瘤，那么准确率达到99.9%，但结果并没有任何意义。因此要配合其他一些指标如召回率、误判率等等。

更常用的指标是ROC曲线，AUC值，KS曲线/KS值，提升度，混淆矩阵等。
这些指标难以直观地解释，我尽量说的直白一些。

ROC曲线（就不说中文名了，只会让你困惑）衡量的是，当我想召回更多的正例时，需要容忍多少的反例被错误地召回（它的纵横坐标分别是召回率和误判率。召回率，所有正例中有多少被正确地召回；误判率，所有负例中有多少被误判为正例。）最好情况是，不需要容忍任何错误，即可召回全部的正例；最坏情况是，当我想召回一定比例的正例，必须召回同等比例的反例，相当于随机选择。

AUC值是ROC曲线下的面积。AUC在0.5~1之间，越接近1，表示模型越好；越接近0.5，表示模型的判断越接近随机值。为什么不可以小于0.5呢？因为如果小于0.5，模型就是反向指标，只需要将模型结果反转一下（正变反，反变正），就是一个更好的模型，AUC值就大于0.5。

KS值（也不说中文名了，是两位数学家名字的首字母）用来衡量模型区分两种类别（二分类）的能力。具体来说，想象两条曲线（KS曲线），一条代表累计的划分正确的正例比例（“真正率”，或召回率），一条代表累计的“错误地划分为正例”的反例比例（“假正率”，或误判率），两条曲线之间最大的距离就是KS值。KS值在0~1之间，越接近1，代表模型的区分度越好。通常>0.2表示有区分度，越高越好。

从本质上说，ROC曲线、KS曲线都是相通的，这里就不展开了。

混淆矩阵是一个2*2的矩阵，分别表示预测正实际正、预测正实际负、预测负实际正、预测负实际负的案例数量。混淆矩阵可以直观地看到模型判断的效果如何。

说到混淆矩阵，必须穿插着讲一下阈（yu）值的概念。

如果模型输出的是概率值，那么需要定一个阈值才能够使用，混淆矩阵才能被算出。如果一个模型训练的不错，AUC很高，那么一个合适的阈值能够发挥模型的最大威力。通常来说这并不是难点，但是也需要注意。有人说最佳阈值是最大的KS值对应的概率值，但这个实际上跟你的业务偏好密切相关，更多的是一个经验值，而没有一致标准的最佳。

提升度，或称lift，表示一个模型对正例的捕捉能力高于随机选择的倍数。譬如1000个案例中有100个违约用户，如果一个模型预测的头部20%数据（也就是200条）中捕捉到了50%的违约用户（50个），那么对应的提升度就是(50/200)/(100/1000) = 2.5。提升度=1，意味着模型的选择和随机选择没有区别。

6、训练机器学习模型的常用工具

免费的有R语言、Python，收费的有SAS、SPM等。

R语言和Python都是机器学习语言中的佼佼者，令人欣慰的是，它们相对于其他编程语言，也非常容易入门。其中关键在于，它们有着成熟的开源社区，来自全世界的优秀的开发者贡献了他们的高度封装的代码，使得使用者仅需要加载相关的“包/模块”，即可使用机器学习算法，而无需了解其中的算法细节，真正做到了一行代码顶一百行。

当然它们也有缺点。最主要的一点是，它们的运行效率都不高，对于计算量大、实时性高的作业，需要做优化。常用的优化方式是，用C语言修改其中承担密集计算任务的部分。关于它们训练的模型如何部署到线上环境，后面还会涉及。

收费工具的优点是有着良好的售后支持。SAS是老牌的建模工具，历史悠久，名气大，价格贵，几乎所有银行都用它。SPM是它的竞争者，主打Treenet算法，擅长处理极多变量、高度缺失的数据。它们都是高度集成的工具，不需要写代码（当然也可以写），只需要点击鼠标即可实现复杂的功能和运算。相对而言，它们的部署上线也有成熟的傻瓜式的做法。

另外还有其他一些常见工具，如SPSS、Matlab等，笔者接触不多，就不展开了。

7、分类的常用算法

如前所述，分类算法常见的如：逻辑回归，决策树类算法，随机森林，提升树类算法，支持向量机（SVM）等。下面择要进行介绍。

逻辑回归是最经典最悠久的分类算法。虽然它的名字有回归二字，但它并不是回归算法，而是分类算法。它的分类效果中规中矩；最大的优点是解释性好，可以直接生成参数，套用公式。它对缺失值敏感，需要对缺失值进行预处理（填充或删除）。

决策树类算法是分类算法中一个庞大的家族，常见的有CART树（中文名：分类与回归树，也就是既可以做分类，也可以做回归），C50，ID3等。决策树算法的共性是，它们都通过生成节点、生成树干、生成叶片、剪枝的方式进行工作。具体而言，它们首先通过某种方式找到重要性最高的变量，在此节点进行分裂，使得分裂后的两部分纯度最高，再找到次重要的变量，依次循环作业，直到到达目标或预定深度。

不同决策树算法的区别在于它们如何判断变量的重要性。具体而言，CART树可以使用“信息增益”或“基尼系数”来判断，C50使用“信息增益率”，ID3使用“信息增益”，还有一些决策树算法根据卡方P值等进行判别。这些名词这里不做展开，简而言之，基尼系数用来衡量分类的纯度（纯度指的就是某一类别的比重。显然，分类的纯度越高越好。）；信息增益用来衡量给定一个条件后不确定性减少的程度；信息增益率与信息增益相似，不同的是它对取值较多的变量进行了惩罚。决策树的优点是对缺失值通常不敏感，解释性强，可视化好，缺点是容易过拟合。

随机森林，顾名思义，实际上就是一堆决策树，它们通过投票表决的方式得出预测结论，因此能够比较好地克服决策树容易过拟合的问题。随机森林本质上是一颗颗CART树，所以它也支持回归和分类。随机森林是一个广受欢迎的算法，应用场景广泛，基本无需调参，简单可靠。

提升树类算法包括adaboost、xgboost等。adaboost效率较低，笔者接触不多，这里就xgboost做一下简介。

上文提到SPM主打Treenet算法，又名GBDT，中文名梯度提升决策树，这是一个强大的算法，而xgboost（极限梯度提升树）是它的优化版。相对于GBDT，xgboost在优化时对损失函数进行了二阶泰勒展开（不必纠结于术语），信息损失更少。xgboost本质上也是若干棵CART树，通过对每棵树分类的结果按权重进行加总，得到最终的预测结果。

xgboost是一个极为强大的算法，尤其当数据质量较差时（如缺失值多、无关变量多、字符型变量多），它相对于其他算法的优势会逐渐体现出来。同时由于用到了多线程，它的运行效率也很高。在各项国际建模赛事中，xgboost屡屡帮助参赛者夺魁。

虽然它有这么多优点，但缺点也很明显：首先它是一个黑箱，无法进行定量解释；其次它的建模过程涉及到较多超参数，调参的工作量比较大。其中比较重要的参数有：目标函数的选择（逻辑回归、多分类），正则化的强度（>=1的数值），学习速率（<1的正值，用以控制模型学习的步长，控制该速率可以使后续的迭代有更大的学习空间，相对的训练时间也更长），模型评价指标（如AUC、错误率等），以及一系列控制树形态、优化样本分布不均衡问题的参数，等等。

简单小结一下应用场景：
随机森林、CART树、逻辑回归，支持离散和连续型的因变量，其中CART树对缺失值不敏感。那么由CART树组成的随机森林为什么对缺失值敏感呢？笔者也不清楚。欢迎赐教。
C50、adaboost 仅支持离散型因变量。
对于二分类，xgboost 仅支持连续型因变量（且必须为0、1值），对缺失值不敏感。

8、补充说明一下关于数据质量的一些常见问题

缺失值：
缺失值是最常见的数据质量问题。缺失值的处理有很多方式，这里提纲挈领地介绍一下。
简单粗暴法：直接插入0值或均值；不处理，使用对缺失值不敏感的算法。
删除行列法：删除包含过多缺失值的行或列。
估测法：使用相关的其他自变量对缺失值进行估测。
专业法：各个工具有专业的包或功能模块来处理缺失值，只是用起来比较麻烦和耗时。
组合法：以上方法的组合。
通常来说，你可以先尝试一下简单粗暴法，如果效果不如人意，再做更专业的处理。

正负样本分布不均衡：
通常，如果负样本数量比正样本高1~2个数量级，这种程度的不均衡不需要做特殊处理。
但是如果正样本数量极少，远远少于负样本，这种情况下训练的结果往往会失真。针对这种情况，也有成熟的解决方案，其核心都是消除样本不均衡的问题。这里简要提其中一个：下采样。
所谓下采样，就是将正例单独分成一份，负例随机均分成K份，每一份负样本都与正样本组合训练一次，形成K个模型，再通过K个模型投票表决，得出最终的预测结论。

9、模型的训练过程

1）明确训练目标：以始为终，首先明确目标。是分类问题，聚类问题，回归问题？需要得出概率还是二值结果？
2）读取数据：方式有很多，可以读取csv等平面文件，也可以连接数据库。
3）数据预处理：删除不相关变量、明显有错误的记录等。
4）特征工程：缺失值处理；归一化；降维；分箱；构造新变量等。

补充说明：
所谓归一化，就是考虑到不同变量取值的数量级差异较大，导致模型模型收敛速度变慢，因此事先将各变量放大或缩小至同一量纲。常见的有线性归一化、0均值标准化方法。归一化只对收敛速度有影响，对模型的好坏没有影响。
所谓降维，就是从原始的特征中抽取最重要的信息，组合成新的较少的特征。这样做的好处，一是减少了训练的计算量，二是防止过拟合。常用的降维方法有PCA（主成分分析）等。
所谓分箱，就是将连续变量离散化。比如，将年龄划分为幼年，青年，中年，老年等。这样做通常会使模型更加健壮，不容易过拟合。那么如何评价分箱的效果的好坏呢？对应的指标叫做IV（信息价值，取值0~1），和基尼系数类似，它通过加权汇总每个分箱内部的纯度，来评价分箱效果的好坏。纯度越高，IV越大。例如上述年龄的分箱是最好的方式吗？只有IV能告诉你，IV越大越好。
根据数据质量的不同，特征工程可能花费很多时间，也可能不需要任何处理。

5）训练、测试数据的划分：除了随机划分以外，如果作业涉及到时间维度，还需要加入跨期验证。
6）选择算法-建立模型-调参-验证结果-优化算法：通过调参优化模型，如果还是不满意，可能需要回到上一步重做特征工程。
7）结果保存/部署上线：如果是离线的预测任务，需要将结果保存，通常到这里就结束了；但如果是实时的生产任务，则还需要部署模型。

10、模型的线上部署

如果是逻辑回归模型，那么可以直接用模型的系数构造公式，将变量代入，即可得到对应的概率值。这种最简单直观。但逻辑回归本身的表现通常不是最好的。

如果是决策树，则可以通过Java代码对树的各个节点进行构造，也很方便。

如果是其他解释性差、或者黑箱中的模型，则无法这样做。这时候分两种情况：

1）你使用的是SPM这样的收费工具，它可以将模型直接转化成Java代码。

2）你使用的是R/Python之类的工具。这时候你必须亲自动手了。比较简单的方法是，在模型环境（如R）中，构造一个函数，它接收一系列自变量作为参数，返回预测结果的值。然后在Java环境中，建立与R的连接（ rConnection），通过API调用这个模型函数。这里需要注意的是，在生产环境中，调用之后，连接不要关闭。如果关闭，那么系统会回收模型的内存，则每次调用都会重新建立连接、重新训练模型。

以上只是浮光掠影地看一眼机器学习知识的概况，其中的任何一个知识点都足以写一篇完整的论文来讲述。作者笔力不足，在此不做深入探讨。写的不到位处，欢迎质疑。接下来（下一篇文章）我们会以一个真实的案例来做练习。

C++11堆操作深度解析：std::is_heap与std::is_heap_until原理解析与实践
文章目录堆结构基础与函数接口堆的核心性质函数签名与核心接口std::is_heapstd::is_heap_until实现原理深度剖析std::is_heap的验证逻辑std::is_heap_until的定位策略算法优化细节代码实践与案例分析基础用法演示自定义比较器实现最小堆检查边缘情况处理性能分析与实际应用时间复杂度对比典型应用场景与手动实现的对比注意事项与最佳实践迭代器要求比较器设计C++标
为什么会出现“与此站点的连接不安全”警告？
当浏览器弹出“与此站点的连接不安全”的红色警告时，不仅会让访客感到不安，还可能直接导致用户流失、品牌信誉受损，甚至引发数据泄露风险。作为网站运营者，如何快速解决这一问题？一、为什么会出现“与此站点的连接不安全”警告？浏览器提示“不安全连接”，本质上是检测到当前网站与用户之间的数据传输未经过加密保护。以下是触发警告的常见原因：1.未安装SSL证书SSL（SecureSocketsLayer）证书是网
WHQL签名怎么申请 GDCA SSL证书 windows
WHQL（WindowsHardwareQualityLabs）签名是微软对硬件和驱动程序进行认证的一种方式，以确保它们与Windows操作系统的兼容性和稳定性。以下是申请WHQL签名的基本步骤，供您参考：1.准备阶段准备硬件设备和驱动程序：确保您的硬件设备已经准备好，并且对应的驱动程序已经经过充分的测试，能够在各种配置和环境下正常工作。获取EV代码签名证书：根据微软的要求，驱动程序进行WHQL认
JSON 与 AJAX Auscy json ajax 前端
一、JSON（JavaScriptObjectNotation）1.数据类型与语法细节支持的数据类型：基本类型：字符串（需用双引号）、数字、布尔值（true/false）、null。复杂类型：数组（[]）、对象（{}）。严格语法规范：键名必须用双引号包裹（如"name":"张三"）。数组元素用逗号分隔，最后一个元素后不能有多余逗号。数字不能以0开头（如012会被解析为12），不支持八进制/十六进制
C++ 11 Lambda表达式和min_element()与max_element()的使用_c++ lamda函数 min_element((1) 2401_84976182 程序员 c语言 c++学习
既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上CC++开发知识点，真正体系化！由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新如果你需要这些资料，可以戳这里获取#include#include#includeusingnamespacestd;boolcmp(int
C++ 11 Lambda表达式和min_element()与max_element()的使用_c++ lamda函数 min_element(
网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。需要这份系统化的资料的朋友，可以添加戳这里获取一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！intmain(){vectormyvec{3,
JavaScript 树形菜单总结 Auscy microsoft
树形菜单是前端开发中常见的交互组件，用于展示具有层级关系的数据（如文件目录、分类列表、组织架构等）。以下从核心概念、实现方式、常见功能及优化方向等方面进行总结。一、核心概念层级结构：数据以父子嵌套形式存在，如{id:1,children:[{id:2}]}。节点：树形结构的基本单元，包含自身信息及子节点（若有）。展开/折叠：子节点的显示与隐藏切换，是树形菜单的核心交互。递归渲染：因数据层级不固定，
基于定制开发开源AI智能名片S2B2C商城小程序的社群游戏定制策略研究说私域人工智能小程序游戏
摘要：本文聚焦社群游戏定制领域，深入探讨以社群文化和用户偏好为导向的定制策略。通过分析互动游戏活动、社群文化塑造等关键要素，结合定制开发开源AI智能名片S2B2C商城小程序的技术特性，提出针对性游戏定制方案。研究旨在提升社群用户参与度与游戏体验，为社群游戏发展提供理论支持与实践指导。关键词：社群游戏定制；定制开发开源AI智能名片S2B2C商城小程序；社群文化；用户偏好一、引言在数字化社交蓬勃发展的
冒泡、选择、插入排序：三大基础排序算法深度解析（C语言实现） xienda 算法排序算法数据结构
在算法学习道路上，排序算法是每位程序员必须掌握的基石。本文将深入解析冒泡排序、选择排序和插入排序这三种基础排序算法，通过C语言代码实现和对比分析，帮助读者彻底理解它们的差异与应用场景。算法原理与代码实现1.冒泡排序（BubbleSort）工作原理：通过重复比较相邻元素，将较大元素逐步"冒泡"到数组末尾。voidbubbleSort(intarr[],intn){ for(inti=0;iarr[
全面触摸屏输入法设计与实现长野君
本文还有配套的精品资源，点击获取简介：触摸屏输入法是针对触摸设备优化的文字输入方案，包括虚拟键盘、手写、语音识别和手势等多种输入方式。本方案通过提供主程序文件、用户手册、界面截图、示例图、说明文本和音效文件，旨在为用户提供一个完整的、多样的文字输入体验。开发者通过持续优化算法和用户界面，使用户在无物理键盘环境下也能高效准确地进行文字输入。1.触摸屏输入法概述简介在现代信息技术飞速发展的今天，触摸屏
前端项目架构设计要领
1.架构设计的核心目标在设计前端项目架构时，核心目标是模块化、可维护、可扩展、可测试，以及开发效率的最大化。这些目标可以通过以下几个方面来实现：组件化：将UI功能封装为可复用的组件。模块化：将业务逻辑分解为独立的模块或服务。自动化构建与部署：实现自动化构建、测试和部署流程，减少人为操作的错误。代码规范化与检查：确保团队协作时，代码风格和质量一致。2.项目目录结构设计一个清晰合理的目录结构对大型项目
高效批量单词翻译工具的设计与应用
本文还有配套的精品资源，点击获取简介：在信息技术飞速发展的今天，批量单词翻译工具通过计算机的数据处理能力，大大提高了语言学习和文字处理的效率。用户通过简单输入单词列表到一个文本文件，并运行翻译程序，即可获得翻译结果并保存至指定文件。该工具集成了内置或外部翻译引擎，利用自然语言处理技术实现快速准确的翻译，并可能提供词性识别等附加功能。尽管机器翻译无法完全取代人工校对，但它为用户提供了一种高效的翻译解
嵌入式系统LCD显示模块编程实践
本文还有配套的精品资源，点击获取简介：本文档提供了一个具有800x480分辨率的3.5英寸液晶显示模块LW350AC9001的驱动程序代码，以及嵌入式系统中使用C/C++语言进行硬件编程的实践指南。该模块的2mm厚度使其适用于空间受限的便携式设备。内容包括驱动程序源代码、硬件控制接口使用方法，以及如何在嵌入式系统中进行图形处理、电源管理与性能优化。1.嵌入式系统原理1.1嵌入式系统概念嵌入式系统是
Android 开源组件和第三方库汇总 gyyzzr Android Android 开源框架
转载1、github排名https://github.com/trending,github搜索：https://github.com/search2、https://github.com/wasabeef/awesome-android-ui目录UIUI卫星菜单节选器下拉刷新模糊效果HUD与Toast进度条UI其它动画网络相关响应式编程地图数据库图像浏览及处理视频音频处理测试及调试动态更新热更新
22、文档：Google Docs的强大与易用性 pear55 探索云技术的无限可能 Google Docs 云端文档语音输入
文档：GoogleDocs的强大与易用性1.GoogleDocs简介GoogleDocs是Google提供的在线办公套件的一部分，它是一个基于云端的文字处
ARM嵌入式可编程控制器技术开发拉勾科研工作室 arm开发
PLC自动化设计|毕业设计指导|工业自动化解决方案✨专业领域：PLC程序设计与调试工业自动化控制系统HMI人机界面开发工业传感器应用电气控制系统设计工业网络通信擅长工具：西门子S7系列PLC编程三菱/欧姆龙PLC应用触摸屏界面设计电气CAD制图工业现场总线技术自动化设备调试主要内容：PLC控制系统设计工业自动化方案规划电气原理图绘制控制程序编写与调试毕业论文指导毕业设计题目与程序设计✅具体问题可以
Android ViewBinding 使用与封装教程积跬步DEV Android 开发实战大全 android
AndroidViewBinding使用与封装教程：一、ViewBinding是什么？核心功能：为每个XML布局文件自动生成一个绑定类（如ActivityMainBinding），直接暴露所有带ID的视图引用。优点：避免繁琐的findViewById()，类型安全且编译时检查。对比DataBinding：ViewBinding仅处理视图引用，无数据绑定功能。DataBinding支持双向数据绑定，
理解TCP连接中的进程阻塞与CPU调度机制 109702008 编程 #C语言网络 tcp/ip 网络人工智能
引言在计算机网络通信中，TCP连接的建立是一个经典的三次握手过程。当用户调用connect()函数发起连接时，内核会发送SYN报文并等待对方的SYN-ACK响应。此时，调用进程通常会进入阻塞状态，暂停执行直至连接成功或超时。这一机制看似简单，但其背后的内核实现却涉及进程调度、等待队列管理和CPU资源分配等复杂操作。本文将深入探讨阻塞状态的实现原理，并解析CPU在进程阻塞期间的行为。一、进程阻塞的实
基于链家网的二手房数据采集清洗与可视化分析 Mint_Datazzh 项目 selenium 网络爬虫
个人学习内容笔记，仅供参考。项目链接：https://gitee.com/rongwu651/lianjia原文链接：基于链家网的二手房数据采集清洗与可视化分析–笔墨云烟研究内容该课题的主要目的是通过将二手房网站上的存量与已销售房源，构建一个二手房市场行情情况与房源特点的可视化平台。该平台通过HTML架构和Echarts完成可视化的搭建。因此，该课题的主要研究内容就是如何利用相关技术设计并实现这样
Java大厂面试实录：谢飞机的电商场景技术问答（Spring Cloud、MyBatis、Redis、Kafka、AI等）
Java大厂面试实录：谢飞机的电商场景技术问答（SpringCloud、MyBatis、Redis、Kafka、AI等）本文模拟知名互联网大厂Java后端岗位面试流程，以电商业务为主线，由严肃面试官与“水货”程序员谢飞机展开有趣的对话，涵盖SpringCloud、MyBatis、Redis、Kafka、SpringSecurity、AI等热门技术栈，并附详细解析，助力求职者备战大厂面试。故事设定谢
【超硬核】JVM源码解读：Java方法main在虚拟机上解释执行 HeapDump性能社区 java 开发语言后端 jvm
本文由HeapDump性能社区首席讲师鸠摩（马智）授权整理发布第1篇-关于Java虚拟机HotSpot，开篇说的简单点开讲Java运行时，这一篇讲一些简单的内容。我们写的主类中的main()方法是如何被Java虚拟机调用到的？在Java类中的一些方法会被由C/C++编写的HotSpot虚拟机的C/C++函数调用，不过由于Java方法与C/C++函数的调用约定不同，所以并不能直接调用，需要JavaC
算法学习笔记：17.蒙特卡洛算法 ——从原理到实战，涵盖 LeetCode 与考研 408 例题
在计算机科学和数学领域，蒙特卡洛算法（MonteCarloAlgorithm）以其独特的随机抽样思想，成为解决复杂问题的有力工具。从圆周率的计算到金融风险评估，从物理模拟到人工智能，蒙特卡洛算法都发挥着不可替代的作用。本文将深入剖析蒙特卡洛算法的思想、解题思路，结合实际应用场景与Java代码实现，并融入考研408的相关考点，穿插图片辅助理解，帮助你全面掌握这一重要算法。蒙特卡洛算法的基本概念蒙特卡
算法学习笔记：15.二分查找 ——从原理到实战，涵盖 LeetCode 与考研 408 例题呆呆企鹅仔算法学习算法学习笔记考研二分查找
在计算机科学的查找算法中，二分查找以其高效性占据着重要地位。它利用数据的有序性，通过不断缩小查找范围，将原本需要线性时间的查找过程优化为对数时间，成为处理大规模有序数据查找问题的首选算法。二分查找的基本概念二分查找（BinarySearch），又称折半查找，是一种在有序数据集合中查找特定元素的高效算法。其核心原理是：通过不断将查找范围减半，快速定位目标元素。与线性查找逐个遍历元素不同，二分查找依赖
（Python基础篇）了解和使用分支结构 EternityArt 基础篇 python
目录一、引言二、Python分支结构的类型与语法（一）if语句（单分支）（二）if-else语句（双分支）（三）if-elif-else语句（多分支）三、分支结构的应用场景（一）提示用户输入用户名，然后再提示输入密码，如果用户名是“admin”并且密码是“88888”则提示正确，否则，如果用户名不是admin还提示用户用户名不存在,（二）提示用户输入用户名，然后再提示输入密码，如果用户名是“adm
LeetCode算法题：电话号码的字母组合吱屋猪_ 算法 leetcode java
题目描述：给定一个仅包含数字2-9的字符串，返回所有它能表示的字母组合。答案可以按任意顺序返回。给出数字到字母的映射如下（与电话按键相同）。注意1不对应任何字母。2->"abc"3->"def"4->"ghi"5->"jkl"6->"mno"7->"pqrs"8->"tuv"9->"wxyz"例如，给定digits="23"，返回["ad","ae","af","bd","be","bf","cd
基于开源AI智能名片链动2+1模式与S2B2C商城小程序的渠道选择策略研究说私域人工智能小程序
摘要：在数字化商业环境下，品牌与产品的渠道选择对其市场推广和运营成功至关重要。本文聚焦于如何依据自身品牌和产品特性，结合开源AI智能名片链动2+1模式与S2B2C商城小程序，运用科学的渠道选择方法，慎重挑选1-2个适宜平台，集中资源发力并取得成绩后再拓展其他渠道。通过理论分析与案例研究，探讨该策略的有效性和可行性，为企业渠道布局提供参考。关键词：渠道选择；开源AI智能名片；链动2+1模式；S2B2
深入解析 TCP 连接状态与进程挂起、恢复与关闭誰能久伴不乏 tcp/ip 网络服务器
文章目录深入解析TCP连接状态与进程挂起、恢复与关闭一、TCP连接的各种状态1.**`LISTEN`**（监听）2.**`SYN_SENT`**（SYN已发送）3.**`SYN_RECEIVED`**（SYN已接收）4.**`ESTABLISHED`**（已建立）5.**`FIN_WAIT_1`**（关闭等待1）6.**`FIN_WAIT_2`**（关闭等待2）7.**`CLOSE_WAIT`**
基于架构的软件设计（Architecture-Based Software Design，ABSD）是一种以架构为核心的软件开发方法
ABSD方法与生命周期基于架构的软件设计（Architecture-BasedSoftwareDesign，ABSD）是一种以架构为核心的软件开发方法，强调在开发的各个阶段都要以架构为中心，确保系统的整体结构和质量属性得到有效管理。ABSD方法是一个自顶向下、递归细化的过程，软件系统的架构通过该方法得到细化，直到能产生软件构件和类。ABSD方法的三个基础功能的分解：使用基于模块的内聚和耦合技术，将
Java大厂面试故事：谢飞机的互联网音视频场景技术面试全纪录（Spring Boot、MyBatis、Kafka、Redis、AI等）来旺 Java场景面试宝典 Java Spring Boot MyBatis Kafka Redis 微服务 AI
Java大厂面试故事：谢飞机的互联网音视频场景技术面试全纪录（SpringBoot、MyBatis、Kafka、Redis、AI等）互联网大厂技术面试不仅考察技术深度，更注重业务场景与系统设计能力。本篇以严肃面试官与“水货”程序员谢飞机的对话，带你体验音视频业务场景下的Java面试全过程，涵盖主流技术栈，并附详细答案解析，助你面试无忧。故事场景设定谢飞机是一名有趣但技术基础略显薄弱的程序员，这次应
php 高并发下日志量巨大，如何高效采集、存储、分析贵哥的编程之路(热爱分享为后来者) PHP语言经典程序100题 php 开发语言
1.问题背景高并发系统每秒产生大量日志（如访问日志、错误日志、业务日志等）。单机写入、存储、分析能力有限，容易成为瓶颈。需要支持实时采集、分布式存储、快速检索与分析。2.主流架构方案一、分布式日志采集架构[应用服务器(PHP等)]|v[日志采集Agent（如Filebeat、Fluentd、Logstash）]|v[消息队列/缓冲（如Kafka、Redis、RabbitMQ）]|v[日志存储（如E
Java实现的基于模板的网页结构化信息精准抽取组件：HtmlExtractor yangshangchuan 信息抽取 HtmlExtractor 精准抽取信息采集
HtmlExtractor是一个Java实现的基于模板的网页结构化信息精准抽取组件，本身并不包含爬虫功能，但可被爬虫或其他程序调用以便更精准地对网页结构化信息进行抽取。 HtmlExtractor是为大规模分布式环境设计的，采用主从架构，主节点负责维护抽取规则，从节点向主节点请求抽取规则，当抽取规则发生变化，主节点主动通知从节点，从而能实现抽取规则变化之后的实时动态生效。如
java编程思想 -- 多态百合不是茶 java 多态详解
一: 向上转型和向下转型面向对象中的转型只会发生在有继承关系的子类和父类中（接口的实现也包括在这里）。父类：人子类：男人向上转型： Person p = new Man() ; //向上转型不需要强制类型转化向下转型： Man man =
[自动数据处理]稳扎稳打,逐步形成自有ADP系统体系 comsci dp
对于国内的IT行业来讲,虽然我们已经有了"两弹一星",在局部领域形成了自己独有的技术特征,并初步摆脱了国外的控制...但是前面的路还很长.... 首先是我们的自动数据处理系统还无法处理很多高级工程...中等规模的拓扑分析系统也没有完成,更加复杂的
storm 自定义日志文件商人shang storm cluster logback
Storm中的日志级级别默认为INFO，并且，日志文件是根据worker号来进行区分的，这样，同一个log文件中的信息不一定是一个业务的，这样就会有以下两个需求出现： 1. 想要进行一些调试信息的输出 2. 调试信息或者业务日志信息想要输出到一些固定的文件中不要怕，不要烦恼，其实Storm已经提供了这样的支持，可以通过自定义logback 下的 cluster.xml 来输
Extjs3 SpringMVC使用 @RequestBody 标签问题记录 21jhf
springMVC使用 @RequestBody(required = false) UserVO userInfo 传递json对象数据，往往会出现http 415，400,500等错误，总结一下需要使用ajax提交json数据才行，ajax提交使用proxy，参数为jsonData，不能为params；另外，需要设置Content-type属性为json，代码如下：（由于使用了父类aaa
一些排错方法文强chu 方法
1、java.lang.IllegalStateException: Class invariant violation at org.apache.log4j.LogManager.getLoggerRepository(LogManager.java:199)at org.apache.log4j.LogManager.getLogger(LogManager.java:228) at o
Swing中文件恢复我觉得很难小桔子 swing
我那个草了！老大怎么回事，怎么做项目评估的？只会说相信你可以做的，试一下，有的是时间！用java开发一个图文处理工具，类似word，任意位置插入、拖动、删除图片以及文本等。文本框、流程图等，数据保存数据库，其余可保存pdf格式。ok,姐姐千辛万苦，
php 文件操作 aichenglong PHP 读取文件写入文件
1 写入文件 @$fp=fopen("$DOCUMENT_ROOT/order.txt", "ab"); if(!$fp){ echo "open file error" ; exit; } $outputstring="date:"." \t tire:".$tire."
MySQL的btree索引和hash索引的区别 AILIKES 数据结构 mysql 算法
Hash 索引结构的特殊性，其检索效率非常高，索引的检索可以一次定位，不像B-Tree 索引需要从根节点到枝节点，最后才能访问到页节点这样多次的IO访问，所以 Hash 索引的查询效率要远高于 B-Tree 索引。可能很多人又有疑问了，既然 Hash 索引的效率要比 B-Tree 高很多，为什么大家不都用 Hash 索引而还要使用 B-Tree 索引呢
JAVA的抽象--- 接口 --实现百合不是茶
抽象接口实现接口 //抽象类 ,方法 //定义一个公共抽象的类 ,并在类中定义一个抽象的方法体抽象的定义使用abstract abstract class A 定义一个抽象类例如： //定义一个基类 public abstract class A{ //抽象类不能用来实例化，只能用来继承 //
JS变量作用域实例 bijian1013 作用域
<script> var scope='hello'; function a(){ console.log(scope); //undefined var scope='world'; console.log(scope); //world console.log(b);
TDD实践（二） bijian1013 java TDD
实践题目：分解质因数 Step1：单元测试： package com.bijian.study.factor.test; import java.util.Arrays; import junit.framework.Assert; import org.junit.Before; import org.junit.Test; import com.bijian.
[MongoDB学习笔记一]MongoDB主从复制 bit1129 mongodb
MongoDB称为分布式数据库，主要原因是1.基于副本集的数据备份， 2.基于切片的数据扩容。副本集解决数据的读写性能问题，切片解决了MongoDB的数据扩容问题。事实上，MongoDB提供了主从复制和副本复制两种备份方式，在MongoDB的主从复制和副本复制集群环境中，只有一台作为主服务器，另外一台或者多台服务器作为从服务器。本文介绍MongoDB的主从复制模式，需要指明
【HBase五】Java API操作HBase bit1129 hbase
import java.io.IOException; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.hbase.HBaseConfiguration; import org.apache.hadoop.hbase.HColumnDescriptor; import org.apache.ha
python调用zabbix api接口实时展示数据 ronin47
zabbix api接口来进行展示。经过思考之后，计划获取如下内容： 1、获得认证密钥 2、获取zabbix所有的主机组 3、获取单个组下的所有主机 4、获取某个主机下的所有监控项
jsp取得绝对路径 byalias 绝对路径
在JavaWeb开发中，常使用绝对路径的方式来引入JavaScript和CSS文件，这样可以避免因为目录变动导致引入文件找不到的情况，常用的做法如下：一、使用${pageContext.request.contextPath} 　　代码” ${pageContext.request.contextPath}”的作用是取出部署的应用程序名，这样不管如何部署，所用路径都是正确的。
Java定时任务调度：用ExecutorService取代Timer bylijinnan java
《Java并发编程实战》一书提到的用ExecutorService取代Java Timer有几个理由，我认为其中最重要的理由是：如果TimerTask抛出未检查的异常，Timer将会产生无法预料的行为。Timer线程并不捕获异常，所以 TimerTask抛出的未检查的异常会终止timer线程。这种情况下，Timer也不会再重新恢复线程的执行了;它错误的认为整个Timer都被取消了。此时，已经被
SQL 优化原则 chicony sql
一、问题的提出　在应用系统开发初期，由于开发数据库数据比较少，对于查询SQL语句，复杂视图的的编写等体会不出SQL语句各种写法的性能优劣，但是如果将应用系统提交实际应用后，随着数据库中数据的增加，系统的响应速度就成为目前系统需要解决的最主要的问题之一。系统优化中一个很重要的方面就是SQL语句的优化。对于海量数据，劣质SQL语句和优质SQL语句之间的速度差别可以达到上百倍，可见对于一个系统
java 线程弹球小游戏 CrazyMizzz java 游戏
最近java学到线程，于是做了一个线程弹球的小游戏，不过还没完善这里是提纲 1.线程弹球游戏实现 1.实现界面需要使用哪些API类 JFrame JPanel JButton FlowLayout Graphics2D Thread Color ActionListener ActionEvent MouseListener Mouse
hadoop jps出现process information unavailable提示解决办法 daizj hadoop jps
hadoop jps出现process information unavailable提示解决办法 jps时出现如下信息： 3019 -- process information unavailable3053 -- process information unavailable2985 -- process information unavailable2917 --
PHP图片水印缩放类实现 dcj3sjt126com PHP
<?php class Image{ private $path; function __construct($path='./'){ $this->path=rtrim($path,'/').'/'; } //水印函数，参数：背景图，水印图，位置，前缀,TMD透明度 public function water($b,$l,$pos
IOS控件学习：UILabel常用属性与用法 dcj3sjt126com ios UILabel
参考网站： http://shijue.me/show_text/521c396a8ddf876566000007 http://www.tuicool.com/articles/zquENb http://blog.csdn.net/a451493485/article/details/9454695 http://wiki.eoe.cn/page/iOS_pptl_artile_281
完全手动建立maven骨架 eksliang java eclipse Web
建一个 JAVA 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=App [-Dversion=0.0.1-SNAPSHOT] [-Dpackaging=jar] 建一个 web 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=web-a
配置清单 gengzg 配置
1、修改grub启动的内核版本 vi /boot/grub/grub.conf 将default 0改为1 拷贝mt7601Usta.ko到/lib文件夹拷贝RT2870STA.dat到 /etc/Wireless/RT2870STA/文件夹拷贝wifiscan到bin文件夹，chmod 775 /bin/wifiscan 拷贝wifiget.sh到bin文件夹，chm
Windows端口被占用处理方法 huqiji windows
以下文章主要以80端口号为例，如果想知道其他的端口号也可以使用该方法..........................1、在windows下如何查看80端口占用情况?是被哪个进程占用?如何终止等. 这里主要是用到windows下的DOS工具,点击"开始"--"运行",输入&
开源ckplayer 网页播放器，跨平台(html5, mobile)，flv, f4v, mp4, rtmp协议. webm, ogg, m3u8 ！天梯梦 mobile
CKplayer，其全称为超酷flv播放器，它是一款用于网页上播放视频的软件，支持的格式有：http协议上的flv,f4v,mp4格式，同时支持rtmp视频流格式播放，此播放器的特点在于用户可以自己定义播放器的风格，诸如播放/暂停按钮，静音按钮，全屏按钮都是以外部图片接口形式调用，用户根据自己的需要制作出播放器风格所需要使用的各个按钮图片然后替换掉原始风格里相应的图片就可以制作出自己的风格了，
简单工厂设计模式 hm4123660 java 工厂设计模式简单工厂模式
简单工厂模式（Simple Factory Pattern）属于类的创新型模式，又叫静态工厂方法模式。是通过专门定义一个类来负责创建其他类的实例，被创建的实例通常都具有共同的父类。简单工厂模式是由一个工厂对象决定创建出哪一种产品类的实例。简单工厂模式是工厂模式家族中最简单实用的模式，可以理解为是不同工厂模式的一个特殊实现。
maven笔记 zhb8015 maven
跳过测试阶段： mvn package -DskipTests 临时性跳过测试代码的编译： mvn package -Dmaven.test.skip=true maven.test.skip同时控制maven-compiler-plugin和maven-surefire-plugin两个插件的行为，即跳过编译，又跳过测试。指定测试类 mvn test
非mapreduce生成Hfile，然后导入hbase当中 Stark_Summer map hbase reduce Hfile path实例
最近一个群友的boss让研究hbase，让hbase的入库速度达到5w+/s，这可愁死了，4台个人电脑组成的集群，多线程入库调了好久，速度也才1w左右，都没有达到理想的那种速度，然后就想到了这种方式，但是网上多是用mapreduce来实现入库，而现在的需求是实时入库，不生成文件了，所以就只能自己用代码实现了，但是网上查了很多资料都没有查到，最后在一个网友的指引下，看了源码，最后找到了生成Hfile
jsp web tomcat 编码问题王新春 tomcat jsp pageEncode
今天配置jsp项目在tomcat上，windows上正常，而linux上显示乱码，最后定位原因为tomcat 的server.xml 文件的配置，添加 URIEncoding 属性： <Connector port="8080" protocol="HTTP/1.1" connectionTi