JenningLang

谈谈爬虫的昨天、今天和明天

本人接触爬虫及其相关技术已经有大概一年半的时间。虽然为了吃饭不得不从事爬虫相关工作，但实际上个人是比较不喜欢这个行业的。这篇文章主要是写给想要从事这个行业的人，让新人可以知道这个行业都在做什么以及未来发展如何，当然也欢迎同行和大牛的指正。

这篇文章是一个综述性质的文章，首先会 “简要” 介绍一下爬虫技术的历史；然后在第二部分，我会介绍自己接触过的一些当前常用的网络内容爬取技术；最后写一些关于这个行业未来个人的看法。

由于我本身不是从事搜索引擎这种大规模爬虫研发的，所以第二部分更关注的是一些破解技术，而不是例如高并发、爬取策略、缓存等这类大规模爬虫技术；同时也不关注 IoT 领域的爬虫技术发展。第三部分的核心观点是：我不建议有志之士进入这个行业。

1. 爬虫的昨天：从搜索引擎说起

网络爬虫（web crawler、spider）这个名字本身就是来源于搜索引擎的原理：利用网页之间的链接，网络程序可以从一个网站发现新的网站，同时对网页内容进行解析、存储、赋权等操作。

在互联网发展的早期（大约 2005 年前），谷歌、百度等公司迅速成为行业巨头，其成功可以说是搭建在爬虫技术之上的。

与此同时或稍晚一些，一些中小公司开始利用爬虫技术来自动获取网络上公开的数据，但当时对于爬虫的热情程度，远不及最近几 (10?) 年。

随着大数据、人工智能概念的普及，很多创业公司或者打其旗号，或者想在相关领域脱颖而出。数据哪里来呢？绝大多数是来自于爬取。另一方面，随着互联网相关产业的发展，有很多项目研发模式都是依托于爬虫技术的。比如一些新想法的快速验证，项目冷启动的数据来源等等。越来越多的公司会把注意力集中在自己擅长的领域，至于数据哪里来，答案还是爬取。

一个典型的例子是今日头条早期，当时头条还没有做 UGC 业务，大量的新闻数据来自于网易、新浪等传统的新闻网站，而头条的技术人员专注于将个性化投放做到行业领先，成功吃掉了这些传统新闻网站的大部分用户。

也有一些本身就是基于爬虫的产品，例如机票比价的服务，淘宝历史价格追溯的服务 (早年我还在用 360 浏览器的时候有这个功能，不知道现在还有没有了)。此外，互联网激烈的竞争导致产品的数据对标分析近乎常态，你的对手不可能把数据给你吧，那对标数据哪里来？一个字：爬。

以上总总，可见爬虫技术一路走来，可以说是当今互联网一个非常重要的技术组成了。据估计，目前网络上的流量超过 50% 都是爬虫！（具体出处我已经找不到了）

然而戏剧性的是，虽然爬虫技术的应用场景如此广泛，相比于前端、后端、算法等岗位，爬虫工程师的收入可以说是很低的，从心理上来说也是位于鄙视链的底端！

2. 爬虫的今天：PC 与移动端

2.1 PC 页爬取的相关技术

我们经常和产品说的一句话是：PC 页爬取的需求基本都能做。

这是由于早期的互联网产品形态和技术原因，PC 站爬取整体难度并不大，或者说相对于移动端来说并不大。从产品形态来说，PC 站很多无需登录即可访问大部分内容，且PC 站需要搜索引擎访问以提高其搜索排名，这使得其内容更容易获取（相比较移动端普遍需要登录且不需要给搜索引擎提供便利）；技术上来说，PC 站使用的是浏览器加载 html、js 和 css 的方式，相关技术比较成熟，学习曲线平缓，调试工具丰富，且对应的操作系统安全性考量不如移动端高。

PC 站的数据来源一般来说有以下三种：

查看网页 (html) 是否可以直接下载解析
查看是否有数据接口可用 (PC、m 站、历史版本接口)
- PC 接口直接打开浏览器调试工具或使用 charles 抓包
- m 站接口可以通过浏览器调试工具切换成手机视图再抓包
- 历史版本接口可以直接通过 baidu、谷歌或者 github 搜索关键字，或者看一下自己公司之前的历史代码、wiki 等，这个就属于碰运气了
代码操作 (无头) 浏览器 (例如 Selenium 等) 拿数据 (无头浏览器汇总)：可以解决大部分疑难问题，缺点是效率低、稳定性差

针对 PC 页常见的反爬手段和对应措施：

封 ip：破解核心是通过代理来切换 ip
- 付费代理
- 爬取免费代理
特定 header 参数：伪造即可
接口签名：破解核心是搞清楚签名机制
- 完全弄懂其 js 并通过其他语言重写签名算法，效率最高
- nodejs 在服务器上执行签名代码获取签名
- 代码操作 (无头) 浏览器
js 跳转 + 携带特定 cookie：类似于接口签名的解决思路
js 混淆：情况比较复杂，具体情况具体分析
登陆 + cookie：批量注册虚假账号，分析登陆接口和返回数据，模拟登陆
传统验证码：
- 如果高频弹出、或者新 ip 首次访问弹出验证码，可以接入第三方或自研的打码服务
- 如果验证码弹出频率较低且是短期抓取任务，可以在需要填写验证码的时候手工处理
- 如果一个 ip 访问几次才出现验证码，可以通过使用代理的方式规避验证码
新式验证码（点击、滑块）：这部分我几乎没接触过，现看了网上的一些资料,主要是通过代码操作浏览器的方式进行破解，具体见参考资料
其他，比如页面核心数据通过字体加密（网上有相关资料）、蜜罐（没有遇到过）等

2.2 移动端爬取的相关技术

移动端相较于 PC 页爬取的几个难点如下：

设备绑定：移动端可以通过获取硬件设备 id 来识别用户身份，而 PC 站浏览器是没有这么高的权限的，一些例如浏览器指纹的技术也未能被广泛采用
手机号绑定：APP 使用需要注册这件事几乎可以说是一个使用常识了，基本核心的数据都需要登录后才能查看。而 APP 登录往往需要和手机号绑定，而手机号又和身份证绑定。如果需要获取大量手机号就需要拿到大量虚假的身份信息，这常常是违法行为
网络多样化：APP 的部分核心数据可以不通过 http 协议进行传输，给抓包带来更大难度
数据加密：数据加密涉及到加密和解密两个步骤。对于 PC 页因为解密需要 JS 操作，而 JS 对于用户是可见的，从理论上来说不存在无法破解的情况；而 APP 由于本身代码不易被接触到的特性，所以对于加密数据的解密基本无解
操作系统安全：app 抓取的一个常用技术是代理人模式，对于高版本的安卓系统信任第三方证书已经很难搞了；而苹果系统虽然可以安装证书，操作软件却难度较大，且设备成本高

目前我接触过的（基本都是同事做的）移动端抓取技术主要包括：

抓接口：如果没有防护直接使用
控制手机软件+代理人模式：这本质上类似于 PC 页抓取控制浏览器的思路，如果无法破解就不破解，直接模拟用户请求拿数据就行了；控制手机软件可以通过安卓的无障碍模式
手机 root 后直接读取手机本地数据库数据
见过某大牛博客直接破解手机软件的，不过本人和身边的同事技术都没有这么高超，同时我对爬虫这个东西怎么也提不起兴趣

3. 爬虫的明天：需求、技术、成本、未来

3.1 谈未来前先谈谈需求

3.1.1 爬虫本身的不确定性

保证软件良好运行的核心是控制软件的复杂度与不确定性，控制复杂度类似于骑马手持缰绳，而控制不确定性类似于把马圈在栅栏里。

抓取这件事本身，就是不确定性非常高的事情：反爬策略、对方接口迭代、对方数据结构改变、目标内容下线。所以说依赖抓取的产品，本身存在不稳定性的风险，所以在产品提需求时，一定要确定这是短期需求还是长期需求；如果是长期需求，需要看看是否有别的方式可以弥补不确定性。如果在讨论需求的时候不考虑这些，就很容易将自身置于泥潭之中。

3.1.2 爬虫需求的不灭性

在可以预见的未来，爬虫的需求是会越来越强烈的。这是个数据需求如此强烈的时代，低成本获取数据的诱惑实在是太大了！正如盗版行业不会被消灭一样，爬虫的需求也具备不灭性。即便爬取难度随着时间正逐渐升高，且这个行业背负着道德和法律的双重风险，老板和技术负责人们依旧会不停地产出爬取需求的新点子！

3.1.3 PC 与移动端

正如第二章介绍的，PC 爬取难度远低于移动端。但从当前互联网产品的发展来看，未来高用户量产品必将继续向移动端发展，很多产品甚至 PC 站只保留海报和 APP 下载功能了！

个人电脑产生之初是作为工具被研发出来，随着发展逐渐变为娱乐设备，未来必然将再次退化为工具。而一方面工具将和用户身份相互绑定，另一方面作为工具的网页很难引起大家的爬取需求。

所以虽然 PC 站的爬取技术很成熟，但未来是没什么用的！ 而移动端技术难度又比较大，虽然随着需求的强烈程度增加，抓取难度肯定会下降，不过这要过多久呢？五年还是十年？到那个时候，互联网的行业风向又将在哪里呢？

The future of web scraping is actually linked with the future of web!

3.2 爬虫行业几个主流发展方向

3.2.1 人工智能

目前已经知道的人工智能在爬虫领域的发展包括以下方面：

网页内容解析与提取：上面提到过爬虫本身是很难控制复杂度的软件。人工智能已经被应用于网页核心内容的自动提取（去广告等）。例如 Diffbot 这家美国公司，已经有自己成熟的产品
人类行为模拟：例如目前点击验证码和滑块验证码一般会基于人类行为数据以及神经网络模型，进行反爬模型训练；与之对应的，爬虫本身也可以根据人类行为数据进行模拟训练，达到欺骗反爬模型的目的；另外一个例子就是 APP 检测用户行为是否正常，可以通过一些人工智能的手段模拟人类的使用行为，来欺骗检测
计算机视觉：比较简单的应用场景是传统的图形验证码识别；另外，由于 APP数据通过其他方法获取很难，因此可以通过计算机视觉提取所需的感兴趣数据；另一个例子是 google已经开始采用基于人工智能的图像和视频内容理解技术，因为传统的搜索引擎只能检索如标题、上下文之类的文字信息，如果这个技术有所突破，google 的图片和视频搜索将更加准确

未来人工智能技术会在爬虫领域有更多的应用，毕竟新技术各行各业都迫切地需要拿来解决自己的痛点问题。

3.2.2 集中式爬虫机构

从前文我们可以看出，爬虫技术的难度越来越高，同时还有较高的道德和法律风险。这使得未来，会出现几个比较大的爬虫供应商，这些集中式的爬虫机构，钻研爬虫技术，承担各种风险，当然也会有高额的利润作为回报。

实际上，目前国内已经有类似的厂商，并且我也接触过。虽然并不光鲜，但绝对是未来的发展趋势。

3.2.3 工具软件、手机厂商与剑走偏锋

工具软件与手机厂商似乎和爬虫没什么关系，他们两者看起来也没什么关联。但他们的共同点是：通过某种方法绕过了爬虫的常见困难，直接采集用户数据，而且可以操作得更加肆无忌惮。

我见过的某公众号助手，同时也兼做公众号流量数据提供商，虽然两者可能没什么直接联系，但至少这是一条能拿到其他厂商核心数据的可行和有效途径。

而手机厂商可以绕过设备、用户的壁垒，各个软件可以说是对其门户大开，想做一些数据采集类的工作，简直轻而易举！

3.3 我对这个行业的看法

我对这个行业的看法很简单：有志之士不应该进入这一行业。

有人可能反驳说，爬虫也可以技术做得很深入啊，技术面很广啊等等诸如此类。但我想问：如果人生每天只是用来破解别人的防护措施，这样的人生有什么意义？

这本质上和知道茴字有四种写法没什么区别：都毫无意义！除了让自己觉得自己好像很 nb。更不用说爬虫这个行业的道德负担和法律风险。如果只是混口吃食还行，想作为自己的事业还是算了吧，我敢保证那样的话将是个无趣的人生。

有志之士应该做什么？应该像乔布斯一样创造改变世界的产品，应该和马斯克一样把人生目标定位在火星移民，应该如比尔盖茨一样为了世界疫苗普及贡献自己的力量。

或许这些都太虚了，但作为一个人，至少不要让自己堕入黑暗而不自知。

附录：参考资料和有用的资源

参考资料

Wikipedia: Internet_bot
Wikipedia: Web_crawler
Wikipedia: Web_scraping
Wikipedia: Data_scraping
The System Design of Mobile
Application Crawler and The Implementation
of Some Key Technologies , HaoLi, 2016
Summary of web crawler technology research, Linxuan Yu et al 2020
3 Predictions about Future of Web Scraping
Web scraping: future
THE FUTURE OF WEB SCRAPING
Qura: Can a Web Crawler be programmed to use artificial intelligence?
Qura: What is the future of web scraping?
震惊! 滑动验证码竟然能这样破解
爬虫(十二)：图形验证码的识别、滑动验证码的识别（B站滑动验证码）

资源

无头浏览器汇总

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
UI学习——cell的复用和自定义cell Magnetic_h ui 学习
目录cell的复用手动（非注册）自动（注册）自定义cellcell的复用在iOS开发中，单元格复用是一种提高表格（UITableView）和集合视图（UICollectionView）滚动性能的技术。当一个UITableViewCell或UICollectionViewCell首次需要显示时，如果没有可复用的单元格，则视图会创建一个新的单元格。一旦这个单元格滚动出屏幕，它就不会被销毁。相反，它被添
10月|愿你的青春不负梦想-读书笔记-01 Tracy的小书斋
本书的作者是俞敏洪，大家都很熟悉他了吧。俞敏洪老师是我行业的领头羊吧，也是我事业上的偶像。本日摘录他书中第一章中的金句：『一个人如果什么目标都没有，就会浑浑噩噩，感觉生命中缺少能量。能给我们能量的，是对未来的期待。第一件事，我始终为了进步而努力。与其追寻全世界的骏马，不如种植丰美的草原，到时骏马自然会来。第二件事，我始终有阶段性的目标。什么东西能给我能量？答案是对未来的期待。』读到这里的时候，我便
学点心理知识，呵护孩子健康静候花开_7090
昨天听了华中师范大学教育管理学系副教授张玲老师的《哪里才是学生心理健康的最后庇护所，超越教育与技术的思考》的讲座。今天又重新学习了一遍，收获匪浅。张玲博士也注意到了当今社会上的孩子由于心理问题导致的自残、自杀及伤害他人等恶性事件。她向我们普及了一个重要的命题，她说心理健康的一些基本命题，我们与我们通常的一些教育命题是不同的，她还举了几个例子，让我们明白我们原来以为的健康并非心理学上的健康。比如如果
Cell Insight | 单细胞测序技术又一新发现，可用于HIV-1和Mtb共感染个体诊断尐尐呅
结核病是艾滋病合并其他疾病中导致患者死亡的主要原因。其中结核病由结核分枝杆菌（Mycobacteriumtuberculosis,Mtb）感染引起，获得性免疫缺陷综合症（艾滋病）由人免疫缺陷病毒（Humanimmunodeficiencyvirustype1,HIV-1）感染引起。国家感染性疾病临床医学研究中心/深圳市第三人民医院张国良团队携手深圳华大生命科学研究院吴靓团队，共同研究得出单细胞测序
店群合一模式下的社区团购新发展——结合链动 2+1 模式、AI 智能名片与 S2B2C 商城小程序源码说私域人工智能小程序
摘要：本文探讨了店群合一的社区团购平台在当今商业环境中的重要性和优势。通过分析店群合一模式如何将互联网社群与线下终端紧密结合，阐述了链动2+1模式、AI智能名片和S2B2C商城小程序源码在这一模式中的应用价值。这些创新元素的结合为社区团购带来了新的机遇，提升了用户信任感、拓展了营销渠道，并实现了线上线下的完美融合。一、引言随着互联网技术的不断发展，社区团购作为一种新兴的商业模式，在满足消费者日常需
腾讯云技术深度探索：构建高效云原生微服务架构我的运维人生云原生架构腾讯云运维开发技术共享
腾讯云技术深度探索：构建高效云原生微服务架构在当今快速发展的技术环境中，云原生技术已成为企业数字化转型的关键驱动力。腾讯云作为行业领先的云服务提供商，不断推出创新的产品和技术，助力企业构建高效、可扩展的云原生微服务架构。本文将深入探讨腾讯云在微服务领域的最新进展，并通过一个实际案例展示如何在腾讯云平台上构建云原生应用。腾讯云微服务架构概览腾讯云微服务架构基于云原生理念，旨在帮助企业快速实现应用的容
DIV+CSS+JavaScript技术制作网页（旅游主题网页设计与制作）云南大理 STU学生网页设计网页设计期末网页作业 html静态网页 html5期末大作业网页设计 web大作业
️精彩专栏推荐作者主页:【进入主页—获取更多源码】web前端期末大作业：【HTML5网页期末作业(1000套)】程序员有趣的告白方式：【HTML七夕情人节表白网页制作(110套)】文章目录二、网站介绍三、网站效果▶️1.视频演示2.图片演示四、网站代码HTML结构代码CSS样式代码五、更多源码二、网站介绍网站布局方面：计划采用目前主流的、能兼容各大主流浏览器、显示效果稳定的浮动网页布局结构。网站程
2020-04-12每天三百字之连接与替代冷眼看潮
不知道是不是好为人师，有时候还真想和别人分享一下我对某些现象的看法或者解释。人类社会不断发展进步的过程，就是不断连接与替代的过程。人类发现了火并应用火以后，告别了茹毛饮血的野兽般的原始生活（火烧、烹饪替代了生食）人类用石器代替了完全手工，工具的使用使人类进步一大步。类似这样的替代还有很多，随着科技的发展，有更多的原始的事物被替代，代之以更高效、更先进的技术。在近现代，汽车替代了马车，高速公路和铁路
探索OpenAI和LangChain的适配器集成：轻松切换模型提供商 nseejrukjhad langchain easyui 前端 python
#探索OpenAI和LangChain的适配器集成：轻松切换模型提供商##引言在人工智能和自然语言处理的世界中，OpenAI的模型提供了强大的能力。然而，随着技术的发展，许多人开始探索其他模型以满足特定需求。LangChain作为一个强大的工具，集成了多种模型提供商，通过提供适配器，简化了不同模型之间的转换。本篇文章将介绍如何使用LangChain的适配器与OpenAI集成，以便轻松切换模型提供商
使用LLaVa和Ollama实现多模态RAG示例 llzwxh888 python 人工智能开发语言
本文将详细介绍如何使用LLaVa和Ollama实现多模态RAG（检索增强生成），通过提取图像中的结构化数据、生成图像字幕等功能来展示这一技术的强大之处。安装环境首先，您需要安装以下依赖包：!pipinstallllama-index-multi-modal-llms-ollama!pipinstallllama-index-readers-file!pipinstallunstructured!p
关于城市旅游的HTML网页设计——(旅游风景云南 5页)HTML+CSS+JavaScript 二挡起步 web前端期末大作业 javascript html css 旅游风景
⛵源码获取文末联系✈Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业|游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作|HTML期末大学生网页设计作业，Web大学生网页HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScrip
HTML网页设计制作大作业（div+css）云南我的家乡旅游景点带文字滚动二挡起步 web前端期末大作业 web设计网页规划与设计 html css javascript dreamweaver 前端
Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作HTML期末大学生网页设计作业HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScript：做与用户的交互行为文章目录前端学习路线
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
CX8836：小体积大功率升降压方案推荐（附Demo设计指南）诚芯微科技社交电子
CX8836是一颗同步四开关单向升降压控制器，在4.5V-40V宽输入电压范围内稳定工作，持续负载电流10A，能够在输入高于或低于输出电压时稳定调节输出电压，可适用于USBPD快充、车载充电器、HUB、汽车启停系统、工业PC电源等多种升降压应用场合，为大功率TYPE-CPD车载充电器提供最优解决方案。提供CX8836Demo测试、CX8836样品申请及CX8836方案开发技术支持。CX8836同升
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
【华为OD技术面试真题 - 技术面】-测试八股文真题题库（1）算法大师华为od 面试 python 算法前端
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.黑盒测试和白盒测试的区别2.假设我们公司现在开发一个类似于微信的软件1.0版本，现在要你测试这个功能：打开聊天窗口，输入文本，限制字数在200字以内。问你怎么提取测试点。功能测试性能测试安全性测试可用性测试跨平台兼容性测试网络环境测试3.接口测试的工具你了解哪些
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
展现思维导图魅力，不断挖掘人生宝藏思维导图讲师Mandy
第13期最强思维导图训练营已经结束一周了，但是我依旧是感觉所有学员还在努力的学习，这些学员中有教师、学生、白领、公务员、宝妈等等，只要你努力，只要你想改变自己，任何行业，任何岗位都可以参与进来，28天足以让你见成效，在这28天中，我们的学员不仅仅是收获了一枚毕业证，最重要的是让自己的思维方式得到升级，今天的你为自己投资，明天的你就会感谢你今天的付出，我们来听一听来自13期最强思维导图训练营优秀学员
2019-11-04复盘——飞来山上千寻塔，闻说鸡鸣见日升。那一叶秋
1、大盘篇先上老图，看习惯了，也就知道走势了图1上证指数日线图还是那张老图，自己可以在自己的相关软件上画出来，快变盘了。2、个股篇未加仓、未减仓。分析量能的时候，突然发现这么一个东西：“放量突破年线，缩量回调。”合众科技日线图其实，最近的N只个股，在技术分析上，都到了变盘的临界时候。结合这么久的走势，特别是ZJH不断放开IPO的申请，本质上说是融资难度变大，或者说是为企业的融资开创便利。但现在市场
【华为OD技术面试真题精选 - 非技术题】 -HR面，综合面_华为od hr面一个射手座的程序媛程序员华为od 面试职场和发展
最后的话最近很多小伙伴找我要Linux学习资料，于是我翻箱倒柜，整理了一些优质资源，涵盖视频、电子书、PPT等共享给大家！资料预览给大家整理的视频资料：给大家整理的电子书资料：如果本文对你有帮助，欢迎点赞、收藏、转发给朋友，让我有持续创作的动力！网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。需要这份系统化的资料的朋友，可以点击这里获
18、架构-可观测性之聚合度量大树~~ 架构 java python 后端架构
聚合度量聚合度量是指对系统运行时产生的各种指标数据进行收集、聚合和分析，以了解系统的健康状况和性能表现。聚合度量是可观测性的关键组成部分，通过对度量数据的分析，可以及时发现系统中的异常和瓶颈。以下是对聚合度量各个方面的详细解析，并结合具体的数据案例和技术支撑。指标收集收集系统运行时产生的各种指标数据是聚合度量的基础。常见的指标包括CPU使用率、内存使用率、请求处理时间、请求数、错误率等。以下是指标
教育用心灵温暖心灵
@陈春丽长期学习班冯倩。今天一早就听到说高职合并，取消中专教育的教育信息。感觉是虽然知道，再听还是吓一跳。国家重视职业教育为何还要取消中专技术学校的教育？再听高中就要进行技术教育了，一部分人学习好继续努力学习考大学，一部分人在高中就可以进行职业教育接受职业教育了还要中专技术教育学校干什么呢！a有些职业教育学校转型升级快，不是孩子上完给找工作，而是学校帮孩子创业，我觉得是不错的方向！新闻新你得实时更
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
EIO国际确定性的交易（3/10）资管，资金委托安全吗？古城鹏哥
大家可能都知道资金托管，账户是自己开，钱在自己的账户上，密码是由自己掌控，别人提不走你账户的资金，每天可以看下到自己的账户，也可以看到交易流水。现金只能提到自己的银行卡中。账户由技术人员或操作人员，或者是机构团队帮你操作账户，产生盈利和收入，以获得的利润来分配盈利，技术强硬和做的时间久了过硬技术团队，会保证你的资金本金，不会让你的本金亏损的按照一定比例分配收入。所以在这个过程当中一定要看清楚技术的
目前哪里有卖高仿包包，推荐十个渠道已更新富腕表之家
1、工厂购买，推荐微信:【76929666】目前买的人最多的渠道。2、某宝购买，价格较高，质量没有保障。3、拼夕夕，价格是便宜，但是质量不敢想象。4、专柜购买，数量较少，经常断货，价格也太高不好接受。5、批发市场购买，可遇不可求，一般生活在批发市场附近的，根本不用考虑在哪里买高仿包包分几个级别？在当今的包类市场中，广州作为一个知名的货源地，已经成为高仿包行业的一个重要标志。随着市场的需求增加，高仿
下一站深圳默琊
昨天已经买好3/15到深圳的机票了，原本上周还有点拖延症发作，不太积极，所以昨天就直接逼迫自己买机票，然后在订房，下周就是确认行业和把具体的面谈日程定下来。行业的选择上目前没有太大的偏好，上一份工作主要是风控和客服，客服部分也算是个小组长，有负责培训和一些案件SOP流程的制定等工作。总感觉客服这个职位的职涯发展只能是垂直的往更高的管理层走，对于横向发展似乎不容易，而鉴于做客服1年的感受，我不太喜欢
OPENAIGC开发者大赛企业组AI黑马奖 | AIGC数智传媒解决方案 RPA中国人工智能 AIGC 传媒
在第二届拯救者杯OPENAIGC开发者大赛中，涌现出一批技术突出、创意卓越的作品。为了让这些优秀项目被更多人看到，我们特意开设了优秀作品报道专栏，旨在展示其独特之处和开发者的精彩故事。无论您是技术专家还是爱好者，希望能带给您不一样的知识和启发。让我们一起探索AIGC的无限可能，见证科技与创意的完美融合！创未来AI应用赛-企业组AI黑马奖作品名称：AIGC数智传媒解决方案参赛团队：深圳市三象智能技术
tomcat基础与部署发布暗黑小菠萝 Tomcat java web
从51cto搬家了，以后会更新在这里方便自己查看。做项目一直用tomcat，都是配置到eclipse中使用，这几天有时间整理一下使用心得，有一些自己配置遇到的细节问题。 Tomcat：一个Servlets和JSP页面的容器，以提供网站服务。一、Tomcat安装安装方式：①运行.exe安装包 &n
网站架构发展的过程 ayaoxinchao 数据库应用服务器网站架构
1.初始阶段网站架构：应用程序、数据库、文件等资源在同一个服务器上 2.应用服务和数据服务分离：应用服务器、数据库服务器、文件服务器 3.使用缓存改善网站性能：为应用服务器提供本地缓存，但受限于应用服务器的内存容量，可以使用专门的缓存服务器，提供分布式缓存服务器架构 4.使用应用服务器集群改善网站的并发处理能力：使用负载均衡调度服务器，将来自客户端浏览器的访问请求分发到应用服务器集群中的任何
[信息与安全]数据库的备份问题 comsci 数据库
如果你们建设的信息系统是采用中心-分支的模式,那么这里有一个问题如果你的数据来自中心数据库,那么中心数据库如果出现故障,你的分支机构的数据如何保证安全呢? 是否应该在这种信息系统结构的基础上进行改造,容许分支机构的信息系统也备份一个中心数据库的文件呢? &n
使用maven tomcat plugin插件debug关联源代码商人shang maven debug 查看源码 tomcat-plugin
*首先需要配置好'''maven-tomcat7-plugin'''，参见[[Maven开发Web项目]]的'''Tomcat'''部分。 *配置好后，在[[Eclipse]]中打开'''Debug Configurations'''界面，在'''Maven Build'''项下新建当前工程的调试。在'''Main'''选项卡中点击'''Browse Workspace...'''选择需要开发的
大访问量高并发 oloz 大访问量高并发
大访问量高并发的网站主要压力还是在于数据库的操作上，尽量避免频繁的请求数据库。下面简要列出几点解决方案： 01、优化你的代码和查询语句，合理使用索引 02、使用缓存技术例如memcache、ecache将不经常变化的数据放入缓存之中 03、采用服务器集群、负载均衡分担大访问量高并发压力 04、数据读写分离 05、合理选用框架，合理架构(推荐分布式架构)。
cache 服务器小猪猪08 cache
Cache 即高速缓存.那么cache是怎么样提高系统性能与运行速度呢？是不是在任何情况下用cache都能提高性能？是不是cache用的越多就越好呢？我在近期开发的项目中有所体会，写下来当作总结也希望能跟大家一起探讨探讨，有错误的地方希望大家批评指正。　　1.Cache 是怎么样工作的? 　　Cache 是分配在服务器上
mysql存储过程香水浓 mysql
Description:插入大量测试数据 use xmpl; drop procedure if exists mockup_test_data_sp; create procedure mockup_test_data_sp( in number_of_records int ) begin declare cnt int; declare name varch
CSS的class、id、css文件名的常用命名规则 agevs JavaScript UI 框架 Ajax css
CSS的class、id、css文件名的常用命名规则 (一)常用的CSS命名规则　　头：header 　　内容：content/container 　　尾：footer 　　导航：nav 　　侧栏：sidebar 　　栏目：column 　　页面外围控制整体布局宽度：wrapper 　　左右中：left right
全局数据源 AILIKES java tomcat mysql jdbc JNDI
实验目的：为了研究两个项目同时访问一个全局数据源的时候是创建了一个数据源对象，还是创建了两个数据源对象。 1：将diuid和mysql驱动包（druid-1.0.2.jar和mysql-connector-java-5.1.15.jar）copy至%TOMCAT_HOME%/lib下；2：配置数据源，将JNDI在%TOMCAT_HOME%/conf/context.xml中配置好,格式如下：&l
MYSQL的随机查询的实现方法 baalwolf mysql
MYSQL的随机抽取实现方法。举个例子，要从tablename表中随机提取一条记录，大家一般的写法就是：SELECT * FROM tablename ORDER BY RAND() LIMIT 1。但是，后来我查了一下MYSQL的官方手册，里面针对RAND()的提示大概意思就是，在ORDER BY从句里面不能使用RAND()函数，因为这样会导致数据列被多次扫描。但是在MYSQL 3.23版本中，
JAVA的getBytes()方法 bijian1013 java eclipse unix OS
在Java中，String的getBytes()方法是得到一个操作系统默认的编码格式的字节数组。这个表示在不同OS下，返回的东西不一样！ String.getBytes(String decode)方法会根据指定的decode编码返回某字符串在该编码下的byte数组表示，如： byte[] b_gbk = "
AngularJS中操作Cookies bijian1013 JavaScript AngularJS Cookies
如果你的应用足够大、足够复杂，那么你很快就会遇到这样一咱种情况：你需要在客户端存储一些状态信息，这些状态信息是跨session(会话)的。你可能还记得利用document.cookie接口直接操作纯文本cookie的痛苦经历。幸运的是，这种方式已经一去不复返了，在所有现代浏览器中几乎
[Maven学习笔记五]Maven聚合和继承特性 bit1129 maven
Maven聚合在实际的项目中，一个项目通常会划分为多个模块，为了说明问题，以用户登陆这个小web应用为例。通常一个web应用分为三个模块： 1. 模型和数据持久化层user-core, 2. 业务逻辑层user-service以 3. web展现层user-web， user-service依赖于user-core user-web依赖于user-core和use
【JVM七】JVM知识点总结 bit1129 jvm
1. JVM运行模式 1.1 JVM运行时分为-server和-client两种模式，在32位机器上只有client模式的JVM。通常，64位的JVM默认都是使用server模式，因为server模式的JVM虽然启动慢点，但是，在运行过程，JVM会尽可能的进行优化 1.2 JVM分为三种字节码解释执行方式：mixed mode, interpret mode以及compiler
linux下查看nginx、apache、mysql、php的编译参数 ronin47
在linux平台下的应用，最流行的莫过于nginx、apache、mysql、php几个。而这几个常用的应用，在手工编译完以后，在其他一些情况下（如：新增模块），往往想要查看当初都使用了那些参数进行的编译。这时候就可以利用以下方法查看。 1、nginx [root@361way ~]# /App/nginx/sbin/nginx -V nginx: nginx version: nginx/
unity中运用Resources.Load的方法？ brotherlamp unity视频 unity资料 unity自学 unity unity教程
问：unity中运用Resources.Load的方法？答：Resources.Load是unity本地动态加载资本所用的方法,也即是你想动态加载的时分才用到它,比方枪弹,特效,某些实时替换的图像什么的,主张此文件夹不要放太多东西,在打包的时分,它会独自把里边的一切东西都会集打包到一同,不论里边有没有你用的东西,所以大多数资本应该是自个建文件放置 1、unity实时替换的物体即是依据环境条件
线段树-入门 bylijinnan java 算法线段树
/** * 线段树入门 * 问题：已知线段[2,5] [4,6] [0,7]；求点2,4,7分别出现了多少次 * 以下代码建立的线段树用链表来保存，且树的叶子结点类似[i,i] * * 参考链接：http://hi.baidu.com/semluhiigubbqvq/item/be736a33a8864789f4e4ad18 * @author lijinna
全选与反选 chicony 全选
<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN" "http://www.w3.org/TR/html4/loose.dtd"> <html> <head> <title>全选与反选</title>
vim一些简单记录 chenchao051 vim
mac在/usr/share/vim/vimrc linux在/etc/vimrc 1、问：后退键不能删除数据，不能往后退怎么办？答：在vimrc中加入set backspace=2 2、问：如何控制tab键的缩进？答：在vimrc中加入set tabstop=4 (任何
Sublime Text 快捷键 daizj 快捷键 sublime
[size=large][/size]Sublime Text快捷键：Ctrl+Shift+P：打开命令面板Ctrl+P：搜索项目中的文件Ctrl+G：跳转到第几行Ctrl+W：关闭当前打开文件Ctrl+Shift+W：关闭所有打开文件Ctrl+Shift+V：粘贴并格式化Ctrl+D：选择单词，重复可增加选择下一个相同的单词Ctrl+L：选择行，重复可依次增加选择下一行Ctrl+Shift+L：
php 引用(&)详解 dcj3sjt126com PHP
在PHP 中引用的意思是：不同的名字访问同一个变量内容. 与Ｃ语言中的指针是有差别的．Ｃ语言中的指针里面存储的是变量的内容在内存中存放的地址变量的引用 PHP 的引用允许你用两个变量来指向同一个内容复制代码代码如下: <? $a="ABC"; $b =&$a; echo
SVN中trunk,branches,tags用法详解 dcj3sjt126com SVN
Subversion有一个很标准的目录结构，是这样的。比如项目是proj，svn地址为svn://proj/，那么标准的svn布局是svn://proj/|+-trunk+-branches+-tags这是一个标准的布局，trunk为主开发目录，branches为分支开发目录，tags为tag存档目录（不允许修改）。但是具体这几个目录应该如何使用，svn并没有明确的规范，更多的还是用户自己的习惯。
对软件设计的思考 e200702084 设计模式数据结构算法 ssh 活动
软件设计的宏观与微观软件开发是一种高智商的开发活动。一个优秀的软件设计人员不仅要从宏观上把握软件之间的开发，也要从微观上把握软件之间的开发。宏观上，可以应用面向对象设计，采用流行的SSH架构，采用web层，业务逻辑层，持久层分层架构。采用设计模式提供系统的健壮性和可维护性。微观上，对于一个类，甚至方法的调用，从计算机的角度模拟程序的运行情况。了解内存分配，参数传
同步、异步、阻塞、非阻塞 geeksun 非阻塞
同步、异步、阻塞、非阻塞这几个概念有时有点混淆，在此文试图解释一下。同步：发出方法调用后，当没有返回结果，当前线程会一直在等待（阻塞）状态。场景：打电话，营业厅窗口办业务、B/S架构的http请求-响应模式。异步：方法调用后不立即返回结果，调用结果通过状态、通知或回调通知方法调用者或接收者。异步方法调用后，当前线程不会阻塞，会继续执行其他任务。实现：
Reverse SSH Tunnel 反向打洞實錄 hongtoushizi ssh
實際的操作步驟： # 首先，在客戶那理的機器下指令連回我們自己的 Server，並設定自己 Server 上的 12345 port 會對應到幾器上的 SSH port ssh -NfR 12345:localhost:22 [email protected] # 然後在 myhost 的機器上連自己的 12345 port，就可以連回在客戶那的機器 ssh localhost -p 1
Hibernate中的缓存 Josh_Persistence 一级缓存 Hiberante缓存查询缓存二级缓存
Hibernate中的缓存一、Hiberante中常见的三大缓存：一级缓存，二级缓存和查询缓存。 Hibernate中提供了两级Cache，第一级别的缓存是Session级别的缓存，它是属于事务范围的缓存。这一级别的缓存是由hibernate管理的，一般情况下无需进行干预；第二级别的缓存是SessionFactory级别的缓存，它是属于进程范围或群集范围的缓存。这一级别的缓存
对象关系行为模式之延迟加载 home198979 PHP 架构延迟加载
形象化设计模式实战 HELLO!架构一、概念 Lazy Load：一个对象，它虽然不包含所需要的所有数据，但是知道怎么获取这些数据。延迟加载貌似很简单，就是在数据需要时再从数据库获取，减少数据库的消耗。但这其中还是有不少技巧的。二、实现延迟加载实现Lazy Load主要有四种方法：延迟初始化、虚
xml 验证 pengfeicao521 xml xml解析
有些字符，xml不能识别，用jdom或者dom4j解析的时候就报错 public static void testPattern() { // 含有非法字符的串 String str = "Jamey친Ñ&#1282
div设置半透明效果 spjich css 半透明
为div设置如下样式： div{filter:alpha(Opacity=80);-moz-opacity:0.5;opacity: 0.5;} 说明： 1、filter：对win IE设置半透明滤镜效果，filter:alpha(Opacity=80)代表该对象80%半透明，火狐浏览器不认2、-moz-opaci
你真的了解单例模式么？ w574240966 java 单例设计模式 jvm
单例模式，很多初学者认为单例模式很简单，并且认为自己已经掌握了这种设计模式。但事实上，你真的了解单例模式了么。一，单例模式的5中写法。（回字的四种写法，哈哈。） 1，懒汉式（1）线程不安全的懒汉式 public cla