u010590166

[置顶] 教你如何迅速秒杀掉：99%的海量数据处理面试题

教你如何迅速秒杀掉：99%的海量数据处理面试题

作者：July
出处：结构之法算法之道blog

前言

一般而言，标题含有“秒杀”，“99%”，“史上最全/最强”等词汇的往往都脱不了哗众取宠之嫌，但进一步来讲，如果读者读罢此文，却无任何收获，那么，我也甘愿背负这样的罪名，:-)，同时，此文可以看做是对这篇文章：十道海量数据处理面试题与十个方法大总结的一般抽象性总结。

毕竟受文章和理论之限，本文将摒弃绝大部分的细节，只谈方法/模式论，且注重用最通俗最直白的语言阐述相关问题。最后，有一点必须强调的是，全文行文是基于面试题的分析基础之上的，具体实践过程中，还是得具体情况具体分析，且各个场景下需要考虑的细节也远比本文所描述的任何一种解决方法复杂得多。

OK，若有任何问题，欢迎随时不吝赐教。谢谢。

何谓海量数据处理？

所谓海量数据处理，无非就是基于海量数据上的存储、处理、操作。何谓海量，就是数据量太大，所以导致要么是无法在较短时间内迅速解决，要么是数据太大，导致无法一次性装入内存。

那解决办法呢?针对时间，我们可以采用巧妙的算法搭配合适的数据结构，如Bloom filter/Hash/bit-map/堆/数据库或倒排索引/trie树，针对空间，无非就一个办法：大而化小：分而治之/hash映射，你不是说规模太大嘛，那简单啊，就把规模大化为规模小的，各个击破不就完了嘛。

至于所谓的单机及集群问题，通俗点来讲，单机就是处理装载数据的机器有限(只要考虑cpu，内存，硬盘的数据交互)，而集群，机器有多辆，适合分布式处理，并行计算(更多考虑节点和节点间的数据交互)。

再者，通过本blog内的有关海量数据处理的文章：Big Data Processing，我们已经大致知道，处理海量数据问题，无非就是：

分而治之/hash映射 + hash统计 + 堆/快速/归并排序；
双层桶划分
Bloom filter/Bitmap；
Trie树/数据库/倒排索引；
外排序；
分布式处理之Hadoop/Mapreduce。

下面，本文第一部分、从set/map谈到hashtable/hash_map/hash_set，简要介绍下set/map/multiset/multimap，及hash_set/hash_map/hash_multiset/hash_multimap之区别(万丈高楼平地起，基础最重要)，而本文第二部分，则针对上述那6种方法模式结合对应的海量数据处理面试题分别具体阐述。

第一部分、从set/map谈到hashtable/hash_map/hash_set

稍后本文第二部分中将多次提到hash_map/hash_set，下面稍稍介绍下这些容器，以作为基础准备。一般来说，STL容器分两种，

序列式容器(vector/list/deque/stack/queue/heap)，
关联式容器。关联式容器又分为set(集合)和map(映射表)两大类，以及这两大类的衍生体multiset(多键集合)和multimap(多键映射表)，这些容器均以RB-tree完成。此外，还有第3类关联式容器，如hashtable(散列表)，以及以hashtable为底层机制完成的hash_set(散列集合)/hash_map(散列映射表)/hash_multiset(散列多键集合)/hash_multimap(散列多键映射表)。也就是说，set/map/multiset/multimap都内含一个RB-tree，而hash_set/hash_map/hash_multiset/hash_multimap都内含一个hashtable。

所谓关联式容器，类似关联式数据库，每笔数据或每个元素都有一个键值(key)和一个实值(value)，即所谓的Key-Value(键-值对)。当元素被插入到关联式容器中时，容器内部结构(RB-tree/hashtable)便依照其键值大小，以某种特定规则将这个元素放置于适当位置。

包括在非关联式数据库中，比如，在MongoDB内，文档(document)是最基本的数据组织形式，每个文档也是以Key-Value（键-值对）的方式组织起来。一个文档可以有多个Key-Value组合，每个Value可以是不同的类型，比如String、Integer、List等等。
{ "name" : "July",
"sex" : "male",
"age" : 23 }

set/map/multiset/multimap

set，同map一样，所有元素都会根据元素的键值自动被排序，因为set/map两者的所有各种操作，都只是转而调用RB-tree的操作行为，不过，值得注意的是，两者都不允许两个元素有相同的键值。
不同的是：set的元素不像map那样可以同时拥有实值(value)和键值(key)，set元素的键值就是实值，实值就是键值，而map的所有元素都是pair，同时拥有实值(value)和键值(key)，pair的第一个元素被视为键值，第二个元素被视为实值。
至于multiset/multimap，他们的特性及用法和set/map完全相同，唯一的差别就在于它们允许键值重复，即所有的插入操作基于RB-tree的insert_equal()而非insert_unique()。

hash_set/hash_map/hash_multiset/hash_multimap

hash_set/hash_map，两者的一切操作都是基于hashtable之上。不同的是，hash_set同set一样，同时拥有实值和键值，且实质就是键值，键值就是实值，而hash_map同map一样，每一个元素同时拥有一个实值(value)和一个键值(key)，所以其使用方式，和上面的map基本相同。但由于hash_set/hash_map都是基于hashtable之上，所以不具备自动排序功能。为什么?因为hashtable没有自动排序功能。
至于hash_multiset/hash_multimap的特性与上面的multiset/multimap完全相同，唯一的差别就是它们hash_multiset/hash_multimap的底层实现机制是hashtable(而multiset/multimap，上面说了，底层实现机制是RB-tree)，所以它们的元素都不会被自动排序，不过也都允许键值重复。

所以，综上，说白了，什么样的结构决定其什么样的性质，因为set/map/multiset/multimap都是基于RB-tree之上，所以有自动排序功能，而hash_set/hash_map/hash_multiset/hash_multimap都是基于hashtable之上，所以不含有自动排序功能，至于加个前缀multi_无非就是允许键值重复而已。

此外，

关于什么hash，请看blog内此篇文章：http://blog.csdn.net/v_JULY_v/article/details/6256463；
关于红黑树，请参看blog内系列文章：http://blog.csdn.net/v_july_v/article/category/774945，
关于hash_map的具体应用：http://blog.csdn.net/sdhongjun/article/details/4517325，关于hash_set：http://blog.csdn.net/morewindows/article/details/7330323。

OK，接下来，请看本文第二部分、处理海量数据问题之六把密匙。

第二部分、处理海量数据问题之六把密匙

密匙一、分而治之/Hash映射 + Hash统计 + 堆/快速/归并排序

1、海量日志数据，提取出某日访问百度次数最多的那个IP。

既然是海量数据处理，那么可想而知，给我们的数据那就一定是海量的。针对这个数据的海量，我们如何着手呢?对的，无非就是分而治之/hash映射 + hash统计 + 堆/快速/归并排序，说白了，就是先映射，而后统计，最后排序：

分而治之/hash映射：针对数据太大，内存受限，只能是：把大文件化成(取模映射)小文件，即16字方针：大而化小，各个击破，缩小规模，逐个解决
hash统计：当大文件转化了小文件，那么我们便可以采用常规的hash_map(ip，value)来进行频率统计。
堆/快速排序：统计完了之后，便进行排序(可采取堆排序)，得到次数最多的IP。

具体而论，则是： “首先是这一天，并且是访问百度的日志中的IP取出来，逐个写入到一个大文件中。注意到IP是32位的，最多有个2^32个IP。同样可以采用映射的方法，比如模1000，把整个大文件映射为1000个小文件，再找出每个小文中出现频率最大的IP（可以采用hash_map对那1000个文件中的所有IP进行频率统计，然后依次找出各个文件中频率最大的那个IP）及相应的频率。然后再在这1000个最大的IP中，找出那个频率最大的IP，即为所求。”--十道海量数据处理面试题与十个方法大总结。

关于本题，还有几个问题，如下：

1、Hash取模是一种等价映射，不会存在同一个元素分散到不同小文件中去的情况，即这里采用的是mod1000算法，那么相同的IP在hash后，只可能落在同一个文件中，不可能被分散的。
2、那到底什么是hash映射呢？简单来说，就是为了便于计算机在有限的内存中处理big数据，从而通过一种映射散列的方式让数据均匀分布在对应的内存位置(如大数据通过取余的方式映射成小树存放在内存中，或大文件映射成多个小文件)，而这个映射散列方式便是我们通常所说的hash函数，设计的好的hash函数能让数据均匀分布而减少冲突。尽管数据映射到了另外一些不同的位置，但数据还是原来的数据，只是代替和表示这些原始数据的形式发生了变化而已。

此外，有一朋友quicktest用python语言实践测试了下本题，地址如下：http://blog.csdn.net/quicktest/article/details/7453189。谢谢。OK，有兴趣的，还可以再了解下一致性hash算法，见blog内此文第五部分：http://blog.csdn.net/v_july_v/article/details/6879101。

2、寻找热门查询，300万个查询字符串中统计最热门的10个查询

原题：搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来，每个查询串的长度为1-255字节。假设目前有一千万个记录（这些查询串的重复度比较高，虽然总数是1千万，但如果除去重复后，不超过3百万个。一个查询串的重复度越高，说明查询它的用户越多，也就是越热门），请你统计最热门的10个查询串，要求使用的内存不能超过1G。

解答：由上面第1题，我们知道，数据大则划为小的，如如一亿个Ip求Top 10，可先%1000将ip分到1000个小文件中去，并保证一种ip只出现在一个文件中，再对每个小文件中的ip进行hashmap计数统计并按数量排序，最后归并或者最小堆依次处理每个小文件的top10以得到最后的结。

但如果数据规模比较小，能一次性装入内存呢?比如这第2题，虽然有一千万个Query，但是由于重复度比较高，因此事实上只有300万的Query，每个Query255Byte，因此我们可以考虑把他们都放进内存中去（300万个字符串假设没有重复，都是最大长度，那么最多占用内存3M*1K/4=0.75G。所以可以将所有字符串都存放在内存中进行处理），而现在只是需要一个合适的数据结构，在这里，HashTable绝对是我们优先的选择。

所以我们放弃分而治之/hash映射的步骤，直接上hash统计，然后排序。So，针对此类典型的TOP K问题，采取的对策往往是：hashmap + 堆。如下所示：

hash统计：先对这批海量数据预处理。具体方法是：维护一个Key为Query字串，Value为该Query出现次数的HashTable，即hash_map(Query，Value)，每次读取一个Query，如果该字串不在Table中，那么加入该字串，并且将Value值设为1；如果该字串在Table中，那么将该字串的计数加一即可。最终我们在O(N)的时间复杂度内用Hash表完成了统计；
堆排序：第二步、借助堆这个数据结构，找出Top K，时间复杂度为N‘logK。即借助堆结构，我们可以在log量级的时间内查找和调整/移动。因此，维护一个K(该题目中是10)大小的小根堆，然后遍历300万的Query，分别和根元素进行对比。所以，我们最终的时间复杂度是：O（N） + N' * O（logK），（N为1000万，N’为300万）。

别忘了这篇文章中所述的堆排序思路：“维护k个元素的最小堆，即用容量为k的最小堆存储最先遍历到的k个数，并假设它们即是最大的k个数，建堆费时O（k），并调整堆(费时O（logk）)后，有k1>k2>...kmin（kmin设为小顶堆中最小元素）。继续遍历数列，每次遍历一个元素x，与堆顶元素比较，若x>kmin，则更新堆（x入堆，用时logk），否则不更新堆。这样下来，总费时O（k*logk+（n-k）*logk）=O（n*logk）。此方法得益于在堆中，查找等各项操作时间复杂度均为logk。”--第三章续、Top K算法问题的实现。
当然，你也可以采用trie树，关键字域存该查询串出现的次数，没有出现为0。最后用10个元素的最小推来对出现频率进行排序。

3、有一个1G大小的一个文件，里面每一行是一个词，词的大小不超过16字节，内存限制大小是1M。返回频数最高的100个词。
由上面那两个例题，分而治之 + hash统计 + 堆/快速排序这个套路，我们已经开始有了屡试不爽的感觉。下面，再拿几道再多多验证下。请看此第3题：又是文件很大，又是内存受限，咋办?还能怎么办呢?无非还是：

分而治之/hash映射：顺序读文件中，对于每个词x，取hash(x)%5000，然后按照该值存到5000个小文件（记为x0,x1,...x4999）中。这样每个文件大概是200k左右。如果其中的有的文件超过了1M大小，还可以按照类似的方法继续往下分，直到分解得到的小文件的大小都不超过1M。
hash统计：对每个小文件，采用trie树/hash_map等统计每个文件中出现的词以及相应的频率。
堆/归并排序：取出出现频率最大的100个词（可以用含100个结点的最小堆）后，再把100个词及相应的频率存入文件，这样又得到了5000个文件。最后就是把这5000个文件进行归并（类似于归并排序）的过程了。

4、海量数据分布在100台电脑中，想个办法高效统计出这批数据的TOP10。

此题与上面第3题类似，

堆排序：在每台电脑上求出TOP10，可以采用包含10个元素的堆完成（TOP10小，用最大堆，TOP10大，用最小堆，比如求TOP10大，我们首先取前10个元素调整成最小堆，如果发现，然后扫描后面的数据，并与堆顶元素比较，如果比堆顶元素大，那么用该元素替换堆顶，然后再调整为最小堆。最后堆中的元素就是TOP10大）。
求出每台电脑上的TOP10后，然后把这100台电脑上的TOP10组合起来，共1000个数据，再利用上面类似的方法求出TOP10就可以了。

针对此解法，有读者觉得有问题，如举个例子如求2个文件中的top2，照上述算法，如果第一个文件里有：

a 49次

b 50次

c 2次

d 1次

第二个文件里有：

a 9次

b 1次

c 11次

d 10次

虽然第一个文件里出来top2是b（50次）,a（49次）,第二个文件里出来top2是c（11次）,d（10次）,然后2个top2：b（50次）a（49次）与c（11次）d（10次）归并，则算出所有的文件的top2是b(50 次),a(49 次),但实际上是a(58 次),b(51 次)。是否真是如此呢?
事实上答案很简单：hash取模是一种等价映射，不存在同一个元素被hash映射到不同的小文件中。

5、有10个文件，每个文件1G，每个文件的每一行存放的都是用户的query，每个文件的query都可能重复。要求你按照query的频度排序。

方案1：直接上：

hash映射：顺序读取10个文件，按照hash(query)%10的结果将query写入到另外10个文件（记为a0,a1,..a9）中。这样新生成的文件每个的大小大约也1G（假设hash函数是随机的）。
hash统计：找一台内存在2G左右的机器，依次对用hash_map(query, query_count)来统计每个query出现的次数。注：hash_map(query,query_count)是用来统计每个query的出现次数，不是存储他们的值，出现一次，则count+1。
堆/快速/归并排序：利用快速/堆/归并排序按照出现次数进行排序，将排序好的query和对应的query_cout输出到文件中，这样得到了10个排好序的文件（记为）。最后，对这10个文件进行归并排序（内排序与外排序相结合）。根据此方案1，这里有一份实现：https://github.com/ooooola/sortquery/blob/master/querysort.py。

除此之外，此题还有以下两个方法：
方案2：一般query的总量是有限的，只是重复的次数比较多而已，可能对于所有的query，一次性就可以加入到内存了。这样，我们就可以采用trie树/hash_map等直接来统计每个query出现的次数，然后按出现次数做快速/堆/归并排序就可以了。

方案3：与方案1类似，但在做完hash，分成多个文件后，可以交给多个文件来处理，采用分布式的架构来处理（比如MapReduce），最后再进行合并。

6、给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url？

可以估计每个文件安的大小为5G×64=320G，远远大于内存限制的4G。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。

分而治之/hash映射：遍历文件a，对每个url求取，然后根据所取得的值将url分别存储到1000个小文件（记为，这里漏写个了a1）中。这样每个小文件的大约为300M。遍历文件b，采取和a相同的方式将url分别存储到1000小文件中（记为）。这样处理后，所有可能相同的url都在对应的小文件（）中，不对应的小文件不可能有相同的url。然后我们只要求出1000对小文件中相同的url即可。
hash统计：求每对小文件中相同的url时，可以把其中一个小文件的url存储到hash_set中。然后遍历另一个小文件的每个url，看其是否在刚才构建的hash_set中，如果是，那么就是共同的url，存到文件里面就可以了。

OK，此第一种方法：分而治之/hash映射 + hash统计 + 堆/快速/归并排序，再看最后4道题，如下：

7、怎么在海量数据中找出重复次数最多的一个？

方案1：先做hash，然后求模映射为小文件，求出每个小文件中重复次数最多的一个，并记录重复次数。然后找出上一步求出的数据中重复次数最多的一个就是所求（具体参考前面的题）。

8、上千万或上亿数据（有重复），统计其中出现次数最多的钱N个数据。

方案1：上千万或上亿的数据，现在的机器的内存应该能存下。所以考虑采用hash_map/搜索二叉树/红黑树等来进行统计次数。然后就是取出前N个出现次数最多的数据了，可以用第2题提到的堆机制完成。

9、一个文本文件，大约有一万行，每行一个词，要求统计出其中最频繁出现的前10个词，请给出思想，给出时间复杂度分析。

方案1：这题是考虑时间效率。用trie树统计每个词出现的次数，时间复杂度是O(n*le)（le表示单词的平准长度）。然后是找出出现最频繁的前10个词，可以用堆来实现，前面的题中已经讲到了，时间复杂度是O(n*lg10)。所以总的时间复杂度，是O(n*le)与O(n*lg10)中较大的哪一个。

10. 1000万字符串，其中有些是重复的，需要把重复的全部去掉，保留没有重复的字符串。请怎么设计和实现？

方案1：这题用trie树比较合适，hash_map也行。
方案2：from xjbzju:，1000w的数据规模插入操作完全不现实，以前试过在stl下100w元素插入set中已经慢得不能忍受，觉得基于hash的实现不会比红黑树好太多，使用vector+sort+unique都要可行许多，建议还是先hash成小文件分开处理再综合。

上述方案2中读者xbzju的方法让我想到了一些问题，即是set/map，与hash_set/hash_map的性能比较?共计3个问题，如下：

1、hash_set在千万级数据下，insert操作优于set? 这位blog：http://t.cn/zOibP7t 给的实践数据可靠不?
2、那map和hash_map的性能比较呢? 谁做过相关实验?

3、那查询操作呢，如下段文字所述?

或者小数据量时用map，构造快，大数据量时用hash_map?

rbtree PK hashtable

据朋友№邦卡猫№的做的红黑树和hash table的性能测试中发现：当数据量基本上int型key时，hash table是rbtree的3-4倍，但hash table一般会浪费大概一半内存。

因为hash table所做的运算就是个%，而rbtree要比较很多，比如rbtree要看value的数据，每个节点要多出3个指针（或者偏移量）如果需要其他功能，比如，统计某个范围内的key的数量，就需要加一个计数成员。

且1s rbtree能进行大概50w+次插入，hash table大概是差不多200w次。不过很多的时候，其速度可以忍了，例如倒排索引差不多也是这个速度，而且单线程，且倒排表的拉链长度不会太大。正因为基于树的实现其实不比hashtable慢到哪里去，所以数据库的索引一般都是用的 B/B+树，而且B+树还对磁盘友好(B树能有效降低它的高度，所以减少磁盘交互次数)。比如现在非常流行的NoSQL数据库，像 MongoDB也是采用的B树索引。关于B树系列，请参考本blog内此篇文章：从B树、B+树、B*树谈到R 树。

OK，更多请待后续实验论证。接下来，咱们来看第二种方法，双层捅划分。

密匙二、双层桶划分

双层桶划分----其实本质上还是分而治之的思想，重在“分”的技巧上！
　　适用范围：第k大，中位数，不重复或重复的数字
　　基本原理及要点：因为元素范围很大，不能利用直接寻址表，所以通过多次划分，逐步确定范围，然后最后在一个可以接受的范围内进行。可以通过多次缩小，双层只是一个例子。
　　扩展：
　　问题实例：

11、2.5亿个整数中找出不重复的整数的个数，内存空间不足以容纳这2.5亿个整数。
　　有点像鸽巢原理，整数个数为2^32,也就是，我们可以将这2^32个数，划分为2^8个区域(比如用单个文件代表一个区域)，然后将数据分离到不同的区域，然后不同的区域在利用bitmap就可以直接解决了。也就是说只要有足够的磁盘空间，就可以很方便的解决。

12、5亿个int找它们的中位数。

思路一：这个例子比上面那个更明显。首先我们将int划分为2^16个区域，然后读取数据统计落到各个区域里的数的个数，之后我们根据统计结果就可以判断中位数落到那个区域，同时知道这个区域中的第几大数刚好是中位数。然后第二次扫描我们只统计落在这个区域中的那些数就可以了。
实际上，如果不是int是int64，我们可以经过3次这样的划分即可降低到可以接受的程度。即可以先将int64分成2^24个区域，然后确定区域的第几大数，在将该区域分成2^20个子区域，然后确定是子区域的第几大数，然后子区域里的数的个数只有2^20，就可以直接利用direct addr table进行统计了。
　　思路二@绿色夹克衫：同样需要做两遍统计，如果数据存在硬盘上，就需要读取2次。
方法同基数排序有些像，开一个大小为65536的Int数组，第一遍读取，统计Int32的高16位的情况，也就是0-65535，都算作0,65536 - 131071都算作1。就相当于用该数除以65536。Int32 除以 65536的结果不会超过65536种情况，因此开一个长度为65536的数组计数就可以。每读取一个数，数组中对应的计数+1，考虑有负数的情况，需要将结果加32768后，记录在相应的数组内。
第一遍统计之后，遍历数组，逐个累加统计，看中位数处于哪个区间，比如处于区间k，那么0- k-1的区间里数字的数量sum应该<n/2（2.5亿）。而k+1 - 65535的计数和也<n/2，第二遍统计同上面的方法类似，但这次只统计处于区间k的情况，也就是说(x / 65536) + 32768 = k。统计只统计低16位的情况。并且利用刚才统计的sum，比如sum = 2.49亿，那么现在就是要在低16位里面找100万个数(2.5亿-2.49亿)。这次计数之后，再统计一下，看中位数所处的区间，最后将高位和低位组合一下就是结果了。

密匙三：Bloom filter/Bitmap

Bloom filter

关于什么是Bloom filter，请参看blog内此文：

海量数据处理之Bloom Filter详解

　　适用范围：可以用来实现数据字典，进行数据的判重，或者集合求交集
　　基本原理及要点：
　　对于原理来说很简单，位数组+k个独立hash函数。将hash函数对应的值的位数组置1，查找时如果发现所有hash函数对应位都是1说明存在，很明显这个过程并不保证查找的结果是100%正确的。同时也不支持删除一个已经插入的关键字，因为该关键字对应的位会牵动到其他的关键字。所以一个简单的改进就是 counting Bloom filter，用一个counter数组代替位数组，就可以支持删除了。
　　还有一个比较重要的问题，如何根据输入元素个数n，确定位数组m的大小及hash函数个数。当hash函数个数k=(ln2)*(m/n)时错误率最小。在错误率不大于E的情况下，m至少要等于n*lg(1/E)才能表示任意n个元素的集合。但m还应该更大些，因为还要保证bit数组里至少一半为0，则m应该>=nlg(1/E)*lge 大概就是nlg(1/E)1.44倍(lg表示以2为底的对数)。
　　举个例子我们假设错误率为0.01，则此时m应大概是n的13倍。这样k大概是8个。
　　注意这里m与n的单位不同，m是bit为单位，而n则是以元素个数为单位(准确的说是不同元素的个数)。通常单个元素的长度都是有很多bit的。所以使用bloom filter内存上通常都是节省的。

　　扩展：
　　Bloom filter将集合中的元素映射到位数组中，用k（k为哈希函数个数）个映射位是否全1表示元素在不在这个集合中。Counting bloom filter（CBF）将位数组中的每一位扩展为一个counter，从而支持了元素的删除操作。Spectral Bloom Filter（SBF）将其与集合元素的出现次数关联。SBF采用counter中的最小值来近似表示元素的出现频率。

13、给你A,B两个文件，各存放50亿条URL，每条URL占用64字节，内存限制是4G，让你找出A,B文件共同的URL。如果是三个乃至n个文件呢？

　　根据这个问题我们来计算下内存的占用，4G=2^32大概是40亿*8大概是340亿，n=50亿，如果按出错率0.01算需要的大概是650亿个bit。现在可用的是340亿，相差并不多，这样可能会使出错率上升些。另外如果这些urlip是一一对应的，就可以转换成ip，则大大简单了。

同时，上文的第5题：给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url？如果允许有一定的错误率，可以使用Bloom filter，4G内存大概可以表示340亿bit。将其中一个文件中的url使用Bloom filter映射为这340亿bit，然后挨个读取另外一个文件的url，检查是否与Bloom filter，如果是，那么该url应该是共同的url（注意会有一定的错误率）。

Bitmap

关于什么是Bitmap，请看blog内此文第二部分：http://blog.csdn.net/v_july_v/article/details/6685962。

下面关于Bitmap的应用，直接上题，如下第9、10道：

14/11题、在2.5亿个整数中找出不重复的整数，注，内存不足以容纳这2.5亿个整数。

方案1：采用2-Bitmap（每个数分配2bit，00表示不存在，01表示出现一次，10表示多次，11无意义）进行，共需内存2^32 * 2 bit=1 GB内存，还可以接受。然后扫描这2.5亿个整数，查看Bitmap中相对应位，如果是00变01，01变10，10保持不变。所描完事后，查看bitmap，把对应位是01的整数输出即可。
方案2：也可采用与第1题类似的方法，进行划分小文件的方法。然后在小文件中找出不重复的整数，并排序。然后再进行归并，注意去除重复的元素。

15、腾讯面试题：给40亿个不重复的unsigned int的整数，没排过序的，然后再给一个数，如何快速判断这个数是否在那40亿个数当中？
方案1：frome oo，用位图/Bitmap的方法，申请512M的内存，一个bit位代表一个unsigned int值。读入40亿个数，设置相应的bit位，读入要查询的数，查看相应bit位是否为1，为1表示存在，为0表示不存在。

密匙四、Trie树/数据库/倒排索引

Trie树

　　适用范围：数据量大，重复多，但是数据种类小可以放入内存
　　基本原理及要点：实现方式，节点孩子的表示方式
　　扩展：压缩实现。
　　问题实例：

上面的第2题：寻找热门查询：查询串的重复度比较高，虽然总数是1千万，但如果除去重复后，不超过3百万个，每个不超过255字节。
上面的第5题：有10个文件，每个文件1G，每个文件的每一行都存放的是用户的query，每个文件的query都可能重复。要你按照query的频度排序。
1000万字符串，其中有些是相同的(重复),需要把重复的全部去掉，保留没有重复的字符串。请问怎么设计和实现？
上面的第8题：一个文本文件，大约有一万行，每行一个词，要求统计出其中最频繁出现的前10个词。其解决方法是：用trie树统计每个词出现的次数，时间复杂度是O(n*le)（le表示单词的平准长度），然后是找出出现最频繁的前10个词。

更多有关Trie树的介绍，请参见此文：从Trie树（字典树）谈到后缀树。

数据库索引
　　适用范围：大数据量的增删改查
　　基本原理及要点：利用数据的设计实现方法，对海量数据的增删改查进行处理。

关于数据库索引及其优化，更多可参见此文：http://www.cnblogs.com/pkuoliver/archive/2011/08/17/mass-data-topic-7-index-and-optimize.html；
关于MySQL索引背后的数据结构及算法原理，这里还有一篇很好的文章：http://www.codinglabs.org/html/theory-of-mysql-index.html；
关于B 树、B+ 树、B* 树及R 树，本blog内有篇绝佳文章：http://blog.csdn.net/v_JULY_v/article/details/6530142。

倒排索引(Inverted index)
　　适用范围：搜索引擎，关键字查询
　　基本原理及要点：为何叫倒排索引？一种索引方法，被用来存储在全文搜索下某个单词在一个文档或者一组文档中的存储位置的映射。
　以英文为例，下面是要被索引的文本：
    T0 = "it is what it is"
    T1 = "what is it"
    T2 = "it is a banana"
我们就能得到下面的反向文件索引：
"a": {2}
    "banana": {2}
    "is": {0, 1, 2}
  "it": {0, 1, 2}
  "what": {0, 1}
　检索的条件"what","is"和"it"将对应集合的交集。

　　正向索引开发出来用来存储每个文档的单词的列表。正向索引的查询往往满足每个文档有序频繁的全文查询和每个单词在校验文档中的验证这样的查询。在正向索引中，文档占据了中心的位置，每个文档指向了一个它所包含的索引项的序列。也就是说文档指向了它包含的那些单词，而反向索引则是单词指向了包含它的文档，很容易看到这个反向的关系。
　　扩展：
　　问题实例：文档检索系统，查询那些文件包含了某单词，比如常见的学术论文的关键字搜索。

关于倒排索引的应用，更多请参见：

第二十三、四章：杨氏矩阵查找，倒排索引关键词Hash不重复编码实践，
第二十六章：基于给定的文档生成倒排索引的编码与实践。

密匙五、外排序

　　适用范围：大数据的排序，去重
　　基本原理及要点：外排序的归并方法，置换选择败者树原理，最优归并树
　　扩展：
　　问题实例：
　　1).有一个1G大小的一个文件，里面每一行是一个词，词的大小不超过16个字节，内存限制大小是1M。返回频数最高的100个词。
　　这个数据具有很明显的特点，词的大小为16个字节，但是内存只有1M做hash明显不够，所以可以用来排序。内存可以当输入缓冲区使用。

关于多路归并算法及外排序的具体应用场景，请参见blog内此文：

第十章、如何给10^7个数据量的磁盘文件排序

密匙六、分布式处理之Mapreduce

MapReduce是一种计算模型，简单的说就是将大批量的工作（数据）分解（MAP）执行，然后再将结果合并成最终结果（REDUCE）。这样做的好处是可以在任务被分解后，可以通过大量机器进行并行计算，减少整个操作的时间。但如果你要我再通俗点介绍，那么，说白了，Mapreduce的原理就是一个归并排序。

适用范围：数据量大，但是数据种类小可以放入内存
　　基本原理及要点：将数据交给不同的机器去处理，数据划分，结果归约。
　　扩展：
　　问题实例：

The canonical example application of MapReduce is a process to count the appearances of each different word in a set of documents:
海量数据分布在100台电脑中，想个办法高效统计出这批数据的TOP10。
一共有N个机器，每个机器上有N个数。每个机器最多存O(N)个数并对它们操作。如何找到N^2个数的中数(median)？

更多具体阐述请参见blog内：

从Hadhoop框架与MapReduce模式中谈海量数据处理，
及MapReduce技术的初步了解与学习。

其它模式/方法论，结合操作系统知识

至此，六种处理海量数据问题的模式/方法已经阐述完毕。据观察，这方面的面试题无外乎以上一种或其变形，然题目为何取为是：秒杀99%的海量数据处理面试题，而不是100%呢。OK，给读者看最后一道题，如下：

非常大的文件，装不进内存。每行一个int类型数据，现在要你随机取100个数。

我们发现上述这道题，无论是以上任何一种模式/方法都不好做，那有什么好的别的方法呢？我们可以看看：操作系统内存分页系统设计(说白了，就是映射+建索引)。

Windows 2000使用基于分页机制的虚拟内存。每个进程有4GB的虚拟地址空间。基于分页机制，这4GB地址空间的一些部分被映射了物理内存，一些部分映射硬盘上的交换文件，一些部分什么也没有映射。程序中使用的都是4GB地址空间中的虚拟地址。而访问物理内存，需要使用物理地址。关于什么是物理地址和虚拟地址，请看：

物理地址 (physical address): 放在寻址总线上的地址。放在寻址总线上，如果是读，电路根据这个地址每位的值就将相应地址的物理内存中的数据放到数据总线中传输。如果是写，电路根据这个地址每位的值就将相应地址的物理内存中放入数据总线上的内容。物理内存是以字节(8位)为单位编址的。
虚拟地址 (virtual address): 4G虚拟地址空间中的地址，程序中使用的都是虚拟地址。使用了分页机制之后，4G的地址空间被分成了固定大小的页，每一页或者被映射到物理内存，或者被映射到硬盘上的交换文件中，或者没有映射任何东西。对于一般程序来说，4G的地址空间，只有一小部分映射了物理内存，大片大片的部分是没有映射任何东西。物理内存也被分页，来映射地址空间。对于32bit的 Win2k，页的大小是4K字节。CPU用来把虚拟地址转换成物理地址的信息存放在叫做页目录和页表的结构里。

物理内存分页，一个物理页的大小为4K字节，第0个物理页从物理地址 0x00000000 处开始。由于页的大小为4KB，就是0x1000字节，所以第1页从物理地址 0x00001000 处开始。第2页从物理地址 0x00002000 处开始。可以看到由于页的大小是4KB，所以只需要32bit的地址中高20bit来寻址物理页。

返回上面我们的题目：非常大的文件，装不进内存。每行一个int类型数据，现在要你随机取100个数。针对此题，我们可以借鉴上述操作系统中内存分页的设计方法，做出如下解决方案：

操作系统中的方法，先生成4G的地址表，在把这个表划分为小的4M的小文件做个索引，二级索引。30位前十位表示第几个4M文件，后20位表示在这个4M文件的第几个，等等，基于key value来设计存储，用key来建索引。

但如果现在只有10000个数，然后怎么去随机从这一万个数里面随机取100个数？请读者思考。更多海里数据处理面试题，请参见此文第一部分：http://blog.csdn.net/v_july_v/article/details/6685962。

参考文献

十道海量数据处理面试题与十个方法大总结；
海量数据处理面试题集锦与Bit-map详解；
十一、从头到尾彻底解析Hash表算法；
海量数据处理之Bloom Filter详解；
从Trie树（字典树）谈到后缀树；
第三章续、Top K算法问题的实现；
第十章、如何给10^7个数据量的磁盘文件排序；
从B树、B+树、B*树谈到R 树；
第二十三、四章：杨氏矩阵查找，倒排索引关键词Hash不重复编码实践；
第二十六章：基于给定的文档生成倒排索引的编码与实践；
从Hadhoop框架与MapReduce模式中谈海量数据处理；
第十六~第二十章：全排列，跳台阶，奇偶排序，第一个只出现一次等问题；
http://blog.csdn.net/v_JULY_v/article/category/774945；
STL源码剖析第五章，侯捷著；
2012百度实习生招聘笔试题：http://blog.csdn.net/hackbuteer1/article/details/7542774。

后记

经过上面这么多海量数据处理面试题的轰炸，我们依然可以看出这类问题是有一定的解决方案/模式的，所以，不必将其神化。然这类面试题所包含的问题还是比较简单的，若您在这方面有更多实践经验，欢迎随时来信与我不吝分享： zhoulei0907@yahoo.cn。当然，自会注明分享者及来源。

不过，相信你也早就意识到，若单纯论海量数据处理面试题，本blog内的有关海量数据处理面试题的文章已涵盖了你能在网上所找到的7 0~80%。但有点，必须负责任的敬告大家：无论是这些海量数据处理面试题也好，还是算法也好，面试时， 70~80%的人不是倒在这两方面，而是倒在基础之上( 诸如语言，数据库，操作系统，网络协议等等)，所以，无论任何时候，基础最重要，没了基础，便什么都不是。如果你问我什么叫做掌握了基础，很简单，我可以举个例子，如到这里： http://forum.csdn.net/BList/Cpp/，如果你几乎能解决那里的全部问题，那么你的 c/c++基础便够了。

最后，推荐国外一面试题网站： http://www.careercup.com/，以及个人正在读的 Redis/MongoDB绝佳站点： http://blog.nosqlfan.com/。

OK，本文若有任何问题，欢迎随时不吝留言，评论，赐教，谢谢。完。

你可能感兴趣的:([置顶] 教你如何迅速秒杀掉：99%的海量数据处理面试题)

Python实现MySQL数据库对象的血缘分析 weixin_30777913 数据库 python mysql 开发语言
Python控制台的程序，实现遍历MySQL中所有的SQL对象（表、视图、用户定义函数、存储过程和触发器等），并取得它们之间之前的依赖性关系，并列出三张表，第一张表的第一列是所有的SQL对象名称，第二列是它的数据的生成路径，路径中的相邻SQL对象之间用“->”隔开，如果有多条路径，就存储多条记录，第二张表是根据依赖性生成所有表的列表，依懒性从上到下依次递增，第三张表是根据依赖性生成所有第二张表中表
C++编程学习笔记：函数相关特性、引用与编译流程共享家9527 C++c++
目录一、函数的缺省参数（一）全缺省参数（二）半缺省参数二、函数重载（一）参数类型不同（二）参数个数不同（三）参数类型顺序不同三、引用相关问题（一）引用的基本概念与初始化（二）引用在函数中的应用-以Swap函数为例1.普通变量交换（值传递方式存在问题）2.使用指针引用实现交换3.使用普通引用实现交换（更简洁常用）四、C++编译流程（一）预处理（二）编译（三）汇编（四）链接在深入学习C++编程的过程中
[推荐了解]各类游戏引擎入门选择说明 CodeCaptain Cocos Creator 经验分享游戏
开发一款属于自己的游戏其实是很多人的梦想，但市面上如此多的引擎如何选择却是很多人入门前的难题。因此，简单做了关于Godot、CocosCreator、Unity以及其他几类游戏引擎的学习曲线、未来发展趋势等信息的总结，以供参考。1.Godot•学习曲线：•初学者友好：Godot的学习曲线较为平缓，适合初学者和中级开发者。它使用GDScript作为主要的脚本语言，与Python语法相似，易于上手。•
《ZooKeeper Zab协议深度剖析：构建高可用分布式系统的基石》猿享天开人工智能数学基础专讲 java 开发语言
《ZooKeeperZab协议深度剖析：构建高可用分布式系统的基石》一、分布式协调的挑战与ZooKeeper的解决方案1.1分布式系统一致性难题
【SpringBoot苍穹外卖】debugDay03.5 m0_72696598 spring boot 后端 java
1、AOP面向切面编程1.@Target(ElementType.METHOD)作用：指定自定义注解可以应用的目标范围。参数：ElementType是一个枚举类，定义了注解可以应用的目标类型。ElementType.METHOD表示该注解只能用于方法上。其他常见的ElementType值：TYPE：类、接口、枚举等。FIELD：字段（包括枚举常量）。PARAMETER：方法参数。CONSTRUCT
Android笔记【17】返回数据的两种方法 m0_72696598 Android开发 android 笔记
目录一、问题二、具体分析1、代码2、区别1.目的和使用场景resultLauncherstartActivity2.数据传递方式3.返回结果的管理4.代码示例对比使用resultLauncher启动活动并处理返回结果：使用startActivity启动活动（不处理返回）：总结3、使用startActivity启动活动，也可以返回信息。因为有putExtra区别总结示例对比1.使用startActi
Match-Case，Python中if-elif-else的最大竞争对手橙色小博 python的学习之旅 python 数据库开发语言
目录1.前言2.if-elif-else？switch-case？match-case！3.MatchCase基础语法4.MatchCase模式匹配的高级特性4.1字面量模式：精确匹配特定值4.2变量模式：捕获值并赋值给变量4.3序列模式：匹配序列中的元素4.4映射模式：匹配字典中的键值对4.5类模式：匹配对象的属性5.MatchCase的实际应用5.1简化命令（两个例子）1）处理用户输入2）处理
【lesson10】高并发内存池细节优化 (unstoppable) 项目高并发内存池高并发内存池 C++多线程细节优化
文章目录大于256KB的大块内存申请问题大于256KB的大块释放申请问题使用定长内存池脱离使用new释放对象时优化为不传对象大小完整版代码Common.hObjectPool.hThreadCache.hThreadCache.cppConcurrentAlloc.hCentralCache.hCentralCache.cppPageCache.hPageCache.cpp大于256KB的大块内存
从零开始学AI——2 人工智能
前言比我想得要难得多……主要是数理统计基本都忘光了……写的也比较乱，希望大家能斧正我的问题。第二章当我们训练出一个模型之后，我们自然希望它能够在新的数据上也有良好的表现，这个能力被称为泛化，我们把模型在新数据上的误差称为泛化误差。泛化误差小的模型自然是我们更喜欢的模型，他也说明了模型的泛化能力强，本章主要介绍了用什么标准来评估模型的泛化误差如何可靠的计算评估能力值并进行比较2.1评估标准：性能度量
突破数据迁移瓶颈！AWS Snowball如何让PB级数据“瞬间”上云？ AWS官方合作商 aws 云计算
“一次100TB数据迁移耗时30天，网络成本超预算5倍…”这是某生物基因公司的真实困境。当企业数字化转型进入深水区，海量数据迁移成为上云的第一道拦路虎。AWSSnowball以「物理设备」重新定义数据传输，如何用“反直觉”方案破解行业难题？本文将深度解析其技术逻辑与落地场景。一、为什么传统方案无法破解海量数据困局？1.1算一笔数据经济账公式：传输时间（天）=数据量（TB）/（带宽（Mbps）×0.
Linux压缩指令在地球表面艰难爬行 linux 服务器
Linux系统提供了多种压缩指令，用于将文件和目录打包成压缩文件，以节省存储空间和方便传输。以下是一些常用的Linux压缩指令及其详细介绍：1.gzipgzip是最常用的压缩工具之一，它通常用于压缩单个文件。压缩后的文件名会以.gz结尾。基本用法:gzipfilename这将压缩filename并生成filename.gz，原文件被删除。解压缩:gunzipfilename.gz这将解压缩file
开发环境详解：那么多教搭建环境的文章视频，你有没有想过编程为什么要搭建环境？搭建环境一套操作下来究竟干了什么？北子ALF Python pytorch tensorflow python c语言 c++青少年编程开发语言
1.初识"环境"概念1.狭义理解：一个环境就是一个解释器或编译器搭建环境这件事，可能大部分人开始学python时才会注意到，而之前学C或C++的时候不太理会这回事，这是由于python语言的新颖性和特殊性，使得“环境”似乎更被强调了，具体我们后面细说。大部分学校计算机专业会从C开始，为的就是能对编程概念如编译、解释、调试、IDE这些基本概念以及程序从人写代码到机器执行的过程有个大体的认识，便于后面
如何学习并使用C++ 北子ALF C/C++学习
首先可以给出一个论断：C++的语法和各种组件的原理及使用可以说是所有编程语言里面比较难的那么如何掌握所有东西，比如网络编程，文件读写，STL。不要对语法记各种笔记，比如vector容器有什么什么方法什么什么属性，如果你看了某篇博客或者看了某本书然后就把上面的所有东西自己劈里啪啦达到笔记里，这是没有任何用的，因为你打完仍然啥都不会。所以allyouneedisC/C++参考文档.chm,去网上找这个
大模型Agent发展的五重境界、Agent四要素大模型面试人工智能自然语言处理 agi 大模型 ai Agent
一、Agent发展的五重境界第一阶段：工具型agent框架(Tool-basedAgentFrameworks)工具型agent框架是在ChatGPT横空出世后同时期出现的，当时LLM刚刚展现出强大的文本生成能力，但其应用仍局限于纯文本环境，promptengineering初步发展。为了实现语言模型与外部工具的基础连接机制，开发者们采用了预定义工具集、简单决策树、基本记忆管理实现了有限的自主性，
大模型 | 三大智能体平台Dify、Coze、FastGPT对比分析大模型面试人工智能 AI大模型语言模型 LLM ai Dify Agent
AI智能体技术发展太快，各种搭建和使用智能体的平台也是层出不穷。有很多平台都配备了一大堆实用的工具和框架，让每个人都可以轻轻松松地打造出厉害的智能体。今天给大家介绍3个最主流的智能体平台：一、DifyDify是一个开源的大语言模型应用开发平台，支持GPT、Mistral、Llama3等数百种模型。平台提供声明式开发环境（通过YAML定义应用）、模块化设计、LLMOps功能（监控和优化应用性能）以及
AWS EC2 容量块使用指南：预留高性能GPU实例的完整攻略 ivwdcwso 运维与云原生 aws 云计算 ec2 GPU
AWSEC2容量块（CapacityBlocks）是一项专为需要临时访问大规模GPU计算资源的客户设计的服务。它允许用户预先预留特定数量的高性能GPU实例，确保在需要时能够获得所需的计算能力。本文将详细介绍EC2容量块的使用方法、最佳实践和注意事项。什么是EC2容量块？EC2容量块是AWS提供的一种预留特定类型GPU实例的机制，允许用户在未来1天到182天的时间范围内预留计算资源。这项服务特别适合
编译原理课设工作日志北子ALF 编译原理笔记
在过去的四天里，我弄清楚了flex和bison的用法，知道了他们如何协作并联合编译，做到了不关注c代码只看.l和.y就能知道生成程序做了什么同时掌握了makefile的编写和使用现在是2025/3/29Sat12:19我们需要搞定目标代码生成32位MIPS汇编固定长度指令：每条指令都用固定的32位长度，每条指令都是四个字节，所以内存数据的访问必须以32位严格对齐寻址方式支持基址寻址、立即数寻址、寄
Token是做什么用的？海姐软件测试软件测试面试通关秘籍 http 网络协议 https 网络测试工具
Token的核心用途解析Token（令牌）是网络通信中用于身份验证和授权的凭证，其核心目的是在客户端与服务端之间安全传递用户身份信息，确保请求的合法性。以下是Token的核心功能及典型应用场景：1.身份验证（Authentication）作用：验证用户是谁。流程：用户登录成功后，服务端生成Token（如JWT）并返回给客户端。客户端后续请求携带Token（通常放在HTTPHeader的Author
Vue 3 自定义指令：实现自动滚动效果朝阳581 vue.js 前端 javascript
Vue3自定义指令：实现自动滚动效果的深度解析在前端开发中，尤其是在使用Vue3框架构建用户界面时，自定义指令为我们提供了一种强大且灵活的方式来扩展HTML元素的行为。今天，我们将深入探讨一个实用的Vue3自定义指令——v-auto-scroll，它能够实现文本内容在固定宽度容器中的自动滚动效果，特别适用于展示较长的文本内容而空间有限的场景。指令功能概述v-auto-scroll指令的主要功能是监
利用 @eslint/eslintrc 实现 ESLint9的适配朝阳581 vue.js javascript 前端
深度解析：利用@eslint/eslintrc实现ESLint的高效配置管理在前端开发领域，代码质量和一致性是至关重要的。ESLint作为一款流行的代码检查工具，帮助开发者发现代码中的潜在问题并保持代码风格的一致性。而随着项目的复杂度增加和团队规模的扩大，如何高效地管理和定制ESLint配置成为了一个关键问题。今天，我们将深入探讨如何利用@eslint/eslintrc插件结合实际的ESLint配
Tauri 2.0.0-rc 安装全局快捷方式插件朝阳581 rust javascript
Tauri2.0.0-rc安装全局快捷方式插件Tauri2.0.0-rc引入了全局快捷方式插件允许你在你的应用中注册全局快捷方式，并在用户按下这些快捷方式时触发JavaScript回调。首先，你需要在你的Rust项目中安装全局快捷方式插件。在Cargo.toml文件中添加依赖。tauri-plugin-global-shortcut={git="https://github.com/tauri-a
更新PowerShell后无法使用conda：usage: conda-script.py [-h] [-v] [--no-plugins] [-V] COMMAND ... weixin_53136387 conda
我更新后遇到的问题如图。附解决方法：1、首先确定环境变量与powershell都配置完毕2、编辑powershell的配置文件：notepad$PROFILE3、将下列代码放到上述文件结尾，注意将conda.exe的文件路径换为自己的安装路径Write-Host"Running4th:CurrentUserCurrentHost"-ForegroundColorMagentaWrite-Host"
beats耳机红白交替闪烁三次_beats耳机红白灯交替闪如何解决龐先生 beats耳机红白交替闪烁三次
大家好，我是时间财富网智能客服时间君，上述问题将由我为大家进行解答。以BeatsStudio3Wireless为例，其beats耳机红白灯交替闪的解决方法是：1、首先要确认是否用的原机充电线，或者手机充电线也是可以的，但一定要是原装的。其次不能用移动电源充电，因为耳机伏数太小，移动电源不会放电出来的。2、如果用的是原装充电线，又是用的电脑或者手机的充电插头还是充不进去电，那代表有短路现象，如果在质
beats耳机红白交替闪烁三次_beats耳机红白灯交替闪怎么解决凶猪下山 beats耳机红白交替闪烁三次
大家好，我是时间财富网智能客服时间君，上述问题将由我为大家进行解答。beats耳机红白灯交替闪的解决方法是：1、首先要确认是否用的原机充电线，或者手机充电线也是可以的，但一定要是原装的。其次不能用移动电源充电，因为耳机伏数太小，移动电源不会放电出来的。2、如果用的是原装充电线，又是用的电脑或者手机的充电插头还是充不进去电，那代表有短路现象，如果在质保期内，建议找商家维修或调换。beats耳机是Be
QML输入控件：Dial联动、音频均衡器的实现 (3) Quz Qt6 QML 开发进阶之旅 qt
目录示例1：带数显的Dial代码说明适用场景运行效果示例2：多组Dial控件联动代码说明运行效果示例3：音频均衡器界面代码说明运行效果完整工程下载在上篇中介绍了Dial控件与鼠标事件的应用，本文主要介绍Dial与其它控件的联动，以及音频均衡器界面的实现。相关阅读：QML输入控件:Dial基本用法与样式定制（1）-CSDN博客QML输入控件:Dial与事件(2)-CSDN博客最终展示效果:示例1：带
Redmi Buds 5 pro连接Win11卡顿问题解决办法 qq_45836941 笔记本电脑
这耳机连手机没问题，有时候连电脑声音总是断断续续的，重连也没用。在站内看到这位高手发的方法确实有效，@原讠京我扌丁字忄曼我把详细方法发出来方便和我一样的小白看到这个方法，解决问题1.右键开始菜单找到设备管理器2.找到蓝牙3.右击RedmiBuds5pro点击禁用设备，这样就好了
ESLint报错：Could not find config file. kart jim eslint vscode
如果你的ESLint的版本大于8，同时使用.eslinrc.js和.eslintignore作为配置文件，且目前用的是VSCODE，就有可能遇到报错：Couldnotfindconfigfile.这个是因为VSCode中ESLint插件的配置eslint.useFlatConfig的问题，其默认值是空值导致ESLint默认使用flat的配置方式，在VSCode的配置文件里加上：{"eslint.u
移动WiFi设备品牌推荐与选购指南 MingDong523 服务器运维
在2025年，移动WiFi设备的选择需根据使用场景、网络需求及预算综合考量。以下是结合市场热度和用户口碑的推荐品牌及具体型号：一、主流品牌推荐华为（HUAWEI）优势：技术成熟、稳定性强，支持多设备连接，覆盖4G/5G全网通，适合差旅、家庭备用等场景。热门型号：华为移动路由Pro：支持4G全网通和双频WiFi，插卡即用，适合旅行或临时网络需求，价格约439元12。随行WiFi3：便携设计，4G网络
VS Code中如何扩大控制台输出行？ MingDong523 vscode
在VSCode中扩大控制台（终端或输出面板）的显示区域，可以通过以下几种方式实现：手动调整控制台高度（最直接）操作步骤：将鼠标移动到控制台（终端或输出面板）与代码编辑器的分界线上。当光标变成↕上下箭头时，按住左键向上拖动即可扩大控制台区域。向下拖动则缩小控制台区域。VSCode控制台拖拽示意图快捷键快速切换（推荐）展开/隐藏控制台：Windows/Linux：Ctrl+``（反引号键）macOS：
AirPods 4(主动降噪版本) 和老版的AirPods Pro2对比 MingDong523 ios
一、核心功能对比特性新款AirPods（主动降噪版）AirPodsPro2主动降噪(ANC)基础降噪（环境声抑制约20dB）自适应降噪（环境声抑制达35dB+）通透模式支持（基础版）支持（自适应通透，可动态调节）音质表现改进低音，空间音频支持定制驱动单元+个性化空间音频佩戴设计半入耳式（无耳塞）入耳式（附带硅胶耳塞）续航时间6小时（降噪开启）6小时（降噪开启）芯片H2芯片（推测）H2芯片（支持动态
java观察者模式 3213213333332132 java 设计模式游戏观察者模式
观察者模式——顾名思义，就是一个对象观察另一个对象，当被观察的对象发生变化时，观察者也会跟着变化。在日常中，我们配java环境变量时，设置一个JAVAHOME变量,这就是被观察者，使用了JAVAHOME变量的对象都是观察者，一旦JAVAHOME的路径改动，其他的也会跟着改动。这样的例子很多，我想用小时候玩的老鹰捉小鸡游戏来简单的描绘观察者模式。老鹰会变成观察者，母鸡和小鸡是
TFS RESTful API 模拟上传测试 ronin47
TFS RESTful API 模拟上传测试。　　细节参看这里：https://github.com/alibaba/nginx-tfs/blob/master/TFS_RESTful_API.markdown 模拟POST上传一个图片： curl --data-binary @/opt/tfs.png http
PHP常用设计模式单例, 工厂, 观察者, 责任链, 装饰, 策略,适配,桥接模式 dcj3sjt126com 设计模式 PHP
// 多态, 在JAVA中是这样用的, 其实在PHP当中可以自然消除, 因为参数是动态的, 你传什么过来都可以, 不限制类型, 直接调用类的方法 abstract class Tiger { public abstract function climb(); } class XTiger extends Tiger { public function climb()
hibernate 171815164 Hibernate
main,save Configuration conf =new Configuration().configure(); SessionFactory sf=conf.buildSessionFactory(); Session sess=sf.openSession(); Transaction tx=sess.beginTransaction(); News a=new
Ant实例分析 g21121 ant
下面是一个Ant构建文件的实例，通过这个实例我们可以很清楚的理顺构建一个项目的顺序及依赖关系，从而编写出更加合理的构建文件。下面是build.xml的代码： <?xml version="1
[简单]工作记录_接口返回405原因 53873039oycg 工作
最近调接口时候一直报错，错误信息是: responseCode:405 responseMsg:Method Not Allowed 接口请求方式Post.
关于java.lang.ClassNotFoundException 和 java.lang.NoClassDefFoundError 的区别程序员是怎么炼成的
真正完成类的加载工作是通过调用 defineClass来实现的；而启动类的加载过程是通过调用 loadClass来实现的；就是类加载器分为加载和定义 protected Class<?> findClass(String name) throws ClassNotFoundExcept
JDBC学习笔记-JDBC详细的操作流程 aijuans jdbc
所有的JDBC应用程序都具有下面的基本流程：　　1、加载数据库驱动并建立到数据库的连接。　　2、执行SQL语句。　　3、处理结果。　　4、从数据库断开连接释放资源。下面我们就来仔细看一看每一个步骤：其实按照上面所说每个阶段都可得单独拿出来写成一个独立的类方法文件。共别的应用来调用。 1、加载数据库驱动并建立到数据库的连接： Html代码 St
rome创建rss antonyup_2006 tomcat cms xml struts Opera
引用 1.RSS标准 RSS标准比较混乱，主要有以下3个系列 RSS 0.9x / 2.0 : RSS技术诞生于1999年的网景公司(Netscape)，其发布了一个0.9版本的规范。2001年，RSS技术标准的发展工作被Userland Software公司的戴夫温那(Dave Winer)所接手。陆续发布了0.9x的系列版本。当W3C小组发布RSS 1.0后，Dave W
html表格和表单基础百合不是茶 html 表格表单 meta 锚点
第一次用html来写东西,感觉压力山大,每次看见别人发的都是比较牛逼的再看看自己什么都还不会, html是一种标记语言,其实很简单都是固定的格式 _----------------------------------------表格和表单表格是html的重要组成部分,表格用在body里面的主要用法如下; <table> &
ibatis如何传入完整的sql语句 bijian1013 java sql ibatis
ibatis如何传入完整的sql语句？进一步说，String str ="select * from test_table"，我想把str传入ibatis中执行，是传递整条sql语句。解决办法： <
精通Oracle10编程SQL(14)开发动态SQL bijian1013 oracle 数据库 plsql
/* *开发动态SQL */ --使用EXECUTE IMMEDIATE处理DDL操作 CREATE OR REPLACE PROCEDURE drop_table(table_name varchar2) is sql_statement varchar2(100); begin sql_statement:='DROP TABLE '||table_name;
【Linux命令】Linux工作中常用命令 bit1129 linux命令
不断的总结工作中常用的Linux命令 1.查看端口被哪个进程占用通过这个命令可以得到占用8085端口的进程号，然后通过ps -ef|grep 进程号得到进程的详细信息 netstat -anp | grep 8085 察看进程ID对应的进程占用的端口号 netstat -anp | grep 进程ID &
优秀网站和文档收集白糖_ 网站
集成 Flex, Spring, Hibernate 构建应用程序性能测试工具-JMeter Hmtl5-IOCN网站 Oracle精简版教程网站鸟哥的linux私房菜 Jetty中文文档 50个jquery必备代码片段 swfobject.js检测flash版本号工具
angular.extend boyitech AngularJS angular.extend AngularJS API
angular.extend 复制src对象中的属性去dst对象中. 支持多个src对象. 如果你不想改变一个对象，你可以把dst设为空对象{}: var object = angular.extend({}, object1, object2). 注意: angular.extend不支持递归复制. 使用方法: angular.extend(dst, src); 参数:
java-谷歌面试题-设计方便提取中数的数据结构 bylijinnan java
网上找了一下这道题的解答，但都是提供思路，没有提供具体实现。其中使用大小堆这个思路看似简单，但实现起来要考虑很多。以下分别用排序数组和大小堆来实现。使用大小堆： import java.util.Arrays; public class MedianInHeap { /** * 题目：设计方便提取中数的数据结构 * 设计一个数据结构，其中包含两个函数，1.插
ajaxFileUpload 针对 ie jquery 1.7+不能使用问题修复版本 Chen.H ajaxFileUpload ie6 ie7 ie8 ie9
jQuery.extend({ handleError: function( s, xhr, status, e ) { // If a local callback was specified, fire it if ( s.error ) { s.error.call( s.context || s, xhr, status, e ); }
[机器人制造原则]机器人的电池和存储器必须可以替换 comsci 制造
机器人的身体随时随地可能被外来力量所破坏,但是如果机器人的存储器和电池可以更换,那么这个机器人的思维和记忆力就可以保存下来,即使身体受到伤害,在把存储器取下来安装到一个新的身体上之后,原有的性格和能力都可以继续维持..... 另外,如果一
Oracle Multitable INSERT 的用法 daizj oracle
转载Oracle笔记-Multitable INSERT 的用法 http://blog.chinaunix.net/uid-8504518-id-3310531.html 一、Insert基础用法语法： Insert Into 表名 (字段1,字段2,字段3...） Values (值1,
专访黑客历史学家George Dyson datamachine on
20世纪最具威力的两项发明——核弹和计算机出自同一时代、同一群年青人。可是，与大名鼎鼎的曼哈顿计划（第二次世界大战中美国原子弹研究计划）相比，计算机的起源显得默默无闻。出身计算机世家的历史学家George Dyson在其新书《图灵大教堂》（Turing’s Cathedral）中讲述了阿兰·图灵、约翰·冯·诺依曼等一帮子天才小子创造计算机及预见计算机未来
小学6年级英语单词背诵第一课 dcj3sjt126com english word
always 总是 rice 水稻，米饭 before 在...之前 live 生活，居住 usual 通常的 early 早的 begin 开始 month 月份 year 年 last 最后的 east 东方的 high 高的 far 远的 window 窗户 world 世界 than 比...更
在线IT教育和在线IT高端教育 dcj3sjt126com 教育
codecademy http://www.codecademy.com codeschool https://www.codeschool.com teamtreehouse http://teamtreehouse.com lynda http://www.lynda.com/ Coursera https://www.coursera.
Struts2 xml校验框架所定义的校验文件蕃薯耀 Struts2 xml校验 Struts2 xml校验框架 Struts2校验
>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年7月11日 15:54:59 星期六 http://fa
mac下安装rar和unrar命令 hanqunfeng mac
1.下载：http://www.rarlab.com/download.htm 选择 RAR 5.21 for Mac OS X 2.解压下载后的文件 tar -zxvf rarosx-5.2.1.tar 3.cd rar sudo install -c -o $USER unrar /bin #输入当前用户登录密码 sudo install -c -o $USER rar
三种将list转换为map的方法 jackyrong list
在本文中，介绍三种将list转换为map的方法： 1）传统方法假设有某个类如下 class Movie { private Integer rank; private String description; public Movie(Integer rank, String des
年轻程序员需要学习的5大经验 lampcy 工作 PHP 程序员
在过去的7年半时间里，我带过的软件实习生超过一打，也看到过数以百计的学生和毕业生的档案。我发现很多事情他们都需要学习。或许你会说，我说的不就是某种特定的技术、算法、数学，或者其他特定形式的知识吗？没错，这的确是需要学习的，但却并不是最重要的事情。他们需要学习的最重要的东西是“自我规范”。这些规范就是：尽可能地写出最简洁的代码；如果代码后期会因为改动而变得凌乱不堪就得重构；尽量删除没用的代码，并添加
评“女孩遭野蛮引产致终身不育 60万赔偿款1分未得”医腐深入骨髓 nannan408
先来看南方网的一则报道：再正常不过的结婚、生子，对于29岁的郑畅来说，却是一个永远也无法实现的梦想。从2010年到2015年，从24岁到29岁，一张张新旧不一的诊断书记录了她病情的同时，也清晰地记下了她人生的悲哀。　　粗暴手术让人发寒　　2010年7月，在酒店做服务员的郑畅发现自己怀孕了，可男朋友却联系不上。在没有和家人商量的情况下，她决定堕胎。　　12月5日，
使用jQuery为input输入框绑定回车键事件 VS 为a标签绑定click事件 Everyday都不同 jsp input 回车键绑定 click enter
假设如题所示的事件为同一个，必须先把该js函数抽离出来，该函数定义了监听的处理： function search() { //监听函数略...... } 为input框绑定回车事件，当用户在文本框中输入搜索关键字时，按回车键，即可触发search(): //回车绑定 $(".search").keydown(fun
EXT学习记录 tntxia ext
1. 准备（1）官网：http://www.sencha.com/ 里面有源代码和API文档下载。 EXT的域名已经从www.extjs.com改成了www.sencha.com ，但extjs这个域名会自动转到sencha上。（2）帮助文档：想要查看EXT的官方文档的话，可以去这里h
mybatis3的mapper文件报Referenced file contains errors xingguangsixian mybatis
最近使用mybatis.3.1.0时无意中碰到一个问题： The errors below were detected when validating the file "mybatis-3-mapper.dtd" via the file "account-mapper.xml". In most cases these errors can be d