kudou1994

机器翻译Transformer框架分析笔记 | Attention is all you need

个人笔记使用，可能记得比较乱，是针对大量文章总结而成，方便自己理解和复习

〇、笔记一中对Encoder-Decoder Attention理解有误

此注意力中的输入Q K V
其中K V应该是从编码器得到的输出乘以decoder子层随机初始化的W_K和W_V得到的
Q是上一步self-attention的输出乘以decoder子层随机初始化的W_Q得到的
注意：Decoder端中每个Decoder子层都有两组Q K V对应两组不同的W_Q，W_K，W_V

一、前期分析笔记

二、Transformer整体框架

三、Transformer中的Self-attention

Multi-head attention与Scaled Dot-Product Attention
在Decoder端被称为Masked multi-head attention
Self-attention的字面理解：自注意力机制， Q K V都来自自身，对输入本身做注意力。
在做自注意力处理之前，Q K V会先经过一个Linear层（乘以一个矩阵），线性变换，做维度变换：num_head * (d_q, d_k, d_v)
在做完点积注意力后，输出（多个z）要经过concat串联合并操作变成一个Z，因为Feed Forward一次只接收一个Z。
为什么会产生多个z呢？因为是多头注意力机制，一个头产生一个z，多个头就产生多个z。
多头怎样理解呢？其实就是人多好办事，每个人对同一个问题都有自己不同的看法，大致可能相同，但是具体肯定不同，所以就会有多个z。
而在点积注意力中，Q K V作为输入，首先就要打分，打什么分呢？打的是我们一句话中所有的单词对我们的原始输入向量x1这个单词的关注度，所以让Q与K做点乘，得到一个分值例如96；
为了保持我们的梯度稳定，用得到的分值除以K向量维度的平方根，统一降低这个分值，得到12（起到调节作用，使得内积不至于太大，太大的话 softmax 后梯度很小，就非 0 即 1 了，不够“soft‘’，不利于反向传播的进行。）；
这只是某个其他单词对我们输入的单词x1的关注度的打分，对于所有单词对x1的关注度打分我们做一个softmax归一化，使分值和为1全为正数（防止梯度爆炸）。对于得到的这些新的分值，乘以对应的V（每个词都有对应的Q K V）得到对应的加权向量z（增大对需要关注的词的关注度，减小无关词的关注度）。 将所有词关于单词x1的加权向量z相加，得到单词x1最终的self-attention的输出Z.
以上是一个单词在一头下的情况，实际使用时，输入应该是一句话，得到的输出也是一个矩阵，所以以上过程就要对应一个矩阵的输入输出形式。

multi-head attention是通过h个不同的线性变换对Q，K，V进行投影，最后将不同的attention结果拼接起来（这跟 CNN 中的多个卷积核的思想是一致的）

四、Q K V

这三个才是真正的输入，因为每一个Encoder子层或Decoder子层都有对应的输入和输出，所以他们的输入都是Q K V。
Q K V就是由一个向量（也许是最初的输入向量或者是上一步的输出向量）乘以对应的W转换矩阵得到的。
这个W转换矩阵是随机初始化而来，通过不断的训练而进行调整，一个子层中一头有一组Q K V。
而每一个Q K V都对应一个W矩阵，所以一个子层一头中有三个W矩阵，分别是W_Q, W_K, W_V
Note: 在一般的attention模型中，Q就是decoder的隐层，K就是encoder的隐层，V也是encoder的隐层。所谓的self-attention就是取Q，K，V相同，均为encoder或者decoder的input embedding and positional embedding，更具体为“网络输入是三个相同的向量q, k和v，是word embedding和position embedding相加得到的结果"。（原文这段话其实有点没看懂，QKV相等？？？？？是想说‘Q K V所对应的原输入是同一个’这个意思吗？）

五、self-attention计算过程

六、实际应用中矩阵形式的计算

attention map

矩阵形式的Q*KT，得到一个word2word的attention map，再坐完softmax后横轴和为1
按行做归一化是因为attention的初衷是计算每个Query和所有的Keys之间的相关性
当句子很长时，attention map会非常大，会导致内存爆炸。解决方法：减小batch_size，采用多卡来弥补。或者直接减小句子长度。
在Decoder端中QKT得到一个attention map 但是我们要保证未来的词不影响当前词的预测，所以要对当前预测词之后的词使用mask的方式进行遮盖。一般的 Mask 是将填充部分置零，但 Attention 中的 Mask 是要在 softmax 之前，把填充部分减去一个大整数（这样 softmax 之后就非常接近 0 了）。

softmax后可以再加个dropout，然后再multiply V
合并后的Z，乘以一个随机初始化的W0得到输出Z

七、单词间的关注度

以下展示了输入的一句话中所有单词对单词it的关注度
图1是其中某一个头（颜色越深关注度越高）
图2是其中某两个头
图3是8个头
当头数大于1时，就很难直观的进行理解了。

八、Transformer中的输入

输入包括Encoder端和Decoder端
输入由词向量和位置编码相加得到

九、Positional Embedding

由于Transformer是完全基于Attention的，在训练的过程中单词与单词之间的相对位置信息不能很好地被模型所捕捉到，所以为了让模型知道我们输入的句子中各单词的顺序/位置，并且在后续的训练之中模型可以学习到单词之间相对的特征，我们引入一个已经嵌入好的向量，加一个位置向量。（每个单词对应一个位置向量）
这个位置向量的每个值都在-1与1之间。

Positional Encodiung生成的方法：

1.用不同频率的sin和cos函数直接计算，生成固定的编码
2.训练出一份位置编码参考论文
效果相差无几，所以采用第一种方法。

目的：

我们做位置编码的目的就是要捕捉各个单词的位置信息，告诉模型，这个it单词在原句总处在什么位置，同时还可以告诉模型，it这个单词与animal这个单词或者其他单词之间的相对位置关系。那么随便一种编码其实都能规定出一种固定单词对应关系，我们为什么还要费这么大劲来获取这么复杂的数值关系呢？
因为sin，cos函数可以表示成为某两个向量的线性关系，这样我们就能体现出不同单词之间的相对位置关系了。

摘自柚子皮大佬，这是我找到的关于位置编码解释的最好的一段话。
并且能提高准确率、减弱过拟合。

下图是某20个词的位置编码，每个单词共512维，前256维的值用sin函数获得，后面256维的值用cos函数获得。

十、Encoder与Decoder

图中只显示了一个，实际当中有N个，也就是“多头”，但都共享一个输入
编码器最终的输出转化为K和V（K=V），传给解码器的每一个子层中的Encoder-Decoder Attention，作为Encoder-Decoder Attention的K和V。而Encoder-Decoder Attention之前一步的Masked Multi-head attention的输出转化为Encoder-Decoder Attention中的Q。
所以说Encoder-Decoder Attention不需要初始化Q K V 他的输入Q K V都是前一步的输出和编码端的输出给的。

十一、Encoder子层与Decoder子层

Encoder-Decoder Attention

每一个子层之中都有一个自注意力和全连接前馈神经网络（有些文章中也称它为一种注意力机制）
Decoder端和Encoder大体相同，但是Decoder端中所有decoder子层中都多了一个Encoder-Decoder Attention
Transformer中的注意力机制都是多头的

十二、Add&Normalize

在每一个自注意力层之后都有一个Add&Normalize残差与归一化
残差结构的思想，来源于CNN
方便后面的数据处理，加快收敛，防止梯度消失

在一个Encoder子层中，首先由word voctor+Positional encoding生成输入向量z1，然后经过self-attention层输出得到z1，再由z1和原输入x1相加并归一化得到z1_new，z1_new作为此时的原输入经过Feed Forward再经过Add&Normalize得到最终Decoder#1层的输出，次输出作为Decoder#2的输入，直到Encoder端结束，得到最终的输出。

十三、Feed Forward 与 CNN

fully connected feed-forward network
Position-wise Feed-Forward Networks 事实上它就是窗口大小为 1 的一维卷积
位置全链接前馈网络——MLP变形，输入与输出维度相同
有两层dense，第一层的激活函数是ReLU(或者其更平滑的版本Gaussian Error Linear Unit-gelu)，第二层是一个线性激活函数，整体来说就是做了一个非线性变换，如果multi-head输出表示为Z，则FFN可以表示为：

hidden_size变化为：512->2048->512，hidden_size维度 = dmodel维度
filter_size = dff = 内部层的维度 = 2048

十四、Decoder端的两种注意力

解码端和编码端大体相同，不同之处：

每一个Decoder子层都多了一个多头注意力Encoder-Decoder Attention，因此每一个Decoder子层有两组不同的Q K V与W_Q，W_K，W_V，不需要masking（因为在前一步已经masking过了，并且encoder的输出是可以看到所有词的）
Decoder端中的self-attention是 masked multi-head attention（需要添加mask步骤）在计算Q*KT得到的attention map后，要对当前预测词以后的词进行遮盖（接近0的数字）
上一次decoder的输出变成这次deocder的输入，Self-Attention 的Q K V来自上一次deocder的输出
在第一次进行解码时，没有真正的输入向量，输入向量是句子开始符 < start > 的向量。
Self-Attention：当前翻译和已经翻译的前文之间的关系；Encoder-Decnoder Attention：当前翻译和编码的特征向量之间的关系。

十五、The Final Linear and Softmax Layer

在N个Decoder子层输出之后得到的是浮点向量，需要这一步转化为我们真正的翻译
首先经过Linear全连接层，将decoder的输出映射到一个logits向量上（假设词表有10000个，那么这个logits向量就有10000维），这10000个元素对应的值表示词表中10000个词的可能倾向值，然后利用softmax转化为概率，这10000个概率中，哪个元素对应的概率最大，哪个元素对应原始词表中的那个词就是我们的翻译。

十六、流程动图

Decoder的结束：直到输出一个终止符。

这张图可真是太秀了，一下子就豁然开朗了

十七、Auto recursive decoding 自动递归解码

整个从Encoder到Decoder再到最终的结果整个过程，每一轮翻译出一个单词就要依靠这一轮Encoder的输出和上一轮Decoder的输出，这是一种递归过程。
越到后面Decoder需要的数据越多，计算量增加，但都属于递归方式。

十八、Training

训练过程，我们做一个德语到英语的翻译
假设我们有一个句子，让它走一次这个transformer流程，得到一个翻译后的英文句子。
假设这是我们在训练之前就已经生成好的一个词汇表其中的英语部分的所有单词，“eos”（end of sentence的缩写形式）。

利用我们已有的词汇表，可以将am这个单词用one-hot编码进行表示，我们得到的这个one-hot编码的向量表示什么呢？表示的是标准翻译。我们将德语的一句话经过我们的模型输出一句英文句子，接着我们让模型得到的句子和我们标准翻译的句子的编码进行对比，然后用反向传播算法来略微调整所有模型的权重，生成更接近结果的输出。

由于模型参数是随机初始化的，未训练的模型输出随机值。我们可以对比真实输出，然后利用误差后传调整模型权重，使得输出更接近与真实输出

The Loss Function

接着上面，那我们怎样进行比较呢？怎样比较两个概率分布呢？我们可以简单地用其中一个减去另一个。
还可使用交叉熵和KL散度。
上面的例子是对于单个单词而言，而在实际情况当中，我们是针对的一句话的输出对比，那么我们期望模型输出连续的概率分布满足如下条件：

每一个单词的概率分布向量维度与词汇表中词的个数相同
position#1概率分布在与“i”关联的单元格有最高的概率
position#2概率分布在与“am”关联的单元格有最高的概率
以此类推，第五个输出的分布表示“”关联的单元格有最高的概率
下面这张图表示的是标准翻译对应的概率分布（对应单词都为1，其余都为0）

在一个足够大的数据集上充分训练后，我们希望模型输出的概率分布看起来像这个样子：

注意到每个位置（词）都得到了一点概率，即使它不太可能成为那个时间步的输出——这是softmax的一个很有用的性质，它可以帮助模型训练。

greedy decoding & beam search

因为这个模型一次只产生一个输出，不妨假设这个模型每次只选择概率最高的单词，并把剩下的词抛弃（比如说position#1,0。93是该行中概率的最大值，我们就认为position#1这一步输出的单词是：I），这是其中一种方法（叫greedy decoding贪心解码）。
另一个方法是留住概率最高的两个单词，这个时候上面那张图就不适用了，不过我们假设，第一次输出position#1得到的概率分布依次为：[0.3, 0.02, 0.6, 0.01, 0.05, 0.02]，取概率最高的两个对应的单词为：I 和 a ，那么在预测position#2时跑两次模型：第一次假设 I 为上一轮的输出，第二次假设 a 为上一轮的输出。之后分别得到了position#2的概率分布，我们计算positions #1 和position #2的误差，哪个误差小我们就用哪个。然后就得到了position#1的预测值；不断的重复知道终止符的出现。这个方法被称作集束搜索（beam search）。
上面的例子中，beam_size = 2（因为我们在进行完position#1和position#2后就进行了误差分析，返回了正确的position#1的预测值），top_beams = 2 （每次取概率最高的2个值），这些都是可以调整的超参数。
上面这一段我感觉可能理解有点偏差，英语好的请自行阅读原文：
Now, because the model produces the outputs one at a time, we can assume that the model is selecting the word with the highest probability from that probability distribution and throwing away the rest. That’s one way to do it (called greedy decoding). Another way to do it would be to hold on to, say, the top two words (say, ‘I’ and ‘a’ for example), then in the next step, run the model twice: once assuming the first output position was the word ‘I’, and another time assuming the first output position was the word ‘me’, and whichever version produced less error considering both positions #1 and #2 is kept. We repeat this for positions #2 and #3…etc. This method is called “beam search”, where in our example, beam_size was two (because we compared the results after calculating the beams for positions #1 and #2), and top_beams is also two (since we kept two words). These are both hyperparameters that you can experiment with.

十九、论文其他内容

1. Optimizer：Adam

我们使用Adam优化器，其中β1 = 0.9, β2 = 0.98及ϵ= 10-9。我们根据以下公式在训练过程中改变学习率：

这对应于在第一次训练到步骤为warmup_steps后线性地增加学习速率，然后与步骤数的平方分之一成比例地减少学习率。我们使用warmup_steps = 4000。

2. 正则化

Residual Dropout：
在Add&Normalized之前对每个attention和Feed Forward的输出都进行dropout，并且在Encoder端和Decoder端的输入中，在embeddings 与 positional encodings相加之后也进行dropout
Label Smoothing：
对输入做平滑处理，让编码中的0变成近似0，让1变成近似1.
这让模型不易理解，因为模型学得更加不确定，但提高了准确性和BLEU得分。

3. checkpoints average

通过对不同阶段生成的CKPT进行平均以得到更好的模型（一般不超过20个，实测16个效果不错？）

4. 长度惩罚α

在论文《Google’s Neural Machine Translation System: Bridging the Gap
between Human and Machine Translation》里：
在解码过程中，我们使用beam search来寻找序列y，该序列y在给定的训练模型下最大化得分函数s(Y, X)。我们介绍了基于最大概率的波束搜索算法的两个重要改进：覆盖惩罚和长度归一化。通过长度归一化，我们试图解释这样一个事实，即我们必须比较不同长度的假设。如果没有某种形式的长度归一化，规则的波束搜索将平均偏爱较短的结果而不是较长的结果，因为在每一步都添加了一个负对数概率，从而对于较长的句子产生较低（更多负）的分数。我们首先尝试简单地除以长度来归一化。然后，我们改进了原来的启发式算法，将其除以α，其中α是在一个开发集上优化的。最后，我们根据注意模块设计了一个经验上更好的评分函数，它还包括一个覆盖惩罚，以支持完全覆盖源句的翻译。
在谷歌的这篇论文中通过实验说明α在0.6-0.7的时候是最优值，其实不然，通过在做项目的时候大量的decoder证明，不一定。

二十、Transformer的优缺点

优点：

作者用最小的序列化运算来测量可以被并行化的计算。也就是说对于某个序列x1,x2,…,xn，self-attention可以直接计算xi,xj的点乘结果，而rnn就必须按照顺序从x1计算到xn
这里Path length指的是要计算一个序列长度为n的信息要经过的路径长度。cnn需要增加卷积层数来扩大视野，rnn需要从1到n逐个进行计算，而self-attention只需要一步矩阵计算就可以，Transformer 在结构上优越，任何两个 token 可以无视距离直接互通。所以也可以看出，self-attention可以比rnn更好地解决长时依赖问题。当然如果计算量太大，比如序列长度n>序列维度d这种情况，也可以用窗口限制self-attention的计算数量。
Attention 层的好处是能够一步到位捕捉到全局的联系，因为它直接把序列两两比较（代价是计算量变为 (n2)，当然由于是纯矩阵运算，这个计算量相当也不是很严重）；相比之下，RNN 需要一步步递推才能捕捉到，而 CNN 则需要通过层叠来扩大感受野，这是 Attention 层的明显优势。
另外，从作者在附录中给出的例子可以看出，self-attention模型更可解释，attention结果的分布表明了该模型学习到了一些语法和语义信息
LSTM、GRU 还是最近的 SRU都是递归式进行训练，顺序进行（顺序计算的过程中信息会丢失，尽管LSTM等门机制的结构一定程度上缓解了长期依赖的问题，但是对于特别长期的依赖现象,LSTM依旧无能为力），RNN 的明显缺点之一就是无法并行，因此速度较慢，这是递归的天然缺陷。并且RNN 无法很好地学习到全局的结构信息，因为它本质是一个马尔科夫决策过程，递归公式为y = f(y, x)。CNN 的方案也是可行的，窗口式遍历，不依赖前一步的输出，可并行，比如尺寸为 3 的卷积，公式为y = f(xt-1, xt, xt+1)，而且通过层叠来增大感受野，容易捕捉到一些全局的结构信息。而transformer框架则直接可以捕获全局信息，可并行，公式为y = f(x, x, x)，直接将 xt 与原来的每个词进行比较，最后算出 yt。

缺点：

实践上：有些rnn轻易可以解决的问题transformer没做到，比如复制string，尤其是碰到比训练时的sequence更长的时。
理论上：transformers非computationally universal（图灵完备），这种非RNN式的模型是非图灵完备的，无法单独完成NLP中推理、决策等计算问题（包括使用transformer的bert模型等等）。
粗暴的抛弃RNN和CNN虽然非常炫技，但是它也使模型丧失了捕捉局部特征的能力，RNN + CNN + Transformer的结合可能会带来更好的效果。
无法对位置信息进行很好地建模，这是硬伤。尽管可以引入 Position Embedding，但我认为这只是一个缓解方案，并没有根本解决问题。举个例子，用这种纯 Attention 机制训练一个文本分类模型或者是机器翻译模型，效果应该都还不错，但是用来训练一个序列标注模型（分词、实体识别等），效果就不怎么好了。那为什么在机器翻译任务上好？我觉得原因是机器翻译这个任务并不特别强调语序，因此 Position Embedding 所带来的位置信息已经足够了，此外翻译任务的评测指标 BLEU 也并不特别强调语序。（看过一篇文章有说，加和不加位置编码，在机器翻译之中效果相差不大）

廿一、参考文献

The Illustrated Transformer（神文啊！图文并茂！）
一文读懂「Attention is All You Need」| 附代码实现
Attention Is All You Need（论文网页版）
Attention Is All You Need（论文PDF）
使用Excel和tensorflow实现Transformer（通过简单的例子走了一遍transformer流程）
神经机器翻译之谷歌 transformer 模型
深度学习：transformer模型——柚子皮
BERT大火却不懂Transformer？读这一篇就够了
transformer 各个部分主要内容——hpulfc
论文笔记：Attention is all you need
Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation

情绪觉察日记第37天露露_e800
今天是家庭关系规划师的第二阶最后一天，慧萍老师帮我做了个案，帮我处理了埋在心底好多年的一份恐惧，并给了我深深的力量！这几天出来学习，爸妈过来婆家帮我带小孩，妈妈出于爱帮我收拾东西，并跟我先生和婆婆产生矛盾，妈妈觉得他们没有照顾好我…。今晚回家见到妈妈，我很欣赏她并赞扬她，妈妈说今晚要跟我睡我说好，当我们俩躺在床上准备睡觉的时候，我握着妈妈的手对她说:妈妈这几天辛苦你了，你看你多利害把我们的家收拾得
机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
铭刻于星（四十二）随风至
69夜晚，绍敏同学做完功课后，看了眼房外，没听到动静才敢从书包的夹层里拿出那个心形纸团。折痕压得很深，都有些旧了，想来是已经写好很久了。绍敏同学慢慢地、轻轻地捏开折叠处，待到全部拆开后，又反复抚平纸张，然后仔细地一字字默看。只是开头的三个字是第一次看到，让她心漏跳了几拍。“亲爱的绍敏：从四年级的时候，我就喜欢你了，但是我一直不敢说，怕影响你学习。六年级的时候听说有人跟你表白，你接受了，我很难过，但
UI学习——cell的复用和自定义cell Magnetic_h ui 学习
目录cell的复用手动（非注册）自动（注册）自定义cellcell的复用在iOS开发中，单元格复用是一种提高表格（UITableView）和集合视图（UICollectionView）滚动性能的技术。当一个UITableViewCell或UICollectionViewCell首次需要显示时，如果没有可复用的单元格，则视图会创建一个新的单元格。一旦这个单元格滚动出屏幕，它就不会被销毁。相反，它被添
学点心理知识，呵护孩子健康静候花开_7090
昨天听了华中师范大学教育管理学系副教授张玲老师的《哪里才是学生心理健康的最后庇护所，超越教育与技术的思考》的讲座。今天又重新学习了一遍，收获匪浅。张玲博士也注意到了当今社会上的孩子由于心理问题导致的自残、自杀及伤害他人等恶性事件。她向我们普及了一个重要的命题，她说心理健康的一些基本命题，我们与我们通常的一些教育命题是不同的，她还举了几个例子，让我们明白我们原来以为的健康并非心理学上的健康。比如如果
ArcGIS栅格计算器常见公式（赋值、0和空值的转换、补充栅格空值）研学随笔 arcgis 经验分享
我们在使用ArcGIS时通常经常用到栅格计算器，今天主要给大家介绍我日常中经常用到的几个公式，供大家参考学习。将特定值（-9999）赋值为0，例如-9999.Con("raster"==-9999,0,"raster")2.给空值赋予特定的值（如0）Con(IsNull("raster"),0,"raster")3.将特定的栅格值(如1)赋值为空值，其他保留原值SetNull("raster"==
【一起学Rust | 设计模式】习惯语法——使用借用类型作为参数、格式化拼接字符串、构造函数广龙宇一起学Rust #Rust设计模式 rust 设计模式开发语言
提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档文章目录前言一、使用借用类型作为参数二、格式化拼接字符串三、使用构造函数总结前言Rust不是传统的面向对象编程语言，它的所有特性，使其独一无二。因此，学习特定于Rust的设计模式是必要的。本系列文章为作者学习《Rust设计模式》的学习笔记以及自己的见解。因此，本系列文章的结构也与此书的结构相同（后续可能会调成结构），基本上分为三个部分
回溯 Leetcode 332 重新安排行程 mmaerd Leetcode刷题学习记录 leetcode 算法职场和发展
重新安排行程Leetcode332学习记录自代码随想录给你一份航线列表tickets，其中tickets[i]=[fromi,toi]表示飞机出发和降落的机场地点。请你对该行程进行重新规划排序。所有这些机票都属于一个从JFK（肯尼迪国际机场）出发的先生，所以该行程必须从JFK开始。如果存在多种有效的行程，请你按字典排序返回最小的行程组合。例如，行程[“JFK”,“LGA”]与[“JFK”,“LGB
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
2019-12-22-22:30 涓涓1016
今天是冬至，写下我的日更，是因为这两天的学习真的是能量的满满，让我看到了自己，未来另外一种可能性，也让我看到了这两年这几年的过程中我所接受那些痛苦的来源。一切的根源和痛苦都来自于人生，家庭，而你的原生家庭，你的爸爸和妈妈，是因为你这个灵魂在那一刻选择他们作为你的爸爸和妈妈来的，所以你得接受他，你得接纳他，他就是因为他的存在而给你的学习和成长带来这些痛苦，那其实是你必然要经历的这个过程，当你去接纳的
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
四章-32-点要素的聚合彩云飘过
本文基于腾讯课堂老胡的课《跟我学Openlayers--基础实例详解》做的学习笔记，使用的openlayers5.3.xapi。源码见1032.html，对应的官网示例https://openlayers.org/en/latest/examples/cluster.htmlhttps://openlayers.org/en/latest/examples/earthquake-clusters.
GitHub上克隆项目 bigbig猩猩 github
从GitHub上克隆项目是一个简单且直接的过程，它允许你将远程仓库中的项目复制到你的本地计算机上，以便进行进一步的开发、测试或学习。以下是一个详细的步骤指南，帮助你从GitHub上克隆项目。一、准备工作1.安装Git在克隆GitHub项目之前，你需要在你的计算机上安装Git工具。Git是一个开源的分布式版本控制系统，用于跟踪和管理代码变更。你可以从Git的官方网站（https://git-scm.
HTML网页设计制作大作业（div+css）云南我的家乡旅游景点带文字滚动二挡起步 web前端期末大作业 web设计网页规划与设计 html css javascript dreamweaver 前端
Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作HTML期末大学生网页设计作业HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScript：做与用户的交互行为文章目录前端学习路线
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
node.js学习小猿L node.js node.js 学习 vim
node.js学习实操及笔记温故node.js，node.js学习实操过程及笔记~node.js学习视频node.js官网node.js中文网实操笔记githubcsdn笔记为什么学node.js可以让别人访问我们编写的网页为后续的框架学习打下基础，三大框架vuereactangular离不开node.jsnode.js是什么官网：node.js是一个开源的、跨平台的运行JavaScript的运行
阶段总结反思轻争
马上就要进入10月份了，今天做一下前段时间的总结和反思。前段时间，日更、英语、健身、护肤坚持的比较好。阅读、书法坚持的不好。1.中间被迫停更半个多月，其余时间一直在坚持日更挑战。偶尔也有不想写的时候，就做一下摘抄。因为阅读（输入）没跟上来，所以写作（输出）质量有待进一步加强。2.英语做到了一周至少学习5天，每次不少于30分钟，但是小班课没有跟上更新速度，下一步要争取利用零碎时间补听小班课。3.减肥
ARM驱动学习之基础小知识 JT灬新一 ARM 嵌入式 arm开发学习
ARM驱动学习之基础小知识•sch原理图工程师工作内容–方案–元器件选型–采购（能不能买到，价格）–原理图（涉及到稳定性）•layout画板工程师–layout（封装、布局，布线，log）（涉及到稳定性）–焊接的一部分工作（调试阶段板子的焊接）•驱动工程师–驱动，原理图，layout三部分的交集容易发生矛盾•PCB研发流程介绍–方案，原理图(网表)–layout工程师（gerber文件）–PCB板
ARM驱动学习之5 LEDS驱动 JT灬新一嵌入式 C 底层 arm开发学习单片机
ARM驱动学习之5LEDS驱动知识点：•linuxGPIO申请函数和赋值函数–gpio_request–gpio_set_value•三星平台配置GPIO函数–s3c_gpio_cfgpin•GPIO配置输出模式的宏变量–S3C_GPIO_OUTPUT注意点：DRIVER_NAME和DEVICE_NAME匹配。实现步骤：1.加入需要的头文件：//Linux平台的gpio头文件#include//三
ARM驱动学习之4小结 JT灬新一嵌入式 C++arm开发学习 linux
ARM驱动学习之4小结#include#include#include#include#include#defineDEVICE_NAME"hello_ctl123"MODULE_LICENSE("DualBSD/GPL");MODULE_AUTHOR("TOPEET");staticlonghello_ioctl(structfile*file,unsignedintcmd,unsignedlo
展现思维导图魅力，不断挖掘人生宝藏思维导图讲师Mandy
第13期最强思维导图训练营已经结束一周了，但是我依旧是感觉所有学员还在努力的学习，这些学员中有教师、学生、白领、公务员、宝妈等等，只要你努力，只要你想改变自己，任何行业，任何岗位都可以参与进来，28天足以让你见成效，在这28天中，我们的学员不仅仅是收获了一枚毕业证，最重要的是让自己的思维方式得到升级，今天的你为自己投资，明天的你就会感谢你今天的付出，我们来听一听来自13期最强思维导图训练营优秀学员
2019-3-23晨间日记红红火火小耳朵
今天是什么日子起床：7点40就寝：23点半天气：有太阳，不过一会儿出来一会儿进去特别清爽的凉意，还蛮舒服的心情：小激动要给女朋友过生日啦纪念日：田田女士过生日任务清单昨日完成的任务，最重要的三件事：1.英语一对一2.运动计划3.认真护肤习惯养成：调整状态周目标·完成进度英语七天打卡（5/7）轻课阅读（87/180）音标课（25/30）读书（福尔摩斯一章）学习·信息·阅读#英语课#Cookingte
【华为OD技术面试真题精选 - 非技术题】 -HR面，综合面_华为od hr面一个射手座的程序媛程序员华为od 面试职场和发展
最后的话最近很多小伙伴找我要Linux学习资料，于是我翻箱倒柜，整理了一些优质资源，涵盖视频、电子书、PPT等共享给大家！资料预览给大家整理的视频资料：给大家整理的电子书资料：如果本文对你有帮助，欢迎点赞、收藏、转发给朋友，让我有持续创作的动力！网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。需要这份系统化的资料的朋友，可以点击这里获
教育用心灵温暖心灵
@陈春丽长期学习班冯倩。今天一早就听到说高职合并，取消中专教育的教育信息。感觉是虽然知道，再听还是吓一跳。国家重视职业教育为何还要取消中专技术学校的教育？再听高中就要进行技术教育了，一部分人学习好继续努力学习考大学，一部分人在高中就可以进行职业教育接受职业教育了还要中专技术教育学校干什么呢！a有些职业教育学校转型升级快，不是孩子上完给找工作，而是学校帮孩子创业，我觉得是不错的方向！新闻新你得实时更
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
学习“论语”-第59天春峰轩
12.14子张问政。子曰：“居之无倦，行之以忠。”子张问为政之道。孔子说：“在位尽职不懈怠，执行政令要忠诚。”12.15子曰：“博学于文，约之以礼，亦可以弗畔矣夫！”孔子说：“君子广泛地学习文献，并且用礼节约束自己，也就不会离经叛道了。”12.16子曰：“君子成人之美，不成人之恶。小人反是。”孔子说：“君子成全别人的好事，而不助长别人的坏处。小人则与此相反行事。”知识点:“成人之美，不成人之恶”贯
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
2019-01-19 王小康KK
姓名:王康公司:扬州市方圆建筑工程有限公司2018年3月16日～3月18日上海361期《六项精进》感谢二组学员【日精进打卡第307天】【知～学习】《六项精进》大纲3遍共862遍《大学》通篇3遍共860遍《六项精进》全书40页【经典名句】思想决定行为，行为决定习惯，习惯决定性格，性格决定命运。【行～实践】一、修身：（对自己个人）1、践行六项精进的理念。二、齐家：（对家庭和家人）1、和女朋友视频聊天。
二分查找排序算法周凡杨 java 二分查找排序算法折半
一：概念二分查找又称折半查找（折半搜索/ 二分搜索），优点是比较次数少，查找速度快，平均性能好；其缺点是要求待查表为有序表，且插入删除困难。因此，折半查找方法适用于不经常变动而查找频繁的有序列表。首先，假设表中元素是按升序排列，将表中间位置记录的关键字与查找关键字比较，如果两者相等，则查找成功；否则利用中间位置记录将表分成前、后两个子表，如果中间位置记录的关键字大于查找关键字，则进一步
java中的BigDecimal bijian1013 java BigDecimal
在项目开发过程中出现精度丢失问题，查资料用BigDecimal解决，并发现如下这篇BigDecimal的解决问题的思路和方法很值得学习，特转载。原文地址：http://blog.csdn.net/ugg/article/de
Shell echo命令详解 daizj echo shell
Shell echo命令 Shell 的 echo 指令与 PHP 的 echo 指令类似，都是用于字符串的输出。命令格式： echo string 您可以使用echo实现更复杂的输出格式控制。 1.显示普通字符串: echo "It is a test" 这里的双引号完全可以省略，以下命令与上面实例效果一致： echo Itis a test 2.显示转义
Oracle DBA 简单操作周凡杨 oracle dba sql
--执行次数多的SQL select sql_text,executions from ( select sql_text,executions from v$sqlarea order by executions desc ) where rownum<81; &nb
画图重绘朱辉辉33 游戏
我第一次接触重绘是编写五子棋小游戏的时候，因为游戏里的棋盘是用线绘制的，而这些东西并不在系统自带的重绘里，所以在移动窗体时，棋盘并不会重绘出来。所以我们要重写系统的重绘方法。在重写系统重绘方法时，我们要注意一定要调用父类的重绘方法，即加上super.paint(g)，因为如果不调用父类的重绘方式，重写后会把父类的重绘覆盖掉，而父类的重绘方法是绘制画布，这样就导致我们
线程之初体验西蜀石兰线程
一直觉得多线程是学Java的一个分水岭，懂多线程才算入门。之前看《编程思想》的多线程章节，看的云里雾里，知道线程类有哪几个方法，却依旧不知道线程到底是什么？书上都写线程是进程的模块，共享线程的资源，可是这跟多线程编程有毛线的关系，呜呜。。。线程其实也是用户自定义的任务，不要过多的强调线程的属性，而忽略了线程最基本的属性。你可以在线程类的run()方法中定义自己的任务，就跟正常的Ja
linux集群互相免登陆配置林鹤霄 linux
配置ssh免登陆 1、生成秘钥和公钥 ssh-keygen -t rsa 2、提示让你输入，什么都不输，三次回车之后会在~下面的.ssh文件夹中多出两个文件id_rsa 和 id_rsa.pub 其中id_rsa为秘钥，id_rsa.pub为公钥，使用公钥加密的数据只有私钥才能对这些数据解密 c
mysql : Lock wait timeout exceeded; try restarting transaction aigo mysql
原文：http://www.cnblogs.com/freeliver54/archive/2010/09/30/1839042.html 原因是你使用的InnoDB 表类型的时候, 默认参数:innodb_lock_wait_timeout设置锁等待的时间是50s, 因为有的锁等待超过了这个时间,所以抱错. 你可以把这个时间加长,或者优化存储
Socket编程基本的聊天实现。 alleni123 socket
public class Server { //用来存储所有连接上来的客户 private List<ServerThread> clients; public static void main(String[] args) { Server s = new Server(); s.startServer(9988); } publi
多线程监听器事件模式(一个简单的例子) 百合不是茶线程监听模式
多线程的事件监听器模式监听器时间模式经常与多线程使用,在多线程中如何知道我的线程正在执行那什么内容,可以通过时间监听器模式得到创建多线程的事件监听器模式思路: 1, 创建线程并启动,在创建线程的位置设置一个标记 2,创建队
spring InitializingBean接口 bijian1013 java spring
spring的事务的TransactionTemplate，其源码如下： public class TransactionTemplate extends DefaultTransactionDefinition implements TransactionOperations, InitializingBean{ ... } TransactionTemplate继承了DefaultT
Oracle中询表的权限被授予给了哪些用户 bijian1013 oracle 数据库权限
Oracle查询表将权限赋给了哪些用户的SQL，以备查用。 select t.table_name as "表名", t.grantee as "被授权的属组", t.owner as "对象所在的属组"
【Struts2五】Struts2 参数传值 bit1129 struts2
Struts2中参数传值的3种情况 1.请求参数绑定到Action的实例字段上 2.Action将值传递到转发的视图上 3.Action将值传递到重定向的视图上一、请求参数绑定到Action的实例字段上以及Action将值传递到转发的视图上 Struts可以自动将请求URL中的请求参数或者表单提交的参数绑定到Action定义的实例字段上，绑定的规则使用ognl表达式语言
【Kafka十四】关于auto.offset.reset[Q/A] bit1129 kafka
I got serveral questions about auto.offset.reset. This configuration parameter governs how consumer read the message from Kafka when there is no initial offset in ZooKeeper or
nginx gzip压缩配置 ronin47 nginx gzip 压缩范例
nginx gzip压缩配置更多 0 nginx gzip 配置随着nginx的发展，越来越多的网站使用nginx，因此nginx的优化变得越来越重要，今天我们来看看nginx的gzip压缩到底是怎么压缩的呢？ gzip(GNU-ZIP)是一种压缩技术。经过gzip压缩后页面大小可以变为原来的30%甚至更小，这样，用
java-13.输入一个单向链表，输出该链表中倒数第 k 个节点 bylijinnan java
two cursors. Make the first cursor go K steps first. /* * 第 13 题：题目：输入一个单向链表，输出该链表中倒数第 k 个节点 */ public void displayKthItemsBackWard(ListNode head,int k){ ListNode p1=head,p2=head;
Spring源码学习-JdbcTemplate queryForObject bylijinnan java spring
JdbcTemplate中有两个可能会混淆的queryForObject方法： 1. Object queryForObject(String sql, Object[] args, Class requiredType) 2. Object queryForObject(String sql, Object[] args, RowMapper rowMapper) 第1个方法是只查
[冰川时代]在冰川时代,我们需要什么样的技术? comsci 技术
看美国那边的气候情况....我有个感觉...是不是要进入小冰期了? 那么在小冰期里面...我们的户外活动肯定会出现很多问题...在室内呆着的情况会非常多...怎么在室内呆着而不发闷...怎么用最低的电力保证室内的温度.....这都需要技术手段... &nb
js 获取浏览器型号 cuityang js 浏览器
根据浏览器获取iphone和apk的下载地址 <!DOCTYPE html> <html> <head> <meta charset="utf-8" content="text/html"/> <meta name=
C# socks5详解转 dalan_123 socket C#
http://www.cnblogs.com/zhujiechang/archive/2008/10/21/1316308.html 这里主要讲的是用.NET实现基于Socket5下面的代理协议进行客户端的通讯，Socket4的实现是类似的，注意的事，这里不是讲用C#实现一个代理服务器，因为实现一个代理服务器需要实现很多协议，头大，而且现在市面上有很多现成的代理服务器用，性能又好，
运维 Centos问题汇总 dcj3sjt126com 云主机
一、sh 脚本不执行的原因 sh脚本不执行的原因只有2个 1.权限不够 2.sh脚本里路径没写完整。二、解决You have new mail in /var/spool/mail/root 修改/usr/share/logwatch/default.conf/logwatch.conf配置文件 MailTo = MailFrom 三、查询连接数
Yii防注入攻击笔记 dcj3sjt126com sql WEB安全 yii
网站表单有注入漏洞须对所有用户输入的内容进行个过滤和检查，可以使用正则表达式或者直接输入字符判断，大部分是只允许输入字母和数字的，其它字符度不允许；对于内容复杂表单的内容，应该对html和script的符号进行转义替换：尤其是<,>,',"",&这几个符号这里有个转义对照表： http://blog.csdn.net/xinzhu1990/articl
MongoDB简介[一] eksliang mongodb MongoDB简介
MongoDB简介转载请出自出处：http://eksliang.iteye.com/blog/2173288 1.1易于使用 MongoDB是一个面向文档的数据库，而不是关系型数据库。与关系型数据库相比，面向文档的数据库不再有行的概念，取而代之的是更为灵活的“文档”模型。另外，不
zookeeper windows 入门安装和测试 greemranqq zookeeper 安装分布式
一、序言以下是我对zookeeper 的一些理解： zookeeper 作为一个服务注册信息存储的管理工具，好吧，这样说得很抽象，我们举个“栗子”。栗子1号：假设我是一家KTV的老板，我同时拥有5家KTV，我肯定得时刻监视
Spring之使用事务缘由(2-注解实现) ihuning spring
Spring事务注解实现 1. 依赖包： 1.1 spring包： spring-beans-4.0.0.RELEASE.jar spring-context-4.0.0.
iOS App Launch Option 啸笑天 option
iOS 程序启动时总会调用application:didFinishLaunchingWithOptions:，其中第二个参数launchOptions为NSDictionary类型的对象，里面存储有此程序启动的原因。 launchOptions中的可能键值见UIApplication Class Reference的Launch Options Keys节。 1、若用户直接
jdk与jre的区别（_） macroli java jvm jdk
简单的说JDK是面向开发人员使用的SDK，它提供了Java的开发环境和运行环境。SDK是Software Development Kit 一般指软件开发包，可以包括函数库、编译程序等。 JDK就是Java Development Kit JRE是Java Runtime Enviroment是指Java的运行环境，是面向Java程序的使用者，而不是开发者。如果安装了JDK，会发同你
Updates were rejected because the tip of your current branch is behind qiaolevip 学习永无止境每天进步一点点众观千象 git
$ git push joe prod-2295-1 To [email protected]:joe.le/dr-frontend.git ! [rejected] prod-2295-1 -> prod-2295-1 (non-fast-forward) error: failed to push some refs to '[email protected]
[一起学Hive]之十四-Hive的元数据表结构详解 superlxw1234 hive hive元数据结构
关键字：Hive元数据、Hive元数据表结构之前在 “[一起学Hive]之一–Hive概述，Hive是什么”中介绍过，Hive自己维护了一套元数据，用户通过HQL查询时候，Hive首先需要结合元数据，将HQL翻译成MapReduce去执行。本文介绍一下Hive元数据中重要的一些表结构及用途，以Hive0.13为例。文章最后面，会以一个示例来全面了解一下，
Spring 3.2.14，4.1.7，4.2.RC2发布 wiselyman Spring 3
Spring 3.2.14、4.1.7及4.2.RC2于6月30日发布。其中Spring 3.2.1是一个维护版本(维护周期到2016-12-31截止)，后续会继续根据需求和bug发布维护版本。此时，Spring官方强烈建议升级Spring框架至4.1.7 或者将要发布的4.2 。其中Spring 4.1.7主要包含这些更新内容。