BQW_

【自然语言处理】【向量检索】面向开放域稠密检索的多视角文档表示学习

面向开放域稠密检索的多视角文档表示学习 《Multi-View Document Representation Learning for Open-Domain Dense Retrieval》

论文地址：https://arxiv.org/pdf/2203.08372.pdf

相关博客：
【自然语言处理】【对比学习】SimCSE：基于对比学习的句向量表示
【自然语言处理】BERT-Whitening
【自然语言处理】【Pytorch】从头实现SimCSE
【自然语言处理】【向量检索】面向开发域稠密检索的多视角文档表示学习
【自然语言处理】【向量表示】AugSBERT：改善用于成对句子评分任务的Bi-Encoders的数据增强方法
【自然语言处理】【向量表示】PairSupCon：用于句子表示的成对监督对比学习

一、简介

过去几年里，随着预训练语言模型的进步，稠密检索已经成为开发域文本检索的重要且有效的方法。一个典型的稠密检索通常会采用一个双编码器架构来将query和document编码为单个低维向量，并基于它们的表示来计算相关分数。在线上场景的应用中，所有文档的嵌入向量都是提前预计算的，并且利用近似最近邻 $(\text{ANN})$ 技术有效地提高检索过程。为了增强双编码器的能力，最近的研究仔细设计了复杂的方法来高效训练，包含构建更具有挑战性的难负样本并继续预训练语言模型。

然而，由于单个向量表示的限制，根据理论分析双编码器面临着表示能力的上界。在 $\text{SQuAD}$ 开发集上的真实样本中，作者发现单个向量表示不能很好的匹配多视角的query，如上图所示。一个文档对应不同视角的4个不同的问题，它们中的每个都匹配不同的句子和答案。在传统双编码器中，文档会被表示为单个向量，而它会被各种queries召回，其限制了双编码器的能力。

对于多向量模型，交叉编码器架构通过计算query-document对的深度上下文表示得到更好的表现，但是计算代价昂贵且对于大规模检索的第一阶段并不适合。一些最近的研究尝试中交叉编码器进行借鉴并通过更精细的结构来扩展编码器，其允许query和document嵌入向量间的多向量表示和稠密检索。然而，它们中的大多数包含softmax或者sum操作，其不能被分解为内积的最大值，所有 $\text{ANN}$ 检索不能被直接应用。

基于这些观察，作者提出了Multi-View document Representations learning framework，简称MVR。 $\text{MVR}$ 来源于一个观察：一个文档通常包含若干个语言单元，并且能够回答多个包含独立语义的query。这就像是给定一个特定的文档，不同的提问者会从不同的角度提出不同的问题。因此，作者提出一种简单有效的方法，即通过viewers生成多个视角的表示，通过优化具有退火温度的global-local损失函数来改善表示空间。

先前的工作发现[CLS] token倾向于聚合整个输入的含义，其与作者期望生成多视角嵌入并不一致。所以作者首先修改了双编码器架构，在文档输入中抛弃了[CLS]并添加了多个[Viewer]。最后一层的viewers表示被用于多视角表示。

为了鼓励多个viewers来更好的对齐不同潜在的queries，作者提出了一个具有退火温度的全局-局部损失函数。

二、相关工作

1. 检索器和排序器架构

随着深度语言模型的发展，微调的预训练 $\text{BERT}$ 实现了非常好的re-ranking效果。最初的方式是基于re-ranker的交叉编码器，如下图 $(a)$ 所示。其会将query和document进行拼接后输入至 $\text{BERT}$ ，并输入[CLS]的嵌入向量来生成相关分数。受益于query-document对的深度上下文表示，深度语言模型有助于解决词汇不匹配和语义不匹配问题。然而，基于ranker的交叉编码器需要计算量昂贵的交叉注意力操作，因此其并不适合大规模第一阶段检索，其通常被用于第二阶段的重排序。

对于第一阶段检索，双编码器是目前最常用的架构，因为其能够在近似最近邻 $\text{ANN}$ 的支持下方便有效的使用。如下图 $(b)$ 所示，其将query和document分别输入至独立的编码器来生成单个向量表示，然后通过嵌入向量的相似度来衡量相关分数。由于采用了深度语言模型，基于retriever的双编码器实现了良好的性能。后来的研究通过不同的精心设计来进一步改善性能。

除了典型的双编码器，也存在一些变体利用基于双编码器的稠密交互。如下图 $(c)$ 所示， $\text{ColBERT}$ 采用后交互范式，其会计算所有term向量的点积分数，随后使用max-pooler和sum-pooler来生成相关分数。后来，Gao et al.通过仅对与倒排列表重叠的token进行评分来改善模型。另一个变体是基于注意力机制的聚合器，如下图 $(d)$ 所示。其利用注意力机制来压缩document嵌入向量来与query向量，用于生成最终的相关分数。有一些工作时建立在这个范式上的。具体来说， $\text{Poly-Encoder}$ 设置了 $k$ 个可学习codes来添加至document嵌入中。 $\text{DRPQ}$ 通过在document向量上迭代 $\text{K-means}$ 聚类来生成多个嵌入向量，然后通过注意力机制与query进行交互，从而实现了更好的结果。然而，稠密交互方法并不能直接应用 $\text{ANN}$ ，由于sum-pooler和注意力机制并不能分解为内积上的max操作，并且不能应用快速 $\text{ANN}$ 。所以这些方法通常会近似召回候选集，然后通过re-ranking进行细化，而 $\text{MVR}$ 能够直接应用在第一阶段检索。

另一个相关的方法是 $\text{ME-BERT}$ ，其采用前 $k$ 个文档的token嵌入向量作为文档的表示。然而，仅采用前k个嵌入向量可能会失去文档后面部分的信息，而本文的viewer tokens能够从整个文档中抽取信息。

2. 有效的稠密检索

除了前面专注在架构设计上的工作外，也有一些工作来改善稠密检索的有效性。现有的学习稠密文章检索器的方法能够被划分为两个类别：(1) 用于检索的预训练；(2) 在标注数据上微调预训练语言模型。

在第一个类别中，Lee et al.和Chang et.al提出了不同的预训练任务并证明了在稠密检索上预训练的有效性。最近， $\text{DPR-PAQ}$ 提出了领域匹配预训练，而 $\text{Condenser}$ 使用继续预训练来强制模型生成信息丰富的[CLS]表示。

对于第二类别，近期的工作展示了微调一个有效的稠密检索器的关键是难负样本。 $\text{DPR}$ 采用batch内负样本和 $\text{BM25}$ 难负样本。 $\text{ANCE}$ 提出了在训练过程中构造难负样本。 $\text{RocketQA}$ 展示了交叉编码器能够过滤和挖掘高质量的难负样本。Li et al.和Ren et al.展示了以文章为中心和以query为中心的负样本能够使训练更加鲁棒。值得一提的是，从基于交叉编码器的re-ranker中蒸馏知识至双编码器retriever能够改善双编码器的效果。这些工作的大多数都是建立在双编码器上，并且天然继承了单向量表示的限制，而本文的工作修改双编码器来产生多视角嵌入，并且与这些策略正交。

三、方法

1. 前言

开始时会使用 $\text{BERT}$ 作为backbone网络结构，如上图 $b$ 所示。一个典型的双编码器采用对偶编码架构将query和document映射为单维实质向量。

给定一个 $\text{query}$ q和一个文档集合 $D=\{d_1,\dots,d_j,\dots,d_n\}$ ，稠密检索会利用相同的 $\text{BERT}$ 编码器来获得queries和documents的表示。 $\text{query}$ q和 $\text{document}$ d的相似度分数 $f (q, d)$ 可以使用稠密表示来计算：
$f(q,d)=sim(E_Q(q),E_D(d)) \tag{1}$
其中， $sim(\cdot)$ 评估两个嵌入向量的相似度函数，例如cosine距离或者欧式距离。并且[CLS]表示的内积是被广泛使用的。

传统对比损失函数被广泛应用在训练query和passage编码器。对于给定的 $\text{query}$ q，其会计算与负样本集合 $\{d_1^-,d_2^-,\dots,d_l^-\}$ 中正文档 $d^+$ 的负对数似然
$\mathcal{L}=-\text{log}\frac{e^{f(q,d^+)/\tau}}{e^{f(q,d^+)/\tau}+\sum_l e^{f(q,d_l^-)/\tau}} \tag{2}$
其中， $\tau$ 是超参数，合适的 $\tau$ 有助于更好的优化。

2. 基于多查看器 $\text{(Multi-Viewer)}$ 的架构

首先于单向量表示，典型的双编码器面临一个挑战：一个文档会包含多个语义，并且会被从多个视角的不同潜在queries进行查询。虽然先前的研究合并了稠密交互来允许多重表示并且提高了有效性，他们通常会导致额外的计算和复杂的结构。因此，作者提出了一种简单有效的方法，通过多查看器 $\text{(multiple viewers)}$ 来生成多视角表示。

由于预训练 $\text{BERT}$ 已经广泛应用于下游任务，包括句子级的任务。一些工作发现[CLS]倾向于聚合整个句子的含义。然而，本文的模型倾向于捕获一个文档中更加细粒度的语义单元，因此引入了多查看器 $\text{(multiple viewers)}$ 。作者使用新添加的多查看器tokens [VIE]来替换[CLS]，其是被随机初始化。对于文档输入，在句子开始的位置添加不同的 $[\text{VIE}_i](i=1,2,\dots,n)$ 。为了避免影响原始输入句子的位置编码，设置 $[\text{VIE}_i]$ 的所有位置ids为0，文档句子的tokens仍然是从1开始。然后，利用双编码器来获得queries和documents的表示
$E(q)=\text{Enc}_q([VIE]\circ q\circ [SEP]) \\ E(d)=\text{Enc}_d([VIE_1]\dots[VIE_n]\circ d\circ [SEP]) \tag{3}$
其中， $\circ$ 是拼接操作。[VIE]和[SEP]是 $\text{BERT}$ 中的特殊tokens。 $\text{Enc}_q$ 和 $\text{Enc}_d$ 意味着query和document编码器。使用最后一层隐藏状态作为query和document的嵌入向量。

[VIE]的表示被用于查询 $q$ 和文档 $d$ 的表示，其被表示为 $E_0(q)$ 和 $E_i(d)(i=0,1,\dots,k-1)$ 。由于query通常比document短，且代表一个具体的含义。这里保留了典型的设置来为query生成唯一的嵌入向量。

query $q$ 和document $d$ 的相似度分数 $f (q, d)$ 通过稠密表示来计算。如上图所示，先计算单个query嵌入向量和文档多个视角嵌入向量的Individual Scores，这里采用内积。 $[\text{VIE}_i]$ 对应的分数表示为 $f_i(q,d)(i=0,1,\dots,k-1)$ 。然后采用max-pooler来聚合这些Induividual score为Aggregate Score $f (q, d)$ ，其作为query和document的相似分数：
$\begin{align} f(q,d)&=\mathop{\text{Max}}_i\{f_i(q,d)\} \\ &=\mathop{\text{Max}}_i\{sim(E_0(q),E_i(d))\} \tag{4} \end{align}$

3. 全局-局部损失函数( $\text{Global-Local Loss}$ )

为了鼓励多查看器更好的对齐不同的潜在query，作者引入了Global-Local损失函数来优化多视角架构的训练。其会合并全局对比损失函数和局部一致性损失函数
$\mathcal{L}=\mathcal{L}_{global}+\lambda\mathcal{L}_{local} \tag{5}$
全局对比损失函数来自于传统的双编码器。给定query和一个正向文档 $d^+$ ，以及一系列负样本 $\{d_1^-,d_2^-,\dots,d_l^-\}$ ，其计算如下
$\mathcal{L}_{global}=-\text{log}\frac{e^{f(q,d^+)/\tau}}{e^{f(q,d^+)/\tau}+\sum_l e^{f(q,d_l^-)/\tau}} \tag{6}$
为了改善多视角嵌入空间的一致性，作者在不同查看器间应用局部一致性损失函数，如等式 $(7)$ 。对于一个具体的query，多视角文档表示之一将会与等式 $(4)$ 中的max-score匹配。局部一致性损失函数强制选择的查看器与query更紧密的对齐，并且区别于其他的查看器
$\mathcal{L}_{local}=-\text{log}\frac{e^{f(q,d^+)/\tau}}{\sum_k e^{f_i(q,d^+)/\tau}} \tag{7}$
为了进一步鼓励更多的不同查看器被激活，作者采用了等式 $(8)$ 的退化温度，来逐步调整查看器softmax分布的陡峭性。训练开始阶段具有高temperature，查看器的softmax值倾向于均匀分布，为了使查看器被公平选择并从训练数据中获得梯度的反馈。在训练过程中，temperature逐步减低使得优化更加稳定
$\tau=max\{0.3,exp(-\alpha t)\} \tag{8}$
其中， $\alpha$ 是控制退火速度的超参数， $t$ 表示训练的 $\text{epochs}$ ，每个 $\text{epoch}$ 的temperature更新。为了简化设置，在 $\mathcal{L}_{local}$ 和 $\mathcal{L}_{global}$ 中使用相同的退火稳定，并且实验验证了退火温度主要与多个查看器的 $\mathcal{L}_{local}$ 相关联。

在推断过程中，为文档的所有查看器嵌入向量建立索引，并且模型利用 $\text{ANN}$ 技术直接从建立的索引上进行检索。然而， $\text{Poly-Encoder}$ 和 $\text{DRPQ}$ 采用包含softmax和sum操作的基于注意力的聚合器，以至于快速 $\text{ANN}$ 不能直接被应用。虽然 $\text{DRPQ}$ 提出了近似softmax，其仍然需要先召回候选集合，然后使用复杂的聚合器进行重排序，导致了昂贵的计算和复杂的处理过程。相反， $\text{MVR}$ 不需要后处理就能直接应用在第一阶段检索。尽管索引的规模会随着查看器数量 $k$ 的增长而增长，但是由于 $\text{ANN}$ 技术的有效性，时间复杂度是索引尺寸的次线性。

震惊！ “深度学习”都在学习什么扉间798 深度学习学习人工智能
常见的机器学习分类算法俗话说三个臭皮匠胜过诸葛亮这里面集成学习就是将单一的算法弱弱结合算法融合用投票给特征值加权重AdaBoost集成学习算法通过迭代训练一系列弱分类器，给予分类错误样本更高权重，使得后续弱分类器更关注这些样本，然后将这些弱分类器线性组合成强分类器，提高整体分类性能。（一）投票机制投票是一种直观且常用的算法融合策略。在多分类问题中，假设有多个分类器对同一数据进行分类判断。每个分类器
深度学习 | pytorch + torchvision + python 版本对应及环境安装 zfgfdgbhs 深度学习 python pytorch
目录一、版本对应二、安装命令（pip）1.版本（1）v2.5.1~v2.0.0（2）v1.13.1~v1.11.0（3）v1.10.1~v1.7.02.安装全过程（1）选择版本（2）安装结果参考文章一、版本对应下表来自pytorch的github官方文档：pytorch/vision:Datasets,TransformsandModelsspecifictoComputerVisionpytor
一文讲清楚深度学习和机器学习平凡而伟大. 机器学习人工智能深度学习机器学习人工智能
目录1.定义机器学习（MachineLearning,ML）深度学习（DeepLearning,DL）2.工作原理机器学习深度学习3.应用场景机器学习深度学习4.主要区别5.为什么选择深度学习？6.总结深度学习和机器学习是人工智能（AI）领域中两个密切相关但有所区别的概念。要清楚地解释它们之间的关系，我们可以从定义、工作原理、应用场景以及两者的主要区别等方面进行探讨。1.定义机器学习（Machin
DeepSeek：智能搜索与分析的新纪元 XRC2231 学习
在人工智能浪潮席卷全球的今天，DeepSeek如同一颗璀璨的新星，以其独特的魅力和强大的功能，在AI领域脱颖而出。DeepSeek，这一基于深度学习和数据挖掘技术的智能搜索与分析系统，不仅重新定义了搜索引擎的边界，更以其卓越的性能和广泛的应用场景，为全球用户带来了前所未有的智能体验。本文将从DeepSeek的定义、特点、应用场景、优势等方面进行全面而深入的介绍，带您领略这一新兴技术的独特魅力。一、
哈尔滨工业大学DeepSeek公开课人工智能：大模型原理技术与应用-从GPT到DeepSeek｜附视频下载方法你觉得205 人工智能机器学习大数据 ai 知识图谱 python 运维
导读INTRODUCTION今天继续哈尔滨工业大学车万翔教授带来了一场主题为“DeepSeek技术前沿与应用”的报告。本报告深入探讨了大语言模型在自然语言处理（NLP）领域的核心地位及其发展历程，从基础概念出发，延伸至语言模型在机器翻译、拼音输入法、语音识别等任务中的关键作用。强调了语言模型不仅辅助其他NLP任务，本身也蕴含大量知识，如地理信息、语义理解和推理能力。随着技术的发展，尤其是trans
When Large Language Models Meet Speech: A Survey on Integration Approaches UnknownBody LLM Daily Survey Paper 语言模型人工智能自然语言处理
主要内容研究背景：大语言模型（LLMs）在自然语言处理领域取得显著进展，其与语音的融合具有广泛应用前景，但缺乏相关集成方法的综述。文章将语音与LLMs集成方法分为基于文本、基于潜在表示和基于音频令牌三大类。集成方法基于文本的集成：通过级联集成、LLM重打分和LLM生成式错误纠正等方式，利用文本作为LLMs的输入和输出，处理语音相关任务，但存在信息损失和准确性与多样性平衡的问题。基于潜在表示的集成：
【机器学习】机器学习四大分类藓类少女机器学习机器学习分类人工智能
机器学习的方法主要可以分为四大类，根据学习方式和数据标注情况进行分类：1.监督学习（SupervisedLearning）特点：有标注数据（即训练数据有明确的输入(X)和输出(Y)）。学习目标是找到一个映射(f(X)\approxY)。适用于分类和回归问题。主要算法：分类（Classification）：逻辑回归（LogisticRegression）支持向量机（SVM）朴素贝叶斯（NaïveBa
大模型学习终极指南：从新手到专家的必经之路，全网最详尽解析，你敢挑战吗？大模型入门教程学习人工智能 AI 大模型大模型学习大模型教程 AI大模型
随着人工智能技术的飞速发展，大模型（Large-ScaleModels）已经成为推动自然语言处理（NLP）、计算机视觉（CV）等领域进步的关键因素。本文将为您详细介绍从零开始学习大模型直至成为专家的全过程，包括所需掌握的知识点、学习资源以及实践建议等。无论您是初学者还是有一定基础的专业人士，都能从中获得有价值的指导。一、基础知识准备在开始学习大模型之前，需要先掌握一些基础知识，这些知识将为后续的学
向量数据库技术系列三-Chroma介绍恰恰虎 chromadb 数据库向量
一、前言Chroma是一个开源的AI原生向量数据库，旨在帮助开发者更加便捷地构建大模型应用，将知识、事实和技能等文档整合进大型语言模型（LLM）中。它提供了简单易用的API，支持存储嵌入及其元数据、嵌入文档和查询、搜索嵌入等功能。主要有以下特点:轻量级：Chroma是一个基于向量检索库实现的轻量级向量数据库，不需要复杂的配置和大规模基础设施支持，非常适合小型或中型项目。易用性：提供简单的API，易
Milvus学习整理 louisliao_1981 milvus 学习
Milvus学习整理一、度量类型(metric_type)二、向量字段和适用场景介绍三、索引字段介绍（一）、概述总结（二）、详细说明四、简单代码示例（一）、建立集合和索引示例（二）、搜索示例（三）、参考文档五、数据搜索(一)、基础搜索参数说明(二)、范围搜索1.概述总结2.详细说明(三)、全文搜索(BM25)1.概述2.使用全文搜索步骤(四)、其他搜索一、度量类型(metric_type)相似度量
LLM之向量数据库Chroma milvus FAISS maxmaxma 数据库 milvus faiss
以下是Chroma、Milvus和FAISS的核心区别，从功能定位、架构设计、性能及应用场景等维度进行对比：一、功能定位Chroma轻量级向量数据库：专注于快速构建中小型语义搜索原型，提供简单易用的API，适合快速集成到现有应用中。特点：支持近似最近邻搜索（ANN）、实时性能优化，但对大规模数据处理能力有限。Milvus分布式向量数据库：专为超大规模向量数据设计，支持云原生架构和高可用性，适合企业
大模型Agent 和 RAG 的关系大数据追光猿大模型语言模型人工智能学习方法 transformer
Agent和RAG（Retrieval-AugmentedGeneration）是两种在自然语言处理（NLP）和人工智能领域中广泛使用的技术，它们在功能、目标和实现方式上既有区别又有联系。以下是它们的关系及其协同作用的详细分析。1.Agent和RAG的定义（1）Agent定义：Agent是一种智能体，能够感知环境并采取行动以完成特定任务。在NLP领域，Agent通常指一个基于大语言模型（LLM）的
【Rust日报】 2020-02-17 WASM向量图形 --wasm_svg_graphics 0.3.0 Rust语言中文社区
WASM向量图形--wasm_svg_graphics0.3.0一个用于通过WASM渲染SVG图形的Rust库它提供了快速有效的方法，可以使用WebAssembly与SVG进行交互。它能够：声明形状和样式以用于这些形状使用SVG标签将这些形状渲染到DOM自动检测两个形状是否相同，因此只有一个SVG将添加到DOM中声明已命名的项目/容器，以便以后进行例如隐藏，重新显示和重新放置之类的调整。声明开发团
AI模型技术演进与行业应用图谱智能计算研究中心其他
内容概要当前AI模型技术正经历从基础架构到行业落地的系统性革新。主流深度学习框架如TensorFlow和PyTorch持续优化动态计算图与分布式训练能力，而MXNet凭借高效的异构计算支持在边缘场景崭露头角。与此同时，模型压缩技术通过量化和知识蒸馏将参数量降低60%-80%，联邦学习则通过加密梯度交换实现多机构数据协同训练。在应用层面，医疗诊断模型通过迁移学习在CT影像分类任务中达到98.2%的准
AI大模型训练教程 Small踢倒coffee_氕氘氚 python自学经验分享笔记
1.引言随着人工智能技术的快速发展，大模型（如GPT-3、BERT等）在自然语言处理、计算机视觉等领域取得了显著的成果。训练一个大模型需要大量的计算资源、数据和专业知识。本教程将带你了解如何从零开始训练一个AI大模型。2.准备工作2.1硬件要求GPU：推荐使用NVIDIA的高性能GPU，如A100、V100等。内存：至少64GBRAM。存储：SSD存储，至少1TB。#2.2软件环境操作系统：Lin
使用Jupyter Notebook进行深度学习编程 - 深度学习教程 shandianfk_com ChatGPT AI jupyter 深度学习 ide
大家好，今天我们要聊聊如何使用JupyterNotebook进行深度学习编程。深度学习是人工智能领域中的一项重要技术，通过模仿人脑神经网络的方式进行学习和分析。JupyterNotebook作为一个强大的工具，可以帮助我们轻松地进行深度学习编程，尤其适合初学者和研究人员。本文将带领大家一步步了解如何在JupyterNotebook中开展深度学习项目。一、什么是JupyterNotebook？Jup
深度学习 Deep Learning 第8章深度学习优化 odoo中国 AI编程人工智能深度学习人工智能优化
深度学习第8章深度学习的优化章节概述本章深入探讨了深度学习中的优化技术，旨在解决模型训练过程中面临的各种挑战。优化是深度学习的核心环节，直接关系到模型的训练效率和最终性能。本章首先介绍了优化在深度学习中的特殊性，然后详细讨论了多种优化算法，包括随机梯度下降（SGD）、动量法、Nesterov动量法、AdaGrad、RMSProp和Adam等。此外，还探讨了参数初始化策略、自适应学习率方法以及二阶优
GPT-4o mini TTS：OpenAI 推出轻量级文本转语音模型！情感操控+白菜价冲击配音圈蚝油菜花每日 AI 项目与应用实例开源人工智能
❤️如果你也关注AI的发展现状，且对AI应用开发感兴趣，我会每日分享大模型与AI领域的开源项目和应用，提供运行实例和实用教程，帮助你快速上手AI技术！AI在线答疑->智能检索历史文章和开源项目->丰富的AI工具库->每日更新->尽在微信公众号->搜一搜：蚝油菜花️“声优连夜转行送外卖！OpenAI新模型每分钟语音成本仅9分钱”大家好，我是蚝油菜花。当同行还在用机械音合成器折磨听众时，这个AI怪物已
Dify-Plus：企业级AI管理核弹！开源方案吊打SaaS，额度+密钥+鉴权系统全面集成蚝油菜花每日 AI 项目与应用实例人工智能开源开源人工智能
❤️如果你也关注AI的发展现状，且对AI应用开发感兴趣，我会每日分享大模型与AI领域的开源项目和应用，提供运行实例和实用教程，帮助你快速上手AI技术！AI在线答疑->智能检索历史文章和开源项目->丰富的AI工具库->每日更新->尽在微信公众号->搜一搜：蚝油菜花“CTO集体失眠！这个开源项目让企业AI管理进入上帝模式”大家好，我是蚝油菜花。当同行还在为API调用次数和预算超支扯皮时，这个国产神器已
事务回滚核心技术 KBkongbaiKB java
一、事务回滚的数学本质与核心挑战1.1事务状态机模型操作执行持久化完成系统故障事务回滚ActivePartiallyCommittedCommittedFailedAborted1.2核心技术挑战矩阵问题维度单机事务分布式事务原子性保证存储引擎WAL日志二阶段提交协议隔离性实现MVCC多版本控制全局锁调度机制可见性管理事务ID版本链向量时钟同步回滚触发条件SQL执行异常/死锁网络分区/节点故障二、
景联文科技提供高质量文本标注服务，驱动AI技术发展景联文科技科技人工智能
文本标注是指在原始文本数据上添加标签的过程，这些标签可以用来指示特定的实体、关系、事件等信息，以帮助计算机理解和处理这些数据。文本标注是自然语言处理（NLP）领域的一个重要环节，它通过为文本的不同部分提供具体的含义和上下文信息，增强机器学习和深度学习模型对文本内容的理解能力。标注类型情感分析情感极性：确定文本表达的情感倾向，如正面、负面或中立。强度评估：衡量情感的强烈程度，从轻微到极端不等。命名实
景联文科技：以高质量数据标注推动人工智能领域创新与发展景联文科技科技人工智能数据标注
在当今这个由数据驱动的时代，高质量的数据标注对于推动机器学习、自然语言处理（NLP）、计算机视觉等领域的发展具有不可替代的重要性。数据标注过程涉及对原始数据进行加工，通过标注特定对象的特征来生成能够被机器学习模型识别和使用的编码格式，从而使数据更具有意义和可解读性。数据标注的主要类型包括：图像标注：指在图片中标识出目标物体的位置、形状或类别等信息，如自动驾驶技术中的行人、车辆及交通标志的识别。文本
端到端的NLP框架（Haystack） deepdata_cn NLP 自然语言处理人工智能
Haystack是一个端到端的NLP框架，专门用于构建基于文档的问答系统，是实现RAG的理想选择。它提供了数据预处理、文档存储、检索和生成等一系列组件，支持多种语言模型和检索器。提供可视化界面，方便用户进行配置和调试；支持多模态数据，可处理文本、图像等多种类型的数据；具有可扩展性，可根据需求添加自定义组件。2020年在自然语言处理技术快速发展，对高效、易用且灵活的端到端NLP框架需求日益增长的背景
客服机器人怎么才能精准的回答用户问题？玩人工智能的辣条哥 AI面试机器人客服机器人
环境：客服机器人问题描述：客服机器人怎么才能精准的回答用户问题？解决方案：客服机器人要精准回答用户问题，需综合技术、数据和用户体验等多方面因素。以下是关键策略和步骤：1.精准理解用户意图自然语言处理（NLP）技术分词与实体识别：提取关键词（如“订单号”“退货”）和实体（如时间、地点）。意图分类：通过机器学习模型（如BERT、Transformer）将问题归类（如“售后”“支付”）。上下文理解记录对
深度学习篇---对角矩阵&矩阵的秩&奇异矩阵 Ronin-Lotus 程序代码篇深度学习篇深度学习矩阵人工智能线性代数
文章目录前言一、对角矩阵（DiagonalMatrix）1.1定义1.2特性行列式运算简化1.3应用领域深度学习信号处理量子力学经济学二、矩阵的秩（RankofaMatrix）2.1定义2.2特性满秩降秩影响2.3应用领域深度学习图像压缩推荐系统控制理论三、奇异矩阵（SingularMatrix）3.1定义3.2特性秩不足行列式为零3.3应用领域深度学习正则化损失函数结构工程统计学数值计算四、跨领
DeepSeek、Grok 与 ChatGPT 三巨头：技术架构与应用场景的全方位解析云策量化 Deepseek chatgpt deepseek grok
前言在当今人工智能领域，DeepSeek、Grok和ChatGPT作为语言模型的三巨头，各自凭借独特的技术架构和广泛的应用场景，在自然语言处理领域占据着重要地位。本文将对这三款模型的技术架构和应用场景进行全方位解析，以期为读者提供深入的了解和有价值的参考。一、技术架构（一）DeepSeekDeepSeek是由DeepSeek团队开发的一款大型语言模型，其技术架构基于深度学习中的Transforme
OpenCV 4.2.0与扩展模块安装与应用指南土城三富
本文还有配套的精品资源，点击获取简介：OpenCV4.2.0是一个先进的计算机视觉库，包含了图像处理、计算机视觉和机器学习算法。本压缩包包含OpenCV核心库和扩展模块（opencv_contrib），版本均为4.2.0。该版本引入了性能增强、API优化以及对深度学习框架和硬件加速技术的更新支持。扩展模块提供了额外的实验性算法和功能，有助于研究和开发新算法。指南详细介绍了如何安装和配置这些库，并提
OpenCV ML 模块使用指南 ice_junjun OpenCV opencv 人工智能计算机视觉
一、模块概述OpenCV的ML模块提供了丰富的机器学习算法，可用于解决各种计算机视觉和数据分析问题。本指南将详细介绍该模块中主要的机器学习算法，包括支持向量机（SVM）、K均值聚类（K-Means）和神经网络（ANN），并结合图像分类和聚类分析这两个典型应用场景进行代码实现与解释。二、主要函数及类详解（一）支持向量机（SVM）：cv.ml.SVM_create()功能支持向量机（SVM）是一种强大
介于YOLOv5的裂缝识别系统程序员～小强 YOLO
介于YOLOv5的裂缝识别系统在现代工业中，裂缝监测是的保障设施安全的重要环节。我们公司的新项目——基于YOLOv5的裂缝识别系统，将为您提供高效、精准的解决方案，助力各类工程项目的质量管理。系统优势我们的裂缝识别系统借助YOLOv5进行深度学习，经过精心训练，拥有强大的图像识别能力。只需简单的步骤，您就能将复杂的裂缝检测转化为轻松的操作，让分析变得更加简单、高效。核心功能图片上传与场景选择用户可
自然语言处理（5）—— 中文分词隐私无忧人工智能 #自然语言处理自然语言处理中文分词人工智能
中文分词的基本原理及实现1.什么是词2.基本原理3.发展趋势：多数场景无需显式分词信息处理的目标是使用计算机能够理解和产生自然语言。而自然语言理解和产生的前提是对语言能够做出全面的解析。汉语词汇是语言中能够独立运用的最小的语言单位，是语言中的原子结构。由于中文缺乏类似英文的空格分隔，分词的准确性直接影响后续任务（如机器翻译、情感分析）的效果。因此，对中文进行分词就显得至关重要。中文分词（Chine
对股票分析时要注意哪些主要因素？会飞的奇葩猪股票分析云掌股吧
　　众所周知，对散户投资者来说，股票技术分析是应战股市的核心武器，想学好股票的技术分析一定要知道哪些是重点学习的，其实非常简单，我们只要记住三个要素：成交量、价格趋势、振荡指标。一、成交量　　大盘的成交量状态。成交量大说明市场的获利机会较多，成交量小说明市场的获利机会较少。当沪市的成交量超过150亿时是强市市场状态，运用技术找综合买点较准；
【Scala十八】视图界定与上下文界定 bit1129 scala
Context Bound，上下文界定，是Scala为隐式参数引入的一种语法糖，使得隐式转换的编码更加简洁。隐式参数首先引入一个泛型函数max，用于取a和b的最大值 def max[T](a: T, b: T) = { if (a > b) a else b } 因为T是未知类型，只有运行时才会代入真正的类型，因此调用a >
C语言的分支——Object-C程序设计阅读有感 darkblue086 apple c 框架 cocoa
自从1972年贝尔实验室Dennis Ritchie开发了C语言，C语言已经有了很多版本和实现，从Borland到microsoft还是GNU、Apple都提供了不同时代的多种选择，我们知道C语言是基于Thompson开发的B语言的，Object-C是以SmallTalk-80为基础的。和C++不同的是，Object C并不是C的超集，因为有很多特性与C是不同的。 Object-C程序设计这本书
去除浏览器对表单值的记忆周凡杨 html 记忆 autocomplete form 浏览
&n
java的树形通讯录 g21121 java
最近用到企业通讯录，虽然以前也开发过，但是用的是jsf，拼成的树形，及其笨重和难维护。后来就想到直接生成json格式字符串，页面上也好展现。 // 首先取出每个部门的联系人 for (int i = 0; i < depList.size(); i++) { List<Contacts> list = getContactList(depList.get(i
Nginx安装部署 510888780 nginx linux
Nginx ("engine x") 是一个高性能的 HTTP 和反向代理服务器，也是一个 IMAP/POP3/SMTP 代理服务器。 Nginx 是由 Igor Sysoev 为俄罗斯访问量第二的 Rambler.ru 站点开发的，第一个公开版本0.1.0发布于2004年10月4日。其将源代码以类BSD许可证的形式发布，因它的稳定性、丰富的功能集、示例配置文件和低系统资源
java servelet异步处理请求墙头上一根草ｊａｖａ异步返回ｓｅｒｖｌｅｔ
servlet3.0以后支持异步处理请求，具体是使用AsyncContext ，包装httpservletRequest以及httpservletResponse具有异步的功能， final AsyncContext ac = request.startAsync(request, response); ac.s
我的spring学习笔记8-Spring中Bean的实例化 aijuans Spring 3
在Spring中要实例化一个Bean有几种方法： 1、最常用的（普通方法） <bean id="myBean" class="www.6e6.org.MyBean" /> 使用这样方法，按Spring就会使用Bean的默认构造方法，也就是把没有参数的构造方法来建立Bean实例。（有构造方法的下个文细说） 2、还
为Mysql创建最优的索引 annan211 mysql 索引
索引对于良好的性能非常关键，尤其是当数据规模越来越大的时候，索引的对性能的影响越发重要。索引经常会被误解甚至忽略，而且经常被糟糕的设计。索引优化应该是对查询性能优化最有效的手段了，索引能够轻易将查询性能提高几个数量级，最优的索引会比较好的索引性能要好2个数量级。 1 索引的类型 (1) B-Tree 不出意外，这里提到的索引都是指 B-
日期函数百合不是茶 oracle sql 日期函数查询
ORACLE日期时间函数大全 TO_DATE格式(以时间:2007-11-02 13:45:25为例) Year: yy two digits 两位年显示值:07 yyy three digits 三位年显示值:007
线程优先级 bijian1013 java thread 多线程 java多线程
多线程运行时需要定义线程运行的先后顺序。线程优先级是用数字表示，数字越大线程优先级越高，取值在1到10，默认优先级为5。实例： package com.bijian.study; /** * 因为在代码段当中把线程B的优先级设置高于线程A,所以运行结果先执行线程B的run()方法后再执行线程A的run()方法 * 但在实际中，JAVA的优先级不准，强烈不建议用此方法来控制执
适配器模式和代理模式的区别 bijian1013 java 设计模式
一.简介适配器模式：适配器模式（英语：adapter pattern）有时候也称包装样式或者包装。将一个类的接口转接成用户所期待的。一个适配使得因接口不兼容而不能在一起工作的类工作在一起，做法是将类别自己的接口包裹在一个已存在的类中。 &nbs
【持久化框架MyBatis3三】MyBatis3 SQL映射配置文件 bit1129 Mybatis3
SQL映射配置文件一方面类似于Hibernate的映射配置文件，通过定义实体与关系表的列之间的对应关系。另一方面使用<select>,<insert>,<delete>，<update>元素定义增删改查的SQL语句，这些元素包含三方面内容 1. 要执行的SQL语句 2. SQL语句的入参，比如查询条件 3. SQL语句的返回结果
oracle大数据表复制备份个人经验 bitcarter oracle 大表备份大表数据复制
前提：数据库仓库A（就拿oracle11g为例）中有两个用户user1和user2,现在有user1中有表ldm_table1,且表ldm_table1有数据5千万以上，ldm_table1中的数据是从其他库B（数据源）中抽取过来的，前期业务理解不够或者需求有变，数据有变动需要重新从B中抽取数据到A库表ldm_table1中。
HTTP加速器varnish安装小记 ronin47 http varnish 加速
上午共享的那个varnish安装手册，个人看了下，有点不知所云，好吧~看来还是先安装玩玩！苦逼公司服务器没法连外网，不能用什么wget或yum命令直接下载安装，每每看到别人博客贴出的在线安装代码时，总有一股羡慕嫉妒“恨”冒了出来。。。好吧，既然没法上外网，那只能麻烦点通过下载源码来编译安装了！ Varnish 3.0.4下载地址： http://repo.varnish-cache.org/
java-73-输入一个字符串，输出该字符串中对称的子字符串的最大长度 bylijinnan java
public class LongestSymmtricalLength { /* * Q75题目：输入一个字符串，输出该字符串中对称的子字符串的最大长度。 * 比如输入字符串“google”，由于该字符串里最长的对称子字符串是“goog”，因此输出4。 */ public static void main(String[] args) { Str
学习编程的一点感想 Cb123456 编程感想 Gis
写点感想，总结一些，也顺便激励一些自己.现在就是复习阶段，也做做项目. 本专业是GIS专业，当初觉得本专业太水，靠这个会活不下去的，所以就报了培训班。学习的时候，进入状态很慢，而且当初进去的时候，已经上到Java高级阶段了，所以.....，呵呵，之后有点感觉了，不过，还是不好好写代码，还眼高手低的，有
[能源与安全]美国与中国 comsci 能源
现在有一个局面：地球上的石油只剩下N桶，这些油只够让中国和美国这两个国家中的一个顺利过渡到宇宙时代，但是如果这两个国家为争夺这些石油而发生战争，其结果是两个国家都无法平稳过渡到宇宙时代。。。。而且在战争中，剩下的石油也会被快速消耗在战争中，结果是两败俱伤。。。在这个大
SEMI-JOIN执行计划突然变成HASH JOIN了的原因分析 cwqcwqmax9 oracle
甲说： A B两个表总数据量都很大，在百万以上。 idx1 idx2字段表示是索引字段 A B 两表上都有 col1字段表示普通字段 select xxx from A where A.idx1 between mmm and nnn and exists (select 1 from B where B.idx2 =
SpringMVC-ajax返回值乱码解决方案 dashuaifu Ajax springMVC response 中文乱码
SpringMVC-ajax返回值乱码解决方案一：（自己总结，测试过可行） ajax返回如果含有中文汉字，则使用：（如下例：） @RequestMapping(value="/xxx.do") public @ResponseBody void getPunishReasonB
Linux系统中查看日志的常用命令 dcj3sjt126com OS
因为在日常的工作中，出问题的时候查看日志是每个管理员的习惯，作为初学者，为了以后的需要，我今天将下面这些查看命令共享给各位 cat tail -f 日志文件说明 /var/log/message 系统启动后的信息和错误日志，是Red Hat Linux中最常用的日志之一 /var/log/secure 与安全相关的日志信息 /var/log/maillog 与邮件相关的日志信
[应用结构]应用 dcj3sjt126com PHP yii2
应用主体应用主体是管理 Yii 应用系统整体结构和生命周期的对象。每个Yii应用系统只能包含一个应用主体，应用主体在入口脚本中创建并能通过表达式 \Yii::$app 全局范围内访问。补充: 当我们说"一个应用"，它可能是一个应用主体对象，也可能是一个应用系统，是根据上下文来决定[译：中文为避免歧义，Application翻译为应
assertThat用法 eksliang JUnit assertThat
junit4.0 assertThat用法一般匹配符1、assertThat( testedNumber, allOf( greaterThan(8), lessThan(16) ) ); 注释： allOf匹配符表明如果接下来的所有条件必须都成立测试才通过，相当于“与”（&&） 2、assertThat( testedNumber, anyOf( g
android点滴2 gundumw100 应用服务器 android 网络应用 OS HTC
如何让Drawable绕着中心旋转？ Animation a = new RotateAnimation(0.0f, 360.0f, Animation.RELATIVE_TO_SELF, 0.5f, Animation.RELATIVE_TO_SELF,0.5f); a.setRepeatCount(-1); a.setDuration(1000); 如何控制Andro
超简洁的CSS下拉菜单 ini html Web 工作 html5 css
效果体验：http://hovertree.com/texiao/css/3.htmHTML文件： <!DOCTYPE html> <html xmlns="http://www.w3.org/1999/xhtml"> <head> <title>简洁的HTML+CSS下拉菜单-HoverTree</title>
kafka consumer防止数据丢失 kane_xie kafka offset commit
kafka最初是被LinkedIn设计用来处理log的分布式消息系统，因此它的着眼点不在数据的安全性（log偶尔丢几条无所谓），换句话说kafka并不能完全保证数据不丢失。尽管kafka官网声称能够保证at-least-once，但如果consumer进程数小于partition_num，这个结论不一定成立。考虑这样一个case，partiton_num=2
@Repository、@Service、@Controller 和 @Component mhtbbx DAO spring bean prototype
@Repository、@Service、@Controller 和 @Component 将类标识为Bean Spring 自 2.0 版本开始，陆续引入了一些注解用于简化 Spring 的开发。@Repository注解便属于最先引入的一批，它用于将数据访问层 (DAO 层 ) 的类标识为 Spring Bean。具体只需将该注解标注在 DAO类上即可。同时，为了让 Spring 能够扫描类
java 多线程高并发读写控制误区 qifeifei java thread
先看一下下面的错误代码，对写加了synchronized控制，保证了写的安全，但是问题在哪里呢？ public class testTh7 { private String data; public String read(){ System.out.println(Thread.currentThread().getName() + "read data "
mongodb replica set(副本集)设置步骤 tcrct java mongodb
网上已经有一大堆的设置步骤的了，根据我遇到的问题，整理一下，如下：首先先去下载一个mongodb最新版，目前最新版应该是2.6 cd /usr/local/bin wget http://fastdl.mongodb.org/linux/mongodb-linux-x86_64-2.6.0.tgz tar -zxvf mongodb-linux-x86_64-2.6.0.t
rust学习笔记 wudixiaotie 学习笔记
1.rust里绑定变量是let，默认绑定了的变量是不可更改的，所以如果想让变量可变就要加上mut。 let x = 1; let mut y = 2; 2.match 相当于erlang中的case，但是case的每一项后都是分号，但是rust的match却是逗号。 3.match 的每一项最后都要加逗号，但是最后一项不加也不会报错，所有结尾加逗号的用法都是类似。 4.每个语句结尾都要加分