05hBoolShow

RocketQAv2阅读笔记（#问答系统 #NLP #检索）

#问答系统 #NLP #检索

知乎博客：RocketQAv2 阅读笔记 - 知乎

百度的检索技术厉害的原因：现实中海量的用户历史数据、强大的中文ERNIE预训练模型、各种创新的模型训练策略。其中RocketQA v2便是其一。

先前，自己工作中，也有使用过RocketQA v1模型（策略），并完成相关业务。特此拜读v2论文《RocketQAv2: A Joint Training Method for Dense Passage Retrieval and Passage Re-ranking》--EMNLP2021

1.Background：

在QA检索中，passage retrieval 和passage re-ranking 是QA召回的一个流行的pipeline的两个模块。通常是在dense passage retrieval 后面加一个passage re-ranker 来提升 dense passage retrieval 召回的效果。这两部分性能的共同作用，最终决定了QA检索性能。传统的方法使用迭代优化的思想，即固定其中一个模型来优化另一个模型。然而，研究表明，如果两者的共同优化训练（联合训练），那么将有助于提升系统的整体性能。

2. Motivation：

然而，联合训练的最大难题是如何解决retriever and re-ranker训练方式的不一致的问题。

具体的，retriever 通常通过采用in-batch 负采样来训练，以期望最大限度地提高positive样本的概率，最小限度地减少采样得到的negatives样本的概率。retriever 一般通过在一个list规模的样本中拔高正样本的概率来训练，即listwise的训练方式。

re-ranker 通常以根据单一样本（point）的具体类别（或打分）或者一个正负样本对（pair）的正负对比关系 来训练模型的，即pointwise 或pairwise的训练方式。

为了解决联合训练的问题，于是文章提出了RocketQAv2 这个可以联合训练retriever和 re-ranker的训练策略。RocketQAv2主要由 dynamic listwise distillation和hybrid data augmentation strategy两部分组成。

通过将retriever和re-ranker的训练方式都统一为listwise模式，于是dynamic listwise distillation机制被提出来，从而实现retriever 和the re-ranker的联合训练。

因为listwise训练方式，需要多样化的、高质量、可以更好地代表整个语料库中所有passage分布的训练list样本。于是一个能更有效构建listwise训练数据的数据扩充方法hybrid data augmentation strategy被提了出来。

3. Contributions

首次提出了一种dense passage retriever 和passage re-ranker 的联合训练的方法 RocketQAv2。
我们通过dynamic listwise distillation 和hybrid data augmentation 来支持该joint learning approach。
实验表明，RocketQAv2在MARCO and Natural Questions datasets 上的有效

4. Methodology

4.1预备知识

4.1.1dense passage retrieval（双塔模型）

给定一个query q，retrieval功能是从库中整体的M个文本passage中检索出top k个最相关的passage。retrieval 一般使用 dual-encoder（双塔模型）实现功能。

具体的，分别计算 query 和 passage的embedding EQ（·）和EP（·），以及通过embedding 点积形式计算文本相似性。

Tip: 一般双塔模型训练后，会第一时间推理库中所有passage为embedding存储起来，并为每个文本和embedding建立索引。从而实现一次双塔embedding推理,多次检索召回的目的，以减少时间。

4.1.2 passage re-ranker（单塔模型| cross-encoder）

retrieval 检索完对应的候选passage列表后，一般会使用re-ranker预测列表中passage的正负置信度。通过从候补正例中剔除负例，或增加强负例的方式，调整listwise中样本的label，提高listwise 数据质量。通过使用re-ranker产生的listwise 数据，再次训练更优质的retrieval 。

re-ranker一般基于cross-encoder(CE)。

cross-encoder能够评估query和passage列表相关性分数s(q，p)，测量候选passage p与query q的语义相关性水平。

在re-ranker一般基于cross-encoder (CE)，CE 可以更好地捕获passage和query之间的语义交互。但是相比于 dual-encoder ，CE也需要更多的计算工作量。

re-ranker用[SEP]拼接q和p并输入到CE中，将CE的[CLS]embedding输入一个MLP（多层线性网络）中，最终得到q和p相关性得分Sce(q，p)。

4.1.3 传统训练方式

dense passage retrieval 和passage re-ranking 通常以一种单独训练，或者迭代训练方式进行学习的（即，固定一个，然后优化另一个）

4.2 Dynamic Listwise Distillation

一般基于cross-encoder的re-ranker性能更强大，因此通常是将模型知识从 re-ranker 蒸馏进retriever。也就是，re-ranker是teacher 模型，retriever是student 模型。

但是两者通常独立训练，re-ranker的参数是被冻结的。这也就无法实现共同优化这两部分的目的，这两部分也无法达到彼此相互优化的作用。Dynamic Listwise Distillation便是为联合训练而提出的。

步骤：

关于为何取名为Dynamic Listwise Distillation的原因：

Listwise ：retriever和re-ranker都是用Listwise 方式训练的。

Distillation：联合训练的过程是一个模型蒸馏的过程。

Dynamic ：这个训练的过程中，teacher 和 student是共同进行参数更新优化的，在训练teacher的时候，student通过学习soft label也实现了参数更新。

传统的，训练好teacher后，teacher参数固定后，进而进行student的指导训练。

4.3 Hybrid Data Augmentation

为了执行Dynamic Listwise Distillation，我们需要为每个query生成listwise 训练的passage list。并且，passage list应该是由多样化的、高质量的passage组成，这样才能逼急现实情况中passage库的数据分布。

研究表明，passage list包含hard negatives（极度像正样本的难的负样本）是很重要的。因为weak negatives 很容易被学习到，是不会为这两个模块增加额外收益的。前人有使用randomly sampled hard negatives和denoised hard negatives这两种数据构造策略。

Hybrid Data Augmentation是通过综合randomly sampled hard negatives 和denoised hard negatives这两种方法后，得到的混合的方法。

结合图2，描述Hybrid Data Augmentation的实现步骤：

先拥已经训练好的RocketQAv1 retriever和RocketQAv1 reranker。这两个模型是该作者上一篇论文RocketQAv1中提出的。
接着利用RocketQA retriever从语料库中检索前n个passage。
获取undenoised样本：从n个passage中随机抽取undenoised hard negatives，其中也包括了ground-truth positives（就是人工标注为正例的样本）。
denoised instances的实例获取方法：使用RocketQA reranker来剔除和query相关性打分低的passage。也取出那些和query相关性打分高的预测为positives的denoised positives。

Hybrid Data Augmentation与前人方法相比，其利用了更多的方法（undenoised and denoised）来生成positives和negatives，提高了list样本的多样性。并且重点关注了hard negatives的构建。

4.4 Training Procedure

步骤：

拥有在RocketQA中，已经训练好的retriever和re-ranker。
训练好的retriever和re-ranker初始化RocketQA v2 中retriever and re-ranker。利用 RocketQA 中的retriever and re-ranker 通过Hybrid Data Augmentation生成listwise训练数据。
利用dynamic listwise distillation，联合训练retriever 和re-ranker。
训练结束后，在QA检索的pipeline中，便可结合retriever and re-ranker来进行推理（召回、精排等操作）。

RocketQA这里训练好的retriever和re-ranker，分别为RocketQA中步骤1和步骤2处得到的模型，非全步骤训练的最强模型。也不一定非得RocketQA中的模型，也可以是其他已经训练好的召回模型和精排模型替代。

4.5 RocketQAv2 VS RocketQA

首先，RocketQA也是蒸馏的过程，不过采用的是teacher对样本进行打标签来蒸馏Student（通过产生hard pseudo labeled data）。而v2使用soft labels的蒸馏方式。

其次，RocketQA无法实现两个模块的联合训练，只能固定re-ranker来蒸馏优化retriever。

最后，RocketQA只使用了denoised hard negatives的数据构造方式。而v2的Hybrid Data Augmentation综合了randomly sampled hard negatives 和denoised hard negatives这两种方法。构建了更多样和高质量的训练数据。

5. Experiments

5.1 Main results

关键的参数：构建listwise数据时候，the ratio of the positive to the hard negative is set to 1:127 on MSMARCO and 1:31 on NQ.

Passage retrieval results on MSMARCO and Natural Questions datasets.

我们可以看到RocketQAv2 retriever和PAIR的表现大大优于其他基线。PAIR是与RocketQAv2同时进行的工作，它通过对域外数据的预训练来获得改进。
RocketQAv2在MRR@10和Recall@5的指标上优于PAIR，我们认为 dynamic listwise distillation 使the retriever 能capture the re-ranker ability of passage ranking at top ranks.

Results on Passage Re-ranking

细节：

RocketQAv2 re-ranker 有基于BM25 retriever 和 RocketQA retriever 以及RocketQAv2 retriever 初始化的。

倒数第1,2两行，基于RocketQA的retriever得到的检索passage list 数据，分别使用RocketQA和RocketQAv2的re-ranker进行联合训练，发现RocketQAv2的re-ranker性能领先了0.9个百分点，这也证明了经过联合训练的re-ranker的性能更强。

5.2 Ablation analysis

Dynamic 蒸馏 or Static蒸馏 ?

结论：静态蒸馏效果不及动态蒸馏（表第2行数据）

Listwise or Pointwise for re-ranker?

将re-ranker从listwize转换为pointwise，会导致性能下降。listwize训练方法比pointwise更适用于我们的联合训练架构，因为它可以更好地模拟dynamic listwise distillation中的相关性分布。

The Effect of Hybrid Data Augmentation’s Denoised Instances

去掉训练样本中的去噪样本会导致性能下滑。这表明从不同方式生成的训练数据能更好地代表了整个passage库中所有passage的分布，并提高了性能。

The Number of Hard Negatives

对每个query的强负例个数的增加会带来检索模型与精排模型性能的提升。

6.附--扩展知识

6.1 Cross-Encoder 和 Dual-encoder 的优缺点

时间上：

Dual-encoder（双塔）一般是面向千万级别的检索库，速度更快。

因为可以一次性对库中所有的文本生成embedding并建立索引存储。后面，面对不同query，都无需在进行embedding的推理，节省了大量时间开销。

而Cross-Encoder一般只用到的100或1000级别的数据规模上，因为对于不同的query，Cross-Encoder都得反复的计算passage的embedding。而Dual-encoder 一次inference ，多次使用

Cross-Encoder为何性能更优秀，并常被用于精排模型中？

其实两者都可以对检索样本进行打分，但是Cross-Encoder往往更准确。

查了很多资料，没找到答案。

个人认为，Cross-Encoder通过【SEP】拼接句子对的方式，可能符合BERT等模型的预训练任务NSP有关。NSP加持了模型的性能。

还有就是，同样的数据，训练单一的encoderCross-Encoder的，可能比同时训练两个encoder的双塔模型，更容易。

两者应用的选择上：

当需要对小规模的一组要进行的要评分的句子对时，就可以使用Cross-Encoder。

比如，您有 100 个句子对，您想获得这 100 个句子对的相似度分数。

当需要在向量空间中，对大量的句子embedding以进行快速比较时，都会使用Dual-encoder。例如信息检索/语义搜索或聚类。

Cross-Encoder 比双塔有更高的性能，但是，Cross-Encoder不能很好地扩展到大型数据集。一种流行的做法是，结合两者模型的优点，取长补短。

例如在QA检索/语义搜索中，通常用Dual-encoder当召回模型，用Cross-Encoder当精排模型。

首先，使用Dual-encoder从海量数据的passage库中检索top 100 最相似的句子。然后，使用Cross-Encoder通过计算每个句子对的分数来重新排列这 100 个候选答案。

你可能感兴趣的:(nlp,nlp,自然语言处理,搜索引擎,人工智能)

《量子门与AI神经元：计算世界的奇妙碰撞》程序猿阿伟人工智能量子计算
在当今科技飞速发展的时代，量子计算和人工智能作为前沿领域，正不断颠覆我们对计算和智能的认知。量子门操作和AI中的神经元计算过程，分别作为这两大领域的核心机制，看似处于不同维度，却有着千丝万缕的联系，它们之间的区别与关联，犹如一把钥匙，为我们打开了通往更高级计算与智能世界的大门。量子门操作是量子计算的基础，它利用量子力学的奇妙特性，如叠加和纠缠，对量子比特进行操控。量子比特，作为量子信息的基本单元，
自建智能算力中心 vs 第三方算力租赁：AI企业的算力博弈与最优解
人工智能的爆发式增长正在重塑全球产业格局。从ChatGPT到DeepSeek，从自动驾驶到智能医疗，AI模型的训练和推理需求呈现指数级增长。在这场技术革命中，算力已成为企业竞争的“命脉”。然而，面对动辄数亿元的硬件投入和复杂的运维挑战，AI企业正面临一个关键抉择：自建智能算力中心，还是选择第三方算力租赁？本文将从成本、效率、风险及适用场景等维度展开深度分析，为企业提供决策参考。一、成本对比：重资产
还在为找图发愁？图生生AI以图生图，一键生成专属风格！图生生人工智能 ai AI作画图生生
你是否也遇到过这样的烦恼：想为文章配图，却找不到风格合适的图片？设计海报时，灵感枯竭，不知从何下手？看到喜欢的图片风格，却无法应用到自己的作品中？别担心，图生生AI生图来帮你！只需上传一张图片，AI就能自动生成相似风格的图片，让你轻松拥有专属图库！图生生AI生图是一款基于人工智能技术的图片生成工具，它能够深度学习和理解图片的风格、色彩、构图等元素，并以此为基础生成全新的图片。无论你是设计师、自媒体
AI人工智能深度学习算法：搭建可拓展的深度学习模型架构 AI大模型应用之禅 DeepSeek R1 &AI大模型与大数据 java python javascript kotlin golang 架构人工智能
深度学习、模型架构、可拓展性、神经网络、机器学习1.背景介绍深度学习作为人工智能领域最前沿的技术之一，在图像识别、自然语言处理、语音识别等领域取得了突破性的进展。深度学习模型的成功离不开其强大的学习能力和可拓展性。本文将深入探讨深度学习算法的原理、模型架构设计以及可拓展性的关键要素，并通过代码实例和实际应用场景，帮助读者理解如何搭建可拓展的深度学习模型架构。2.核心概念与联系深度学习的核心概念是人
Lec01-什么是安全？蛋蛋deべ忧桑安全
本文使用人工智能协助翻译，内容仅供参考，可能有错误或遗漏。如果你对内容或超链接有疑问，可以查看原文。参考资料地址：https://github.com/PKUFlyingPig/MIT6.16006.1600课程团队：HenryCorrigan-Gibbs,YaelKalai,BenKettle(TA),NickolaiZeldovich2022年秋季[!warning]免责声明本套笔记为正在进行
聊聊Python都能做些什么 ·零落· Python入门到掌握 python 开发语言
文章目录一、Python简介二、Python都能做些什么1.Web开发2.数据分析和人工智能3.自动化运维和测试4.网络爬虫5.金融科技三、Python开源库都有哪些1.Web开发2.数据分析和科学计算3.机器学习和深度学习4.网络爬虫5.自动化和测试6.其他常用库四、相关链接一、Python简介Python是一种解释型、面向对象、动态数据类型的高级程序设计语言。它最初由GuidovanRossu
NLP高频面试题（四）——BN和LN的区别与联系，为什么attention要用LN Chaos_Wang_ NLP常见面试题自然语言处理人工智能
在深度学习模型中，Normalization是一种极为重要的技巧，BatchNormalization（BN）和LayerNormalization（LN）是其中最为常用的两种方法。然而，二者在实际应用中有着明显的区别与联系，尤其在Transformer的Attention机制中，LN有着独特的优势。一、BN与LN的核心区别与联系1.BatchNormalization(BN)BN的思想源于一个叫
Browser Use开启AI辅助网页操作新时代 CodeJourney. python 人工智能算法数据库
在当今数字化时代，人们的工作和生活与互联网紧密相连。每天，我们都要花费大量时间在各类网站之间穿梭，进行诸如填写表单、查询信息、比价等重复性操作。这些工作不仅耗费精力，还容易因疲劳而出错，严重影响了工作效率。而现有的自动化工具，要么需要掌握专业的编程知识才能使用，要么在功能上存在局限性，让普通技术用户望而却步。不过，随着人工智能技术的飞速发展，一款名为BrowserUse的开源项目应运而生，为我们带
ChatGPT + Vue3：如何打造 AI 智能助手？ Js_x chatgpt 人工智能
引言人工智能（AI）正快速渗透到前端开发领域，越来越多的开发者希望将ChatGPT集成到自己的应用中，为用户提供智能对话、自动回复、辅助决策等功能。本文将介绍如何使用Vue3+OpenAIAPI搭建一个AI智能助手，让你的应用拥有强大的AI交互能力。1.项目准备1.1技术栈选择本项目将使用以下技术：Vue3-现代化的前端框架，响应式强，适合构建交互式应用。Vite-高效的Vue3项目构建工具，提升
用 AI 提高开发效率：自动生成代码、优化 SQL 查询、写测试用例 Js_x 人工智能 sql 测试用例
引言人工智能（AI）正在深刻改变软件开发行业。从代码自动补全到SQL查询优化，再到自动化测试，AI工具已经成为开发者提高生产力的重要助手。本文将介绍ChatGPT、GitHubCopilot、Tabnine等AI编程工具的实际应用，帮助开发者更高效地编写代码、优化数据库查询，并自动生成测试用例。1.AI代码生成：提升开发效率1.1ChatGPT代码生成ChatGPT具备强大的自然语言处理能力，可以
RAG 在多模态数据处理中的应用探索：结合图像与文本生成 hy098543 AIGC
目录引言多模态数据处理的挑战与需求数据异质性与融合难题多样化应用场景的需求RAG在图像与文本生成中的应用架构图像检索与文本生成协同跨模态特征融合与生成关键技术与实现细节图像特征提取与表示文本检索与语义理解跨模态生成模型训练应用案例分析智能设计辅助医疗影像报告生成结论引言随着信息技术的飞速发展，数据呈现出多模态的特性，即包含文本、图像、音频、视频等多种形式。在自然语言处理（NLP）和计算机视觉（CV
理解深度学习1-简介 shangjg3 PyTorch深度学习实战深度学习人工智能
人工智能（AI）旨在打造模仿智能行为的系统。它覆盖了众多方法，涵盖了基于逻辑、搜索和概率推理的技术。机器学习是AI的一个分支，它通过对观测数据进行数学模型拟合来学习决策制定。这个领域近年来迅猛发展，现在几乎（虽不完全准确）与AI同义。深度神经网络是一类机器学习模型，将其应用到数据上的过程称为深度学习。目前，深度网络是最强大和最实用的机器学习模型之一，常见于日常生活中。我们常常用自然语言处理（Nat
人工智能专业毕业设计选题清单：热点课题推荐 HaiLang_IT 人工智能算法 python
目录前言毕设选题开题指导建议更多精选选题选题帮助最后前言大家好,这里是海浪学长毕设专题!大四是整个大学期间最忙碌的时光，一边要忙着准备考研、考公、考教资或者实习为毕业后面临的升学就业做准备,一边要为毕业设计耗费大量精力。学长给大家整理了人工智能专业最新精选选题，如遇选题困难或选题有任何疑问，都可以问学长哦(见文末)!对毕设有任何疑问都可以问学长哦!更多选题指导:最新最全计算机专业毕设选题精选推荐汇
RAG问答系统：检索增强生成框架 ZhangJiQun&MXP 2021 论文教学大模型语言模型
目录RAG（Retrieval-AugmentedGeneration）框架一、RAG框架的定义二、RAG框架的工作原理三、RAG框架的举例说明四、RAG框架的优势RAG问答系统二、工作流程三、优势四、应用场景RAG（Retrieval-AugmentedGeneration）框架即检索增强生成框架，是一种结合了信息检索技术与语言生成模型的人工智能技术。以下是对RAG框架的详细解释及举例说明：一、
【Java】已解决：`java.sql.SQLSyntaxErrorException: SQL` 屿小夏 java sql 开发语言
个人简介：某不知名博主，致力于全栈领域的优质博客分享|用最优质的内容带来最舒适的阅读体验！文末获取免费IT学习资料！文末获取更多信息精彩专栏推荐订阅收藏专栏系列直达链接相关介绍书籍分享点我跳转书籍作为获取知识的重要途径，对于IT从业者来说更是不可或缺的资源。不定期更新IT图书，并在评论区抽取随机粉丝，书籍免费包邮到家AI前沿点我跳转探讨人工智能技术领域的最新发展和创新，涵盖机器学习、深度学习、自然
全网测评：2025年最值得中小企业入局的AI无人直播软件花落谁家？ V_13135861102 人工智能
全网测评：2025年最值得中小企业入局的AI无人直播软件花落谁家？在数字化时代，人工智能技术的快速发展为各行各业带来了深刻的变革。直播电商领域也迎来了前所未有的机遇，AI无人直播软件应运而生，逐步改变着传统电商和直播行业的运营模式。对于预算有限、希望实现高效营销的中小企业而言，选择一款合适的AI无人直播软件显得尤为重要。本文将测评几款热门的AI无人直播软件，帮助中小企业找到最适合自己的入局之选。一
大模型转型之路：必要性与未来前景，迎接智能时代的浪潮_转行大模型大模型入门学习人工智能语言模型 AI 大模型 AI大模型程序员转行
随着人工智能（AI）技术的迅猛发展，特别是大型语言模型（LLM,LargeLanguageModels）的崛起，各行各业正迎来一场前所未有的技术革命。对于普通程序员而言，转行进入大模型领域不仅是对个人职业发展的战略性投资，也是顺应时代潮流、把握未来机遇的重要选择。本文将探讨转行大模型的必然性和该领域的未来发展前景。一、转行大模型的必然性技术普及化与学习资源丰富互联网的发展极大地降低了知识获取的成本
7招教你掌握用DeepSeek辅助论文写作的提示词技巧学境思源AcademicIdeas 学境思源 AI写作 ChatGPT 人工智能
随着人工智能技术的快速发展，大模型（如DeepSeek、ChatGPT等）已经成为论文写作的重要辅助工具。合理运用提示词（Prompt），不仅能极大提高写作效率，还能辅助生成高质量的学术内容。今天的内容将分享如何利用DeepSeek的提示词技巧，助力论文写作。1.明确写作目标，让AI理解你的需求在使用大模型时，清晰的写作目标至关重要。一个好的提示词应当包括：写作主题、内容范围、格式要求、风格倾向等
首款折叠iPhone或定价2300美元；百川智能两位联合创始人被曝离职；Manus启用.cn域名 | 极客头条极客日报 iphone ios
「极客头条」——技术人员的新闻圈！CSDN的读者朋友们好，「极客头条」来啦，快来看今天都有哪些值得我们技术人关注的重要新闻吧。整理|郑丽媛出品|CSDN（ID：CSDNnews）一分钟速览新闻点！华为诺亚方舟实验室主任换帅，90后王云鹤接班姚骏百川智能两位联合创始人被曝离职，均开启AI领域创业蝴蝶效应公司正式备案manus.cn域名传刘强东现身香港科技大学参观人工智能，此前有消息称其重回业务一线A
李开复：AI 2.0 时代的价值 AI大模型应用之禅 DeepSeek R1 &AI大模型与大数据 java python javascript kotlin golang 架构人工智能
人工智能，AI2.0，价值创造，伦理挑战，未来趋势1.背景介绍人工智能（AI）技术近年来发展迅速，从语音识别、图像识别到自然语言处理，AI已经渗透到我们生活的方方面面。李开复，作为一位享誉全球的人工智能专家，在《AI2.0时代的价值》一文中，深刻地探讨了AI2.0时代带来的机遇与挑战，以及AI如何为人类创造价值。AI1.0时代主要集中在规则驱动的系统，例如围棋、象棋等游戏的AI。而AI2.0时代则
李开复：AI 2.0 时代的机遇 AGI大模型与大数据研究院 DeepSeek R1 &大数据AI人工智能 java python javascript kotlin golang 架构人工智能
人工智能，深度学习，Transformer，大模型，通用人工智能，AI2.0，应用场景，未来趋势1.背景介绍人工智能（AI）技术近年来发展迅速，从语音识别、图像识别到自然语言处理等领域取得了突破性进展。其中，深度学习作为人工智能的核心技术之一，推动了AI技术的飞速发展。然而，深度学习模型的训练成本高、数据依赖性强、可解释性差等问题仍然制约着AI技术的进一步发展。李开复先生在《AI2.0时代的机遇》
DeepSeek重构产业生态：餐饮、金融与短视频的智能跃迁放逐者-保持本心，方可放逐其他重构金融
引言：智能时代的产业共振在数字技术浪潮席卷全球的当下，DeepSeek作为人工智能领域的重要参与者，正以其强大的算法能力和多模态交互特性，深度渗透至餐饮、金融、短视频等民生关键领域。从长江之畔的烟火气到陆家嘴的金融脉搏，从市井小店的智能排班到跨国银行的风险定价，从美食博主的AI替身到探店经济的虚实融合，DeepSeek不仅重塑了传统行业的运营逻辑，更在消费升级与技术创新的交汇处，催生出新的商业范式
2025 职业革命：AI 重构就业图谱的生存法则 RPAdaren 人工智能重构
一、技术迭代下的产业剧变2025年的春天，全球科技界正在见证人工智能的第三次浪潮。根据麦肯锡最新发布的《全球就业趋势报告》，大模型技术已渗透至83%的行业领域。以医疗行业为例，IBMWatson的诊断准确率已达98.7%，超越资深医师平均水平；金融领域，摩根大通的AI交易系统每日处理超2000万笔订单，效率提升400%。这些数据背后，是AI技术从单一功能向通用智能的跨越式发展。二、职业版图的重构逻
llama.cpp 和 LLM（大语言模型）这个懒人 llama 语言模型人工智能
llama.cpp和LLM（大语言模型）的介绍，以及两者的关联与区别：1.LLM（LargeLanguageModel，大语言模型）定义：LLM是基于深度学习技术（如Transformer架构）构建的超大参数量的自然语言处理模型。它通过海量文本数据训练，能够生成连贯、语义丰富的文本，完成问答、创作、推理等任务。特点：参数规模大：如GPT-3（1750亿参数）、Llama-65B（650亿参数）等。
AI在项目中的应用酒江人工智能
AI大模型（如GPT-4、BERT、T5等）在各类项目中有广泛的应用，可以极大地提高项目效率、优化流程，并解决许多传统方法难以应对的问题。以下是AI大模型在不同类型项目中的一些具体应用：1.自然语言处理（NLP）文本生成和摘要：AI大模型可以生成高质量的文本内容，自动撰写文章、新闻报道、博客或技术文档，甚至可以进行文献摘要，帮助内容创作者提高效率。情感分析：在客户服务、社交媒体监控或市场研究项目中
智能汽车：驶向未来的革命智能设备
一、引言汽车，作为现代文明的标志，正经历着一场前所未有的变革。人工智能、大数据、云计算等技术的飞速发展，正推动着汽车从单纯的交通工具向智能移动空间转变。智能汽车，作为这场变革的主角，正悄然改变着我们的出行方式和生活方式。二、智能汽车的定义与发展现状智能汽车，是指搭载先进传感器、控制器、执行器等装置，并融合现代通信与网络技术，实现车与X（人、车、路、云端等）智能信息交换、共享，具备复杂环境感知、智能
人工智能与机器学习入门：基尼系数（Gini Index）和基于熵（Entropy）基尼系数基于熵机器学习入门
在决策树应用一文中，在构建决策分类树应用决策算法时，介绍了基尼系数（GiniIndex）和基于熵（Entropy）两种算法。本文通过实例来更加深入的介绍一下这两个算法。仍然以简单的数据为例：id喜欢颜色是否有喉结身高性别1绿否165女2蓝是170男3粉否172女4绿是175男基尼系数分别对喜欢颜色是否有喉结求基尼系数如下：喜欢的颜色id喜欢颜色性别1绿女2蓝男3粉女4绿男对于姓别女分类而言，数据如
云原生架构设计理论与实践（14）系统架构
1.云原生背景业务快速发展与开发、运维、运营之间落后的生产关系与生产力的矛盾企业内部各占山头与企业总体战略规划的矛盾企业内部改革，降本增效的需求企业实现数字孪生，数字资产的必然需求企业外部环境，如人工智能发展、安全合规等大环境的要求2.云原生架构的设计原则服务化原则（拆分为微服务、小服务，非功能特性委托）弹性原则（可伸可缩）可观测原则（基于sla，slo，在log，trace，metric三个维度
MySQL 与 Elasticsearch 联合查询墨瑾轩一起学学数据库【一】mysql elasticsearch adb
关注墨瑾轩，带你探索编程的奥秘！超萌技术攻略，轻松晋级编程高手技术宝库已备好，就等你来挖掘订阅墨瑾轩，智趣学习不孤单即刻启航，编程之旅更有趣嘿，小伙伴们！今天我们要来聊聊MySQL与Elasticsearch如何携手合作，共同完成高效的联合查询和数据检索任务。MySQL是一款非常流行的数据库管理系统，而Elasticsearch则是一款基于Lucene的搜索引擎，擅长全文搜索和实时数据分析。两者结
AI API：快速集成智能化功能的开发利器桂花饼 AIGC AI API 人工智能 AIGC 语言模型 AI作画
AIAPI（ArtificialIntelligenceApplicationProgrammingInterface，人工智能应用程序接口）是应用程序接口的一种，专门用于提供人工智能相关功能的开发接口。它允许开发者利用现有的AI模型、工具或服务，将这些功能集成到自己的应用程序中，并为用户带来智能化的体验。AIAPI的核心功能主要与AI技术相关，比如自然语言处理（NLP）、计算机视觉、语音处理、机
PHP，安卓，UI，java，linux视频教程合集 cocos2d-x小菜 java UI linux PHP android
╔-----------------------------------╗┆
zookeeper admin 笔记 braveCS zookeeper
Required Software 1) JDK>=1.6 2)推荐使用ensemble的ZooKeeper(至少3台)，并run on separate machines 3)在Yahoo!，zk配置在特定的RHEL boxes里，2个cpu，2G内存，80G硬盘数据和日志目录 1)数据目录里的文件是zk节点的持久化备份，包括快照和事务日
Spring配置多个连接池 easterfly spring
项目中需要同时连接多个数据库的时候，如何才能在需要用到哪个数据库就连接哪个数据库呢？ Spring中有关于dataSource的配置： <bean id="dataSource" class="com.mchange.v2.c3p0.ComboPooledDataSource" &nb
Mysql 171815164 mysql
例如，你想myuser使用mypassword从任何主机连接到mysql服务器的话。 GRANT ALL PRIVILEGES ON *.* TO 'myuser'@'%'IDENTIFIED BY 'mypassword' WI TH GRANT OPTION; 如果你想允许用户myuser从ip为192.168.1.6的主机连接到mysql服务器，并使用mypassword作
CommonDAO（公共/基础DAO） g21121 DAO
好久没有更新博客了，最近一段时间工作比较忙，所以请见谅，无论你是爱看呢还是爱看呢还是爱看呢，总之或许对你有些帮助。 DAO(Data Access Object)是一个数据访问（顾名思义就是与数据库打交道）接口，DAO一般在业
直言有讳永夜-极光感悟随笔
1.转载地址:http://blog.csdn.net/jasonblog/article/details/10813313 精华: “直言有讳”是阿里巴巴提倡的一种观念，而我在此之前并没有很深刻的认识。为什么呢？就好比是读书时候做阅读理解，我喜欢我自己的解读，并不喜欢老师给的意思。在这里也是。我自己坚持的原则是互相尊重，我觉得阿里巴巴很多价值观其实是基本的做人
安装CentOS 7 和Win 7后，Win7 引导丢失随便小屋 centos
一般安装双系统的顺序是先装Win7，然后在安装CentOS，这样CentOS可以引导WIN 7启动。但安装CentOS7后，却找不到Win7 的引导，稍微修改一点东西即可。一、首先具有root 的权限。即进入Terminal后输入命令su，然后输入密码即可二、利用vim编辑器打开/boot/grub2/grub.cfg文件进行修改 v
Oracle备份与恢复案例 aijuans oracle
Oracle备份与恢复案例一. 理解什么是数据库恢复当我们使用一个数据库时，总希望数据库的内容是可靠的、正确的，但由于计算机系统的故障（硬件故障、软件故障、网络故障、进程故障和系统故障）影响数据库系统的操作，影响数据库中数据的正确性，甚至破坏数据库，使数据库中全部或部分数据丢失。因此当发生上述故障后，希望能重构这个完整的数据库，该处理称为数据库恢复。恢复过程大致可以分为复原(Restore)与
JavaEE开源快速开发平台G4Studio v5.0发布無為子
我非常高兴地宣布,今天我们最新的JavaEE开源快速开发平台G4Studio_V5.0版本已经正式发布。访问G4Studio网站 http://www.g4it.org 2013-04-06 发布G4Studio_V5.0版本功能新增 (1). 新增了调用Oracle存储过程返回游标，并将游标映射为Java List集合对象的标
Oracle显示根据高考分数模拟录取百合不是茶 PL/SQL编程 oracle例子模拟高考录取学习交流
题目要求: 1,创建student表和result表 2,pl/sql对学生的成绩数据进行处理 3,处理的逻辑是根据每门专业课的最低分线和总分的最低分数线自动的将录取和落选 1,创建student表,和result表学生信息表; create table student( student_id number primary key,--学生id
优秀的领导与差劲的领导 bijian1013 领导管理团队
责任优秀的领导：优秀的领导总是对他所负责的项目担负起责任。如果项目不幸失败了，那么他知道该受责备的人是他自己，并且敢于承认错误。差劲的领导：差劲的领导觉得这不是他的问题，因此他会想方设法证明是他的团队不行，或是将责任归咎于团队中他不喜欢的那几个成员身上。努力工作优秀的领导：团队领导应该是团队成员的榜样。至少，他应该与团队中的其他成员一样努力工作。这仅仅因为他
js函数在浏览器下的兼容 Bill_chen jquery 浏览器 IE DWR ext
做前端开发的工程师，少不了要用FF进行测试，纯js函数在不同浏览器下，名称也可能不同。对于IE6和FF，取得下一结点的函数就不尽相同： IE6：node.nextSibling,对于FF是不能识别的； FF：node.nextElementSibling,对于IE是不能识别的；兼容解决方式：var Div = node.nextSibl
【JVM四】老年代垃圾回收：吞吐量垃圾收集器(Throughput GC) bit1129 垃圾回收
吞吐量与用户线程暂停时间衡量垃圾回收算法优劣的指标有两个：吞吐量越高，则算法越好暂停时间越短，则算法越好首先说明吞吐量和暂停时间的含义。垃圾回收时，JVM会启动几个特定的GC线程来完成垃圾回收的任务，这些GC线程与应用的用户线程产生竞争关系，共同竞争处理器资源以及CPU的执行时间。GC线程不会对用户带来的任何价值，因此，好的GC应该占
J2EE监听器和过滤器基础白糖_ J2EE
Servlet程序由Servlet，Filter和Listener组成，其中监听器用来监听Servlet容器上下文。监听器通常分三类：基于Servlet上下文的ServletContex监听，基于会话的HttpSession监听和基于请求的ServletRequest监听。 ServletContex监听器 ServletContex又叫application
博弈AngularJS讲义(16) - 提供者 boyitech js AngularJS api Angular Provider
Angular框架提供了强大的依赖注入机制，这一切都是有注入器(injector)完成. 注入器会自动实例化服务组件和符合Angular API规则的特殊对象，例如控制器，指令，过滤器动画等。那注入器怎么知道如何去创建这些特殊的对象呢？ Angular提供了5种方式让注入器创建对象，其中最基础的方式就是提供者(provider), 其余四种方式(Value, Fac
java-写一函数f(a,b)，它带有两个字符串参数并返回一串字符，该字符串只包含在两个串中都有的并按照在a中的顺序。 bylijinnan java
public class CommonSubSequence { /** * 题目：写一函数f(a,b)，它带有两个字符串参数并返回一串字符，该字符串只包含在两个串中都有的并按照在a中的顺序。 * 写一个版本算法复杂度O(N^2)和一个O(N) 。 * * O(N^2)：对于a中的每个字符，遍历b中的每个字符，如果相同，则拷贝到新字符串中。 * O(
sqlserver 2000 无法验证产品密钥 Chen.H sql windows SQL Server Microsoft
在 Service Pack 4 (SP 4), 是运行 Microsoft Windows Server 2003、 Microsoft Windows Storage Server 2003 或 Microsoft Windows 2000 服务器上您尝试安装 Microsoft SQL Server 2000 通过卷许可协议 (VLA) 媒体。这样做, 收到以下错误信息CD KEY的 SQ
[新概念武器]气象战争 comsci
气象战争的发动者必须是拥有发射深空航天器能力的国家或者组织.... 原因如下: 地球上的气候变化和大气层中的云层涡旋场有密切的关系,而维持一个在大气层某个层次
oracle 中 rollup、cube、grouping 使用详解 daizj oracle grouping rollup cube
oracle 中 rollup、cube、grouping 使用详解 -- 使用oracle 样例表演示转自namesliu -- 使用oracle 的样列库，演示 rollup, cube, grouping 的用法与使用场景 --- ROLLUP ，为了理解分组的成员数量，我增加了分组的计数 COUNT(SAL)
技术资料汇总分享 Dead_knight 技术资料汇总分享
本人汇总的技术资料，分享出来，希望对大家有用。 http://pan.baidu.com/s/1jGr56uE 资料主要包含： Workflow->工作流相关理论、框架(OSWorkflow、JBPM、Activiti、fireflow...) Security->java安全相关资料(SSL、SSO、SpringSecurity、Shiro、JAAS...) Ser
初一下学期难记忆单词背诵第一课 dcj3sjt126com english word
could 能够 minute 分钟 Tuesday 星期二 February 二月 eighteenth 第十八 listen 听 careful 小心的，仔细的 short 短的 heavy 重的 empty 空的 certainly 当然 carry 携带；搬运 tape 磁带 basket 蓝子 bottle 瓶 juice 汁，果汁 head 头；头部
截取视图的图片, 然后分享出去 dcj3sjt126com OS Objective-C
OS 7 has a new method that allows you to draw a view hierarchy into the current graphics context. This can be used to get an UIImage very fast. I implemented a category method on UIView to get the vi
MySql重置密码 fanxiaolong MySql重置密码
方法一: 在my.ini的[mysqld]字段加入： skip-grant-tables 重启mysql服务，这时的mysql不需要密码即可登录数据库然后进入mysql mysql>use mysql; mysql>更新 user set password=password('新密码') WHERE User='root'; mysq
Ehcache（03）——Ehcache中储存缓存的方式 234390216 ehcache MemoryStore DiskStore 存储驱除策略
Ehcache中储存缓存的方式目录 1 堆内存（MemoryStore） 1.1 指定可用内存 1.2 驱除策略 1.3 元素过期 2 &nbs
spring mvc中的@propertysource jackyrong spring mvc
在spring mvc中，在配置文件中的东西，可以在java代码中通过注解进行读取了： @PropertySource 在spring 3.1中开始引入比如有配置文件 config.properties mongodb.url=1.2.3.4 mongodb.db=hello 则代码中 @PropertySource(&
重学单例模式 lanqiu17 单例 Singleton 模式
最近在重新学习设计模式，感觉对模式理解更加深刻。觉得有必要记下来。第一个学的就是单例模式，单例模式估计是最好理解的模式了。它的作用就是防止外部创建实例，保证只有一个实例。单例模式的常用实现方式有两种，就人们熟知的饱汉式与饥汉式，具体就不多说了。这里说下其他的实现方式静态内部类方式: package test.pattern.singleton.statics; publ
.NET开源核心运行时，且行且珍惜 netcome java .net 开源
背景 2014年11月12日，ASP.NET之父、微软云计算与企业级产品工程部执行副总裁Scott Guthrie，在Connect全球开发者在线会议上宣布，微软将开源全部.NET核心运行时，并将.NET 扩展为可在 Linux 和 Mac OS 平台上运行。.NET核心运行时将基于MIT开源许可协议发布，其中将包括执行.NET代码所需的一切项目——CLR、JIT编译器、垃圾收集器（GC）和核心
使用oscahe缓存技术减少与数据库的频繁交互 Everyday都不同 Web 高并发 oscahe缓存
此前一直不知道缓存的具体实现，只知道是把数据存储在内存中，以便下次直接从内存中读取。对于缓存的使用也没有概念，觉得缓存技术是一个比较”神秘陌生“的领域。但最近要用到缓存技术，发现还是很有必要一探究竟的。缓存技术使用背景：一般来说，对于web项目，如果我们要什么数据直接jdbc查库好了，但是在遇到高并发的情形下，不可能每一次都是去查数据库，因为这样在高并发的情形下显得不太合理——
Spring+Mybatis 手动控制事务 toknowme mybatis
@Override public boolean testDelete(String jobCode) throws Exception { boolean flag = false; &nbs
菜鸟级的android程序员面试时候需要掌握的知识点 xp9802 android
熟悉Android开发架构和API调用掌握APP适应不同型号手机屏幕开发技巧熟悉Android下的数据存储熟练Android Debug Bridge Tool 熟练Eclipse/ADT及相关工具熟悉Android框架原理及Activity生命周期熟练进行Android UI布局熟练使用SQLite数据库；熟悉Android下网络通信机制，S

按字母分类： A B C D E F G H I J K L M N O P Q R S T U V W X Y Z 其他