夏天｜여름이다

TTS | 2019~2023年最新增强/生成情绪的语音合成调研(20231211更新版)

本博客主要是增强/生成情绪的语音合成调研，论文按照时间顺序排列，且有些论文为期刊会议论文，有的是arxiv论文，在本文中，标识如下：

【ICML 】【✨Interspeech 】【ICASSP】

2019.09.30_Determination of representative emotional style of speech based on k-means algorithm

论文地址：Determination of representative emotional style of speech based on k-means algorithm (jask.or.kr)

将GST引入端到端的语音合成模型中，GST-Tacotron 框架如下

添加情感表示的框架

[✨Interspeech 2021]2021.04.03_Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability

论文地址：2104.01408.pdf (arxiv.org)

近年来，情感文本到语音合成（ETTS）取得了很大进展。然而，生成的声音通常无法通过其预期的情感类别在感知上识别。为了解决这个问题，我们提出了一种新的ETTS交互式训练范式，表示为i-ETTS，它试图通过与语音情感识别（SER）模型的交互来直接提高情感的可判别性。此外，我们制定了强化学习的迭代训练策略，以确保i-ETTS优化的质量。实验结果表明，所提出的i-ETTS通过更准确地呈现语音风格，优于最先进的基线。据我们所知，这是情感文本到语音合成中强化学习的首次研究。

[ ICML 2021 ]2021.06.06_Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation

论文地址：Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation (arxiv.org)

随着神经文本转语音（TTS）模型的快速发展，个性化语音生成现在对许多应用的需求量很大。为了实现实际适用性，TTS 模型应该仅使用来自给定说话者的几个音频样本来生成高质量的语音，这些样本的长度也很短。然而，现有方法要么需要对模型进行微调，要么在不进行微调的情况下实现低适应质量。在这项工作中，我们提出了一种新的TTS模型StyleSpeech，它不仅可以合成高质量的语音，还可以有效地适应新的说话者。具体来说，我们提出了风格自适应层归一化（SALN），它根据从参考语音音频中提取的风格来对齐文本输入的增益和偏置。借助 SALN，我们的模型可以有效地合成目标说话人的语音，即使是从单个语音音频中也是如此。此外，为了增强 StyleSpeech 对新说话者语音的适应能力，我们通过引入两个使用风格原型训练的判别器并执行情景训练，将其扩展到 Meta-StyleSpeech。实验结果表明，我们的模型生成高质量的语音，通过单个短时（1-3秒）语音音频准确地跟随说话者的声音，性能明显优于基线。

[ ✨Interspeech 2021]2021.06.17_EMOVIE: A Mandarin Emotion Speech Dataset with a Simple Emotional Text-to-Speech Model

论文地址：2106.09317.pdf (arxiv.org)

最近，人们对神经语音合成的兴趣越来越大。虽然深度神经网络在文本转语音（TTS）任务中取得了最先进的结果，但由于高质量情感语音数据集的稀缺性和先进的情感TTS模型的缺乏，如何生成更具情感性和表现力的语音正成为研究人员面临的新挑战。在本文中，我们首先简要介绍并公开发布了一个普通话情感语音数据集，该数据集包含9,724个样本，其中包含音频文件及其情感人工标记注释。之后，我们提出了一种简单而有效的情感语音合成架构，称为EMSpeech。与那些需要额外参考音频作为输入的模型不同，我们的模型可以仅从输入文本中预测情感标签，并根据情感嵌入生成更具表现力的语音。在实验阶段，我们首先通过情绪分类任务来验证数据集的有效性。然后，我们在提议的数据集上训练我们的模型，并进行一系列主观评估。最后，通过在情感语音合成任务中表现出可比的性能，我们成功地证明了所提模型的能力。

[ ✨Interspeech 2021]2021.11.Emotional Prosody Control for Speech Generation

论文地址：2111.04730.pdf (arxiv.org)

机器生成的语音的特点是其有限或不自然的情绪变化。当前的文本转语音系统生成具有平坦情感的语音、从预定义集合中选择的情感、从训练数据中的韵律序列中学习的平均变化或从源风格传输的平均变化。我们提出了一种文本到语音（TTS）系统，用户可以从连续且有意义的情感空间（Arousal-Valence space）中选择生成语音的情感。所提出的TTS系统可以从任何说话者的文本中生成语音，并可以很好地控制情绪。我们表明，该系统可以处理训练期间看不见的情绪，并且可以根据他/她的语音样本扩展到以前看不见的说话者。我们的工作将最先进的 FastSpeech2 骨干网的视野扩展到多扬声器设置，并为其提供令人垂涎的连续（和可解释）情感控制，而不会对合成语音的质量造成任何可观察到的下降。

[ ICASSP2023 ]2022.11.17_ Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models

论文地址：[2211.09383] Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models (arxiv.org)

论文代码：WelkinYang/GradTTS: Pytorch implementation of "Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech" (github.com)

Demo：

近年来，由于神经生成建模的进步，文本转语音（TTS）合成技术取得了重大进展。然而，现有的任何说话人自适应TTS方法在模仿目标说话人的风格方面都取得了不理想的性能，因为它们在模仿目标说话人的风格方面精度不理想。在这项工作中，我们提出了 Grad-StyleSpeech，这是一个基于扩散模型的任意说话人自适应 TTS 框架，该模型可以生成高度自然的语音，与目标说话人的声音具有极高的相似性，给定几秒钟的参考语音。在英语基准测试中，Grad-StyleSpeech 明显优于最近的说话人自适应 TTS 基线。音频示例可在此 https URL 中找到。

2022.11.26_CONTEXTUAL EXPRESSIVE TEXT-TO-SPEECH

论文地址：2211.14548.pdf (arxiv.org)

代码未开源

富有表现力的文本转语音（TTS）的目标是以高表现力合成具有所需内容、韵律、情感或音色的自然语音。以前的大多数研究都试图从给定的风格和情绪标签中生成语音，通过将风格和情绪分类为固定数量的预定义类别来过度简化问题。在本文中，我们引入了一种新的任务设置，即上下文TTS（CTTS）。CTTS的主要思想是，一个人说话的方式取决于她所处的特定语境，其中语境通常可以表示为文本。因此，在CTTS任务中，我们建议利用这样的上下文来指导语音合成过程，而不是依赖风格和情感的明确标签。为了完成这项任务，我们构建了一个合成数据集并开发了一个有效的框架。实验表明，我们的框架可以在合成数据集和真实场景中基于给定的上下文生成高质量的表达语音。

[ ✨Interspeech 2021]2021.12.07_Multi-speaker Emotional Text-to-speech Synthesizer

论文代码：2112.03557.pdf (arxiv.org)

我们提出了一种方法来训练我们的多说话人情感文本到语音合成器，它可以表达 10 个说话者的 7 种不同情绪的语音。在学习之前，将删除音频样本中的所有静音。这导致我们的模型可以快速学习。应用课程学习来有效地训练我们的模型。我们的模型首先使用大型单说话人中立数据集进行训练，然后使用所有说话人的中性语音进行训练。最后，我们的模型使用来自所有说话者的情感语音数据集进行训练。在每个阶段，每个说话者-情感对的训练样本以小批量出现的概率相等。通过这个过程，我们的模型可以合成所有目标说话者和情绪的语音。我们的合成音频集可在我们的网页上找到。

[ ✨Interspeech 2022 ]2022.07.13_Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS

论文地址：2207.06000.pdf (arxiv.org)

近年来，富有表现力的文本转语音功能已显示出改进的性能。然而，合成语音的风格控制往往局限于离散的情感类别，需要目标说话人在目标风格中记录的训练数据。在许多实际情况下，用户可能没有记录目标情绪的参考语音，但仍然有兴趣通过输入所需情感风格的文本描述来控制语音风格。在本文中，我们提出了一种基于文本的接口，用于多说话人TTS中的情感风格控制和跨说话人风格迁移。我们提出了一种双模态风格编码器，该编码器使用预训练的语言模型对文本描述嵌入和语音风格嵌入之间的语义关系进行建模。为了进一步改善在不相交的多风格数据集上的交叉说话人风格迁移，我们提出了一种新的风格损失。实验结果表明，我们的模型即使在看不见的风格下也能产生高质量的表达性语音。

2022.12.28_Speech Synthesis with Mixed Emotions

论文地址：2208.05890.pdf (arxiv.org)

情感语音合成旨在合成具有各种情感效果的人声。目前的研究主要集中在模仿属于特定情绪类型的平均风格上。在本文中，我们试图在运行时生成具有混合情绪的语音。我们提出了一种新的公式来测量不同情绪的语音样本之间的相对差异。然后，我们将我们的公式合并到序列的情感文本到语音框架中。在训练过程中，该框架不仅明确表征了情绪风格，还通过量化与其他情绪的差异来探索情绪的序数性质。在运行时，我们通过手动定义情感属性向量来控制模型以产生所需的情感混合。客观和主观评价验证了拟议框架的有效性。据我们所知，这项研究是第一个关于建模、综合和评估言语中混合情绪的研究。

[ ICASSP 2023 ]2023.03.02_Fine-grained Emotional Control of Text-To-Speech: Learning To Rank Inter- And Intra-Class Emotion Intensities

论文地址：2303.01508.pdf (arxiv.org)

Demo:https: //wshijun1991.github.io/ICASSP2023_DEMO

最先进的文本转语音（TTS）模型能够产生高质量的语音。然而，生成的语音在情感表达中通常是中性的，而人们往往希望对单词或音素进行细粒度的情感控制。尽管仍然具有挑战性，但最近提出了第一个TTS模型，该模型能够通过手动分配情绪强度来控制语音。不幸的是，由于忽略了班级内的距离，强度差异往往无法识别。在本文中，我们提出了一种细粒度的可控情绪TTS，它同时考虑了类间和类内的距离，并能够合成具有可识别强度差异的语音。我们的主观和客观实验表明，我们的模型在可控性、情感表达性和自然性方面超过了两个最先进的可控TTS模型。

2.1.秩模型

Xemo是非自然情绪分类的样本，Xneu是自然的，

2.2.TTS模型

使用fastspeech2的结构

[ ICASSP 2023 ]2023.03.14_QI-TTS: Questioning Intonation Control for Emotional Speech Synthesis

论文地址：2303.07682.pdf (arxiv.org)

最近的表达性文本转语音（TTS）模型侧重于合成情感语音，但忽略了一些细粒度的风格，例如语调。在本文中，我们提出了QI-TTS，旨在更好地传递和控制语调，以进一步传递说话者的提问意图，同时从参考语音中传递情感。我们提出了一个多样式提取器，从两个不同的层次提取样式嵌入。句子级别代表情感，而最后一个音节级别代表语调。对于细粒度的语调控制，我们使用相对属性来表示音节级别的语调强度。实验验证了QI-TTS在改善情感语音合成中语调表现力的有效性。

[ ICASSP 2023 ]2023.03.15_Cross-speaker Emotion Transfer by Manipulating Speech Style Latents

论文地址：[2303.08329] Cross-speaker Emotion Transfer by Manipulating Speech Style Latents (arxiv.org)

近年来，情感文本转语音取得了长足的进步。但是，它需要大量的标记数据，不容易访问。即使可以获取情感语音数据集，在控制情感强度方面仍然存在局限性。在这项工作中，我们提出了一种在潜在风格空间中使用向量算术进行交叉说话者情感传递和操纵的新方法。通过仅利用少数标记样本，我们从阅读式语音中生成情感语音，而不会丢失说话者身份。此外，使用标量值可以很容易地控制情绪强度，为用户提供了一种直观的方式来操纵语音。实验结果表明，所提方法在表现力、自然性和可控性方面具有较好的性能，保留了说话人的身份。

2023.05.23_ZET-Speech: Zero-shot adaptive Emotion-controllable Text-to-Speech Synthesis with Diffusion and Style-based Models

论文地址：[2305.13831] ZET-Speech: Zero-shot adaptive Emotion-controllable Text-to-Speech Synthesis with Diffusion and Style-based Models (arxiv.org)

代码地址：ZET-Speech/ZET-Speech-Demo: ZET-Speech: Zero-shot adaptive Emotion-controllable Text-to-Speech Synthesis with Diffusion and Style-based Models (TTS) (github.com)

Demo:ZET-Speech

情感文本转语音（TTS）是开发需要自然和情感语音的系统（例如类人对话代理）中的一项重要任务。然而，现有方法的目的只是在培训期间为看到的说话者产生情感 TTS，而没有考虑对看不见的说话者的泛化。在本文中，我们提出了 ZET-Speech，这是一种零样本自适应情绪可控 TTS 模型，允许用户仅使用简短的中性语音片段和目标情绪标签来合成任何说话者的情感语音。具体而言，为了实现零样本自适应TTS模型来合成情感语音，我们提出了基于扩散模型的领域对抗学习和引导方法。实验结果表明，ZET-Speech成功地将自然和情感语音与看得见和看不见的说话者所需的情感相结合。示例位于此 https URL。

论文架构

2023.05.29.v2_Semi-supervised learning for continuous emotional intensity controllable speech synthesis with disentangled representations

论文地址：Submitted to INTERSPEECH (arxiv.org)

最近的文本转语音模型已经达到了生成类似于人类所说的自然语音的水平。但在表现力方面仍然存在局限性。现有的情感语音合成模型在情感潜在空间中使用具有缩放参数的插值特征表现出可控性。然而，由于情绪、说话者等特征的纠缠，现有模型产生的情感潜在空间难以控制持续的情感强度。在本文中，我们提出了一种使用半监督学习来控制情绪连续强度的新方法。该模型使用从语音信息的音素级序列生成的伪标签来学习中等强度的情绪。根据所提出的模型构建的嵌入空间满足了具有情感基础的均匀网格几何形状。实验结果表明，所提方法在可控性和自然性方面具有较好的优点。

[ ✨Interspeech 2023 ]2023.06.09_Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech

论文地址：Submitted to INTERSPEECH (arxiv.org)

有效的言语情感表征在言语情感识别（SER）和情感文本转语音（TTS）任务中起着关键作用。然而，与中性风格语音相比，情感语音样本的获取更加困难和昂贵，这导致了一个大多数相关作品不幸忽略的问题：数据集不平衡。模型可能会过度拟合大多数中性类，并且无法产生稳健有效的情感表征。在本文中，我们提出了一个情感提取器来解决这个问题。我们使用增强方法来训练模型，并使其能够从不平衡的数据集中提取有效且可推广的情感表征。我们的实证结果表明：（1）对于SER任务，所提出的Emotion Extractor在三个不平衡数据集上都超过了最先进的基线;（2）我们的情感提取器生成的表征有利于TTS模型，并使其能够合成更具表现力的语音。

2023.06.28_EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech

论文地址：Submitted to SSW (arxiv.org)

最先进的语音合成模型试图尽可能接近人声。因此，情绪建模是文本转语音（TTS）研究的重要组成部分。在我们的工作中，我们选择了 FastSpeech2 作为起点，并提出了一系列用于合成情感语音的修改。根据自动和人工评估，我们的模型 EmoSpeech 在生成语音的 MOS 分数和情感识别准确性方面都超过了现有模型。我们为构成 EmoSpeech 的 FastSpeech2 架构的每个扩展提供了详细的消融研究。文本中情感的不均匀分布对于更好的综合语音和语调感知至关重要。我们的模型包括一个调节机制，通过允许情绪以不同的强度水平影响每部手机来有效地处理这个问题。人工评估表明，所提出的修改生成的音频具有更高的 MOS 和情感表现力。

论文使用了：

用离散标签表示一个或多个情绪
有参考语音的情感状态
目标情绪状态作为表单条件数据的上下文

2023.08.16_AffectEcho: Speaker Independent and Language-Agnostic Emotion and Affect Transfer for Speech Synthesis

论文地址：2308.08577.pdf (arxiv.org)

情感是一种情感特征，包括效价、唤醒和强度，是实现真实对话的关键属性。虽然现有的文本转语音（TTS）和语音转语音系统依赖于强度嵌入向量和全局风格标记来捕获情感，但这些模型将情感表示为风格的组成部分，或者在离散类别中表示它们。我们提出了 AffectEcho，一种情绪翻译模型，它使用矢量量化代码本在具有五个影响强度级别的量化空间中对情绪进行建模，以捕捉同一情绪中复杂的细微差别和细微差异。量化的情感嵌入是从口语样本中隐式派生的，无需使用单热向量或显式强度嵌入。实验结果表明，我们的方法在控制生成语音的情绪方面是有效的，同时保留了每个说话者独特的身份、风格和情感节奏。我们展示了从双语（英语和中文）语音语料库中学习到的量化情感嵌入的语言独立情感建模能力，以及从参考语音到目标语音的情感迁移任务。我们在定性和定量指标上都取得了最先进的结果。

2023.11.16_EMODIFF: INTENSITY CONTROLLABLE EMOTIONAL TEXT-TO-SPEECH WITH SOFT-LABEL GUIDANCE

论文地址：2211.09496.pdf (arxiv.org)

尽管当前的神经文本转语音（TTS）模型能够生成高质量的语音，但强度可控的情感 TTS 仍然是一项具有挑战性的任务。大多数现有方法需要外部优化才能进行强度计算，从而导致结果欠佳或质量下降。在本文中，我们提出了EmoDiff，这是一种基于扩散的TTS模型，其中情绪强度可以通过源自分类器引导的软标签引导技术来操纵。具体来说，EmoDiff 不是使用指定情绪的 one-hot 向量进行引导，而是使用软标签进行引导，其中指定情绪和 \textit{Neutral} 的值设置为α和1−α分别。这α这里代表情绪强度，可以从 0 到 1 中选择。我们的实验表明，EmoDiff 可以在保持高语音质量的同时精确控制情绪强度。此外，通过反向去噪过程中的采样，可以产生具有特定情感强度的多样化语音。

参考文献

【1】 Emotional Speech Synthesis | Papers With Code

【2】keonlee9420/StyleSpeech: PyTorch Implementation of Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation (github.com) 【3】arxiv-sanity (arxiv-sanity-lite.com)

算法学习笔记：17.蒙特卡洛算法 ——从原理到实战，涵盖 LeetCode 与考研 408 例题
在计算机科学和数学领域，蒙特卡洛算法（MonteCarloAlgorithm）以其独特的随机抽样思想，成为解决复杂问题的有力工具。从圆周率的计算到金融风险评估，从物理模拟到人工智能，蒙特卡洛算法都发挥着不可替代的作用。本文将深入剖析蒙特卡洛算法的思想、解题思路，结合实际应用场景与Java代码实现，并融入考研408的相关考点，穿插图片辅助理解，帮助你全面掌握这一重要算法。蒙特卡洛算法的基本概念蒙特卡
“Datawhale AI夏令营”基于带货视频评论的用户洞察挑战赛 fzyz123 Datawhale AI夏令营人工智能 Datawhale 大模型技术 NLP 深度学习 AI夏令营
前言：本次是DatawhaleAI夏令营2025年第一期的内容，赛事是：基于带货视频评论的用户洞察挑战赛（科大讯飞AI大赛）一、赛事背景在直播电商爆发式增长浪潮中，短视频平台积累的海量带货视频及用户评论数据蕴含巨大商业价值。这些数据不仅是消费者体验的直接反馈，更是驱动品牌决策的关键资产。用户洞察的核心在于视频内容与评论数据的联合挖掘：通过智能识别推广商品分析评论中的情感表达与观点聚合精准捕捉消费者
AI音乐模拟器：AIGC时代的智能音乐创作革命 lauo 人工智能 AIGC 开源前端机器人
AI音乐模拟器：AIGC时代的智能音乐创作革命引言：AIGC浪潮下的音乐创作新范式在数字化转型的浪潮中，人工智能生成内容（AIGC）正在重塑各个创意领域。音乐产业作为创意经济的重要组成部分，正经历着前所未有的变革。据最新市场研究数据显示，全球AI音乐市场规模预计将从2023年的5.8亿美元增长到2030年的26.8亿美元，年复合增长率高达24.3%。这一快速增长的市场背后，是AI音乐技术正在打破传
视频分析：让AI看懂动态画面随机森林404 计算机视觉音视频人工智能 microsoft
引言：动态视觉理解的革命在数字信息爆炸的时代，视频已成为最主要的媒介形式。据统计，每分钟有超过500小时的视频内容被上传到YouTube平台，而全球互联网流量的82%来自视频数据传输。面对如此海量的视频内容，传统的人工处理方式已无法满足需求，这正是人工智能视频分析技术大显身手的舞台。视频分析技术赋予机器"看懂"动态画面的能力，使其能够自动理解、解释甚至预测视频中的内容，这一突破正在彻底改变我们与视
法律科技领域人工智能代理构建的十个经验教训，一位人工智能工程师通过构建、部署和维护智能代理的经验教训来优化法律工作流程的历程。知识大胖 NVIDIA GPU和大语言模型开发教程人工智能 ai
目录介绍什么是代理人？为什么它对法律如此重要？法律技术中代理用例示例-合同审查代理-法律研究代理在LegalTech中使用代理的十个教训-教训1：即使代理很酷，它们也不能解决所有问题-教训2：选择最适合您用例的框架-教训3：能够快速迭代不同的模型-教训4：从简单开始，必要时扩展-教训5：使用跟踪解决方案；您将需要它-教训6：确保跟踪成本，代理循环可能很昂贵-教训7：将控制权交给最终用户（人在环路中
Llama-Omni会说话的人工智能“语音到语音LLM” 利用低延迟、高质量语音转语音 AI 彻底改变对话方式（教程含源码）知识大胖 NVIDIA GPU和大语言模型开发教程 llama 人工智能 nvidia llm
介绍“单靠技术是不够的——技术与文科、人文学科的结合，才能产生让我们心花怒放的成果。”——史蒂夫·乔布斯近年来，人机交互领域发生了重大变化，尤其是随着ChatGPT、GPT-4等大型语言模型(LLM)的出现。虽然这些模型主要基于文本，但人们对语音交互的兴趣日益浓厚，以使人机对话更加无缝和自然。然而，实现语音交互而不受语音转文本处理中常见的延迟和错误的影响仍然是一个挑战。关键字：Llama-Omni
什么是热力学计算？它如何帮助人工智能发展？知识大胖 NVIDIA GPU和大语言模型开发教程人工智能量子计算
现代计算的基础是晶体管，这是一种微型电子开关，可以用它构建逻辑门，从而创建CPU或GPU等复杂的数字电路。随着技术的进步，晶体管变得越来越小。根据摩尔定律，集成电路中晶体管的数量大约每两年增加一倍。这种指数级增长使得计算技术呈指数级发展。然而，晶体管尺寸的缩小是有限度的。我们很快就会达到晶体管无法工作的阈值。此外，人工智能的进步使得对计算能力的需求比以往任何时候都更加迫切。根本问题是自然是随机的（
上海交大：工具增强推理agent
标题：SciMaster:TowardsGeneral-PurposeScientificAIAgentsPartI.X-MasterasFoundation-CanWeLeadonHumanity’sLastExam?来源：arXiv,2507.05241摘要人工智能代理的快速发展激发了利用它们加速科学发现的长期雄心。实现这一目标需要深入了解人类知识的前沿。因此，人类的最后一次考试（HLE）为评
微算法科技的前沿探索：量子机器学习算法在视觉任务中的革新应用 MicroTech2025 量子计算算法
在信息技术飞速发展的今天，计算机视觉作为人工智能领域的重要分支，正逐步渗透到我们生活的方方面面。从自动驾驶到人脸识别，从医疗影像分析到安防监控，计算机视觉技术展现了巨大的应用潜力。然而，随着视觉任务复杂度的不断提升，传统机器学习算法在处理大规模、高维度数据时遇到了计算瓶颈。在此背景下，量子计算作为一种颠覆性的计算模式，以其独特的并行处理能力和指数级增长的计算空间，为解决这一难题提供了新的思路。微算
中国银联豪掷1亿采购海光C86架构服务器信创新态势海光芯片 C86 国产芯片海光信息
近日，中国银联国产服务器采购大单正式敲定，基于海光C86架构的服务器产品中标，项目金额超过1亿元。接下来，C86服务器将用于支撑中国银联的虚拟化、大数据、人工智能、研发测试等技术场景，进一步提升其业务处理能力、用户服务效率和信息安全水平。作为我国重要的银行卡组织和金融基础设施，中国银联在全球183个国家和地区设有银联受理网络，境内外成员机构超过2600家，是世界三大银行卡品牌之一。此次中国银联发力
GPT实操——利用GPT创建一个应用狗木马深度学习 gpt-3 gpt
功能描述信息查询：用户可以询问各种问题，如天气、新闻、股票等，机器人会返回相关信息。任务执行：用户可以要求机器人执行一些简单的任务，如设置提醒、发送邮件等。情感支持：机器人可以与用户进行情感交流，提供安慰和支持。个性化设置：用户可以自定义机器人的回复风格和偏好。技术栈前端：React.js后端：Node.js+Express数据库：MongoDB自然语言处理：OpenAIGPT-3API其他工具：
AI人工智能浪潮中文心一言的独特优势
AI人工智能浪潮中文心一言的独特优势：为什么它是中国市场的“AI主力军”？关键词：文心一言,AI大模型,中文处理,多模态融合,产业落地,安全可控,百度ERNIE摘要：在全球AI大模型浪潮中，百度文心一言（ERNIEBot）凭借“懂中文、会多模态、能落地、守规矩”的四大核心优势，成为中国市场最具竞争力的AI产品之一。本文将用“超级大脑”的比喻，从中文理解、多模态能力、产业生态融合、安全可控性四个维度
正义的算法迷宫—人工智能重构司法体系的技术悖论与文明试炼
一、法庭的数字化迁徙当美国威斯康星州法院采纳COMPAS算法评估被告再犯风险，当中国"智慧法院"系统年处理1.2亿件案件，司法体系正经历从石柱法典到代码裁判的范式革命。这场转型的核心驱动力是司法效率与公正的永恒张力：美国重罪案件平均审理周期达18个月，中国基层法官年人均结案357件（是德国同行的6倍），而算法能在0.3秒内完成百万份文书比对。人工智能渗透司法引发三重裂变：证据分析从经验推断转向数据
微软语音合成标记语言SSML文档结构和事件（详细文档和实例）阿酷tony AI数字人微信语音合成 microsoft 微软语音 SSML文档结构 SSML结构 SSML语音合成
说明：MicrosoftAzure中国技术文档网站，请访问https://docs.azure.cn包含输入文本的语音合成标记语言(SSML)确定了文本转语音输出的结构、内容和其他特征。例如，可以使用SSML来定义段落、句子、中断/暂停或静音。可以使用事件标记（例如书签或视素）来包装文本，这些标记可以稍后由应用程序处理。有关如何在SSML文档中构建元素的详细信息，请参阅以下部分。备注某些语音不支持
【python实战】不玩微博，一封邮件就能知道实时热榜，天秀吃瓜一条coding 从实战学python 人工智能 python linux 爬虫
❤️欢迎订阅《从实战学python》专栏，用python实现办公自动化、数据可视化、人工智能等各个方向的实战案例，有趣又有用！❤️更多精品专栏简介点这里有的人金玉其表败絮其中，有的人却若彩虹般绚烂，怦然心动前言哈喽，大家好，我是一条。在生活中我是一个不太喜欢逛娱乐平台的人，抖音、快手、微博我手机里都没装，甚至微信朋友圈都不看，但是自从开始写博客，有些热度不得不蹭。所以就有了这样一个需求，能不能让微
MCP协议：AI时代的“万能插座”如何重构IT生态与未来
MCP协议：AI时代的“万能插座”如何重构IT生态与未来在人工智能技术爆炸式发展的浪潮中，一个名为ModelContextProtocol（MCP）的技术协议正以惊人的速度重塑IT行业的底层逻辑。2024年11月由Anthropic首次发布，MCP在短短半年内获得OpenAI、谷歌、亚马逊、阿里、腾讯等全球科技巨头的支持，被业内誉为AI时代的HTTP协议或USB-C接口，正在成为连接大模型与现实世
《算法备案全攻略：规范与流程引领数字时代新秩序》算法及大模型备案顾问刘老师算法备案深度学习 AIGC 语言模型算法人工智能
一、算法备案：开启合规新征程（一）备案规定的起源与发展2022年国家互联网信息办公室、工业和信息化部、公安部、国家市场监督管理总局联合发布《互联网信息服务算法推荐管理规定》，自2022年3月1日起施行。此后，相关规定不断完善和演进。如国家网信办于2022年8月、10月及2023年1月先后三次公布了《境内互联网信息服务算法备案清单》。同时，2022年发布的最高人民法院《关于规范和加强人工智能司法应用
C语言学生成绩管理系统<；自创>；(功能7有小错误,但可运行） han_xue_feng java
腾讯云加速企业和个人开发创新公开直播预告直播预告：07/18(周四)15:00-16:00随着人工智能与大模型的蓬勃发展，我们正步入一个由技微信实习第一天周五入职，早上早早来到了公司，发现好多人都没上班，到十点才陆陆续续有人来，办理完入职后，mentor中联夏令营遗憾没有入选不过hr的回复真的很好，辛苦啦#提前批简历挂麻了怎么办##机械制造投递记录#大数据开发的工作有点过于简单了吧sq大数据开发的
Python 实战人工智能数学基础：推荐系统应用 AI天才研究院 AI大模型企业级应用开发实战大数据人工智能语言模型 Java Python 架构设计
作者：禅与计算机程序设计艺术文章目录1.背景介绍2.核心概念与联系2.1用户画像2.2相似性计算2.2.1基于物品的相似度2.2.2基于用户的相似度2.3协同过滤算法2.3.1基于用户的协同过滤算法2.3.2基于物品的协同过滤算法2.3.3基于上下文的协同过滤算法3.核心算法原理和具体操作步骤以及数学模型公式详细讲解3.1基于用户的协同过滤算法3.2基于物品的协同过滤算法3.3混合协同过滤算法3.
Python桌面应用开发的未来——智能化工具与大模型赋能 IronwoodStag78
开发AI智能应用，就下载InsCodeAIIDE，一键接入DeepSeek-R1满血版大模型！标题：Python桌面应用开发的未来——智能化工具与大模型赋能随着人工智能技术的飞速发展，传统软件开发模式正在被重新定义。Python作为一门功能强大且灵活的语言，在桌面应用开发领域一直占据重要地位。然而，面对日益复杂的用户需求和快速变化的技术环境，如何提升开发效率、降低开发门槛，成为开发者亟需解决的问题
深度学习实战-使用TensorFlow与Keras构建智能模型程序员Gloria Python超入门 TensorFlow python
深度学习实战-使用TensorFlow与Keras构建智能模型深度学习已经成为现代人工智能的重要组成部分，而Python则是实现深度学习的主要编程语言之一。本文将探讨如何使用TensorFlow和Keras构建深度学习模型，包括必要的代码实例和详细的解析。1.深度学习简介深度学习是机器学习的一个分支，使用多层神经网络来学习和表示数据中的复杂模式。其广泛应用于图像识别、自然语言处理、推荐系统等领域。
AI产品经理需要了解的算法知识 AI劳模人工智能产品经理 AI产品经理 AI产品经理入门零基础入门产品经理算法语言模型
1、自然语言生成（NLG）自然语言生成（NaturalLanguageGeneration，简称NLG）是一种人工智能技术，它的目标是将计算机的数据、逻辑或算法产生的信息转换成人类可读的自然语言文本。换句话说，NLG能让机器“学会”写文章、报告、故事或者其他任何形式的文字，就像人类作家那样。这项技术使得机器能够理解复杂的数据并将其转化为易于理解的语言，以适应不同的受众和情境。应用实例：金融报告自动
【Python】OpenAI API 宅男很神经 python 开发语言
【Python与OpenAIAPI深度探索：从基础到未来】第一章：OpenAIAPI概览与核心概念1.1OpenAIAPI是什么？能做什么？OpenAIAPI(ApplicationProgrammingInterface，应用程序编程接口)是一套允许开发者通过编程方式访问和使用OpenAI开发的各种先进人工智能模型的服务。这些模型经过海量数据的训练，能够在多种任务上达到甚至超越人类水平。通过AP
Python：操作 Word 对齐方式 Thomas Kant Python python word c#
亲爱的技术爱好者们，热烈欢迎来到Kant2048的博客！我是ThomasKant，很开心能在CSDN上与你们相遇～本博客的精华专栏：【自动化测试】【测试经验】【人工智能】【Python】Python：操作Word对齐方式详解（左对齐/右对齐/居中/两端对齐）在日常办公自动化中，我们经常需要对Word文档中的段落设置对齐方式，如左对齐、右对齐、居中、两端对齐等。本文将带你使用python-docx库
TestCafe ➜ Playwright fixture 架构迁移指南 Thomas Kant 自动化测试 playwright testcafe typescript 测试架构
亲爱的技术爱好者们，热烈欢迎来到Kant2048的博客！我是ThomasKant，很开心能在CSDN上与你们相遇～本博客的精华专栏：【自动化测试】【测试经验】【人工智能】【Python】
医疗金融预测与语音识别中的模型优化及可解释性技术突破智能计算研究中心其他
内容概要随着人工智能技术的纵深发展，模型优化与可解释性技术正在重塑医疗诊断、金融预测及语音识别领域的应用范式。在医疗领域，基于自适应学习的动态参数调整机制，结合迁移学习的跨场景知识复用，显著提升了疾病筛查模型的泛化能力；而金融预测场景中，联邦学习框架通过分布式数据协作，在保障隐私安全的前提下，实现了风险预测模型的多维度优化。语音识别领域则依托边缘计算架构，将模型压缩技术与实时推理引擎结合，有效解决
【kafka】在Linux系统中部署配置Kafka的详细用法教程分享景天科技苑 linux基础与进阶 shell脚本编写实战 kafka linux 分布式 kafka安装配置 kafka优化
✨✨欢迎大家来到景天科技苑✨✨养成好习惯，先赞后看哦~作者简介：景天科技苑《头衔》：大厂架构师，华为云开发者社区专家博主，阿里云开发者社区专家博主，CSDN全栈领域优质创作者，掘金优秀博主，51CTO博客专家等。《博客》：Python全栈，PyQt5和Tkinter桌面应用开发，小程序开发，人工智能，js逆向，App逆向，网络系统安全，云原生K8S，Prometheus监控，数据分析，Django
基于 esp32-s3，结合私有化大模型，集asr语音识别、llm大模型、tts语音合成，设计一个技术方案，要求用websocket保持长链接，
以下方案演示了如何基于ESP32-S3，通过私有化大模型组合ASR（语音识别）、LLM（语言大模型）和TTS（语音合成）来构建一个语音交互系统，并且通过WebSocket保持与服务器的长连接通讯。整体方案分为以下几个部分：系统整体架构与数据流协议设计与消息格式服务器端实现示例ESP32-S3端实现示例运行流程与示例下面将对各部分进行详细说明。ESP32-S3没想到私有化大模型速度也能这么快ESP3
AI技术全景图鉴：从模型开发到落地部署的全链路拆解大模型玩家人工智能 langchain 大模型产品经理学习 ai 程序员
人工智能（AI）技术的快速发展，使得企业在AI模型的开发、训练、部署和运维过程中面临前所未有的复杂性。从数据管理、模型训练到应用落地，再到算力调度和智能运维，一个完整的AI架构需要涵盖多个层面，确保AI技术能够高效、稳定地运行。本文将基于AI技术架构全景图，深入剖析AI的开发工具、AI平台、算力与框架、智能运维四大核心部分，帮助大家系统性地理解AI全生命周期管理。一、AI开发工具：赋能高效开发，提
铸造软件交付的“自动驾驶”系统——AI大模型如何引爆DevOps革命 LucianaiB 评测人工智能自动驾驶 devops
铸造软件交付的“自动驾驶”系统——AI大模型如何引爆DevOps革命嗨，我是LucianaiB！总有人间一两风，填我十万八千梦。路漫漫其修远兮，吾将上下而求索。摘要(Abstract)本文深入探讨了人工智能大模型（AILargeModels）如何驱动DevOps从“自动化”（Automation）向“自主化”（Autonomous）的革命性跃迁。文章指出，AI大模型正成为现代软件工厂的“中枢神经系
算法单链的创建与删除换个号韩国红果果 c 算法
先创建结构体 struct student { int data; //int tag;//标记这是第几个 struct student *next; }; // addone 用于将一个数插入已从小到大排好序的链中 struct student *addone(struct student *h,int x){ if(h==NULL) //??????
《大型网站系统与Java中间件实践》第2章读后感白糖_ java中间件
断断续续花了两天时间试读了《大型网站系统与Java中间件实践》的第2章，这章总述了从一个小型单机构建的网站发展到大型网站的演化过程---整个过程会遇到很多困难，但每一个屏障都会有解决方案，最终就是依靠这些个解决方案汇聚到一起组成了一个健壮稳定高效的大型系统。看完整章内容，
zeus持久层spring事务单元测试 deng520159 java DAO spring jdbc
今天把zeus事务单元测试放出来,让大家指出他的毛病, 1.ZeusTransactionTest.java 单元测试 package com.dengliang.zeus.webdemo.test; import java.util.ArrayList; import java.util.List; import org.junit.Test; import
Rss 订阅开发周凡杨 html xml 订阅 rss 规范
RSS是 Really Simple Syndication的缩写（对rss2.0而言，是这三个词的缩写，对rss1.0而言则是RDF Site Summary的缩写，1.0与2.0走的是两个体系）。 RSS
分页查询实现 g21121 分页查询
在查询列表时我们常常会用到分页，分页的好处就是减少数据交换，每次查询一定数量减少数据库压力等等。按实现形式分前台分页和服务器分页：前台分页就是一次查询出所有记录，在页面中用js进行虚拟分页，这种形式在数据量较小时优势比较明显，一次加载就不必再访问服务器了，但当数据量较大时会对页面造成压力，传输速度也会大幅下降。服务器分页就是每次请求相同数量记录，按一定规则排序，每次取一定序号直接的数据
spring jms异步消息处理 510888780 jms
spring JMS对于异步消息处理基本上只需配置下就能进行高效的处理。其核心就是消息侦听器容器，常用的类就是DefaultMessageListenerContainer。该容器可配置侦听器的并发数量，以及配合MessageListenerAdapter使用消息驱动POJO进行消息处理。且消息驱动POJO是放入TaskExecutor中进行处理，进一步提高性能，减少侦听器的阻塞。具体配置如下：
highCharts柱状图布衣凌宇 hightCharts 柱图
第一步：导入 exporting.js,grid.js,highcharts.js;第二步：写controller @Controller@RequestMapping(value="${adminPath}/statistick")public class StatistickController { private UserServi
我的spring学习笔记2-IoC（反向控制依赖注入） aijuans spring mvc Spring 教程 spring3 教程 Spring 入门
IoC（反向控制依赖注入）这是Spring提出来了，这也是Spring一大特色。这里我不用多说，我们看Spring教程就可以了解。当然我们不用Spring也可以用IoC，下面我将介绍不用Spring的IoC。 IoC不是框架，她是java的技术，如今大多数轻量级的容器都会用到IoC技术。这里我就用一个例子来说明：如：程序中有 Mysql.calss 、Oracle.class 、SqlSe
TLS java简单实现 antlove java ssl keystore tls secure
1. SSLServer.java package ssl; import java.io.FileInputStream; import java.io.InputStream; import java.net.ServerSocket; import java.net.Socket; import java.security.KeyStore; import
Zip解压压缩文件百合不是茶 Zip格式解压 Zip流的使用文件解压
ZIP文件的解压缩实质上就是从输入流中读取数据。Java.util.zip包提供了类ZipInputStream来读取ZIP文件,下面的代码段创建了一个输入流来读取ZIP格式的文件; ZipInputStream in = new ZipInputStream(new FileInputStream(zipFileName)); &n
underscore.js 学习（一） bijian1013 JavaScript underscore
工作中需要用到underscore.js，发现这是一个包括了很多基本功能函数的js库，里面有很多实用的函数。而且它没有扩展 javascript的原生对象。主要涉及对Collection、Object、Array、Function的操作。学
java jvm常用命令工具——jstatd命令(Java Statistics Monitoring Daemon) bijian1013 java jvm jstatd
1.介绍 jstatd是一个基于RMI（Remove Method Invocation）的服务程序，它用于监控基于HotSpot的JVM中资源的创建及销毁，并且提供了一个远程接口允许远程的监控工具连接到本地的JVM执行命令。 jstatd是基于RMI的，所以在运行jstatd的服务
【Spring框架三】Spring常用注解之Transactional bit1129 transactional
Spring可以通过注解@Transactional来为业务逻辑层的方法(调用DAO完成持久化动作)添加事务能力，如下是@Transactional注解的定义： /* * Copyright 2002-2010 the original author or authors. * * Licensed under the Apache License, Version
我(程序员)的前进方向 bitray 程序员
作为一个普通的程序员,我一直游走在java语言中,java也确实让我有了很多的体会.不过随着学习的深入,java语言的新技术产生的越来越多,从最初期的javase,我逐渐开始转变到ssh,ssi,这种主流的码农,.过了几天为了解决新问题,webservice的大旗也被我祭出来了,又过了些日子jms架构的activemq也开始必须学习了.再后来开始了一系列技术学习,osgi,restful.....
nginx lua开发经验总结 ronin47
使用nginx lua已经两三个月了，项目接开发完毕了，这几天准备上线并且跟高德地图对接。回顾下来lua在项目中占得必中还是比较大的，跟PHP的占比差不多持平了，因此在开发中遇到一些问题备忘一下 1：content_by_lua中代码容量有限制，一般不要写太多代码，正常编写代码一般在100行左右（具体容量没有细心测哈哈，在4kb左右），如果超出了则重启nginx的时候会报 too long pa
java-66-用递归颠倒一个栈。例如输入栈{1,2,3,4,5}，1在栈顶。颠倒之后的栈为{5,4,3,2,1}，5处在栈顶 bylijinnan java
import java.util.Stack; public class ReverseStackRecursive { /** * Q 66.颠倒栈。 * 题目：用递归颠倒一个栈。例如输入栈{1,2,3,4,5}，1在栈顶。 * 颠倒之后的栈为{5,4,3,2,1}，5处在栈顶。 *1. Pop the top element *2. Revers
正确理解Linux内存占用过高的问题 cfyme linux
Linux开机后，使用top命令查看，4G物理内存发现已使用的多大3.2G，占用率高达80%以上： Mem: 3889836k total, 3341868k used, 547968k free, 286044k buffers Swap: 6127608k total,&nb
[JWFD开源工作流]当前流程引擎设计的一个急需解决的问题 comsci 工作流
当我们的流程引擎进入IRC阶段的时候，当循环反馈模型出现之后，每次循环都会导致一大堆节点内存数据残留在系统内存中，循环的次数越多，这些残留数据将导致系统内存溢出，并使得引擎崩溃。。。。。。而解决办法就是利用汇编语言或者其它系统编程语言，在引擎运行时，把这些残留数据清除掉。
自定义类的equals函数 dai_lm equals
仅作笔记使用 public class VectorQueue { private final Vector<VectorItem> queue; private class VectorItem { private final Object item; private final int quantity; public VectorI
Linux下安装R语言 datageek R语言 linux
命令如下：sudo gedit /etc/apt/sources.list1、deb http://mirrors.ustc.edu.cn/CRAN/bin/linux/ubuntu/ precise/ 2、deb http://dk.archive.ubuntu.com/ubuntu hardy universesudo apt-key adv --keyserver ke
如何修改mysql 并发数(连接数)最大值 dcj3sjt126com mysql
MySQL的连接数最大值跟MySQL没关系，主要看系统和业务逻辑了方法一：进入MYSQL安装目录打开MYSQL配置文件 my.ini 或 my.cnf查找 max_connections=100 修改为 max_connections=1000 服务里重起MYSQL即可　　方法二：MySQL的最大连接数默认是100客户端登录：mysql -uusername -ppass
单一功能原则 dcj3sjt126com 面向对象的程序设计软件设计编程原则
单一功能原则[ 编辑] SOLID 原则单一功能原则开闭原则 Liskov代换原则接口隔离原则依赖反转原则查论编在面向对象编程领域中，单一功能原则（Single responsibility principle）规定每个类都应该有
POJO、VO和JavaBean区别和联系 fanmingxing VO POJO javabean
POJO和JavaBean是我们常见的两个关键字，一般容易混淆，POJO全称是Plain Ordinary Java Object / Plain Old Java Object，中文可以翻译成：普通Java类，具有一部分getter/setter方法的那种类就可以称作POJO，但是JavaBean则比POJO复杂很多，JavaBean是一种组件技术，就好像你做了一个扳子，而这个扳子会在很多地方被
SpringSecurity3.X--LDAP：AD配置 hanqunfeng SpringSecurity
前面介绍过基于本地数据库验证的方式，参考http://hanqunfeng.iteye.com/blog/1155226，这里说一下如何修改为使用AD进行身份验证【只对用户名和密码进行验证，权限依旧存储在本地数据库中】。将配置文件中的如下部分删除：
mac mysql 修改密码 IXHONG mysql
$ sudo /usr/local/mysql/bin/mysqld_safe –user=root & //启动MySQL(也可以通过偏好设置面板来启动)$ sudo /usr/local/mysql/bin/mysqladmin -uroot password yourpassword //设置MySQL密码（注意，这是第一次MySQL密码为空的时候的设置命令，如果是修改密码，还需在-
设计模式--抽象工厂模式 kerryg 设计模式
抽象工厂模式：工厂模式有一个问题就是，类的创建依赖于工厂类，也就是说，如果想要拓展程序，必须对工厂类进行修改，这违背了闭包原则。我们采用抽象工厂模式，创建多个工厂类，这样一旦需要增加新的功能，直接增加新的工厂类就可以了，不需要修改之前的代码。总结：这个模式的好处就是，如果想增加一个功能，就需要做一个实现类，
评"高中女生军训期跳楼” nannan408
首先，先抛出我的观点，各位看官少点砖头。那就是，中国的差异化教育必须做起来。孔圣人有云：有教无类。不同类型的人，都应该有对应的教育方法。目前中国的一体化教育，不知道已经扼杀了多少创造性人才。我们出不了爱迪生，出不了爱因斯坦，很大原因，是我们的培养思路错了，我们是第一要“顺从”。如果不顺从，我们的学校，就会用各种方法，罚站，罚写作业，各种罚。军
scala如何读取和写入文件内容？ qindongliang1922 java jvm scala
直接看如下代码： package file import java.io.RandomAccessFile import java.nio.charset.Charset import scala.io.Source import scala.reflect.io.{File, Path} /** * Created by qindongliang on 2015/
C语言算法之百元买百鸡 qiufeihu c 算法
中国古代数学家张丘建在他的《算经》中提出了一个著名的“百钱买百鸡问题”，鸡翁一，值钱五，鸡母一，值钱三，鸡雏三，值钱一，百钱买百鸡，问翁，母，雏各几何？代码如下： #include <stdio.h> int main() { int cock,hen,chick; /*定义变量为基本整型*/ for(coc
Hadoop集群安全性：Hadoop中Namenode单点故障的解决方案及详细介绍AvatarNode wyz2009107220 NameNode
正如大家所知，NameNode在Hadoop系统中存在单点故障问题，这个对于标榜高可用性的Hadoop来说一直是个软肋。本文讨论一下为了解决这个问题而存在的几个solution。 1. Secondary NameNode 原理：Secondary NN会定期的从NN中读取editlog，与自己存储的Image进行合并形成新的metadata image 优点：Hadoop较早的版本都自带，