YWXonline

强化学习分享（一） DQN算法原理及实现

摘要：主要讲解DQN算法的原理，伪代码解读，基于pytorch版本的DQN小游戏编程，同时对该代码进行详细标注，以及奉上原码。

（一）强化学习算法介绍

DQN，顾名思义，Deep Q Learning ;在传统强化学习Q-Learning的基础之上，用深度学习的神经网络来拟合函Q值函数，从而达到更好的学习效果。

关于强化学习的基础知识，可以先看这篇文献：强化学习入门：基本思想和经典算法 - 知乎 (zhihu.com)

强化学习的主要应用范围包括：游戏，交通拥堵，能源分配，广告推送，机器人控制，组合与序列控制问题。目前我自己将要研究的是微电网电力资源分配问题，也是强化学习的一个小应用方向。关于策略，状态转移，奖励/回报，价值函数（动作价值和状态价值函数），折扣系数，学习率，目标函数（Target-value network），这些都默认大家知道了，勤动手，百度一下。

强化学习根据算法的应用环境，分为基于模型的算法和无模型算法。

Model-Free 算法，是指算法中智能体不需要学习和理解环境的信息，环境给什么就用什么，信息的结果告诉它把地球炸了，他就会想着把地球炸掉。

Model-Based算法，是指去学习和理解环境。学会用一个模型来模拟环境，通过模拟的环境来得到反馈。后者比前者多了一个模拟环境的这个环节，通过模拟环境预判接下来会发生的情况，然后选择最优动作进行执行。

一般生活中的问题，都很难用一个准确的模型进行描述，因此，主要研究“无模型算法”。

图1.1 强化学习算法分类（按照有无模型分类）

Policy-Based的方法直接输出下一步动作的概率，根据概率来选取动作。但不一定概率最高就会选择该动作，还是会从整体进行考虑。适用于非连续和连续的动作。常见的方法有Policy gradients。
Value-Based的方法输出的是动作的价值，选择价值最高的动作。适用于非连续的动作。常见的方法有Q-learning、Deep Q Network和Sarsa。
更为厉害的方法是二者的结合：Actor-Critic，Actor根据概率做出动作，Critic根据动作给出价值，从而加速学习过程，常见的有A2C，A3C，DDPG等。（需要好好钻研理论知识）。
同时使用Actor-Critic的学习方式巧妙的实现了将值函数和策略分开进行学习的方法，让策略达到最优的时候去指导值函数的更新。
图1.2 演员-评论家算法
经典算法：Q-learning，Sarsa，DQN，Policy Gradient，A3C，DDPG，PPO。

（二）DQN算法原理

（1）关于Q-Learning算法

该算法是DQN算法的前身，Q-learning算法是1989年Watkins提出来的，2015年nature论文所提出的DQN就是在Q-learning的基础上修改得到的。嗯，有兴趣可以深入了解它。

（2）关于DQN算法特点

论文名称：《Human-level control through deep reinforcement learning》

DQN对Q-learning的修改主要体现在以下三个方面：

（1）DQN利用深度卷积神经网络逼近值函数（作为一种逼近手段引入进去）。

（2）DQN利用了经验回放对强化学习的学习过程进行训练（经验池）。

（3）DQN独立设置了目标网络（Target）来单独处理时间差分算法中的TD偏差。它主要解决算法训练不稳定的问题。复制一个和原来Q网络结构一样的Target Q网络，用于计算Q目标值。

那接下来，就针对性的介绍这三个方面

深度卷积神经网络：

图1.3 利用卷积神经网络逼近（Q函数）值函数

这里值函数利用神经网络进行逼近，属于非线性逼近。（中间涉及到激活函数和归一化正则化等操作，不是简单的线性逼近）。这里的值函数对应着一组参数，在神经网络里参数是每层网络的权重，我们用 seta 表示（它里边是一组数据，而非一个数据）。用公式表示的话，值函数为：Q(s,a ; seta)，注意，我们这时候对值函数进行更新时，其实更新的是参数，当网络结构确定时，seta 就代表值函数。DQN所用的网络结构是3个卷积层+两个全连接层。也就是说，我们在不断的训练求解一个Q值，实际上是在更新这个网络中的各层权重参数。用卷积神经网络来拟合任意的值函数，是区别与传统Q-learning的一个重要突破（传统Q-Learning是使用的Q表，S和A稍微一多起来，计算量会呈几何倍增长，效率太低了）

经验回放机制：

利用神经网络逼近值函数的做法在强化学习领域早就存在了，可以追溯到上个世界90年代。那时，学者们发现利用神经网络，尤其是深度神经网络去逼近值函数这件事不太靠谱，因为常常出现不稳定不收敛的情况，所以这个方向一直没有突破，直到DeepMind出现。

是什么原因，才使得该方法稳定且收敛下来了呢？----------他们将认识神经科学的成果应用到了深度神经网络的训练之中！（划重点，知识迁移带来的创新）

人在睡觉的时候，海马体会把一天的记忆重放给大脑皮层。利用这个启发机制，DeepMind团队的研究人员构造了一种神经网络的训练方法：经验回放。

图1.4 DQN算法的粗略工作模型

通过经验回放为什么可以令神经网络的训练收敛且稳定？

原因是：对神经网络进行训练时，它收敛存在的假设是独立同分布。而通过强化学习采集到的经验之间存在着关联性，利用这些经验进行顺序训练，神经网络当然不稳定。经验回放可以打破经验数据间的关联。将采集的经验（原本是具有时间顺序关联的），存储到经验池中，随机抽取一批样本，进行训练，同时，随着采集经验数据的更新，也对池子中的样本库进行更新。这样子使用一个经验池存储多条经验s,a,r,s’，再从中随机抽取一批数据送去训练。解决样本关联性和利用效率的问题。

DQN增加了目标网络：

通过固定Q目标可以解决算法更新不平稳的问题，神经网络一般学习的是固定的目标值，而 Q-learning中Q同样为学习的变化量，变动太大不利于学习。所以DQN算法，使Q在一段时间内保持不变，使神经网络更易于学习，隔一段时间再去拷贝这个参数即可。

（1）这里也拿监督学习做对比,它输入x后输出预测的值y,目的是让预测值逼近这个真实值,这个真实值在监督学习中其实是稳定的:

（2）而DQN输出的预测值也是要逼近Q_target的:

（3）但是这里的Q实际上也要过一遍网络,导致这个Q也是不断变化的,这就好像在练习射箭时,拿一只会动的兔子当靶子:

图1.5 DQN中的Q网络和Q-T网络

固定Q目标做的就是让这个Q在一段时间内保持不变,隔一段时间再去拷贝这个参数即可。

强化学习的伪代码：

图1.6 DQN的伪代码程序

先来逐行解读一下伪代码：

第1行：算法名称----带有经验回放的DQN算法。

第2行：初始化经验池以及容量N。

第3行：以一个随机权重，初始化动作-价值函数 Q。

第4行：开始一个一级循环（就是一个大循环），循环的条件是回合数，满足回合方可跳出。

第5行：初始化回合的第一个状态s1 ,预处理得到状态对应的特征输入。

第6行：从该回合的第一步出发，进行循环T步才结束。

第7行：用随机概率epsilon选择一个动作at（在代码中这里是比较变量和epsilon大小）。

第8行：否则，选择上一次的最大Q值对应的at作为本次动作。（注意，这里选最大动作时用到的值函数网络与逼近值函数所用的网络是一个网络，在代码中就是用的同一个类来实例化两个网络）上边的这两行，其实就是执行贪婪策略。

第9行：在仿真环境中执行动作at，并获取奖励rt和下一个状态xt+1（下一帧图像信息xt+1）。

第10行：更新环境状态，和权重参数等。

第11行：在经验池中存储刚才的一组数据。

第12行：从经验池中取样一个batch（这个批量的大小是可以自己设置的）

第13行：进行判断，如果还没到达最终条件，根据迭代公式计算Q值；如果到达，以最后一次奖励作为本次的Q-T网络目标值。

第14行：针对Q-Target（目标函数）和Q值函数之差的Loss，运用梯度下降策略去求解最优。一般是每隔C步更新一次TD目标网络权值。

第15行：完成一个回合之后跳出循环。

第16行：完成所有回合之后跳出循环。

图1.7 DQN算法代码实现（按照代码板块划分）

结合上边的伪代码流程，大概解释一下这个图的编程顺序和运行流程。先建立一个经验池，方便注入数据和取样数据。建立一个类，以这个类初始化Q和Q-T网络，定期更换Q-T的权重参数。再编写loss函数，取样函数等，别忘了还要初始化env（仿真环境）。

运行的流程就是：Q网络根据随机初始化的权重，进行动作价值预测，选择一个价值最大的进行执行，获得环境的反馈之后，将环境反馈的经验放到经验池中。（随着池子容量越多，经验回放的优势逐渐凸显），随机抽取经验样本，放入DQN网络（Q预测和Q-T网络）中进行计算，由于经验回放的样本是随机抽取的，因此，DQN计算的结果更加有效。由于这两个网络的参数权重没有实时同步，因此同样的经验样本喂入，会存在差值，将计算的结果和Q预测的结果做差，得到Loss函数。只要不断的用梯度下降策略，就能减小Loss函数，带来的是权重参数的改变，将这个更新后的参数放入Q网络，就可以实现Q的优化。

纸上得来终觉浅，还是需要多看视频去多思考。

（三）DQN代码实现

编程思路：


#先来从头看一下DQN算法的伪代码
#1.初始化一下经验池
#2.初始化动作价值Q函数的随机权重
#3.用Q*初始化目标动作价值函数，2和3中的价值函数的差值，就是loss值，衡量算法是否优秀的标准
#4.接下来是两个大的循环，第一个循环是指需要进行多少局（回合），第二个循环是指每个循环需要经历多少步
#{第一个循环：
#    初始化状态序列
#    {
#    第二个循环内容
#    1.1以随机概率epsilon选择随机a动作
#    1.2否则按照最佳Q值对应的a执行操作
#    2.1执行动作与环境进行交互，得到奖励和获得下一步状态
#    2.2进行一个状态转移，然后把学习到的经验放到经验池中
#    2.3不断从经验池中去取出经验进行运算，帮助训练，指导下一步动作
#    2.4.1游戏结束的话，就得到一个奖励
#    2.4.2游戏没有结束的话，按照TDerror 的公式 去更新Q值
#    2.5通过梯度下降，更新算法的大脑参数
#    2.6过了C步之后，将Qnetwork和Qtargetwork做一个同步。
#    }
# }
###编程代码：先大致构建出伪代码，模块化编程，逐步细化###

本程序一共只有两个文件，一个是main文件，另一个是agent文件（都是.py文件）

main.py代码

import random

import gym
#导入游戏库
import numpy as np
import torch
import torch.nn as nn

from agent import Agent


env = gym.make("CartPole-v1")
#创建一个游戏环境
s=env.reset()#初始化游戏，返回一组观测值，s是一个向量
n_state=len(s)#这里是输入的个数
n_action=env.action_space#这里是输出的动作对应状态

EPSILON_DECAY=10000#假设可以衰减10000次

EPSILON_START=1.0#探索率从1开始衰减
EPSILON_END=0.02#探索率的最低值
n_episode=5000
#假设玩5000句
n_time_step=1000
#假设每局1000步
agent=Agent(n_input=n_state,n_output=n_action)
#实例化一个对象
TARGET_UPDATE_FREQUENCY=10
#q_target和q网络的同步频率为10，即10局更新一次
REWARD_BUFFER=np.empty(shape=n_episode)

for episode_i in range(n_episode):
    for step_i in range(n_time_step):
        episode_reward = 0#奖励值从0开始
        epsilon = np.interp(episode_i * n_time_step+step_i,[0,EPSILON_DECAY],[EPSILON_START,EPSILON_END])#现在开始初始化探索率，探索率随着时间递减，最后保持不变
        random_sample=random.random()#表示从0到1之间随机取一个数

        if random_sample<=epsilon:
            a=env.action_space.sample()
        else:
            a=agent.online_net.action(s)#TODO

        s_,r,done,info = env.step(a)
        agent.memeo.add_memo(s,a,r,done,s_)#TODO
        s=s_
        episode_reward+=r#每一个回合有一个累计奖励的过程

        if done:#判断本局是否结束
            s=env.reset()#如果结束，那就重置环境
            REWARD_BUFFER[episode_i]=episode_reward  #把这一句累加的回合奖励记录下来
            break
        batch_s,batch_a,batch_r,batch_done,bacth_s_=agent.memo.sample()#通过这样一个采样函数，将结果赋值给batch_S
        #计算targets
        target_q_values=agent.target_net(batch_s)#TODO
        max_target_q_values=target_q_values.max(dim=1,keepdim=True)[0]#得到最大的target数值
        targets=batch_r+agent.GAMMA *(1-batch_done)*max_target_q_values#这一步就是计算公式#TODO

        #计算q_values
        q_values=agent.online_net(batch_s)#给Q网络输入状态S，然后#TODO
        a_q_values=torch.gather(input=q_values,dim=1,index=batch_a)#思考一下为什么是选择第二列，还有序号为batch_a？
        #这一步做的是将所有的q_value给搜集起来，按顺序把各batch与对应各自的最大值q匹配起来放到一起。

        #计算loss函数
        loss=nn.functional.smooth_l1_loss(targets,a_q_values)#这下就求出了loss

        #计算梯度下降，来更新神经网络中的各个参数
        agent.optimizer.zero_grad()#TODO
        loss.backward()
        agent.optimizer.step()#通过这几步完成一次梯度下降#TODO

    if episode_i % TARGET_UPDATE_FREQUENCY==0:
        agent.target_net.load_state_dict (agent.online_net.state_dict())#这一步将online_net网络中的参数全部同步到target_net网络之中

        #观测每一个回合的奖励，看看训练的咋样了
        print("Episode:{}".format(episode_i))
        print("Avg.Reward:{}".format(np.mean(REWARD_BUFFER[:episode_i])))

agent.py代码

import random
import numpy as np
import torch
import torch.nn as nn #DQN中需要用到，torch中神经网络这个模块。
class Replaymemory():
    def __init__(self,n_s,n_a):
        self.n_s=n_s
        self.n_a=n_a
        self.MEMORY_SIZE=1000#经验池的大小
        self.BATCH_SIZE=64#每次批量的大小

        self.all_s=np.empty(shape=(self.MEMORY_SIZE,self.n_s),dtype=np.float32)
        #开辟一个空白空间，形状是2维的，与MEMORY_SIZE和n_s共同相关，n_s不一定清楚，且数据类型是32位的。
        self.all_a=np.random.randint(low=0,high=n_a,size=self.MEMORY_SIZE,dtype=np.uint8)
        # 这个游戏中，动作只有左和右两个状态，因此可以使用0和1代替,这里使用n_a变量，在赋值时令为2就可以。
        self.all_r=np.empty(self.MEMORY_SIZE,dtype=np.float32)
        #只是一维的存储空间，因为存储的只是每一局导出的数据。
        self.all_done = np.random.randint(low=0, high=2, size=self.MEMORY_SIZE, dtype=np.uint8)
        self.all_s_=np.empty(shape=(self.MEMORY_SIZE,self.n_s),dtype=np.float32)
        self.t_memo=0
        self.t_max=0#在这里做一个变量的标记
    #这一下子，上边就准备好了存储空间。后续直接进行调用就可以。#

    def add_memo(self,s,a,r,done,s_):
        #在这里对t_max进行一个判别

        self.all_s[self.t_memo]=s
        self.all_a[self.t_memo]=a
        self.aal_r[self.t_memo]=r
        self.all_done[self.t_memo]=done
        self.all_s_[self.t_memo]=s_
        self.t_max = max(self.t_memo, self.t_memo + 1)
        self.t_memo=(self.t_memo+1)%self.MEMORY_SIZE#检查是否超过1000，如果是第1001，那么取余之后，会放在第一个位置




    def sample(self):#经验池中，大于64个经验的话，随机取64个，小于64个的话，有几个取几个。
        if self.t_max>self.BATCH_SIZE:
            idxes = random.sample(range(0,self.t_max), self.BATCH_SIZE)  # 从经验池空间的序号中，随机选择64个序号
        else:
            idxes=range(0,self.t_max)
        batch_s=[]
        batch_a=[]
        batch_r=[]
        batch_done=[]
        batch_s_=[]
        for idx in idxes:#遍历前面的随机取出的64个数据，装载到batch_s这边的5个类型数据中
            batch_s.append(self.all_s[idx])
            batch_a.append(self.all_a[idx])
            batch_r.append(self.all_r[idx])
            batch_done.append(self.all_done[idx])
            batch_s_.append(self.all_s_[idx])
            #torch识别不了numpy，所以需要把numpy转化成torch。
        batch_s_tensor=torch.as_tensor(np.asarray(batch_s),dtype=torch.float32)
        batch_a_tensor = torch.as_tensor(np.asarray(batch_a), dtype=torch.int64).unsqueeze(-1)#最后一句是升维
        batch_r_tensor = torch.as_tensor(np.asarray(batch_r), dtype=torch.float32).unsqueeze(-1)
        batch_done_tensor = torch.as_tensor(np.asarray(batch_done), dtype=torch.float32).unsqueeze(-1)
        batch_s__tensor = torch.as_tensor(np.asarray(batch_s_), dtype=torch.float32)

        return batch_s_tensor,batch_a_tensor,batch_r_tensor,batch_done_tensor,batch_s__tensor


class DQN(nn.Module):
    def __init__(self,n_input,n_output):
        super().init()

        self.net=nn.Sequential(
            nn.Linear(in_features=n_input,out_features=88)
            nn.Tanh()
            nn.Linear(in_features=88,out_features=n_output)
       )
    def forward(self,x):#前向传播函数
        return self.net(x)

    def act(self,obs):#得到输出的动作
        obs_tensor=torch.as_tensor(obs,dtype=torch.float32)#先将数据转化成torch格式
        q_value = self(obs_tensor.unsqueeze(0))#把他转化成行向量
        max_q_idx=torch.argmax(input=q_value)#然后求他最大的q_value对应的序号
        action = max_q_idx.detach().item()#找到这个序号对应的action
        return action#把这个序号对应的操作返回给主程序，执行对应操作。

class Agent:
    def __init__(self,n_input,n_output):#在这里定义一下需要的输入和输出数量
        self.n_input=n_input
        self.n_output=n_output

        self.GAMA=0.99#这里衰减因子设置为0.99
        self.learning_rate=1e-3#这里设置的学习率
        self.memo=Replaymemory(self.n_input,self.n_output)#TODO,这里是要补充经验池
        self.online_net= DQN(self.n_input,self.n_output)       #TODO 这里是在线训练网络,这两步操作都叫做实例化
        self.target_net= DQN(self.n_input,self.n_output)       #TODO 这里是目标训练网络

        self.optimizer= torch.optim.Adam(self.online_net.parameters(),lr=self.learning_rate)#TODO 这里是优化器，优化这个网络参数

这样子差不多就结束了，代码可以跑起来，不过要注意版本兼容的问题，最开始版本太新了，导致一直报错。觉得还是需要多实践，多看看代码。

最后，在评论区奉上一个完整的DQN详细标注的完整代码文件，pycharm打开之后可以直接运行。

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Goolge earth studio 进阶4——路径修改与平滑陟彼高冈yu Google earth studio 进阶教程旅游
如果我们希望在大约中途时获得更多的城市鸟瞰视角。可以将相机拖动到这里并创建一个新的关键帧。camera_target_clip_7EarthStudio会自动平滑我们的路径，所以当我们通过这个关键帧时，不是一个生硬的角度，而是一个平滑的曲线。camera_target_clip_8路径上有贝塞尔控制手柄，允许我们调整路径的形状。右键单击，我们可以选择“平滑路径”，这是默认的自动平滑算法，或者我们可
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
基于社交网络算法优化的二维最大熵图像分割智能算法研学社（Jack旭）智能优化算法应用图像分割算法 php 开发语言
智能优化算法应用：基于社交网络优化的二维最大熵图像阈值分割-附代码文章目录智能优化算法应用：基于社交网络优化的二维最大熵图像阈值分割-附代码1.前言2.二维最大熵阈值分割原理3.基于社交网络优化的多阈值分割4.算法结果：5.参考文献：6.Matlab代码摘要：本文介绍基于最大熵的图像分割，并且应用社交网络算法进行阈值寻优。1.前言阅读此文章前，请阅读《图像分割：直方图区域划分及信息统计介绍》htt
探索OpenAI和LangChain的适配器集成：轻松切换模型提供商 nseejrukjhad langchain easyui 前端 python
#探索OpenAI和LangChain的适配器集成：轻松切换模型提供商##引言在人工智能和自然语言处理的世界中，OpenAI的模型提供了强大的能力。然而，随着技术的发展，许多人开始探索其他模型以满足特定需求。LangChain作为一个强大的工具，集成了多种模型提供商，通过提供适配器，简化了不同模型之间的转换。本篇文章将介绍如何使用LangChain的适配器与OpenAI集成，以便轻松切换模型提供商
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
深入理解 MultiQueryRetriever：提升向量数据库检索效果的强大工具 nseejrukjhad 数据库 python
深入理解MultiQueryRetriever：提升向量数据库检索效果的强大工具引言在人工智能和自然语言处理领域，高效准确的信息检索一直是一个关键挑战。传统的基于距离的向量数据库检索方法虽然广泛应用，但仍存在一些局限性。本文将介绍一种创新的解决方案：MultiQueryRetriever，它通过自动生成多个查询视角来增强检索效果，提高结果的相关性和多样性。MultiQueryRetriever的工
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
121. 买卖股票的最佳时机薄荷糖的味道_fb40
给定一个数组，它的第i个元素是一支给定股票第i天的价格。如果你最多只允许完成一笔交易（即买入和卖出一支股票），设计一个算法来计算你所能获取的最大利润。注意你不能在买入股票前卖出股票。示例1:输入:[7,1,5,3,6,4]输出:5解释:在第2天（股票价格=1）的时候买入，在第5天（股票价格=6）的时候卖出，最大利润=6-1=5。注意利润不能是7-1=6,因为卖出价格需要大于买入价格。示例2:输入:
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
回溯算法-重新安排行程 chirou_ 算法数据结构图论 c++图搜索
leetcode332.重新安排行程这题我还没自己ac过，只能现在凭着刚学完的热乎劲把我对题解的理解记下来。本题我认为对数据结构的考察比较多，用什么数据结构去存数据，去读取数据，都是很重要的。classSolution{private:unordered_map>targets;boolbacktracking(intticketNum,vector&result){//1.确定参数和返回值//2
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
Faiss：高效相似性搜索与聚类的利器网络·魚大数据 faiss
Faiss是一个针对大规模向量集合的相似性搜索库，由FacebookAIResearch开发。它提供了一系列高效的算法和数据结构，用于加速向量之间的相似性搜索，特别是在大规模数据集上。本文将介绍Faiss的原理、核心功能以及如何在实际项目中使用它。Faiss原理：近似最近邻搜索：Faiss的核心功能之一是近似最近邻搜索，它能够高效地在大规模数据集中找到与给定查询向量最相似的向量。这种搜索是近似的，
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
Java实现的基于模板的网页结构化信息精准抽取组件：HtmlExtractor yangshangchuan 信息抽取 HtmlExtractor 精准抽取信息采集
HtmlExtractor是一个Java实现的基于模板的网页结构化信息精准抽取组件，本身并不包含爬虫功能，但可被爬虫或其他程序调用以便更精准地对网页结构化信息进行抽取。 HtmlExtractor是为大规模分布式环境设计的，采用主从架构，主节点负责维护抽取规则，从节点向主节点请求抽取规则，当抽取规则发生变化，主节点主动通知从节点，从而能实现抽取规则变化之后的实时动态生效。如
java编程思想 -- 多态百合不是茶 java 多态详解
一: 向上转型和向下转型面向对象中的转型只会发生在有继承关系的子类和父类中（接口的实现也包括在这里）。父类：人子类：男人向上转型： Person p = new Man() ; //向上转型不需要强制类型转化向下转型： Man man =
[自动数据处理]稳扎稳打,逐步形成自有ADP系统体系 comsci dp
对于国内的IT行业来讲,虽然我们已经有了"两弹一星",在局部领域形成了自己独有的技术特征,并初步摆脱了国外的控制...但是前面的路还很长.... 首先是我们的自动数据处理系统还无法处理很多高级工程...中等规模的拓扑分析系统也没有完成,更加复杂的
storm 自定义日志文件商人shang storm cluster logback
Storm中的日志级级别默认为INFO，并且，日志文件是根据worker号来进行区分的，这样，同一个log文件中的信息不一定是一个业务的，这样就会有以下两个需求出现： 1. 想要进行一些调试信息的输出 2. 调试信息或者业务日志信息想要输出到一些固定的文件中不要怕，不要烦恼，其实Storm已经提供了这样的支持，可以通过自定义logback 下的 cluster.xml 来输
Extjs3 SpringMVC使用 @RequestBody 标签问题记录 21jhf
springMVC使用 @RequestBody(required = false) UserVO userInfo 传递json对象数据，往往会出现http 415，400,500等错误，总结一下需要使用ajax提交json数据才行，ajax提交使用proxy，参数为jsonData，不能为params；另外，需要设置Content-type属性为json，代码如下：（由于使用了父类aaa
一些排错方法文强chu 方法
1、java.lang.IllegalStateException: Class invariant violation at org.apache.log4j.LogManager.getLoggerRepository(LogManager.java:199)at org.apache.log4j.LogManager.getLogger(LogManager.java:228) at o
Swing中文件恢复我觉得很难小桔子 swing
我那个草了！老大怎么回事，怎么做项目评估的？只会说相信你可以做的，试一下，有的是时间！用java开发一个图文处理工具，类似word，任意位置插入、拖动、删除图片以及文本等。文本框、流程图等，数据保存数据库，其余可保存pdf格式。ok,姐姐千辛万苦，
php 文件操作 aichenglong PHP 读取文件写入文件
1 写入文件 @$fp=fopen("$DOCUMENT_ROOT/order.txt", "ab"); if(!$fp){ echo "open file error" ; exit; } $outputstring="date:"." \t tire:".$tire."
MySQL的btree索引和hash索引的区别 AILIKES 数据结构 mysql 算法
Hash 索引结构的特殊性，其检索效率非常高，索引的检索可以一次定位，不像B-Tree 索引需要从根节点到枝节点，最后才能访问到页节点这样多次的IO访问，所以 Hash 索引的查询效率要远高于 B-Tree 索引。可能很多人又有疑问了，既然 Hash 索引的效率要比 B-Tree 高很多，为什么大家不都用 Hash 索引而还要使用 B-Tree 索引呢
JAVA的抽象--- 接口 --实现百合不是茶
抽象接口实现接口 //抽象类 ,方法 //定义一个公共抽象的类 ,并在类中定义一个抽象的方法体抽象的定义使用abstract abstract class A 定义一个抽象类例如： //定义一个基类 public abstract class A{ //抽象类不能用来实例化，只能用来继承 //
JS变量作用域实例 bijian1013 作用域
<script> var scope='hello'; function a(){ console.log(scope); //undefined var scope='world'; console.log(scope); //world console.log(b);
TDD实践（二） bijian1013 java TDD
实践题目：分解质因数 Step1：单元测试： package com.bijian.study.factor.test; import java.util.Arrays; import junit.framework.Assert; import org.junit.Before; import org.junit.Test; import com.bijian.
[MongoDB学习笔记一]MongoDB主从复制 bit1129 mongodb
MongoDB称为分布式数据库，主要原因是1.基于副本集的数据备份， 2.基于切片的数据扩容。副本集解决数据的读写性能问题，切片解决了MongoDB的数据扩容问题。事实上，MongoDB提供了主从复制和副本复制两种备份方式，在MongoDB的主从复制和副本复制集群环境中，只有一台作为主服务器，另外一台或者多台服务器作为从服务器。本文介绍MongoDB的主从复制模式，需要指明
【HBase五】Java API操作HBase bit1129 hbase
import java.io.IOException; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.hbase.HBaseConfiguration; import org.apache.hadoop.hbase.HColumnDescriptor; import org.apache.ha
python调用zabbix api接口实时展示数据 ronin47
zabbix api接口来进行展示。经过思考之后，计划获取如下内容： 1、获得认证密钥 2、获取zabbix所有的主机组 3、获取单个组下的所有主机 4、获取某个主机下的所有监控项
jsp取得绝对路径 byalias 绝对路径
在JavaWeb开发中，常使用绝对路径的方式来引入JavaScript和CSS文件，这样可以避免因为目录变动导致引入文件找不到的情况，常用的做法如下：一、使用${pageContext.request.contextPath} 　　代码” ${pageContext.request.contextPath}”的作用是取出部署的应用程序名，这样不管如何部署，所用路径都是正确的。
Java定时任务调度：用ExecutorService取代Timer bylijinnan java
《Java并发编程实战》一书提到的用ExecutorService取代Java Timer有几个理由，我认为其中最重要的理由是：如果TimerTask抛出未检查的异常，Timer将会产生无法预料的行为。Timer线程并不捕获异常，所以 TimerTask抛出的未检查的异常会终止timer线程。这种情况下，Timer也不会再重新恢复线程的执行了;它错误的认为整个Timer都被取消了。此时，已经被
SQL 优化原则 chicony sql
一、问题的提出　在应用系统开发初期，由于开发数据库数据比较少，对于查询SQL语句，复杂视图的的编写等体会不出SQL语句各种写法的性能优劣，但是如果将应用系统提交实际应用后，随着数据库中数据的增加，系统的响应速度就成为目前系统需要解决的最主要的问题之一。系统优化中一个很重要的方面就是SQL语句的优化。对于海量数据，劣质SQL语句和优质SQL语句之间的速度差别可以达到上百倍，可见对于一个系统
java 线程弹球小游戏 CrazyMizzz java 游戏
最近java学到线程，于是做了一个线程弹球的小游戏，不过还没完善这里是提纲 1.线程弹球游戏实现 1.实现界面需要使用哪些API类 JFrame JPanel JButton FlowLayout Graphics2D Thread Color ActionListener ActionEvent MouseListener Mouse
hadoop jps出现process information unavailable提示解决办法 daizj hadoop jps
hadoop jps出现process information unavailable提示解决办法 jps时出现如下信息： 3019 -- process information unavailable3053 -- process information unavailable2985 -- process information unavailable2917 --
PHP图片水印缩放类实现 dcj3sjt126com PHP
<?php class Image{ private $path; function __construct($path='./'){ $this->path=rtrim($path,'/').'/'; } //水印函数，参数：背景图，水印图，位置，前缀,TMD透明度 public function water($b,$l,$pos
IOS控件学习：UILabel常用属性与用法 dcj3sjt126com ios UILabel
参考网站： http://shijue.me/show_text/521c396a8ddf876566000007 http://www.tuicool.com/articles/zquENb http://blog.csdn.net/a451493485/article/details/9454695 http://wiki.eoe.cn/page/iOS_pptl_artile_281
完全手动建立maven骨架 eksliang java eclipse Web
建一个 JAVA 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=App [-Dversion=0.0.1-SNAPSHOT] [-Dpackaging=jar] 建一个 web 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=web-a
配置清单 gengzg 配置
1、修改grub启动的内核版本 vi /boot/grub/grub.conf 将default 0改为1 拷贝mt7601Usta.ko到/lib文件夹拷贝RT2870STA.dat到 /etc/Wireless/RT2870STA/文件夹拷贝wifiscan到bin文件夹，chmod 775 /bin/wifiscan 拷贝wifiget.sh到bin文件夹，chm
Windows端口被占用处理方法 huqiji windows
以下文章主要以80端口号为例，如果想知道其他的端口号也可以使用该方法..........................1、在windows下如何查看80端口占用情况?是被哪个进程占用?如何终止等. 这里主要是用到windows下的DOS工具,点击"开始"--"运行",输入&
开源ckplayer 网页播放器，跨平台(html5, mobile)，flv, f4v, mp4, rtmp协议. webm, ogg, m3u8 ！天梯梦 mobile
CKplayer，其全称为超酷flv播放器，它是一款用于网页上播放视频的软件，支持的格式有：http协议上的flv,f4v,mp4格式，同时支持rtmp视频流格式播放，此播放器的特点在于用户可以自己定义播放器的风格，诸如播放/暂停按钮，静音按钮，全屏按钮都是以外部图片接口形式调用，用户根据自己的需要制作出播放器风格所需要使用的各个按钮图片然后替换掉原始风格里相应的图片就可以制作出自己的风格了，
简单工厂设计模式 hm4123660 java 工厂设计模式简单工厂模式
简单工厂模式（Simple Factory Pattern）属于类的创新型模式，又叫静态工厂方法模式。是通过专门定义一个类来负责创建其他类的实例，被创建的实例通常都具有共同的父类。简单工厂模式是由一个工厂对象决定创建出哪一种产品类的实例。简单工厂模式是工厂模式家族中最简单实用的模式，可以理解为是不同工厂模式的一个特殊实现。
maven笔记 zhb8015 maven
跳过测试阶段： mvn package -DskipTests 临时性跳过测试代码的编译： mvn package -Dmaven.test.skip=true maven.test.skip同时控制maven-compiler-plugin和maven-surefire-plugin两个插件的行为，即跳过编译，又跳过测试。指定测试类 mvn test
非mapreduce生成Hfile，然后导入hbase当中 Stark_Summer map hbase reduce Hfile path实例
最近一个群友的boss让研究hbase，让hbase的入库速度达到5w+/s，这可愁死了，4台个人电脑组成的集群，多线程入库调了好久，速度也才1w左右，都没有达到理想的那种速度，然后就想到了这种方式，但是网上多是用mapreduce来实现入库，而现在的需求是实时入库，不生成文件了，所以就只能自己用代码实现了，但是网上查了很多资料都没有查到，最后在一个网友的指引下，看了源码，最后找到了生成Hfile
jsp web tomcat 编码问题王新春 tomcat jsp pageEncode
今天配置jsp项目在tomcat上，windows上正常，而linux上显示乱码，最后定位原因为tomcat 的server.xml 文件的配置，添加 URIEncoding 属性： <Connector port="8080" protocol="HTTP/1.1" connectionTi