prince of persiaV5

强化学习代码实操和讲解（一）

强化学习代码实操

写在最前面
- 总体思路
- 背景介绍
- 重点代码解析
- - 环境设置
  - reset函数设置
  - act函数设置
  - step函数
- 杂项代码解析
- - simulate函数
  - figure_2_2：对比ε的作用
  - figure_2_3：对比乐观初始值的作用
  - figure_2_4：基于UCB的动作选择的效果
  - figure_2_5：梯度赌博机和是否使用baseline的结果对比
- 总结

写在最前面

本人本科生，为了大创项目在老师的帮助下自学强化学习和深度学习等知识，目前听过了David Silver和周博磊等大牛的课程，对于强化学习的基础知识有了一定的了解，但是上升到打代码上却依然一头雾水，不知道从何写起，因而我从GitHub上面找到了一些感觉很好的练习示例项目，大多数源自《Reinforcement Learning: An introduction》一书，来进行赏析学习。这是原项目地址。里面基本分了章节进行了排布，部分代码有注释，但是没有注释的一部分我对着书研究了一段时间。因而这一系列的文章既是学习过程的记录，也是对自己的一种鞭策。本博客跳过了原书第一章的导论部分，从第二章的多臂赌博机开始。

总体思路

我在接下来的文章中主要用以下思路进行排布：
1.对代码所在的章节背景进行一个简介
2.对重点代码进行赏析解释
3.结合理论对代码进行复盘
4.对学习内容进行总结
希望我能够坚持到底，希望各位看到这篇文章的有缘人也能指出我的不成熟看法并且给些建议。

那接下来让我们开始吧！

背景介绍

k臂赌博机是本书中十分经典的一个模型，在此模型之下没有状态（state）的差异，我们仅仅需要关心我们拉哪个臂的动作（action）。另外，k臂赌博机有动作的真实价值，动作的真实价值从一个均值为0，方差为1的标准正态分布中选择，而实际选择某个动作时，我们所收获的实际收益（return）又是以每个动作的真实价值为均值的方差为1的标准正态分布（整体结构如图所示）。我一开始不明白这个环境的不确定性在哪里，后来才发现实际收益是真实价值基础上的一个分布，并不是确定值（不然也不能算赌博机）。

def figure_2_1():   #绘制下图回报分布的代码
    plt.violinplot(dataset=np.random.randn(200, 10) + np.random.randn(10))
    plt.xlabel("Action")
    plt.ylabel("Reward distribution")
    plt.savefig('figure_2_1.png')
    plt.close()

接下来我们将根据书上的描述对一个赌博机进行1000时刻的交互，以评估性能和动作，这将构成一轮的试验。我们再用2000个不同的赌博机（价值、收益不同）完成2000次独立重复实验，从而获得对一个学习算法平均表现的评估。

重点代码解析

我们将在k臂赌博机的环境下实验 $ε$ -贪心方法再不同 $ε$ 下的训练情况，赌博机简单的增量式实现，乐观初始值的应用，基于置信度上界（UCB）的动作选择以及梯度赌博机算法。基本涵盖了第二章所有有关实操的知识，让我们来逐步分析。

环境设置

import matplotlib.pyplot as plt
import matplotlib
import numpy as np
from tqdm import trange

matplotlib.use('TkAgg') 
class Bandit:
    def __init__(self,k_arm=10,epsilon=0.,initial=0.,step_size=0.1,sample_average=False,UCB_parameter=None,gradient=False,gradient_baseline=False,true_reward=0.):
        self.k=k_arm   #设定赌博机臂数
        self.step_size=step_size   #设定更新步长
        self.sample_average=sample_average   #bool变量，表示是否使用简单增量式算法
        self.indices=np.arange(self.k)   #创建动作索引（和赌博机臂数长度相同）
        self.time=0   #计算所有选取动作的数量，为UCB做准备
        self.UCB_parameter=UCB_parameter   #如果设定了UCB的参数c，就会在下面使用UCB算法
        self.gradient=gradient   #bool变量，表示是否使用梯度赌博机算法
        self.gradient_baseline=gradient_baseline   #设定梯度赌博机算法中的基准项（baseline），通常都用时刻t内的平均收益表示
        self.average_reward=0   #用于存储baseline所需的平均收益
        self.true_reward=true_reward   #存储一个赌博机的真实收益均值，为下面制作一个赌博机的真实价值函数做准备
        self.epsilon=epsilon   #设定epsilon-贪婪算法的参数
        self.initial=initial   #设定初始价值估计，如果调高就是乐观初始值

首先肯定是引入一些环境，主要是matplotlib和numpy包，下面的tqdm主要是用来在实际训练过程中打印进度条的。
接下来就是创建bandit类并且初始化一些变量。所有步骤的含义我都写在了代码块里，要特别注意的是本类涵盖了第二章里的多个任务，所以需要添加一些变量来指示接下来要完成哪个任务，这块代码里的主要难点就是许多不同任务中需要的参量混杂在一起，给理解上带来困难。
接下来就是agent与环境交互和学习的主要部分，大概由以下三个部分组成：
1.reset：在一幕（episode）结束后重置状态以及各项参数；
2.act：agent根据自己的策略选择行动的部分
3.step：环境接受agent的动作并返回return，同时在内部维护一个Q函数，为agent的下一步选择做好准备
之所以要在这里强调这三个部分，是因为这是强化学习编程中的一个很好的分块思想，之后的代码实操很多都是按照这样的思路进行的。

reset函数设置

def reset(self):   #初始化训练状态，设定真实收益和最佳行动状态
        self.q_true=np.random.randn(self.k)+self.true_reward   #设定真实价值函数，在一个标准高斯分布上抬高一个外部设定的true_reward，true_reward设置为非0数字以和不使用baseline的方法相区分
        self.q_estimation=np.zeros(self.k)+self.initial    #设定初始估计值，在全0的基础上用initial垫高，表现乐观初始值
        self.action_count=np.zeros(self.k)   #计算每个动作被选取的数量，为UCB做准备
        self.best_action=np.argmax(self.q_true)   #根据真实价值函数选择最佳策略，为之后做准备
        self.time=0   #设定时间步t为0

我把每一步的具体含义也打在代码中了，值得注意的是其中true_reward的用意，我是根据上下文才推测出来的，由于之后要对比使用和不使用baseline的训练效果，而真实价值是一个标准正态分布，这就导致它回报的平均值会接近0，即baseline接近0，这和不使用baseline的效果是类似的，所以在对比baseline效果的实验中我们通过true_reward把真实价值垫高。

act函数设置

def act(self):
        if np.random.rand()<self.epsilon:
            return np.random.choice(self.indices)   #以epsilon的几率随机选择动作
        if self.UCB_parameter is not None:   #当有设置UCB的参数时，使用基于UCB的动作选择
            UCB_estimation=self.q_estimation+self.UCB_parameter*np.sqrt(np.log(self.time+1)/(self.action_count+1e-5))   #预测值更新函数
            q_best=np.max(UCB_estimation)   #选择不同动作导致的预测值中最大的
            return np.random.choice(np.where(UCB_estimation==q_best)[0])   #返回基于UCB的动作选择下值最大的动作
        if self.gradient:   #如果使用梯度赌博机算法
            exp_est=np.exp(self.q_estimation)   
            self.action_prob=exp_est/np.sum(exp_est)   #以上两步按照softmax分布确定动作概率
            return np.random.choice(self.indices,p=self.action_prob)   #按概率选择执行动作
        q_best=np.max(self.q_estimation)   #如果不使用以上的其他方法，则使用贪心算法，与第一步构成epsilon-贪心算法
        return np.random.choice(np.where(self.q_estimation==q_best)[0])   #执行估计值最大的动作

基本上每一步的用意我也写在了代码中，这一段完成了三个任务，第一是 $ε$ -greedy算法，第二是基于UCB的动作选择，第三是梯度赌博机算法。每一步都比较严格地按照树上的流程来编写，如果对照书本应该可以很快看懂。

step函数

def step(self,action):
        reward=np.random.rand()+self.q_true[action]   #奖励是以真实值为平均的正态分布
        self.time+=1   #总行动数量+1
        self.action_count[action]+=1   #某个行动的行动数量+1
        self.average_reward+=(reward-self.average_reward)/self.time   #计算平均回报（return），为baseline做好准备
        
        if self.sample_average:   #如果使用增量式实现
            self.q_estimation[action]+=(reward-self.q_estimation[action])/self.action_count[action]   #用采样数据来更新行动价值（赌博机实验中只有一个状态，所以只更新行动价值）
        elif self.gradient:   #如果使用梯度赌博机
            one_hot=np.zeros(self.k)
            one_hot[action]=1   #把应该采取的行动概率置为1
            if self.gradient_baseline:   #在梯度赌博机上使用baseline
                baseline=self.average_reward   #平均收益天生就是一个良好的baseline
            else:
                baseline=0   #这里不使用baseline的话baseline就设置为0，如果上面的q_true不用true_reward抬高的话就没办法区分有没有使用baseline了
            self.q_estimation+=self.step_size*(reward-baseline)*(one_hot-self.action_prob)   #梯度赌博机更新状态价值估计
        else:
            self.q_estimation[action]+=self.step_size*(reward-self.q_estimation[action])   #使用固定步长更新状态价值
        return reward

step函数的任务是接受agent动作，根据agent选择的方法更新价值函数估计，并返回reward以进行平均reward的计算。其他代码解释我都已经打在注释中，值得注意我在baseline=0处的注释与上面true_reward参量的用意相呼应。

杂项代码解析

以上三个函数构成了bandit类，接下来的函数就是调用bandit类来进行模拟、计算和绘图。其中simulate函数用来进行循环实验并返回不同策略指导下赌博机的平均回报和做出最佳选择的概率，剩余的figure函数对应于我们需要的不同实验图像。

simulate函数

def simulate(runs,time,bandits):
    rewards=np.zeros((len(bandits),runs,time))   #接收不同赌博机每一轮每一步的回报，方便制成平均回报来画图以对比算法
    best_action_count=np.zeros(rewards.shape)   #计算选择到最佳动作的数量，为算法对比做准备
    for i,bandits in enumerate(bandits):   #开始对每个选择不同算法和参数的赌博机进行循环
        for r in trange(runs):   #对runs个不同的赌博机（算法和超参数相同，奖励分布不同）进行独立实验
            bandits.reset()
            for t in range(time):   #对每个赌博机进行time次实验
                action=bandits.act()   #赌博机选择动作
                reward=bandits.step(action)   #返回每个动作的reward
                rewards[i,r,t]=reward   #把reward放到相应的索引位置方便之后对比
                if action==bandits.best_action:  
                    best_action_count[i,r,t]=1   #当赌博机选到最佳动作时+1（最佳动作在赌博机初始化的时候就已经得到）
    mean_best_action_counts=best_action_count.mean(axis=1)   #计算每个赌博机平均选到最佳动作的概率
    mean_rewards=rewards.mean(axis=1)   #计算每个赌博机收到的平均回报
    return mean_best_action_counts,mean_rewards

书上的没有这一块循环的直接展示，这里由三个循环，第一个循环是有对不同参数设置的赌博机进行循环，不同参数的赌博机对应不同的算法；第二个循环是创建runs个有着相同超参数但是不同奖励分布的赌博机进行循环；第三个循环是对每个赌博机进行time步实验，在其中进行实际的act与回报计算。最后返回每个赌博机选到最佳动作的概率和每个赌博机的平均回报，即选择不同计算策略和不同参数赌博机的表现，方便后面画图对比。

figure_2_2：对比ε的作用

def figure_2_2(runs=2000, time=1000):    #对比不同epsilon下的训练情况
    epsilons = [0, 0.1, 0.01]
    bandits = [Bandit(epsilon=eps, sample_average=True) for eps in epsilons]   #这里用了一个list存储了三个相同参数的赌博机（除了epsilon），方便下面迭代对比
    best_action_counts, rewards = simulate(runs, time, bandits)

    plt.figure(figsize=(10, 20))

    plt.subplot(2, 1, 1)
    for eps, rewards in zip(epsilons, rewards):
        plt.plot(rewards, label='epsilon = %.02f' % (eps))
    plt.xlabel('steps')
    plt.ylabel('average reward')
    plt.legend()   #绘制三个赌博机在epsilon不同的情况下的平均奖励对比图

    plt.subplot(2, 1, 2)
    for eps, counts in zip(epsilons, best_action_counts):
        plt.plot(counts, label='epsilon = %.02f' % (eps))
    plt.xlabel('steps')
    plt.ylabel('% optimal action')
    plt.legend()

    plt.savefig('figure_2_2.png')
    plt.close()   #绘制三个赌博机在epsilon不同的情况下最佳动作选择百分比的对比图

第一个绘图函数绘制了在 $ε$ 分别为0，0.1，0.01下贪心算法的实验情况，使用了增量式算法，对比了它们的平均收益和最佳动作的百分比。如图所示。

上图显示平均收益随着经验的增长而增长。根据教材上的说法，贪心方法（ $ε$ =0）在最初长得略快些，但最后稳定在一个较低的水平。从长远看，完全贪心的算法无论在何层面上表现都很糟糕，下图表示它只在15%的情况下会选择最好的动作，实际上这和乱猜的情况十分接近，因为贪心算法没法跳出来选择其他策略。 $ε$ =0.1时试探得最多因而它能够有表现的快速增长，但是它选择最优动作的概率不会超过91%，因为它要在 $ε$ =0.1的情况下试探。虽然 $ε$ =0.01时改善较慢，但是它最终的表现会超过 $ε$ =0.1的情况。

figure_2_3：对比乐观初始值的作用

def figure_2_3(runs=2000, time=1000):   #对比乐观初始值的作用
    bandits = []
    bandits.append(Bandit(epsilon=0, initial=5, step_size=0.1))   
    bandits.append(Bandit(epsilon=0.1, initial=0, step_size=0.1))   #创建两个赌博机，一个使用乐观初始值5，但是不用epsilon-贪婪进行探索，一个不使用乐观初始值，但是用epsilon探索
    best_action_counts, _ = simulate(runs, time, bandits)

    plt.plot(best_action_counts[0], label='epsilon = 0, q = 5')
    plt.plot(best_action_counts[1], label='epsilon = 0.1, q = 0')
    plt.xlabel('Steps')
    plt.ylabel('% optimal action')
    plt.legend()

    plt.savefig('figure_2_3.png')
    plt.close()   #绘制两个赌博机最佳动作选择百分比的对比图

这里在一张图中展现了使用乐观初始值的探索和使用 $ε$ -贪婪的探索对比，可以发现乐观初始值的探索在初期拥有非常好的探索能力，但在后期逐渐被 $ε$ -贪婪的探索超越。如图所示。

可以非常清楚地看到乐观初始值初期的探索能力很强，但是在300步后趋于平稳，而 $ε$ -贪婪探索几乎保持线性增长。用书上的话说，就是过度乐观的估计会鼓励动作-价值方法去探索，但是无论哪种动作获得的收益都会让算法感到失望进而促进它不断探索。虽然这种办法在平稳问题中非常有效，但是它试探的驱动力天生是暂时的，所以运作的步数一多它就失去了探索性，趋于平缓。而且在非平稳问题中，比如任务发生了变化，对试探的需求变了，它就无法提供帮助。打个比方，乐观初始值就像“后浪”，在祖宗留下经验的领域（平稳问题）初期发展非常快，但是后期就十分疲软；当社会环境和行情发生变化时（非平稳问题），这种吃老本的方式就不如自我发展的方式（ε-贪婪）来的好。所以我们不应该过多地关注这种做法，书上在后面也没再用过这种方法。
p.s. 书上在这一块留下一个问题，为什么乐观初值在初期会有一个尖峰，本人还没想明白。

figure_2_4：基于UCB的动作选择的效果

def figure_2_4(runs=2000, time=1000):   #对比基于UCB的动作选择的作用
    bandits = []
    bandits.append(Bandit(epsilon=0, UCB_parameter=2, sample_average=True))   #创建一个使用基于UCB的动作选择的赌博机
    bandits.append(Bandit(epsilon=0.1, sample_average=True))   #创建一个基于epsilon-贪婪的赌博机
    _, average_rewards = simulate(runs, time, bandits)

    plt.plot(average_rewards[0], label='UCB c = 2')
    plt.plot(average_rewards[1], label='epsilon greedy epsilon = 0.1')
    plt.xlabel('Steps')
    plt.ylabel('Average reward')
    plt.legend()

    plt.savefig('figure_2_4.png')
    plt.close()   #绘制两个赌博机的平均收益

基于UCB的动作选择同样是一种试探方法，相较于 $ε$ -greedy这种充满随机性的动作选择，基于UCB的动作选择更具有一定的目的性。笼统来说，就是价值较低和被选过很多次的动作再次被选到的可能性会变低。两种试探方式的平均收益如图所示。

公式中t表示时刻，从侧面也反映了所有动作的总选择次数， $N_t(a)$ 则是在时刻t时动作a被选择的次数，c是大于0的常数，反映了置信水平。每次选择a时，根号内项的分子分母就会同时增大，但是分子上的增长速度大于分母，所以根号项总体会变小，使得再次选择动作a的价值变小；但是如果长时间不选动作a，这一项的价值又会变大，总体上呈现出试探长时间未尝试的动作的状态，相较于ε-贪婪具有更强的目的性。从上面的实验结果来看，基于UCB的动作选择方法表现良好。但是这种方法很难推广到更一般的强化学习问题，第一个困难是处理非平稳问题时这种方法会被改进地更加复杂，另一个困难是在大的状态空间中（特别是之后需要近似的问题中）这种方法很难有用武之地，因为这种方法本质上适合小规模离散问题（因为需要数数）。
p.s.这张图中基于UCB的方法在初期同样有一个尖峰，大伙可以想一想为什么。

figure_2_5：梯度赌博机和是否使用baseline的结果对比

def figure_2_5(runs=2000, time=1000):   #对比梯度赌博机中是否使用baseline的结果
    bandits = []
    bandits.append(Bandit(gradient=True, step_size=0.1, gradient_baseline=True, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.1, gradient_baseline=False, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.4, gradient_baseline=True, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.4, gradient_baseline=False, true_reward=4))   #创建四个赌博机，分别把α设置为两个0.1和两个0.4，其中一个使用baseline一个不使用
    best_action_counts, _ = simulate(runs, time, bandits)
    labels = ['alpha = 0.1, with baseline',
              'alpha = 0.1, without baseline',
              'alpha = 0.4, with baseline',
              'alpha = 0.4, without baseline']

    for i in range(len(bandits)):
        plt.plot(best_action_counts[i], label=labels[i])
    plt.xlabel('Steps')
    plt.ylabel('% Optimal action')
    plt.legend()

    plt.savefig('figure_2_5.png')
    plt.close()

梯度赌博机考虑的价值不同于之前的动作价值，它针对每个动作a学习一个数值化的偏好函数 $H_t(a)$ ，并利用偏好函数通过softmax分布计算选择动作的概率，并根据概率分布选择动作。最终四种使用梯度赌博机算法的赌博机训练结果如下。
在偏好函数的更新过程中，α代表步长， $\hat R_t$ 代表时刻t内所有收益的平均值，也就是一个baseline，当一个动作的收益高于它时，偏好函数就会增加，在未来选择这个动作的可能性就会上升。关于baseline的重要性书上并没有详细说明，我从周博磊的课程中猜测，梯度赌博机也相当于用蒙特卡洛法来进行试探，收集到的数据比较noisy，baseline就相当于一个平均数，减去它相当于对数据进行标准化，进而达到更好的训练结果的目的。事实上书上的描述为“收益的平均值变化对梯度赌博机算法没有影响，因为收益基准项可以让它马上适应新的收益水平”，这点应该与数据标准化的观点不谋而合。

总结

本文的最后将本章提到的所有算法进行一个集合展示，以表达他们对比的效果。如图所示。
可以看出不同的算法在不同的参数下达到最高值，要想分辨出哪个算法是最好的显然是不太可能的（虽然从这张图上来看UCB算法拥有较为明显的优势）。况且根据前文的分析，许多算法虽然在本章表现良好，但是难以推广到更一般的问题和更大的空间上，因而价值就大大降低了。本章深入探讨了一些平衡探索与开发的方法，在这些方法种，许多都具有局限性，目前来看，ε-greedy算法是一种非常简单且更易推广的算法，事实上后面的章节中也多拿ε-greedy算法来进行开发。当然目前还有很多新的平衡exploitation和exploration的方法，但是正如书上所说，这依然是强化学习界的最大难题之一。
最后我把本章的含中文注释的完整代码放到这里

import matplotlib.pyplot as plt
import matplotlib
import numpy as np
from tqdm import trange

matplotlib.use('TkAgg') 
class Bandit:
    def __init__(self,k_arm=10,epsilon=0.,initial=0.,step_size=0.1,sample_average=False,UCB_parameter=None,gradient=False,gradient_baseline=False,true_reward=0.):
        self.k=k_arm   #设定赌博机臂数
        self.step_size=step_size   #设定更新步长
        self.sample_average=sample_average   #bool变量，表示是否使用简单增量式算法
        self.indices=np.arange(self.k)   #创建动作索引（和赌博机臂数长度相同）
        self.time=0   #计算所有选取动作的数量，为UCB做准备
        self.UCB_parameter=UCB_parameter   #如果设定了UCB的参数c，就会在下面使用UCB算法
        self.gradient=gradient   #bool变量，表示是否使用梯度赌博机算法
        self.gradient_baseline=gradient_baseline   #设定梯度赌博机算法中的基准项（baseline），通常都用时刻t内的平均收益表示
        self.average_reward=0   #用于存储baseline所需的平均收益
        self.true_reward=true_reward   #存储一个赌博机的真实收益均值，为下面制作一个赌博机的真实价值函数做准备
        self.epsilon=epsilon   #设定epsilon-贪婪算法的参数
        self.initial=initial   #设定初始价值估计，如果调高就是乐观初始值
    
    def reset(self):   #初始化训练状态，设定真实收益和最佳行动状态
        self.q_true=np.random.randn(self.k)+self.true_reward   #设定真实价值函数，在一个标准高斯分布上抬高一个外部设定的true_reward，true_reward设置为非0数字以和不使用baseline的方法相区分
        self.q_estimation=np.zeros(self.k)+self.initial    #设定初始估计值，在全0的基础上用initial垫高，表现乐观初始值
        self.action_count=np.zeros(self.k)   #计算每个动作被选取的数量，为UCB做准备
        self.best_action=np.argmax(self.q_true)   #根据真实价值函数选择最佳策略，为之后做准备
        self.time=0   #设定时间步t为0
    
    def act(self):
        if np.random.rand()<self.epsilon:
            return np.random.choice(self.indices)   #以epsilon的几率随机选择动作
        if self.UCB_parameter is not None:   #当有设置UCB的参数时，使用基于UCB的动作选择
            UCB_estimation=self.q_estimation+self.UCB_parameter*np.sqrt(np.log(self.time+1)/(self.action_count+1e-5))   #预测值更新函数
            q_best=np.max(UCB_estimation)   #选择不同动作导致的预测值中最大的
            return np.random.choice(np.where(UCB_estimation==q_best)[0])   #返回基于UCB的动作选择下值最大的动作
        if self.gradient:   #如果使用梯度赌博机算法
            exp_est=np.exp(self.q_estimation)   
            self.action_prob=exp_est/np.sum(exp_est)   #以上两步按照softmax分布确定动作概率
            return np.random.choice(self.indices,p=self.action_prob)   #按概率选择执行动作
        q_best=np.max(self.q_estimation)   #如果不使用以上的其他方法，则使用贪心算法，与第一步构成epsilon-贪心算法
        return np.random.choice(np.where(self.q_estimation==q_best)[0])   #执行估计值最大的动作
    
    def step(self,action):
        reward=np.random.rand()+self.q_true[action]   #奖励是以真实值为平均的正态分布
        self.time+=1   #总行动数量+1
        self.action_count[action]+=1   #某个行动的行动数量+1
        self.average_reward+=(reward-self.average_reward)/self.time   #计算平均回报（return），为baseline做好准备
        
        if self.sample_average:   #如果使用增量式实现
            self.q_estimation[action]+=(reward-self.q_estimation[action])/self.action_count[action]   #用采样数据来更新行动价值（赌博机实验中只有一个状态，所以只更新行动价值）
        elif self.gradient:   #如果使用梯度赌博机
            one_hot=np.zeros(self.k)
            one_hot[action]=1   #把应该采取的行动概率置为1
            if self.gradient_baseline:   #在梯度赌博机上使用baseline
                baseline=self.average_reward   #平均收益天生就是一个良好的baseline
            else:
                baseline=0   #这里不使用baseline的话baseline就设置为0，如果上面的q_true不用true_reward抬高的话就没办法区分有没有使用baseline了
            self.q_estimation+=self.step_size*(reward-baseline)*(one_hot-self.action_prob)   #梯度赌博机更新状态价值估计
        else:
            self.q_estimation[action]+=self.step_size*(reward-self.q_estimation[action])   #使用固定步长更新状态价值
        return reward

def simulate(runs,time,bandits):
    rewards=np.zeros((len(bandits),runs,time))   #接收不同赌博机每一轮每一步的回报，方便制成平均回报来画图以对比算法
    best_action_count=np.zeros(rewards.shape)   #计算选择到最佳动作的数量，为算法对比做准备
    for i,bandits in enumerate(bandits):   #开始对每个选择不同算法和参数的赌博机进行循环
        for r in trange(runs):   #对runs个不同的赌博机（算法和超参数相同，奖励分布不同）进行独立实验
            bandits.reset()
            for t in range(time):   #对每个赌博机进行time次实验
                action=bandits.act()   #赌博机选择动作
                reward=bandits.step(action)   #返回每个动作的reward
                rewards[i,r,t]=reward   #把reward放到相应的索引位置方便之后对比
                if action==bandits.best_action:  
                    best_action_count[i,r,t]=1   #当赌博机选到最佳动作时+1（最佳动作在赌博机初始化的时候就已经得到）
    mean_best_action_counts=best_action_count.mean(axis=1)   #计算每个赌博机平均选到最佳动作的概率
    mean_rewards=rewards.mean(axis=1)   #计算每个赌博机收到的平均回报
    return mean_best_action_counts,mean_rewards

def figure_2_1():
    plt.violinplot(dataset=np.random.randn(200, 10) + np.random.randn(10))
    plt.xlabel("Action")
    plt.ylabel("Reward distribution")
    plt.savefig('figure_2_1.png')
    plt.close()


def figure_2_2(runs=2000, time=1000):    #对比不同epsilon下的训练情况
    epsilons = [0, 0.1, 0.01]
    bandits = [Bandit(epsilon=eps, sample_average=True) for eps in epsilons]   #这里用了一个list存储了三个相同参数的赌博机（除了epsilon），方便下面迭代对比
    best_action_counts, rewards = simulate(runs, time, bandits)

    plt.figure(figsize=(10, 20))

    plt.subplot(2, 1, 1)
    for eps, rewards in zip(epsilons, rewards):
        plt.plot(rewards, label='epsilon = %.02f' % (eps))
    plt.xlabel('steps')
    plt.ylabel('average reward')
    plt.legend()   #绘制三个赌博机在epsilon不同的情况下的平均奖励对比图

    plt.subplot(2, 1, 2)
    for eps, counts in zip(epsilons, best_action_counts):
        plt.plot(counts, label='epsilon = %.02f' % (eps))
    plt.xlabel('steps')
    plt.ylabel('% optimal action')
    plt.legend()

    plt.savefig('figure_2_2.png')
    plt.close()   #绘制三个赌博机在epsilon不同的情况下最佳动作选择百分比的对比图


def figure_2_3(runs=2000, time=1000):   #对比乐观初始值的作用
    bandits = []
    bandits.append(Bandit(epsilon=0, initial=5, step_size=0.1))   
    bandits.append(Bandit(epsilon=0.1, initial=0, step_size=0.1))   #创建两个赌博机，一个使用乐观初始值5，但是不用epsilon-贪婪进行探索，一个不使用乐观初始值，但是用epsilon探索
    best_action_counts, _ = simulate(runs, time, bandits)

    plt.plot(best_action_counts[0], label='epsilon = 0, q = 5')
    plt.plot(best_action_counts[1], label='epsilon = 0.1, q = 0')
    plt.xlabel('Steps')
    plt.ylabel('% optimal action')
    plt.legend()

    plt.savefig('figure_2_3.png')
    plt.close()   #绘制两个赌博机最佳动作选择百分比的对比图


def figure_2_4(runs=2000, time=1000):   #对比基于UCB的动作选择的作用
    bandits = []
    bandits.append(Bandit(epsilon=0, UCB_parameter=2, sample_average=True))   #创建一个使用基于UCB的动作选择的赌博机
    bandits.append(Bandit(epsilon=0.1, sample_average=True))   #创建一个基于epsilon-贪婪的赌博机
    _, average_rewards = simulate(runs, time, bandits)

    plt.plot(average_rewards[0], label='UCB c = 2')
    plt.plot(average_rewards[1], label='epsilon greedy epsilon = 0.1')
    plt.xlabel('Steps')
    plt.ylabel('Average reward')
    plt.legend()

    plt.savefig('figure_2_4.png')
    plt.close()   #绘制两个赌博机的平均收益


def figure_2_5(runs=2000, time=1000):   #对比梯度赌博机中是否使用baseline的结果
    bandits = []
    bandits.append(Bandit(gradient=True, step_size=0.1, gradient_baseline=True, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.1, gradient_baseline=False, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.4, gradient_baseline=True, true_reward=4))
    bandits.append(Bandit(gradient=True, step_size=0.4, gradient_baseline=False, true_reward=4))   #创建四个赌博机，分别把α设置为两个0.1和两个0.4，其中一个使用baseline一个不使用
    best_action_counts, _ = simulate(runs, time, bandits)
    labels = ['alpha = 0.1, with baseline',
              'alpha = 0.1, without baseline',
              'alpha = 0.4, with baseline',
              'alpha = 0.4, without baseline']

    for i in range(len(bandits)):
        plt.plot(best_action_counts[i], label=labels[i])
    plt.xlabel('Steps')
    plt.ylabel('% Optimal action')
    plt.legend()

    plt.savefig('figure_2_5.png')
    plt.close()


def figure_2_6(runs=2000, time=1000):    #绘制四种方法的参数研究图
    labels = ['epsilon-greedy', 'gradient bandit',
              'UCB', 'optimistic initialization']
    generators = [lambda epsilon: Bandit(epsilon=epsilon, sample_average=True),
                  lambda alpha: Bandit(gradient=True, step_size=alpha, gradient_baseline=True),
                  lambda coef: Bandit(epsilon=0, UCB_parameter=coef, sample_average=True),
                  lambda initial: Bandit(epsilon=0, initial=initial, step_size=0.1)]
    parameters = [np.arange(-7, -1, dtype=np.float),
                  np.arange(-5, 2, dtype=np.float),
                  np.arange(-4, 3, dtype=np.float),
                  np.arange(-2, 3, dtype=np.float)]

    bandits = []
    for generator, parameter in zip(generators, parameters):
        for param in parameter:
            bandits.append(generator(pow(2, param)))

    _, average_rewards = simulate(runs, time, bandits)
    rewards = np.mean(average_rewards, axis=1)

    i = 0
    for label, parameter in zip(labels, parameters):
        l = len(parameter)
        plt.plot(parameter, rewards[i:i+l], label=label)
        i += l
    plt.xlabel('Parameter(2^x)')
    plt.ylabel('Average reward')
    plt.legend()

    plt.savefig('figure_2_6.png')
    plt.close()


if __name__ == '__main__':
    figure_2_1()
    figure_2_2()
    figure_2_3()
    figure_2_4()
    figure_2_5()
    figure_2_6()

你可能感兴趣的:(强化学习)

深度 Qlearning：在直播推荐系统中的应用 AGI通用人工智能之禅程序员提升自我硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
深度Q-learning：在直播推荐系统中的应用关键词：深度Q-learning,强化学习,直播推荐系统,个性化推荐1.背景介绍1.1问题的由来随着互联网技术的飞速发展,直播平台如雨后春笋般涌现。面对海量的直播内容,用户很难快速找到自己感兴趣的内容。因此,个性化推荐系统在直播平台中扮演着越来越重要的角色。1.2研究现状目前,主流的个性化推荐算法包括协同过滤、基于内容的推荐等。这些方法在一定程度上缓
OpenAI o1 的价值意义及“强化学习的Scaling Law” & Kimi创始人杨植麟最新分享：关于OpenAI o1新范式的深度思考光剑书架上的书 ChatGPT 大数据AI人工智能计算人工智能算法机器学习
OpenAIo1的价值意义及“强化学习的ScalingLaw”蹭下热度谈谈OpenAIo1的价值意义及RL的Scalinglaw。一、OpenAIo1是大模型的巨大进步我觉得OpenAIo1是自GPT4发布以来，基座大模型最大的进展，逻辑推理能力提升的效果和方法比预想的要好，GPT4o和o1是发展大模型不同的方向，但是o1这个方向更根本，重要性也比GPT4o这种方向要重要得多，原因下面会分析。为什
探索未来，大规模分布式深度强化学习——深入解析IMPALA架构汤萌妮Margaret
探索未来，大规模分布式深度强化学习——深入解析IMPALA架构scalable_agent项目地址:https://gitcode.com/gh_mirrors/sc/scalable_agent在当今的人工智能研究前沿，深度强化学习（DRL）因其在复杂任务中的卓越表现而备受瞩目。本文要介绍的是一个开源于GitHub的重量级项目：“ScalableDistributedDeep-RLwithImp
如何有效的学习AI大模型？ Python程序员罗宾学习人工智能语言模型自然语言处理架构
学习AI大模型是一个系统性的过程，涉及到多个学科的知识。以下是一些建议，帮助你更有效地学习AI大模型：基础知识储备：数学基础：学习线性代数、概率论、统计学和微积分等，这些是理解机器学习算法的数学基础。编程技能：掌握至少一种编程语言，如Python，因为大多数AI模型都是用Python实现的。理论学习：机器学习基础：了解监督学习、非监督学习、强化学习等基本概念。深度学习：学习神经网络的基本结构，如卷
反思的魔力：用语言的力量强化AI智能体步子哥人工智能机器学习
在浩瀚的代码海洋中，AI智能体就像初出茅庐的航海家，渴望探索未知的宝藏。然而，面对复杂的编程任务，他们常常迷失方向。今天，就让我们跟随“反思”的灯塔，见证AI智能体如何通过语言的力量，点亮智慧的明灯，成为代码世界的征服者！智能体的困境近年来，大型语言模型（LLM）在与外部环境（如游戏、编译器、API）交互的领域中大放异彩，化身为目标驱动的智能体。然而，传统的强化学习方法如同一位严苛的训练师，需要大
机器学习实战笔记5——线性判别分析绍少阿机器学习笔记可视化机器学习 python 人工智能
任务安排1、机器学习导论8、核方法2、KNN及其实现9、稀疏表示3、K-means聚类10、高斯混合模型4、主成分分析11、嵌入学习5、线性判别分析12、强化学习6、贝叶斯方法13、PageRank7、逻辑回归14、深度学习线性判别分析（LDA）Ⅰ核心思想对于同样一件事，站在不同的角度，我们往往会有不同的看法，而降维思想，亦是如此。同上节课一样，我们还是学习降维的算法，只是提供了一种新的角度，由上
大模型的实践应用29-大语言模型的RLHF(人类反馈强化学习)的具体应用与原理介绍微学AI 大模型的实践应用语言模型人工智能自然语言处理 RLHF
大家好，我是微学AI，今天给大家介绍一下大模型的实践应用29-大语言模型的RLHF(人类反馈强化学习)的具体应用与原理介绍。在当今人工智能发展的浪潮中，大语言模型（LargeLanguageModels,LLMs）凭借其强大的语言理解和生成能力，成为了研究与应用的热点。而在这股浪潮中，一种名为“基于人类反馈的强化学习”的方法脱颖而出，为大语言模型的优化和应用开辟了新的路径。本文首部分将深入浅出地介
坚定理想信念，锤炼党性修养知涵知
理想信念是中国共产党人的政治灵魂，是共产党人精神上的“钙”，没有理想信念，理想信念不坚定，精神上就会“缺钙”，就会得“软骨病”。党员干部只有坚定理想信念，强化责任担当，锤炼道德操守，提升党性修养，才能切实做到为党分忧、为国尽责、为民奉献。坚定理想信念，就要强化学习精神、自律精神、担当精神。思想理论上的坚定清醒是政治上坚定的前提，党员干部要始终把理论学习作为政治责任、事业需要和精神追求，积极参加组织
python 物理引擎_在 Gym 上构建会动的人工智障1（python） weixin_39542608 python 物理引擎
背景说明作者最近使用processing的一个重要目标就是为学生的编程学习设计具体的应用场景，最近突然发现有一个包已经提供了部分功能，所以探索一下。这个包就是我们今天的主人公：Gym。Gym是用于开发和比较强化学习算法的python包，但是我们也完全可以使用它来作为我们自己程序的应用背景，并提供可视化。简单的说，就是我们使用自己写的小程序，而不是强化学习算法，来尝试完成其中的任务，并把完成任务的过
强化学习（二）----- 马尔可夫决策过程MDP Duckie-duckie 机器学习数据数据分析数据挖掘机器学习算法
1.马尔可夫模型的几类子模型大家应该还记得马尔科夫链(MarkovChain)，了解机器学习的也都知道隐马尔可夫模型(HiddenMarkovModel，HMM)。它们具有的一个共同性质就是马尔可夫性(无后效性)，也就是指系统的下个状态只与当前状态信息有关，而与更早之前的状态无关。马尔可夫决策过程(MarkovDecisionProcess,MDP)也具有马尔可夫性，与上面不同的是MDP考虑了动作
Python强化学习，基于gym的马尔可夫决策过程MDP，动态规划求解，体现序贯决策 baozouxiaoxian python gym qlearning python 强化学习 mdp 动态规划求解马尔科夫决策过程
决策的过程分为单阶段和多阶段的。单阶段决策也就是单次决策，这个很简单。而序贯决策指按时间序列的发生，按顺序连续不断地作出决策，即多阶段决策，决策是分前后顺序的。序贯决策是前一阶段决策方案的选择，会影响到后一阶段决策方案的选择，后一阶段决策方案的选择是取决于前一阶段决策方案的结果。强化学习过程中最典型的例子就是非线性二级摆系统，有4个关键值，小车受力，受力方向，摆速度，摆角，每个状态下都需要决策车的
强化学习分类 0penuel0
Model-free:Qlearning,Sarsa,PolicyGradientsModel-based:能通过想象来预判断接下来将要发生的所有情况.然后选择这些想象情况中最好的那种基于概率：PolicyGradients基于价值：Qlearning,Sarsa两者融合：Actor-Critic回合更新：Monte-carlolearning，基础版的policygradients单步更新：Ql
7. 深度强化学习：智能体的学习与决策 Network_Engineer 机器学习学习机器学习深度学习神经网络 python 算法
引言深度强化学习结合了强化学习与深度学习的优势，通过智能体与环境的交互，使得智能体能够学习最优的决策策略。深度强化学习在自动驾驶、游戏AI、机器人控制等领域表现出色，推动了人工智能的快速发展。本篇博文将深入探讨深度强化学习的基本框架、经典算法（如DQN、策略梯度法），以及其在实际应用中的成功案例。1.强化学习的基本框架强化学习是机器学习的一个分支，专注于智能体在与环境的交互过程中，学习如何通过最大
深度强化学习之DQN-深度学习与强化学习的成功结合 CristianoC
目录概念深度学习与强化学习结合的问题DQN解决结合出现问题的办法DQN算法流程总结一、概念原因：在普通的Q-Learning中，当状态和动作空间是离散且维数不高的时候可以使用Q-Table来存储每个状态动作对应的Q值，而当状态和动作空间是高维连续时，使用Q-Table不现实。一是因为当问题复杂后状态太多，所需内存太大；二是在这么大的表格中查询对应的状态也是一件很耗时的事情。image通常的做法是把
一对一包教会脑电教学服务茗创科技
茗创科技专注于脑科学数据处理，涵盖（EEG/ERP,fMRI,结构像,DTI,ASL,FNIRS）等，欢迎留言讨论及转发推荐，也欢迎了解茗创科技的脑电课程，数据处理服务及脑科学工作站销售业务，可添加我们的工程师（微信号MCKJ-zhouyi或17373158786）咨询。★课程简介★最近有不少人留言“脑电该怎么学习？想强化学习脑电某个内容版块可以吗？...”，也有小伙伴联系我们，咨询脑电相关内容能
基于时序差分的无模型强化学习：Q-learning 算法详解晓shuo 算法强化学习
目录一、无模型强化学习中的时序差分方法与Q-learning1.1时序差分法1.2Q-learning算法状态-动作值函数（Q函数）Q-learning的更新公式Q-learning算法流程Q-learning的特点1.3总结一、无模型强化学习中的时序差分方法与Q-learning 动态规划算法依赖于已知的马尔可夫决策过程（MDP），在环境的状态转移概率和奖励函数完全明确的情况下，智能体无需与环
（18-1）基于深度强化学习的股票交易模型：项目介绍+准备环境码农三叔强化学习从入门到实践人工智能深度学习股票交易模型 DRL Double DQN Dueling DQN
在本章的这个项目中，实现了一个用于股票交易的DRL模型，旨在展示DRL在金融领域的潜力，提供其在股票交易中应用的实际例子。希望通过本章内容的学习，能够为那些对金融与机器学习交叉领域感兴趣的人士提供有益的参考。1.1项目介绍在金融市场中，股票交易是一项充满挑战的任务，需要在高度波动和复杂的市场环境中做出快速且精准的决策。传统的交易策略通常依赖于经验、基本面分析或技术分析。然而，这些方法往往无法在快速
深度学习算法——Transformer fw菜菜数学建模深度学习 transformer 人工智能数学建模 python pytorch
参考教材：动手学pytorch一、模型介绍Transformer模型完全基于注意力机制，没有任何卷积层或循环神经网络层。尽管Transformer最初是应用于在文本数据上的序列到序列学习，但现在已经推广到各种现代的深度学习中，例如语言、视觉、语音和强化学习领域。Transformer作为编码器－解码器架构的一个实例，其整体架构图在下图中展示。正如所见到的，Trans‐former是由编码器和解码器
sumo carla 自动驾驶联合仿真安装配置教程开发驾驶模拟强化学习 jZhUeZPQZw 自动驾驶人工智能机器学习
sumocarla自动驾驶联合仿真安装配置教程开发驾驶模拟强化学习轨迹预测轨迹规划标题：基于SUMO和CARLA的自动驾驶联合仿真系统安装与配置：教程与开发探索摘要：随着自动驾驶技术的迅猛发展，仿真环境在自动驾驶系统的评估、训练和验证中扮演着重要的角色。本文介绍了基于SUMO（SimulationofUrbanMObility）和CARLA（CarLearningtoAct）的自动驾驶联合仿真系统
Python知识点：如何使用Python实现强化学习机器人杰哥在此 Python系列 python 机器人开发语言编程面试
实现一个强化学习机器人涉及多个步骤，包括定义环境、状态和动作，选择适当的强化学习算法，并训练模型。下面是一个简单的例子，使用Python和经典的Q-learning算法来实现一个强化学习机器人，目标是通过OpenAIGym提供的FrozenLake环境训练机器人学会如何在冰面上移动以找到目标。1.安装必要的库首先，需要安装OpenAIGym和Numpy。你可以使用以下命令安装它们：pipinsta
机器学习在医学中的应用听忆. 机器学习人工智能
边走、边悟迟早会好机器学习在医学中的应用是一个广泛且复杂的领域，涵盖了从基础研究到临床应用的多个方面。以下是一个万字总结的结构性思路，分章节深入探讨不同应用场景、技术方法、挑战与未来展望。1.引言背景与发展：介绍医学领域的数字化转型以及机器学习的兴起，探讨其在医学中的潜力。机器学习的基本概念：简要介绍机器学习的基本原理、分类（监督学习、非监督学习、强化学习等）和常用算法（如神经网络、支持向量机、随
人工智能&机器学习&深度学习 AA杂货铺111
机器学习：一切通过优化方法挖掘数据中规律的学科。深度学习：一切运用了神经网络作为参数结构进行优化的机器学习算法。强化学习：不仅能利用现有数据，还可以通过对环境的探索获得新数据，并利用新数据循环往复地更新迭代现有模型的机器学习算法。学习是为了更好地对环境进行探索，而探索是为了获取数据进行更好的学习。深度强化学习：一切运用了神经网络作为参数结构进行优化的强化学习算法。人工智能定义与分类人工智能（Art
学习日志6 Simon#0209 学习
关于量子强化学习：论文Variational_Quantum_Circuits_for_Deep_Reinforcement_Learning：变分量子电路在深度强化学习中的应用论文主要内容：将经典深度强化学习算法（如经验重放和目标网络）重塑为变分量子电路的表示摘要当前最先进的机器学习方法基于经典冯·诺伊曼计算架构，并在许多工业和学术领域得到广泛应用。随着量子计算的发展，研究人员和技术巨头们试图为
【科技前沿】用深度强化学习优化电网，让电力调度更聪明！风清扬雨人工智能人工智能 python 智能电网深度强化学习
Hey小伙伴们，今天我要跟大家分享一个超级酷炫的技术应用——深度强化学习在电网优化中的典型案例！如果你对机器学习感兴趣，或是正寻找如何用AI技术解决实际问题的方法，这篇分享绝对不容错过！‍✨开场白大家好，我是你们的技术小助手！今天我们要聊的是如何利用深度强化学习（DRL）来优化电网的调度，让电力系统变得更智能、更高效。引入话题想象一下，如果你能够通过一种先进的技术手段，自动调整电网中的能源分配，不
大模型对齐方法笔记一：DPO及其变种IPO、KTO、CPO chencjiajy 深度学习笔记机器学习人工智能
DPODPO(DirectPreferenceOptimization)出自2023年5月的斯坦福大学研究院的论文《DirectPreferenceOptimization:YourLanguageModelisSecretlyaRewardModel》，大概是2023-2024年最广为人知的RLHF的替代对齐方法了。DPO的主要思想是在强化学习的目标函数中建立决策函数与奖励函数之间的关系，以规避
多智能体环境设计（二） AI-星辰强化学习自定义环境 python 机器学习
多智能体环境设计：接口设计与实现目录引言PettingZoo框架概述核心接口方法详解3.1reset()方法3.2step(action)方法3.3observe(agent)方法3.4render()方法空间定义4.1观察空间4.2动作空间高级特性5.1并行环境5.2智能体通信5.3动态环境性能优化测试和调试实际应用示例最佳实践和常见陷阱1.引言多智能体环境是强化学习和人工智能研究中的一个重要领
【伤寒强化学习训练】打卡第四十五天一期90天 A卐炏澬焚
3.5.2麻黄汤续讲与大、小青龙汤麻黄九禁【7.18】脉浮紧者，法当汗出而解。若身重心悸者，不可发汗，须自汗出乃愈。所以然者，尺中脉微，此里虚也。须里实，津液自和，便自汗出愈。【7.19】脉浮紧者，法当身疼痛，宜以汗解之。假令尺中迟者，不可发汗。所以然者，以荣气不足，血弱故也。【7.18】：脉浮紧的人照理说要发汗，如果身体重、心悸是不可以发汗；发汗，不一定用麻黄汤，大青龙汤也可以感冒很多人身体都是
从自动驾驶看无人驾驶叉车的技术落地和应用电气_空空自动驾驶自动驾驶机器人人工智能毕设
摘要｜介绍无人驾驶叉车在自动驾驶技术中的应用，分析其关键技术，如环境感知、定位、路径规划等，并讨论机器学习算法和强化学习算法的应用以提高无人叉车的运行效率和准确性。无人叉车在封闭结构化环境、机器学习、有效数据集等方法的助力下，可有效推动叉车无人驾驶关键技术的发展。关键词：无人叉车；自动驾驶；机器学习；数据集随着人工智能技术的持续进步，无人叉车领域的供给与需求均呈现迅猛增长态势。它们不仅正在逐步替代
强化学习自定义环境基础知识 AI-星辰强化学习自定义环境 python 机器学习
1.引言本文旨在全面介绍OpenAIGym自定义环境的创建过程，重点解析其接口、关键属性和函数。本指南适合初学者深入了解强化学习环境的构建原理和实践方法。2.OpenAIGym环境基础OpenAIGym提供了一个标准化的接口，用于创建和使用强化学习环境。了解这个接口的核心组件是创建自定义环境的基础。2.1Env类所有Gym环境都继承自gym.Env类。这个基类定义了环境应该具有的基本结构和方法。i
【《伤寒论》强化学习训练】打卡第32天，一期目标90天最闪亮的那颗星_b02d
一、桂枝加葛根汤和葛根汤不能通用，因为葛根汤里有麻黄，会散阳气。太阳传到阳明时血分受邪，要用麻黄从血分把邪气发出来，所以用葛根汤治燥热感冒。桂枝汤治营卫不调的出汗或桂枝加附子汤治阳虚自汗，不能一开始就用黄芪，黄芪会让桂枝汤发挥不了通营卫的效果，汗止不了。人体表面的能量不足的时候，身体不能收摄自己身体的水分，桂枝加附子汤里有附子，可治阳虚自汗。玉屏风散治表虚的汗有效；桂枝加附子汤治虚汗有效，但是两个
github中多个平台共存 jackyrong github
在个人电脑上，如何分别链接比如oschina,github等库呢，一般教程之列的，默认 ssh链接一个托管的而已，下面讲解如何放两个文件 1）设置用户名和邮件地址 $ git config --global user.name "xx" $ git config --global user.email "[email protected]"
ip地址与整数的相互转换(javascript) alxw4616 JavaScript
//IP转成整型 function ip2int(ip){ var num = 0; ip = ip.split("."); num = Number(ip[0]) * 256 * 256 * 256 + Number(ip[1]) * 256 * 256 + Number(ip[2]) * 256 + Number(ip[3]); n
读书笔记-jquey+数据库+css chengxuyuancsdn html jquery oracle
1、grouping ,group by rollup, GROUP BY GROUPING SETS区别 2、$("#totalTable tbody>tr td:nth-child(" + i + ")").css({"width":tdWidth, "margin":"0px", &q
javaSE javaEE javaME == API下载 Array_06 java
oracle下载各种API文档： http://www.oracle.com/technetwork/java/embedded/javame/embed-me/documentation/javame-embedded-apis-2181154.html JavaSE文档： http://docs.oracle.com/javase/8/docs/api/ JavaEE文档： ht
shiro入门学习 cugfy java Web 框架
声明本文只适合初学者，本人也是刚接触而已，经过一段时间的研究小有收获，特来分享下希望和大家互相交流学习。首先配置我们的web.xml代码如下，固定格式，记死就成 <filter> <filter-name>shiroFilter</filter-name> &nbs
Array添加删除方法 357029540 js
刚才做项目前台删除数组的固定下标值时，删除得不是很完整，所以在网上查了下，发现一个不错的方法，也提供给需要的同学。 //给数组添加删除 Array.prototype.del = function(n){
navigation bar 更改颜色张亚雄 IO
今天郁闷了一下午，就因为objective-c默认语言是英文，我写的中文全是一些乱七八糟的样子，到不是乱码，但是，前两个自字是粗体，后两个字正常体，这可郁闷死我了，问了问大牛，人家告诉我说更改一下字体就好啦，比如改成黑体，哇塞，茅塞顿开。翻书看，发现，书上有介绍怎么更改表格中文字字体的，代码如下
unicode转换成中文 adminjun unicode 编码转换
在Java程序中总会出现\u6b22\u8fce\u63d0\u4ea4\u5fae\u535a\u641c\u7d22\u4f7f\u7528\u53cd\u9988\uff0c\u8bf7\u76f4\u63a5这个的字符，这是unicode编码，使用时有时候不会自动转换成中文就需要自己转换了使用下面的方法转换一下即可。 /** * unicode 转换成中文
一站式 Java Web 框架 firefly aijuans Java Web
Firefly是一个高性能一站式Web框架。涵盖了web开发的主要技术栈。包含Template engine、IOC、MVC framework、HTTP Server、Common tools、Log、Json parser等模块。 firefly-2.0_07修复了模版压缩对javascript单行注释的影响，并新增了自定义错误页面功能。更新日志：增加自定义系统错误页面功能
设计模式——单例模式 ayaoxinchao 设计模式
定义 Java中单例模式定义：“一个类有且仅有一个实例，并且自行实例化向整个系统提供。” 分析从定义中可以看出单例的要点有三个：一是某个类只能有一个实例；二是必须自行创建这个实例；三是必须自行向系统提供这个实例。 &nb
Javascript 多浏览器兼容性问题及解决方案 BigBird2012 JavaScript
不论是网站应用还是学习js,大家很注重ie与firefox等浏览器的兼容性问题，毕竟这两中浏览器是占了绝大多数。一、document.formName.item(”itemName”) 问题问题说明：IE下，可以使用 document.formName.item(”itemName”) 或 document.formName.elements ["elementName&quo
JUnit-4.11使用报java.lang.NoClassDefFoundError: org/hamcrest/SelfDescribing错误 bijian1013 junit4.11 单元测试
下载了最新的JUnit版本，是4.11，结果尝试使用发现总是报java.lang.NoClassDefFoundError: org/hamcrest/SelfDescribing这样的错误，上网查了一下，一般的解决方案是，换一个低一点的版本就好了。还有人说，是缺少hamcrest的包。去官网看了一下，如下发现：
[Zookeeper学习笔记之二]Zookeeper部署脚本 bit1129 zookeeper
Zookeeper伪分布式安装脚本(此脚本在一台机器上创建Zookeeper三个进程，即创建具有三个节点的Zookeeper集群。这个脚本和zookeeper的tar包放在同一个目录下，脚本中指定的名字是zookeeper的3.4.6版本，需要根据实际情况修改)： #!/bin/bash #!!!Change the name!!! #The zookeepe
【Spark八十】Spark RDD API二 bit1129 spark
coGroup package spark.examples.rddapi import org.apache.spark.{SparkConf, SparkContext} import org.apache.spark.SparkContext._ object CoGroupTest_05 { def main(args: Array[String]) { v
Linux中编译apache服务器modules文件夹缺少模块(.so)的问题 ronin47 modules
在modules目录中只有httpd.exp，那些so文件呢？我尝试在fedora core 3中安装apache 2. 当我解压了apache 2.0.54后使用configure工具并且加入了 --enable-so 或者 --enable-modules=so (两个我都试过了) 去make并且make install了。我希望在/apache2/modules/目录里有各种模块，
Java基础-克隆 BrokenDreams java基础
Java中怎么拷贝一个对象呢？可以通过调用这个对象类型的构造器构造一个新对象，然后将要拷贝对象的属性设置到新对象里面。Java中也有另一种不通过构造器来拷贝对象的方式，这种方式称为克隆。 Java提供了java.lang.
读《研磨设计模式》-代码笔记-适配器模式-Adapter bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ package design.pattern; /* * 适配器模式解决的主要问题是，现有的方法接口与客户要求的方法接口不一致 * 可以这样想，我们要写这样一个类（Adapter）: * 1.这个类要符合客户的要求 ---> 那显然要
HDR图像PS教程集锦&心得 cherishLC PS
HDR是指高动态范围的图像，主要原理为提高图像的局部对比度。软件有photomatix和nik hdr efex。一、教程叶明在知乎上的回答： http://www.zhihu.com/question/27418267/answer/37317792 大意是修完后直方图最好是等值直方图，方法是HDR软件调一遍，再结合不透明度和蒙版细调。二、心得 1、去除阴影部分的
maven-3.3.3 mvn archetype 列表 crabdave ArcheType
maven-3.3.3 mvn archetype 列表可以参考最新的：http://repo1.maven.org/maven2/archetype-catalog.xml [INFO] Scanning for projects... [INFO]
linux shell 中文件编码查看及转换方法 daizj shell 中文乱码 vim 文件编码
一、查看文件编码。在打开文件的时候输入:set fileencoding 即可显示文件编码格式。二、文件编码转换 1、在Vim中直接进行转换文件编码,比如将一个文件转换成utf-8格式 &
MySQL--binlog日志恢复数据 dcj3sjt126com binlog
恢复数据的重要命令如下 mysql> flush logs; 默认的日志是mysql-bin.000001，现在刷新了重新开启一个就多了一个mysql-bin.000002
数据库中数据表数据迁移方法 dcj3sjt126com sql
刚开始想想好像挺麻烦的，后来找到一种方法了，就SQL中的 INSERT 语句，不过内容是现从另外的表中查出来的，其实就是 MySQL中INSERT INTO SELECT的使用下面看看如何使用语法：MySQL中INSERT INTO SELECT的使用 1. 语法介绍有三张表a、b、c，现在需要从表b
Java反转字符串 dyy_gusi java 反转字符串
前几天看见一篇文章，说使用Java能用几种方式反转一个字符串。首先要明白什么叫反转字符串，就是将一个字符串到过来啦，比如"倒过来念的是小狗"反转过来就是”狗小是的念来过倒“。接下来就把自己能想到的所有方式记录下来了。 1、第一个念头就是直接使用String类的反转方法，对不起，这样是不行的，因为Stri
UI设计中我们为什么需要设计动效 gcq511120594 UI linux
随着国际大品牌苹果和谷歌的引领，最近越来越多的国内公司开始关注动效设计了，越来越多的团队已经意识到动效在产品用户体验中的重要性了，更多的UI设计师们也开始投身动效设计领域。但是说到底，我们到底为什么需要动效设计？或者说我们到底需要什么样的动效？做动效设计也有段时间了，于是尝试用一些案例，从产品本身出发来说说我所思考的动效设计。一、加强体验舒适度嗯，就是让用户更加爽更加爽的用
JBOSS服务部署端口冲突问题 HogwartsRow java 应用服务器 jboss server EJB3
服务端口冲突问题的解决方法，一般修改如下三个文件中的部分端口就可以了。 1、jboss5/server/default/conf/bindingservice.beans/META-INF/bindings-jboss-beans.xml 2、./server/default/deploy/jbossweb.sar/server.xml 3、.
第三章 Redis/SSDB+Twemproxy安装与使用 jinnianshilongnian ssdb reids twemproxy
目前对于互联网公司不使用Redis的很少，Redis不仅仅可以作为key-value缓存，而且提供了丰富的数据结果如set、list、map等，可以实现很多复杂的功能；但是Redis本身主要用作内存缓存，不适合做持久化存储，因此目前有如SSDB、ARDB等，还有如京东的JIMDB，它们都支持Redis协议，可以支持Redis客户端直接访问；而这些持久化存储大多数使用了如LevelDB、RocksD
ZooKeeper原理及使用 liyonghui160com
ZooKeeper是Hadoop Ecosystem中非常重要的组件，它的主要功能是为分布式系统提供一致性协调(Coordination)服务，与之对应的Google的类似服务叫Chubby。今天这篇文章分为三个部分来介绍ZooKeeper，第一部分介绍ZooKeeper的基本原理，第二部分介绍ZooKeeper
程序员解决问题的60个策略 pda158 框架工作单元测试
根本的指导方针 1. 首先写代码的时候最好不要有缺陷。最好的修复方法就是让 bug 胎死腹中。良好的单元测试强制数据库约束使用输入验证框架避免未实现的“else”条件在应用到主程序之前知道如何在孤立的情况下使用日志 2. print 语句。往往额外输出个一两行将有助于隔离问题。 3. 切换至详细的日志记录。详细的日
Create the Google Play Account sillycat Google
Create the Google Play Account Having a Google account, pay 25$, then you get your google developer account. References: http://developer.android.com/distribute/googleplay/start.html https://p
JSP三大指令 vikingwei jsp
JSP三大指令一个jsp页面中，可以有0~N个指令的定义！ 1. page --> 最复杂：<%@page language="java" info="xxx"...%> * pageEncoding和contentType： > pageEncoding：它