DWQY

（一）强化学习概述

强化学习近几年成为了研究的热门，AlphaGo的故事家喻户晓。作为一个准研究生，抱着极大的好奇心来学习这门理论，虽然网上已经有了许多参考资料，但知识还不是自己的。希望写这样一个系列的博客，能够在对这个领域有一些浅显的认识。所有文章的角度都会从一个小白出发，希望能给大家提供一些帮助。如有错误，请各位积极帮助指正。
本系列的参考书籍为《Easy RL》，获取原文可点此处。提取码2022。所以整系列博客的布局都是按照该书章节完成的。另外之前总有人倾力推荐李宏毅老师的强化学习课程，这个在B站上能够找到资源。但经过我亲身感受来看，如果你只知道强化学习这四个字儿，最好还是先不要去看，其中涉及到很多前续课程，直接听很容易懵的。
强化学习毕竟是一个理论课，其中不可避免的会涉及到一些数学知识。这对我来说也很苦恼，但要想学明白还是要努力克服。好了，让我们开始进入正题吧！
作为引言，本文希望能够讲清楚如下几个问题？
1.什么是强化学习？
2.强化学习中一些关键的基础概念
3.强化学习的组成结构

1.什么是强化学习？

要想介绍强化学习，就不得不说一下下面这个图：

先不考虑强化学习，回想一下人本身是如何成长的。当我们学习东西时，最开始是不知道哪种行为是正确的。一般就是每一个都试试，如果哪个受到了肯定(可能有多种行为受到肯定，但大小是不同)我们在下次面临同样的情况时就会有倾向去做这个动作，久而久之我们对于这种情况的处理的就越来越好。
把上面的例子和上上面的图对应起来，人就是智能体，东西是从环境中获取的。智能体最开始会有一种状态(好比人啥也不会)，在状态下可以执行多种动作，执行完每次动作后就能够得到这次动作的反馈(就是指图里的奖励)。得到奖励后，智能体又会进入一个新的状态(比如人会了第一步怎么做)，于是又可以再执行动作。反复循环，最后智能体的能力就会越来越强，
所以我觉得强化学习就是研究一个小白如何通过和环境的交互成长为一个大神。可能最开始小白也不知道怎么成为一个大神，但是会在不断地试错中不断成长。
学习强化学习就要明确它和监督学习的区别。
首先什么是监督学习，我也管它叫有标签学习。就是每干一件事都会有个结果，而标签就是正确的结果。每次干完都会和标签做比较，对了结束，不对吸取失败经验继续干。这样往往最后都能够得到正确的情况。但监督学习有两个条件需要满足：
1）训练的数据必须要有标签
2）数据要服从独立同分布
细看这两个要求其实都很难满足，现在完成训练标签的主要标注手段还是人工，但效率实在太低。所以比较好的方式是无标签的。同时真实场景中采取不同动作会进入不同的状态，不同状态后续看到的场景也是不同的，所以说明前后的数据是时间序列相关的。这两个是监督学习的难点，却恰恰是强化学习的主要针对目标。运用强化学习，就能够顺利解决这两个问题(换句话说RL适合解决数据有时间序列相关性问题)。但强化学习有它自身的4个难点：
1）延时奖励
2）要不断学习
3）需要有一个好的结果
4）环境带给你的是有条件的
延时奖励说明的就是：和监督学习不同，监督学习中每一步都会和标签进行比对。而诸如下围棋这种强化学习场景，只有最终棋局结束时才能得到一个奖励。前面每步的作用都不直接体现，甚至无法判断每步的正确与否，但是都间接影响着最终的结果。奖励的延时性显然是不利于模型训练的。应该意识到在RL中，环境可能会告诉你这种行为是错误的(奖励为负)，但并不会告诉你正确的行为是什么。
不断学习指RL没有固定的标准，只要效果更好就可以继续学习。那什么时候停止就是一个问题，学习的目的自然是希望好的结果，如果效果坏的话那就没有意义了。
一个很直白的问题就是：智能体是如何获得能力的?其实是通过不断试错探索。所以RL中研究的一个重点是：在试错探索的前提下，智能体的行为如何稳步提升。

2.强化学习一些常见的概念

智能体(agent)：优化行为的对象
环境(environment)：智能体通过和环境交互来学习行为，在博弈中指对手
策略(policy)：智能体采取行动的方式，不是具体的行动，但指导行动的发生。抽象为函数时，输入为状态，输出为动作。分类包括随机性策略、确定性策略(为了防止对手观测，使用随机性策略较多)
动作(action)：智能体实际的行动，会体现在环境中，改变环境的状态
动作空间(action space)：环境确定情况下，有效动作的集合称为动作空间。根据采取动作的性质可分为离散动作空间、连续动作空间
状态(state)：可以有两种(智能体state和环境state)，但主要关注的是环境的state。认为智能体从环境中获取的state是用来反应环境的
观测(observation)：主体是智能体，代表智能体从环境中看到的信息。
注：那状态和观测有什么区别呢？
这里举一个例子：如果以图像为例，state可以认为是我们采集的一张原始图像，而observation则是对原始图像采集特征点，observation依旧可以反应图像，但其实是图像的精炼。但在算力逐渐提高的今天，其实可以模糊两个概念的区别，认定能够观测到所有的数据，所以现在统一称为state
完全可观测(full observed)：智能体能够观察到环境中所有的状态
部分可观测(partially observed)：智能体只能够观察到环境中的部分状态
奖励(reward)：奖励指按照一定的policy执行，能够收获的价值。按照时间段长短，价值也可以分成从头到尾的价值、执行一步的价值、当前状态到最后的价值。
以上主要说明了六个概念：
agent environment policy
action state reward
把以上的六个概念分为两组，前面三个描述了宏观上的强化学习交互过程。就是agent通过policy和环境交互得到结果，用结果不断改进policy。而具体的落实过程是后面一组完成的：在某个state情况下执行action得到reward，又会进入下一个state然后反复循环。两组之间的联系在于state是从environment中获得的，每次执行的action其实是在policy的指导下完成的。
对于一个agent，内部也是由多方面组成的，主要包括三部分：
1）策略函数(policy function)：智能体通过policy function确定下一步的动作
2）价值函数(value function)：利用value function对当前进行评估，说明了当前策略对后续回报的影响，也是未来奖励的预测。
3）模型(model)：代表agent对世界的理解。模型决定了下一个状态是什么样的。模型包括概率函数(也叫状态转移函数)和奖励函数。给出其定义及数学化表达式：

概率函数：状态之间如何转移(也就是在状态s采取动作a进入状态s’的概率)

奖励函数：当前状态采取一个动作，所获得奖励

折扣因子(discount factor)：从主观愿望看，希望尽可能在短的时间里得到多的奖励。认定越往后奖励的权重越小，就把奖励乘以折扣因子。取值在[0,1]
存在policy function+value function+model这就组成了马尔可夫决策过程(这个将在第二章进行介绍)。可以先简单的看看下面这个图，有一个了解：

在了解了一些概念以后。再来看看RL的研究对象及目标，逐步把各类进行细分。RL整体就是围绕policy展开，有了policy就可以执行action，然后就能拿到reward。重点变成了一下三个问题：
1）policy怎么来的？
2）怎么评价一个policy是好是坏？
3）policy是怎么进行优化的？
对于以上三个问题，下面进行解答。也会陆续给出一些相关的概念。
1）policy是怎么来的？policy从宏观上来说可以分为两类：探索和利用
探索：指去尝试一些新的行为，带来的结果可能好可能坏。
利用：指采取已知的可以获得最大奖励的行为
2）怎么评价一个policy是好是坏？最简单的就是看policy能带给我们的价值，价值高就是好。这在上面对于价值函数的定义中提到了，下面来详细讲讲价值函数value function，价值函数分为两种：
(1）状态价值函数(state value function)——价值由状态决定
数学化的表达就是：

(2）状态-行为价值函数(state-action value function)——通常称为Q函数。价值由状态和行为决定。
数学化的表达就是：

先不对这两类价值函数介绍过多，只需要明白，它们可以用来评价policy的好坏即可(其实后续policy的优化也离不开它们)
了解到policy和value之后，RL就可以被分成两类：
1)基于policy的学习：直接进行策略学习
2)基于value的学习：先得到每一步的价值，根据最大价值选择最佳策略
所以说到底，RL就是在每一个状态要确定一个最好的动作。无论是policy还是value都是为这个服务的，policy就直接一点儿，直接决定动作，value就先计算价值然后再根据价值大小决定动作，也就是策略是从学到的价值函数中推算出来的。
当明白这两个分类以后，主要的研究对象就明确了：
对于policy base而言，就是求解这个policy
对于value base而言，就是求解每一步的value值

那什么是学习呢?在没有任何先验知识的背景下，不可能一开始就得到最好的policy。所以通过不断与环境交互试错，不断改正policy，强化自己的model。这就是强化学习。
在后面的过程，分别会针对policy base和value base详细介绍各自的算法。先做一个简单的介绍吧：
对于value base有Q学习(Q-learning)、Sarsa
对于policy base有策略梯度(policy gradient)
其实还有一种演员-评论家算法，是对两种base的融合，汲取各自优点。

现在回答上面的第三个问题，策略如何进行优化，其实就是不断学习的过程。学习伴随着迭代，迭代过程中完成优化。
前面介绍了model是agent的组成部分之一，那有一个问题：model是怎么来的呢?其实这又引出一种RL的分类：
1）有模型强化学习智能体
2）免模型强化学习智能体
之前介绍过model中包括状态转移函数和奖励函数。这里的有无指的就是这两个东西。那这个反映了什么呢？其实反映的就是现阶段是否对真实环境进行建模。如果我们是有模型的(也就是有状态转移函数和奖励函数)，我们就可以根据这个选出最佳的策略(因为哪一步可以获得最佳回报是可以计算的)。但又有一个大问题就是：状态转移函数和奖励函数哪里来呢?按照之前的应用条件，连初始的数据都没有。所以更多情况下研究的对象是免模型的RL。也就是智能体只能在真实环境中通过一定策略来执行动作，等待奖励和状态迁移，然后根据这些反馈信息来更新行为策略，反复迭代直到学习到最优策略。
用一句话总结有模型和免模型的区别：是否需要对真实环境建模
以上讲了这么多，用一个汇总形式的分类图吧：

内容到现在差不多了，但还是要再给出一些概念的定义：
学习和规划：序列决策中的两个基本问题。在规划中，环境已知，可以计算出完美model。不需要与环境交互就可以了解未来环境，寻找最优解。学习就是啥也不知道，一切从头学。常用的一个解决问题的思路是：先学习环境如何工作，了解环境工作方式，即学习得到一个模型，然后利用这个模型进行规划(也就是没有模型先学一个模型，然后对模型进行优化)
探索和利用：这个其实很像人处理事情的方式，对于有些人乐衷于用新的方式解决问题，他也不知道效果好坏。好就赚了，坏下次就不用这种方法了。有的人形成了自己的模式以后，总喜欢用一种已知效果最好的方法处理。前者就是探索，后者就是利用。
讲到探索和利用，总喜欢举一个多臂老虎机的例子。具体多臂老虎机是啥，自己百度下。如果我们有K个摇臂，同时有K次机会。仅探索的思想就是一个摇一下，以最后的期望作为标准。仅利用的思想是，先拿一小部分每个摇一下，从中选出最好的，剩下的一大部分都摇这个。显然，探索和利用是矛盾的。也就是探索-利用窘境。所以我们必须在探索和利用之间达到折中，使回报最大化。

轨迹：状态和动作的一个序列。执行一次轨迹就叫做一个回合(episode)

ps：之前没有关注过神经网络到底有什么特别之处，只知道通过神经网络可以对图片进行特征提取然后完成分类功能。之前以为这个是直接出现的，但前面其实已经有这个过程了：只不过当初以两个独立的形式存在。特征提取+分类器，神经网络只是对两者进行了整合。这样任务就变成了端到端的。这是神经网络比较方便的地方，可以让多个过程变成端到端的。
从上面的知识中明白，RL就是在和环境交互的过程中，确定一个策略。这个策略的价值很高，也就是最后能给我们带来极大的回报。如果利用神经网络的方法得到价值/策略函数。这种就叫做深度强化学习

书后面每一章都有一些习题，我会按照自己的理解做一些解答。可能有一些是不会的，暂时空下。日后明白后会再来补充滴~

1-1基本的结构就是agent+environment+policy
1-2监督学习是有标签的，在前向学习后根据标签得到结果再通过反向传播修正参数。但是强化学习因为延迟奖励的原因，可能训练的策略到最后因为无法及时评价好坏而造成多次无效的训练
1-3基本特征包括：无标签、数据是时间序列相关
1-4最大的原因还是算力提升吧，一些概念、算法好像上世纪就有了。
1-5状态是全局的，观测到的是部分。但现在实际应用中在模糊二者的区别
1-6三部分：policy function+value function+model
1-7有模型、免模型 policy base、value base
1-8直接目标不一样：策略迭代是优化策略，价值迭代是提高价值
1-9在开始学习的时候，是否完成了对环境的建模
1-10未知环境下，没有先验数据，智能体通过和环境交互试错，选取动作，得到最大回报。最终提升智能体能力

1-1 未知环境下，没有先验数据，智能体通过和环境交互试错，选取动作，得到最大回报。最终提升智能体能力
1-2 监督学习和无监督学习区别在于是否有标签，而数据是已经获得的。强化学习没有标签也没有初始数据，通过和环境交互获得数据。
1-3 使用场景就是博弈、自动驾驶领域
1-4 损失函数的作用都是通过梯度下降使损失loss不断降低。深度学习中损失函数代表预测值和真实值的差异。强化学习中损失函数代表最小化负的总奖赏
1-5 区别在开始学习的时候，是否完成了对环境的建模

因作者水平有限，如果错误之处，请在下方评论区指出！

情绪觉察日记第37天露露_e800
今天是家庭关系规划师的第二阶最后一天，慧萍老师帮我做了个案，帮我处理了埋在心底好多年的一份恐惧，并给了我深深的力量！这几天出来学习，爸妈过来婆家帮我带小孩，妈妈出于爱帮我收拾东西，并跟我先生和婆婆产生矛盾，妈妈觉得他们没有照顾好我…。今晚回家见到妈妈，我很欣赏她并赞扬她，妈妈说今晚要跟我睡我说好，当我们俩躺在床上准备睡觉的时候，我握着妈妈的手对她说:妈妈这几天辛苦你了，你看你多利害把我们的家收拾得
机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
铭刻于星（四十二）随风至
69夜晚，绍敏同学做完功课后，看了眼房外，没听到动静才敢从书包的夹层里拿出那个心形纸团。折痕压得很深，都有些旧了，想来是已经写好很久了。绍敏同学慢慢地、轻轻地捏开折叠处，待到全部拆开后，又反复抚平纸张，然后仔细地一字字默看。只是开头的三个字是第一次看到，让她心漏跳了几拍。“亲爱的绍敏：从四年级的时候，我就喜欢你了，但是我一直不敢说，怕影响你学习。六年级的时候听说有人跟你表白，你接受了，我很难过，但
UI学习——cell的复用和自定义cell Magnetic_h ui 学习
目录cell的复用手动（非注册）自动（注册）自定义cellcell的复用在iOS开发中，单元格复用是一种提高表格（UITableView）和集合视图（UICollectionView）滚动性能的技术。当一个UITableViewCell或UICollectionViewCell首次需要显示时，如果没有可复用的单元格，则视图会创建一个新的单元格。一旦这个单元格滚动出屏幕，它就不会被销毁。相反，它被添
学点心理知识，呵护孩子健康静候花开_7090
昨天听了华中师范大学教育管理学系副教授张玲老师的《哪里才是学生心理健康的最后庇护所，超越教育与技术的思考》的讲座。今天又重新学习了一遍，收获匪浅。张玲博士也注意到了当今社会上的孩子由于心理问题导致的自残、自杀及伤害他人等恶性事件。她向我们普及了一个重要的命题，她说心理健康的一些基本命题，我们与我们通常的一些教育命题是不同的，她还举了几个例子，让我们明白我们原来以为的健康并非心理学上的健康。比如如果
ArcGIS栅格计算器常见公式（赋值、0和空值的转换、补充栅格空值）研学随笔 arcgis 经验分享
我们在使用ArcGIS时通常经常用到栅格计算器，今天主要给大家介绍我日常中经常用到的几个公式，供大家参考学习。将特定值（-9999）赋值为0，例如-9999.Con("raster"==-9999,0,"raster")2.给空值赋予特定的值（如0）Con(IsNull("raster"),0,"raster")3.将特定的栅格值(如1)赋值为空值，其他保留原值SetNull("raster"==
【一起学Rust | 设计模式】习惯语法——使用借用类型作为参数、格式化拼接字符串、构造函数广龙宇一起学Rust #Rust设计模式 rust 设计模式开发语言
提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档文章目录前言一、使用借用类型作为参数二、格式化拼接字符串三、使用构造函数总结前言Rust不是传统的面向对象编程语言，它的所有特性，使其独一无二。因此，学习特定于Rust的设计模式是必要的。本系列文章为作者学习《Rust设计模式》的学习笔记以及自己的见解。因此，本系列文章的结构也与此书的结构相同（后续可能会调成结构），基本上分为三个部分
回溯 Leetcode 332 重新安排行程 mmaerd Leetcode刷题学习记录 leetcode 算法职场和发展
重新安排行程Leetcode332学习记录自代码随想录给你一份航线列表tickets，其中tickets[i]=[fromi,toi]表示飞机出发和降落的机场地点。请你对该行程进行重新规划排序。所有这些机票都属于一个从JFK（肯尼迪国际机场）出发的先生，所以该行程必须从JFK开始。如果存在多种有效的行程，请你按字典排序返回最小的行程组合。例如，行程[“JFK”,“LGA”]与[“JFK”,“LGB
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
2019-12-22-22:30 涓涓1016
今天是冬至，写下我的日更，是因为这两天的学习真的是能量的满满，让我看到了自己，未来另外一种可能性，也让我看到了这两年这几年的过程中我所接受那些痛苦的来源。一切的根源和痛苦都来自于人生，家庭，而你的原生家庭，你的爸爸和妈妈，是因为你这个灵魂在那一刻选择他们作为你的爸爸和妈妈来的，所以你得接受他，你得接纳他，他就是因为他的存在而给你的学习和成长带来这些痛苦，那其实是你必然要经历的这个过程，当你去接纳的
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
四章-32-点要素的聚合彩云飘过
本文基于腾讯课堂老胡的课《跟我学Openlayers--基础实例详解》做的学习笔记，使用的openlayers5.3.xapi。源码见1032.html，对应的官网示例https://openlayers.org/en/latest/examples/cluster.htmlhttps://openlayers.org/en/latest/examples/earthquake-clusters.
探索OpenAI和LangChain的适配器集成：轻松切换模型提供商 nseejrukjhad langchain easyui 前端 python
#探索OpenAI和LangChain的适配器集成：轻松切换模型提供商##引言在人工智能和自然语言处理的世界中，OpenAI的模型提供了强大的能力。然而，随着技术的发展，许多人开始探索其他模型以满足特定需求。LangChain作为一个强大的工具，集成了多种模型提供商，通过提供适配器，简化了不同模型之间的转换。本篇文章将介绍如何使用LangChain的适配器与OpenAI集成，以便轻松切换模型提供商
深入理解 MultiQueryRetriever：提升向量数据库检索效果的强大工具 nseejrukjhad 数据库 python
深入理解MultiQueryRetriever：提升向量数据库检索效果的强大工具引言在人工智能和自然语言处理领域，高效准确的信息检索一直是一个关键挑战。传统的基于距离的向量数据库检索方法虽然广泛应用，但仍存在一些局限性。本文将介绍一种创新的解决方案：MultiQueryRetriever，它通过自动生成多个查询视角来增强检索效果，提高结果的相关性和多样性。MultiQueryRetriever的工
GitHub上克隆项目 bigbig猩猩 github
从GitHub上克隆项目是一个简单且直接的过程，它允许你将远程仓库中的项目复制到你的本地计算机上，以便进行进一步的开发、测试或学习。以下是一个详细的步骤指南，帮助你从GitHub上克隆项目。一、准备工作1.安装Git在克隆GitHub项目之前，你需要在你的计算机上安装Git工具。Git是一个开源的分布式版本控制系统，用于跟踪和管理代码变更。你可以从Git的官方网站（https://git-scm.
HTML网页设计制作大作业（div+css）云南我的家乡旅游景点带文字滚动二挡起步 web前端期末大作业 web设计网页规划与设计 html css javascript dreamweaver 前端
Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作HTML期末大学生网页设计作业HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScript：做与用户的交互行为文章目录前端学习路线
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
node.js学习小猿L node.js node.js 学习 vim
node.js学习实操及笔记温故node.js，node.js学习实操过程及笔记~node.js学习视频node.js官网node.js中文网实操笔记githubcsdn笔记为什么学node.js可以让别人访问我们编写的网页为后续的框架学习打下基础，三大框架vuereactangular离不开node.jsnode.js是什么官网：node.js是一个开源的、跨平台的运行JavaScript的运行
阶段总结反思轻争
马上就要进入10月份了，今天做一下前段时间的总结和反思。前段时间，日更、英语、健身、护肤坚持的比较好。阅读、书法坚持的不好。1.中间被迫停更半个多月，其余时间一直在坚持日更挑战。偶尔也有不想写的时候，就做一下摘抄。因为阅读（输入）没跟上来，所以写作（输出）质量有待进一步加强。2.英语做到了一周至少学习5天，每次不少于30分钟，但是小班课没有跟上更新速度，下一步要争取利用零碎时间补听小班课。3.减肥
ARM驱动学习之基础小知识 JT灬新一 ARM 嵌入式 arm开发学习
ARM驱动学习之基础小知识•sch原理图工程师工作内容–方案–元器件选型–采购（能不能买到，价格）–原理图（涉及到稳定性）•layout画板工程师–layout（封装、布局，布线，log）（涉及到稳定性）–焊接的一部分工作（调试阶段板子的焊接）•驱动工程师–驱动，原理图，layout三部分的交集容易发生矛盾•PCB研发流程介绍–方案，原理图(网表)–layout工程师（gerber文件）–PCB板
ARM驱动学习之5 LEDS驱动 JT灬新一嵌入式 C 底层 arm开发学习单片机
ARM驱动学习之5LEDS驱动知识点：•linuxGPIO申请函数和赋值函数–gpio_request–gpio_set_value•三星平台配置GPIO函数–s3c_gpio_cfgpin•GPIO配置输出模式的宏变量–S3C_GPIO_OUTPUT注意点：DRIVER_NAME和DEVICE_NAME匹配。实现步骤：1.加入需要的头文件：//Linux平台的gpio头文件#include//三
ARM驱动学习之4小结 JT灬新一嵌入式 C++arm开发学习 linux
ARM驱动学习之4小结#include#include#include#include#include#defineDEVICE_NAME"hello_ctl123"MODULE_LICENSE("DualBSD/GPL");MODULE_AUTHOR("TOPEET");staticlonghello_ioctl(structfile*file,unsignedintcmd,unsignedlo
展现思维导图魅力，不断挖掘人生宝藏思维导图讲师Mandy
第13期最强思维导图训练营已经结束一周了，但是我依旧是感觉所有学员还在努力的学习，这些学员中有教师、学生、白领、公务员、宝妈等等，只要你努力，只要你想改变自己，任何行业，任何岗位都可以参与进来，28天足以让你见成效，在这28天中，我们的学员不仅仅是收获了一枚毕业证，最重要的是让自己的思维方式得到升级，今天的你为自己投资，明天的你就会感谢你今天的付出，我们来听一听来自13期最强思维导图训练营优秀学员
2019-3-23晨间日记红红火火小耳朵
今天是什么日子起床：7点40就寝：23点半天气：有太阳，不过一会儿出来一会儿进去特别清爽的凉意，还蛮舒服的心情：小激动要给女朋友过生日啦纪念日：田田女士过生日任务清单昨日完成的任务，最重要的三件事：1.英语一对一2.运动计划3.认真护肤习惯养成：调整状态周目标·完成进度英语七天打卡（5/7）轻课阅读（87/180）音标课（25/30）读书（福尔摩斯一章）学习·信息·阅读#英语课#Cookingte
【华为OD技术面试真题精选 - 非技术题】 -HR面，综合面_华为od hr面一个射手座的程序媛程序员华为od 面试职场和发展
最后的话最近很多小伙伴找我要Linux学习资料，于是我翻箱倒柜，整理了一些优质资源，涵盖视频、电子书、PPT等共享给大家！资料预览给大家整理的视频资料：给大家整理的电子书资料：如果本文对你有帮助，欢迎点赞、收藏、转发给朋友，让我有持续创作的动力！网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。需要这份系统化的资料的朋友，可以点击这里获
教育用心灵温暖心灵
@陈春丽长期学习班冯倩。今天一早就听到说高职合并，取消中专教育的教育信息。感觉是虽然知道，再听还是吓一跳。国家重视职业教育为何还要取消中专技术学校的教育？再听高中就要进行技术教育了，一部分人学习好继续努力学习考大学，一部分人在高中就可以进行职业教育接受职业教育了还要中专技术教育学校干什么呢！a有些职业教育学校转型升级快，不是孩子上完给找工作，而是学校帮孩子创业，我觉得是不错的方向！新闻新你得实时更
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
学习“论语”-第59天春峰轩
12.14子张问政。子曰：“居之无倦，行之以忠。”子张问为政之道。孔子说：“在位尽职不懈怠，执行政令要忠诚。”12.15子曰：“博学于文，约之以礼，亦可以弗畔矣夫！”孔子说：“君子广泛地学习文献，并且用礼节约束自己，也就不会离经叛道了。”12.16子曰：“君子成人之美，不成人之恶。小人反是。”孔子说：“君子成全别人的好事，而不助长别人的坏处。小人则与此相反行事。”知识点:“成人之美，不成人之恶”贯
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ztree设置禁用节点 3213213333332132 JavaScript ztree json setDisabledNode Ajax
ztree设置禁用节点的时候注意，当使用ajax后台请求数据,必须要设置为同步获取数据，否者会获取不到节点对象，导致设置禁用没有效果。 $(function(){ showTree(); setDisabledNode(); });
JVM patch by Taobao bookjovi java HotSpot
在网上无意中看到淘宝提交的hotspot patch，共四个，有意思，记录一下。 7050685：jsdbproc64.sh has a typo in the package name 7058036：FieldsAllocationStyle=2 does not work in 32-bit VM 7060619：C1 should respect inline and
将session存储到数据库中 dcj3sjt126com sql PHP session
CREATE TABLE sessions ( id CHAR(32) NOT NULL, data TEXT, last_accessed TIMESTAMP NOT NULL, PRIMARY KEY (id) ); <?php /** * Created by PhpStorm. * User: michaeldu * Date
Vector 171815164 vector
public Vector<CartProduct> delCart(Vector<CartProduct> cart, String id) { for (int i = 0; i < cart.size(); i++) { if (cart.get(i).getId().equals(id)) { cart.remove(i);
各连接池配置参数比较 g21121 连接池
排版真心费劲，大家凑合看下吧，见谅~ Druid DBCP C3P0 Proxool 数据库用户名称 Username Username User 数据库密码 Password Password Password 驱动名
[简单]mybatis insert语句添加动态字段 53873039oycg mybatis
mysql数据库,id自增,配置如下： <insert id="saveTestTb" useGeneratedKeys="true" keyProperty="id" parameterType=&
struts2拦截器配置云端月影 struts2拦截器
struts2拦截器interceptor的三种配置方法方法1. 普通配置法 <struts> <package name="struts2" extends="struts-default"> &
IE中页面不居中，火狐谷歌等正常 aijuans IE中页面不居中
问题是首页在火狐、谷歌、所有IE中正常显示，列表页的页面在火狐谷歌中正常，在IE6、7、8中都不中，觉得可能那个地方设置的让IE系列都不认识，仔细查看后发现，列表页中没写HTML模板部分没有添加DTD定义，就是<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3
String,int,Integer,char 几个类型常见转换 antonyup_2006 html sql .net
如何将字串 String 转换成整数 int? int i = Integer.valueOf(my_str).intValue(); int i=Integer.parseInt(str); 如何将字串 String 转换成Integer ? Integer integer=Integer.valueOf(str); 如何将整数 int 转换成字串 String ? 1.
PL/SQL的游标类型百合不是茶显示游标(静态游标)隐式游标游标的更新和删除 %rowtype ref游标(动态游标)
游标是oracle中的一个结果集,用于存放查询的结果; PL/SQL中游标的声明; 1,声明游标 2,打开游标(默认是关闭的); 3,提取数据 4,关闭游标注意的要点:游标必须声明在declare中,使用open打开游标,fetch取游标中的数据,close关闭游标隐式游标:主要是对DML数据的操作隐
JUnit4中@AfterClass @BeforeClass @after @before的区别对比 bijian1013 JUnit4 单元测试
一.基础知识 JUnit4使用Java5中的注解（annotation），以下是JUnit4常用的几个annotation： @Before：初始化方法对于每一个测试方法都要执行一次（注意与BeforeClass区别，后者是对于所有方法执行一次）@After：释放资源对于每一个测试方法都要执行一次（注意与AfterClass区别，后者是对于所有方法执行一次
精通Oracle10编程SQL(12)开发包 bijian1013 oracle 数据库 plsql
/* *开发包 *包用于逻辑组合相关的PL/SQL类型（例如TABLE类型和RECORD类型）、PL/SQL项（例如游标和游标变量）和PL/SQL子程序（例如过程和函数） */ --包用于逻辑组合相关的PL/SQL类型、项和子程序，它由包规范和包体两部分组成 --建立包规范：包规范实际是包与应用程序之间的接口，它用于定义包的公用组件，包括常量、变量、游标、过程和函数等 --在包规
【EhCache二】ehcache.xml配置详解 bit1129 ehcache.xml
在ehcache官网上找了多次，终于找到ehcache.xml配置元素和属性的含义说明文档了，这个文档包含在ehcache.xml的注释中！ ehcache.xml ： http://ehcache.org/ehcache.xml ehcache.xsd ： http://ehcache.org/ehcache.xsd ehcache配置文件的根元素是ehcahe ehcac
java.lang.ClassNotFoundException: org.springframework.web.context.ContextLoaderL 白糖_ java eclipse spring tomcat Web
今天学习spring+cxf的时候遇到一个问题：在web.xml中配置了spring的上下文监听器： <listener> <listener-class>org.springframework.web.context.ContextLoaderListener</listener-class> </listener> 随后启动
angular.element boyitech AngularJS AngularJS API angular.element
angular.element 描述: 包裹着一部分DOM element或者是HTML字符串，把它作为一个jQuery元素来处理。（类似于jQuery的选择器啦）如果jQuery被引入了，则angular.element就可以看作是jQuery选择器，选择的对象可以使用jQuery的函数；如果jQuery不可用，angular.e
java-给定两个已排序序列，找出共同的元素。 bylijinnan java
import java.util.ArrayList; import java.util.Arrays; import java.util.List; public class CommonItemInTwoSortedArray { /** * 题目：给定两个已排序序列，找出共同的元素。 * 1.定义两个指针分别指向序列的开始。 * 如果指向的两个元素
sftp 异常，有遇到的吗？求解 Chen.H java jcraft auth jsch jschexception
com.jcraft.jsch.JSchException: Auth cancel at com.jcraft.jsch.Session.connect(Session.java:460) at com.jcraft.jsch.Session.connect(Session.java:154) at cn.vivame.util.ftp.SftpServerAccess.connec
[生物智能与人工智能]神经元中的电化学结构代表什么? comsci 人工智能
我这里做一个大胆的猜想,生物神经网络中的神经元中包含着一些化学和类似电路的结构,这些结构通常用来扮演类似我们在拓扑分析系统中的节点嵌入方程一样,使得我们的神经网络产生智能判断的能力,而这些嵌入到节点中的方程同时也扮演着"经验"的角色.... 我们可以尝试一下...在某些神经
通过LAC和CID获取经纬度信息 dai_lm lac cid
方法1：用浏览器打开http://www.minigps.net/cellsearch.html，然后输入lac和cid信息(mcc和mnc可以填0)，如果数据正确就可以获得相应的经纬度方法2：发送HTTP请求到http://www.open-electronics.org/celltrack/cell.php?hex=0&lac=<lac>&cid=&
JAVA的困难分析 datamachine java
前段时间转了一篇SQL的文章（http://datamachine.iteye.com/blog/1971896），文章不复杂，但思想深刻，就顺便思考了一下java的不足，当砖头丢出来，希望引点和田玉。 -----------------------------------------------------------------------------------------
小学5年级英语单词背诵第二课 dcj3sjt126com english word
money 钱 paper 纸 speak 讲，说 tell 告诉 remember 记得，想起 knock 敲，击，打 question 问题 number 数字，号码 learn 学会，学习 street 街道 carry 搬运，携带 send 发送，邮寄，发射 must 必须 light 灯，光线，轻的 front
linux下面没有tree命令 dcj3sjt126com linux
centos p安装 yum -y install tree mac os安装 brew install tree 首先来看tree的用法 tree 中文解释：tree 功能说明：以树状图列出目录的内容。语　　法：tree [-aACdDfFgilnNpqstux][-I <范本样式>][-P <范本样式
Map迭代方式，Map迭代，Map循环蕃薯耀 Map循环 Map迭代 Map迭代方式
Map迭代方式，Map迭代，Map循环 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年
Spring Cache注解+Redis hanqunfeng spring
Spring3.1 Cache注解依赖jar包：  <dependency> <groupId>org.springframework.data</groupId> <artifactId>spring-data-redis</artifactId>
Guava中针对集合的 filter和过滤功能 jackyrong filter
在guava库中，自带了过滤器(filter)的功能，可以用来对collection 进行过滤，先看例子： @Test public void whenFilterWithIterables_thenFiltered() { List<String> names = Lists.newArrayList("John"
学习编程那点事 lampcy 编程 android PHP html5
一年前的夏天，我还在纠结要不要改行，要不要去学php？能学到真本事吗？改行能成功吗？太多的问题，我终于不顾一切，下定决心，辞去了工作，来到传说中的帝都。老师给的乘车方式还算有效，很顺利的就到了学校，赶巧了，正好学校搬到了新校区。先安顿了下来，过了个轻松的周末，第一次到帝都，逛逛吧！接下来的周一，是我噩梦的开始，学习内容对我这个零基础的人来说，除了勉强完成老师布置的作业外，我已经没有时间和精力去
架构师之流处理---------bytebuffer的mark,limit和flip nannan408 ByteBuffer
1.前言。如题，limit其实就是可以读取的字节长度的意思，flip是清空的意思，mark是标记的意思。 2.例子. 例子代码: String str = "helloWorld"; ByteBuffer buff = ByteBuffer.wrap(str.getBytes()); Sy
org.apache.el.parser.ParseException: Encountered " ":" ": "" at line 1, column 1 Everyday都不同 $转义 el表达式
最近在做Highcharts的过程中，在写js时，出现了以下异常：严重: Servlet.service() for servlet jsp threw exception org.apache.el.parser.ParseException: Encountered " ":" ": "" at line 1,
用Java实现发送邮件到163 tntxia java实现
/* 在java版经常看到有人问如何用javamail发送邮件？如何接收邮件？如何访问多个文件夹等。问题零散，而历史的回复早已经淹没在问题的海洋之中。本人之前所做过一个java项目，其中包含有WebMail功能，当初为用java实现而对javamail摸索了一段时间，总算有点收获。看到论坛中的经常有此方面的问题，因此把我的一些经验帖出来，希望对大家有些帮助。此篇仅介绍用
探索实体类存在的真正意义 java小叶檀 POJO
一. 实体类简述实体类其实就是俗称的POJO,这种类一般不实现特殊框架下的接口，在程序中仅作为数据容器用来持久化存储数据用的 POJO（Plain Old Java Objects）简单的Java对象它的一般格式就是 public class A{ private String id; public Str

（一）强化学习概述

1.什么是强化学习？

2.强化学习一些常见的概念

你可能感兴趣的:(强化学习,学习,人工智能)