- 数据分析学习总结笔记16:NLP自然语言处理与文本探索性分析
Lynn Wen
数据分析学习总结笔记
文章目录1引言2数据集3文本统计信息分析4Ngram模型探索5基于pyLDAvis的主题模型探索6绘制词云图7情感分析7.1TextBlob7.2VaderSentimentAnalysis8命名实体识别NER9词性标签探索分析10文本可读性分析11结语1引言探索性数据分析是所有机器学习工作流程中最重要的部分之一,自然语言处理也不例外。但是应该选择哪些工具来进行有效地探索,及对文本数据进行可视化呢
- 数据分析学习总结笔记14:A/B Test及Python实现
Lynn Wen
数据分析学习总结笔记
文章目录1引言2A/BTest的必要性3统计形式主义的必要性4假设检验入门4.1z检验评估平均花费时间4.2z检验评估平均花费时间4.3Z检验评估转化率5总结1引言A/BTest,又称为对比测试,指的是一种实验技术,以确定根据一个选定的指标,新的设计是否带来改进。在Web分析和UI用户体验中,这个想法是通过随机分割流量并比较每个分割点的指标,来比较现有网站(a)和新网站(b)的区别。举个例子说明:
- 数据分析学习总结笔记10:网络分析
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记10:网络分析1网络分析概述1.1三大社会科学理论1.2网络分析内容2网络的基本概念与特征量2.1网络的发展2.2网络的表达形式2.3网络基本概念与特征量2.3.1网络整体指标2.3.2网络节点指标3社会网络分析3.1社会网络分析法概述3.2微博传播简介3.3社会网络分析工具——Cytoscape简介3.4社会网络分析的应用4社交网络4.1社交网络传播4.2社交网络营销4.2.
- 数据分析学习总结笔记07:方差分析
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记07:方差分析1方差分析概述1.1方差分析简介1.2方差分析基本思想和原理1.3方差分析的基本假设2单因素方差分析(One-wayANOVA)2.1单因素方差分析概念2.2单因素方差分析的原理2.3单因素方差分析的基本假设3双因素方差分析(Two-wayANOVA)3.1无交互作用的双因素方差分析3.2有交互作用的双因素方差分析4方差分析实践操作4.1Excel4.2SPSS4
- 数据分析学习总结笔记07:回归分析概述
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记07:回归分析概述1什么是回归分析1.1回归分析概述1.2“回归”的由来1.3回归分析归纳1.3.1回归分析的主要内容1.3.2回归分析的一般模型2统计学中的回归模型2.1相关分析与回归分析2.2回归模型的具体化2.3回归类型的判断2.4回归分析中的统计问题3机器学习角度看回归3.1数据分析问题的不同视角3.2机器学习分类3.3机器学习的流程1什么是回归分析1.1回归分析概述回
- 数据分析学习总结笔记08:数据分类典型方法及其R语言实现
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记08:数据分类典型方法及其R语言操作1判别分析1.1判别分析简介1.1.1判别分析概念1.1.2判别分析的种类1.2距离判别法1.2.1两总体距离判别1.2.2多总体距离判别1.3Fisher判别法1.3.1Fisher判别法原理1.3.2Fisher判别法步骤1.4Bayes判别法1.4.1Bayes判别法概念1.4.2概率判别1.4.3损失判别1.5几种判别方法总结1.6F
- 数据分析学习总结笔记09:文本分析
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记09:文本分析1文本分析1.1文本分析概述1.2结构/非结构化数据1.3文本数据特点1.4自然语言处理——NLP1.5文本挖掘的应用2文本分词2.1英文分词——KNIME2.2中文分词2.2.1中文分词工具2.2.2分词的方法2.2.3中文分词实操——pynlpir2.2.3.1pynlpir准备2.2.3.1操作步骤3中文关键词提取3.1关键词提取概述3.2关键词提取方法3.
- 数据分析学习总结笔记04:异常值处理
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记04:异常值处理1异常值概述2如何判断异常值2.1简单的统计分析2.23δ原则2.3四分位数检验/箱型图分析2.4格拉布斯检验2.5基于模型检测2.6基于距离检测2.7基于密度检测3如何处理异常值1异常值概述数据存在异常值、缺失值和重复值是数据清洗工作中主要可能遇到的三个问题。异常值是数据中的极端的观测值,即在数据集中存在不合理的值,又称离群点。在统计学中异常值(outlier
- 数据分析学习总结笔记03:数据降维经典方法
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记03:数据降维经典方法1.数据降维概述2.数据降维的应用3.数据降维经典方法3.1主成分分析(PCA)3.1.1PCA概述3.1.2PCA原理3.1.3PCA&LDA3.1.4基于标准化变量的主成分分析3.1.5主成分个数的选择3.1.6主成分分析的用途3.1.7PCA实现3.2因子分析(FactorAnalysis)3.2.1因子分析概述3.2.2因子分析原理3.2.3因子分
- 数据分析学习总结笔记05:缺失值分析及处理
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记05:缺失值分析及处理1缺失值概念2缺失值分析的类别2.1按数据缺失形式划分2.2按缺失机制与方式划分3缺失值的处理方法3.1删除缺失值3.2缺失值替代3.3缺失值分析1缺失值概念在数据收集过程中,由于各种原因可能导致数据收集不全,就会产生缺失值,且这种情况往往无法避免。因此,缺失值分析是数据处理工作中常见的问题之一,如果处理不当,会导致部分分析过程简单地从分析中丢弃这些有缺失
- 数据分析学习总结笔记17:文本分析入门案例实战
Lynn Wen
数据分析学习总结笔记
文章目录1数据准备2分词3统计词频4词云5提取特征6用sklearn进行训练1数据准备数据样例如下,数据总量为7.7万+:本节通过一个实战的例子来展示文本分析的最简单流程。首先设定因变量为原始数据中的"评分"。自变量是"评价内容",这里根据评价内容提取TF-IDF特征。之后,通过评价内容的特征建模预测下整体评分。importjieba#导入分词模块importpandasaspd#导入Pandas
- 数据分析学习总结笔记13:生存分析及Python实现
Lynn Wen
数据分析学习总结笔记
文章目录1引言2定义3数学直观4Kaplan-Meier估计5Cox比例风险模型6总结1引言生存分析是一套统计方法,用来解决诸如“多长时间后,某个特定事件发生”这样的问题;换句话说,也可以称之为事件时间分析。这种方法被称为生存分析,是由于主要是由医学研究人员开发的,他们更感兴趣的是寻找不同群体患者的预期寿命(例如:用药物a治疗的组群1和用药物b治疗的组群2)。这种分析不仅可以应用于传统的死亡事件,
- 数据分析学习总结笔记11:空间复杂度和时间复杂度
Lynn Wen
数据分析学习总结笔记
文章目录1算法与程序2算法复杂度概述3时间复杂度3.1时间复杂度记号O3.2时间复杂度的计算3.3时间复杂度的类别3.4时间复杂度分析实例4空间复杂度5O(1),O(n),O(logn),O(nlogn)的区别本文较简略,具体可参照:算法的时间复杂度和空间复杂度-总结1算法与程序(1)算法:是解决问题的方法或过程,严格的讲是满足下述性质的指令序列:输入:有零个或多个外部量作为算法的输入;输出:算法
- 数据分析学习总结笔记15:时间序列分析及Python实现
Lynn Wen
数据分析学习总结笔记
文章目录1引言2时间序列的特性2.1自相关2.2季节性2.3平稳性3时间序列建模3.1移动平均法3.2指数平滑法3.3双指数平滑法3.4三重指数平滑法3.5周期性差分自动平滑回归模型(SARIMA)4实例——股票价格的预测5结论1引言本篇主要帮助大家理解移动平均,指数平滑,平稳性,自相关,SARIMA,通过案例和Python编程实现时间序列的预测技术。无论我们是预测金融市场或股票趋势,或是电能耗费
- 数据分析学习总结笔记02:聚类分析及其R语言实现
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记02:聚类分析及其R语言实现1.聚类分析概述1.1聚类分析简介1.2聚类分析原理1.3聚类&分类1.4如何刻画相似度?2.聚类分析的方法2.1层次聚类2.1.1层次聚类步骤2.1.2简介2.1.3层次聚类的类型2.1.4层次聚类族群个数的选择2.1.5层次聚类R语言实践2.2非层次聚类——K-Means2.2.1K-means聚类简介2.2.2K-means聚类步骤2.2.3k
- 数据分析学习总结笔记06:T检验的原理和步骤
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记06:T检验的原理和步骤1单样本T检验1.1单样本T检验概念1.2单样本T检验步骤2独立样本T检验2.1独立样本T检验概念2.2独立样本T检验步骤1单样本T检验1.1单样本T检验概念目的:利用来自某总体的样本数据,推断该总体的均值是否与指定的检验值之间存在显著性差异。前提:样本来自的总体服从正态分布。基本思想:首先,计算出样本均值;其次,根据经验或以往的调查结果,对总体的均值提
- 数据分析学习总结笔记12:空间自相关——空间位置与相近位置的指标测度
Lynn Wen
数据分析学习总结笔记
文章目录1空间地理相关性2技术性定义3空间相关类型4Moran’sI(莫兰系数)5空间自相关的应用6案例研究:意大利人口迁移分析7总结8实现工具1空间地理相关性地理空间自相关是指一个物体与附近其他物体的相似程度。通俗地说,它度量的是相近物体与其他相近物体的相似程度。地理信息系统的第一规则:一切事物都与其他事物相关联。但是相近事物比较远事物更相关(Waldor.Tobler,1970)。为了理解这个
- 数据分析学习总结笔记01:情感分析
Lynn Wen
数据分析学习总结笔记
数据分析学习总结笔记01:情感分析1.情感分析概述1.1什么是情感分析1.2情感分析的范畴1.3细粒度情感分析1.4情感分析的实际应用2.情感分析方法2.1情感分析基本步骤2.2情感分析分类2.2.1基于情感词典2.2.2基于机器学习2.2.3混合方法2.3情感分析评价标准[^1]3.情感分析工具3.1可能用到的软件3.2情感分析网站3.2Python情感分析APIs3.3情感分析资源[^4]3.
- 312个免费高速HTTP代理IP(能隐藏自己真实IP地址)
yangshangchuan
高速免费superwordHTTP代理
124.88.67.20:843
190.36.223.93:8080
117.147.221.38:8123
122.228.92.103:3128
183.247.211.159:8123
124.88.67.35:81
112.18.51.167:8123
218.28.96.39:3128
49.94.160.198:3128
183.20
- pull解析和json编码
百合不是茶
androidpull解析json
n.json文件:
[{name:java,lan:c++,age:17},{name:android,lan:java,age:8}]
pull.xml文件
<?xml version="1.0" encoding="utf-8"?>
<stu>
<name>java
- [能源与矿产]石油与地球生态系统
comsci
能源
按照苏联的科学界的说法,石油并非是远古的生物残骸的演变产物,而是一种可以由某些特殊地质结构和物理条件生产出来的东西,也就是说,石油是可以自增长的....
那么我们做一个猜想: 石油好像是地球的体液,我们地球具有自动产生石油的某种机制,只要我们不过量开采石油,并保护好
- 类与对象浅谈
沐刃青蛟
java基础
类,字面理解,便是同一种事物的总称,比如人类,是对世界上所有人的一个总称。而对象,便是类的具体化,实例化,是一个具体事物,比如张飞这个人,就是人类的一个对象。但要注意的是:张飞这个人是对象,而不是张飞,张飞只是他这个人的名字,是他的属性而已。而一个类中包含了属性和方法这两兄弟,他们分别用来描述对象的行为和性质(感觉应该是
- 新站开始被收录后,我们应该做什么?
IT独行者
PHPseo
新站开始被收录后,我们应该做什么?
百度终于开始收录自己的网站了,作为站长,你是不是觉得那一刻很有成就感呢,同时,你是不是又很茫然,不知道下一步该做什么了?至少我当初就是这样,在这里和大家一份分享一下新站收录后,我们要做哪些工作。
至于如何让百度快速收录自己的网站,可以参考我之前的帖子《新站让百
- oracle 连接碰到的问题
文强chu
oracle
Unable to find a java Virtual Machine--安装64位版Oracle11gR2后无法启动SQLDeveloper的解决方案
作者:草根IT网 来源:未知 人气:813标签:
导读:安装64位版Oracle11gR2后发现启动SQLDeveloper时弹出配置java.exe的路径,找到Oracle自带java.exe后产生的路径“C:\app\用户名\prod
- Swing中按ctrl键同时移动鼠标拖动组件(类中多借口共享同一数据)
小桔子
java继承swing接口监听
都知道java中类只能单继承,但可以实现多个接口,但我发现实现多个接口之后,多个接口却不能共享同一个数据,应用开发中想实现:当用户按着ctrl键时,可以用鼠标点击拖动组件,比如说文本框。
编写一个监听实现KeyListener,NouseListener,MouseMotionListener三个接口,重写方法。定义一个全局变量boolea
- linux常用的命令
aichenglong
linux常用命令
1 startx切换到图形化界面
2 man命令:查看帮助信息
man 需要查看的命令,man命令提供了大量的帮助信息,一般可以分成4个部分
name:对命令的简单说明
synopsis:命令的使用格式说明
description:命令的详细说明信息
options:命令的各项说明
3 date:显示时间
语法:date [OPTION]... [+FORMAT]
- eclipse内存优化
AILIKES
javaeclipsejvmjdk
一 基本说明 在JVM中,总体上分2块内存区,默认空余堆内存小于 40%时,JVM就会增大堆直到-Xmx的最大限制;空余堆内存大于70%时,JVM会减少堆直到-Xms的最小限制。 1)堆内存(Heap memory):堆是运行时数据区域,所有类实例和数组的内存均从此处分配,是Java代码可及的内存,是留给开发人
- 关键字的使用探讨
百合不是茶
关键字
//关键字的使用探讨/*访问关键词private 只能在本类中访问public 只能在本工程中访问protected 只能在包中和子类中访问默认的 只能在包中访问*//*final 类 方法 变量 final 类 不能被继承 final 方法 不能被子类覆盖,但可以继承 final 变量 只能有一次赋值,赋值后不能改变 final 不能用来修饰构造方法*///this()
- JS中定义对象的几种方式
bijian1013
js
1. 基于已有对象扩充其对象和方法(只适合于临时的生成一个对象):
<html>
<head>
<title>基于已有对象扩充其对象和方法(只适合于临时的生成一个对象)</title>
</head>
<script>
var obj = new Object();
- 表驱动法实例
bijian1013
java表驱动法TDD
获得月的天数是典型的直接访问驱动表方式的实例,下面我们来展示一下:
MonthDaysTest.java
package com.study.test;
import org.junit.Assert;
import org.junit.Test;
import com.study.MonthDays;
public class MonthDaysTest {
@T
- LInux启停重启常用服务器的脚本
bit1129
linux
启动,停止和重启常用服务器的Bash脚本,对于每个服务器,需要根据实际的安装路径做相应的修改
#! /bin/bash
Servers=(Apache2, Nginx, Resin, Tomcat, Couchbase, SVN, ActiveMQ, Mongo);
Ops=(Start, Stop, Restart);
currentDir=$(pwd);
echo
- 【HBase六】REST操作HBase
bit1129
hbase
HBase提供了REST风格的服务方便查看HBase集群的信息,以及执行增删改查操作
1. 启动和停止HBase REST 服务 1.1 启动REST服务
前台启动(默认端口号8080)
[hadoop@hadoop bin]$ ./hbase rest start
后台启动
hbase-daemon.sh start rest
启动时指定
- 大话zabbix 3.0设计假设
ronin47
What’s new in Zabbix 2.0?
去年开始使用Zabbix的时候,是1.8.X的版本,今年Zabbix已经跨入了2.0的时代。看了2.0的release notes,和performance相关的有下面几个:
:: Performance improvements::Trigger related da
- http错误码大全
byalias
http协议javaweb
响应码由三位十进制数字组成,它们出现在由HTTP服务器发送的响应的第一行。
响应码分五种类型,由它们的第一位数字表示:
1)1xx:信息,请求收到,继续处理
2)2xx:成功,行为被成功地接受、理解和采纳
3)3xx:重定向,为了完成请求,必须进一步执行的动作
4)4xx:客户端错误,请求包含语法错误或者请求无法实现
5)5xx:服务器错误,服务器不能实现一种明显无效的请求
- J2EE设计模式-Intercepting Filter
bylijinnan
java设计模式数据结构
Intercepting Filter类似于职责链模式
有两种实现
其中一种是Filter之间没有联系,全部Filter都存放在FilterChain中,由FilterChain来有序或无序地把把所有Filter调用一遍。没有用到链表这种数据结构。示例如下:
package com.ljn.filter.custom;
import java.util.ArrayList;
- 修改jboss端口
chicony
jboss
修改jboss端口
%JBOSS_HOME%\server\{服务实例名}\conf\bindingservice.beans\META-INF\bindings-jboss-beans.xml
中找到
<!-- The ports-default bindings are obtained by taking the base bindin
- c++ 用类模版实现数组类
CrazyMizzz
C++
最近c++学到数组类,写了代码将他实现,基本具有vector类的功能
#include<iostream>
#include<string>
#include<cassert>
using namespace std;
template<class T>
class Array
{
public:
//构造函数
- hadoop dfs.datanode.du.reserved 预留空间配置方法
daizj
hadoop预留空间
对于datanode配置预留空间的方法 为:在hdfs-site.xml添加如下配置
<property>
<name>dfs.datanode.du.reserved</name>
<value>10737418240</value>
 
- mysql远程访问的设置
dcj3sjt126com
mysql防火墙
第一步: 激活网络设置 你需要编辑mysql配置文件my.cnf. 通常状况,my.cnf放置于在以下目录: /etc/mysql/my.cnf (Debian linux) /etc/my.cnf (Red Hat Linux/Fedora Linux) /var/db/mysql/my.cnf (FreeBSD) 然后用vi编辑my.cnf,修改内容从以下行: [mysqld] 你所需要: 1
- ios 使用特定的popToViewController返回到相应的Controller
dcj3sjt126com
controller
1、取navigationCtroller中的Controllers
NSArray * ctrlArray = self.navigationController.viewControllers;
2、取出后,执行,
[self.navigationController popToViewController:[ctrlArray objectAtIndex:0] animated:YES
- Linux正则表达式和通配符的区别
eksliang
正则表达式通配符和正则表达式的区别通配符
转载请出自出处:http://eksliang.iteye.com/blog/1976579
首先得明白二者是截然不同的
通配符只能用在shell命令中,用来处理字符串的的匹配。
判断一个命令是否为bash shell(linux 默认的shell)的内置命令
type -t commad
返回结果含义
file 表示为外部命令
alias 表示该
- Ubuntu Mysql Install and CONF
gengzg
Install
http://www.navicat.com.cn/download/navicat-for-mysql
Step1: 下载Navicat ,网址:http://www.navicat.com/en/download/download.html
Step2:进入下载目录,解压压缩包:tar -zxvf navicat11_mysql_en.tar.gz
- 批处理,删除文件bat
huqiji
windowsdos
@echo off
::演示:删除指定路径下指定天数之前(以文件名中包含的日期字符串为准)的文件。
::如果演示结果无误,把del前面的echo去掉,即可实现真正删除。
::本例假设文件名中包含的日期字符串(比如:bak-2009-12-25.log)
rem 指定待删除文件的存放路径
set SrcDir=C:/Test/BatHome
rem 指定天数
set DaysAgo=1
- 跨浏览器兼容的HTML5视频音频播放器
天梯梦
html5
HTML5的video和audio标签是用来在网页中加入视频和音频的标签,在支持html5的浏览器中不需要预先加载Adobe Flash浏览器插件就能轻松快速的播放视频和音频文件。而html5media.js可以在不支持html5的浏览器上使video和audio标签生效。 How to enable <video> and <audio> tags in
- Bundle自定义数据传递
hm4123660
androidSerializable自定义数据传递BundleParcelable
我们都知道Bundle可能过put****()方法添加各种基本类型的数据,Intent也可以通过putExtras(Bundle)将数据添加进去,然后通过startActivity()跳到下一下Activity的时候就把数据也传到下一个Activity了。如传递一个字符串到下一个Activity
把数据放到Intent
- C#:异步编程和线程的使用(.NET 4.5 )
powertoolsteam
.net线程C#异步编程
异步编程和线程处理是并发或并行编程非常重要的功能特征。为了实现异步编程,可使用线程也可以不用。将异步与线程同时讲,将有助于我们更好的理解它们的特征。
本文中涉及关键知识点
1. 异步编程
2. 线程的使用
3. 基于任务的异步模式
4. 并行编程
5. 总结
异步编程
什么是异步操作?异步操作是指某些操作能够独立运行,不依赖主流程或主其他处理流程。通常情况下,C#程序
- spark 查看 job history 日志
Stark_Summer
日志sparkhistoryjob
SPARK_HOME/conf 下:
spark-defaults.conf 增加如下内容
spark.eventLog.enabled true spark.eventLog.dir hdfs://master:8020/var/log/spark spark.eventLog.compress true
spark-env.sh 增加如下内容
export SP
- SSH框架搭建
wangxiukai2015eye
springHibernatestruts
MyEclipse搭建SSH框架 Struts Spring Hibernate
1、new一个web project。
2、右键项目,为项目添加Struts支持。
选择Struts2 Core Libraries -<MyEclipes-Library>
点击Finish。src目录下多了struts