zadavis

用numpy和pandas进行数据分析

摘要：

入门
1.Series
2.DataFrame
3.pandas io 操作
4.indexing & Selecting
5.reindx(对列，行）
6.Nan
7.多级index
8.map和replace
进阶
1.Series，DataFrame简单计算（加减乘max，min，describe）
2.Series，DataFrame排序
3.DataFrame重命名
4.DataFrame的merge
5.Concatenate和Combine（结合，填补）
6.用apply处理数据
7.Series，DataFrame中用duplicated去重
8.时间序列简单操作
9.时间序列的采样和画图
10.数据分箱技术Binning
11.数据分组技术Groupby
12.数据聚合技术Aggregation
13.透视表
14.分组和透视功能实战

一、NUMPY

1.创建ndarray

import numpy as np
import numpy as np #导入numpy
a1=np.array([1,2,10,4]) #利用列表构建一维数组, array里得是同一数据类型,可以是列表，元组，数组或其他序列
a2=np.array([[1,2,3,4],[4,15,6,17]])#利用列表构建二维数组，可以理解为矩阵
a3=np.zeros(10)  / zeros_like
a4=np.ones(5)   /  ones_like
a5=np.empty((2,2,3))
a6=np.arange(10)
a7 = np.eye(6)

2.数据类型

hot=np.dtype([('name',np.str_,10),('number',np.int64),('price',np.float64)])
print(hot)
a8= np.array([1,2,3],dtype=np.float64)
a9=a8.astype(np.int64) #转换数据类型

3.数据读入

import numpy as np
raw_DATA =
raw_data = np.loadtxt('coupon_nm_new.csv',delimiter=",",dtype=hot)

4.索引和切片

#索引第3家店铺
shop[2]
#索引第3家到第5家店铺
shop[2:6]
#赋值操作
shop[2:5]=6
#多维数组索引
arr=np.array([raw_data['团购活动ID'],raw_data['团购名'],raw_data['购买人数']])
#数组索引
arrt[0,0:3]
#通过布尔值进行索引（赋值的运算会产生布尔型数组）
raw_data[raw_data['购买人数']==50]
raw_data[(raw_data['购买人数']=50)|(raw_data['团购名']!='a')]  &(和) |(或)  and和or无效
#当把值赋值给一个切片时，该值会传播到整个选区
a1 = np.array([0,1,2,3,4,5,6,7,8,9])
a2 = a1[5:8]
a2[0] =999 然后a1[5]会变成999

5.数组转置和轴对换

6.统计分析及函数

#用numpy进行统计分析 sum mean std  var min max
price=raw_data['团购价']
price.sort()
print('排序后团购价为:',price)
np.sum(price)
np.mean(price)
np.var(price)
np.max(price)
np.min(price)

#其他函数
np.sqrt(price)
np.square(price)
np.exp(price)
np.randn(8) #反回标准正态分布的随机数
np.maximum(数组一,数组二)

7.唯一化

二、Pandas

1.Series

2.DataFrame

3.读取文件

raw_data = pd.read_excel('文件名')
raw_data2 = pd.read_csv('文件名') #文件放在pycharmproject里
raw_data3 = pd.read_excel(r'F://````地址')

4.索引和切片

# 筛选某一列的值，返回符合条件的所有行
 df1[df1[column1] == value1]

 # 筛选某一列的值，返回符合条件的某一列
 df1[column2][df1[column1] == value1]

 # 筛选多列的值，返回符合条件的所有行
 df1[df1[column1] == value1][df1[column2] == value2][...]

# 筛选多列的值，返回符合该条件的多列
df1[[column1, column2]][df1[column1] == value1][...]

raw_data.iloc[1,:] = raw_data.iloc[0,:]# 第一行赋值给第二行

#Series.iloc[第几行][第几列]

# 或raw_data.loc[第几行,列名]

#其中第几行不用数字，用值的话，需要先  raw_data.set_index('Team') 再 raw_data.loc[['TeamA’,'TeamB']，列名]


选择其中一列元素 raw_data[column1]
    选择两列元素 raw_data[[column1,column2]] 
    选择评分大于3.5的商家所有信息 raw_data[raw_data['评分']>3.5]
    打印所有列名 raw_data.columns
    得到每一行的所有值raw_data.values
    人均这列所有元素+100  raw_data['人均']+100
    按人均排序，从小到大 raw_data.sort_values(['人均'],ascending=true)
    按index排序 raw_data.sort_index()

5.排序和排名

对索引值进行排序

a.sort_index()#默认升序
a.sort_values(by=[‘a’,''b],axis=0,ascending=[False,True])#先按a列降序，再按b列升序

6.描述统计

raw_data.describe()  #生成描述统计
raw_data.idxmax(最大值的索引)#最大值的索引
raw_data.max()
quantile\sum\mean\median\mad\var\std\cumsum
corr\cov\count

7.唯一值、缺失值

唯一值
显示具体的唯一值

df['col'].unique()

显示列唯一值个数

df['col'].nunique()

缺失值

a.unique()
is_null_data = raw_data[raw_data['评价数'].isnull() == True]
raw_data5 =raw_data[raw_data['评价数'].isnull() == False] #去掉缺失值后的数据

8.清洗数据

1.移除重复值

df.duplicated()#返回布尔型Series 表示各行是否有重复行
df.drop_duplicates() #返回移除了重复行后的数据

filter_words = ['人均：','人均','大概','左右','差不多']
for  i in range(len(raw_data)):
    value = raw_data['人均'].iloc[i]
    if type(value) is int or type(value) is float:
        continue
    for word in filter_words:
        if word in value:
            raw_data.loc[i,'人均'] = raw_data.loc[i,'人均'].replace(word,'')
print(raw_data.head())


#apply（） 可以随意调用任何函数
def clean_price(x):
     filter_words = ['人均：', '人均', '大概', '左右', '差不多']
     if type(x) is int or type(x) is float:
         return x
     for word in filter_words:
        if word in value:
            x = x.replace(word, '')
     return x

9.聚类

def cate_shops(x):
    if x <=2:
        return 0
    if x > 2 and x <= 3.5 :
        return 1
    if x > 3.5:
        return 2
raw_data['商家等级'] = raw_data['评分'].apply(cate_shops)
cata =raw_data.groupby(by=['商家等级']).agg({'人均':'mean'})  #根据商家等级列合在一起 再用agg相加
print(cata)

10.数据表连接

pd.concat([df1,df2,df3]) #数据拼接
pd.merge(left,right,on='key') #主键相同进行内连接
pd.merge(left,right,on=['key1','key2']) #多个主键内连接
pd.merge(left,right,how='left',on=['key1','key2']) #多个主键 左连接
#两个表列名不同时，left_on='a',right_on='b'

常用操作

查看数据属性

df.columns #查看有哪些列
df.index #查看索引
df.dtypes #查看每列的数据类型
df.info()#查看各列数据的数据类型
df.shape #查看行列的大小
df.size #查看有多少单元格
len(df)#查看行数

常用方法

df.head() 返回前几行
df.tail() 返回倒数几行
df.rename(columns={'height':'Height'},inplace=True) 修改列名
df['animal'].replace('snake','python') 指定数据替换
df.collage.value_counts() 查看列为collage中元素的计数
df.sort_values(by=['Height','Weight']) 依据指定列进行排序，默认升序
df.sort_values(by=['b','a'],axis=0,ascending=[False,True]) 先对b列降序，后对a列升序
df.describe() 查看描述性统计的相关信息
max\min\sum\mean 不知道轴axis时 默认对列运算
df['visits'].sum() 对指定列求和

轴的使用
axis：
0值表示沿着某一列或行标签\索引值
向下执行方法
1值表示沿着某一行或列标签横向执行对应的方法
增加删除列的操作

df['class1'] = 1 #增加列，每次只能增加一列
df.loc['k'] = [3,'cat','no',6] #增加行名为k的一行数据
del df['class1'] #删除class1列
df.drop(labels='k',inplace=True) #删除增加的名为k行数据
df = df.drop('k')

缺失值和文本字符串的处理
- 缺失值

pd.isnull(df) 返回所有数据的检测结果
pd.isnull(df['a']) 对某列数据进行检测
pd.dropna(axis=0,how='any',thresh=None,inplace=False)
# any：如果存在任何NA值，则放弃该标签
# all：如果存在的值为NA值，才放弃该标签
# thresh=n 保留至少n个非NaN数据
# inplace：筛选过缺失值的新数据是保存副本还是直接在原数据上修改
df.fillnal(value=0) 用0填充缺失值
len(df.loc[(df['a'].isnull(),'a')]) 查看某列缺失值的个数

文本数据（字符串处理）

s =pd.Series(['A','B','C','Abba','CABA'])
s.str.strip() 去除首位空格

s.str.upper() 转为小写
s[s.str.strip().str.endswith('a')] 选取以a为结尾的数据
df['player'].str.spilt('') 对指定列数据进行分割
df['player'].str.spilt('',expand=True) 使用expand方法，将分割出的数据单独生成一列
sd['player'].str[:3] 使用[]对字符串进行切片提取

文本字符串在处理前，要先转为字符（.str)在进行处理

设置索引和索引提取数据（loc、iloc）

set_index()设置多重索引

new_df = df.set_index(keys=['a','b'],append=False,drop = false)
append 是否将原索引保存
drop是否保存转换为索引的列数据

sort_index 将索引进行排序

new_df.sort_index(na_position=‘last’,inplace=True)
na_position='last'指将缺失值放在最后进行显示

切片（slicers）对多重索引操作
slice表达的是范围，有几重索引就写几个条件,用冒号代表去全部的列
第一重索引取值范围0-1000
第二重索引取值为给定值
第三重索引没给限定条件

new_df.loc[(slice(0,1000),['a','b'],slice(None)),:]

reset_index还原索引

new_df.reset_index(drop=True）

iloc是按照位置索引，loc是按照名称索引

数据的查询、修改、分组计算

1.查询

df[ (df['a']>=2000) | (df['a']<=1700)] #条件为或
df[ (df['a']>=2000) & (df['a']<=1700)] #条件为和
df.loc[(df['a']>=10) &(df['b']>8)]
df[ (df['a']>=10) & (df['b']>=8)]

2.修改

df.loc[df['a']=='yes','a'] ='True' #只是修改了值，并未修改数据类型
df['a'] =df['a'].map({'yes':True,'no':False}) #值和数据类型都修改

3.分组计算

分组查看每组大小

df.groupby(‘a’).size()

单个统计量

grouped['a'].sum() #grouped是储存分组数据的变量

多个统计量

grouped['a'].agg([np.mean,np.sum])

对所有列球多个统计量

grouped['a'].agg([np.mean,np.sum])

不同列球不同统计量

grouped['a'].agg({'a':np.mean,'b':np.sum})

你可能感兴趣的:(数据分析,数据分析,python)

Python Baidu Search API：轻松实现百度搜索的强大工具任凝俭
PythonBaiduSearchAPI：轻松实现百度搜索的强大工具python-baidusearch自己手写的百度搜索接口的封装，pip安装，支持命令行执行。BaiduSearchunofficialAPIforPythonwithnoexternaldependencies项目地址:https://gitcode.com/gh_mirrors/py/python-baidusearch项目介
程序员转行做什么好：数据分析师、AI大模型工程师、产品经理和云计算工程师？雪碧没气阿人工智能产品经理云计算大模型训练 LLM AI大模型程序员
程序员转行做什么好先给结论再说理由：数据分析师、AI大模型工程师、产品经理和云计算工程师。这些领域不仅因应了当前技术发展的趋势，也为程序员提供了转型的广阔舞台和职业发展的新机遇。一起来看看吧！数据分析师：数据驱动决策的关键程序员转行时，应考虑当前市场上的热门行业和岗位需求。例如，AI大模型工程师、数据分析师、前端开发工程师、全栈开发工程师等都是当前市场上需求量较大的职位。就拿数据分析师来说，因其在
简单分享下python打包手机app的apk 小软件大世界 python 开发语言
Python把python程序打包成apk的完整步骤1.引言在移动应用市场蓬勃发展的今天，开发人员常常需要将自己的Python程序打包成APK文件，以便在Android设备上运行。本文将详细介绍将Python程序打包成APK的完整步骤。2.准备工作在开始打包前，我们需要先安装以下几个工具：AndroidStudio：用于构建和打包APK文件；PythonforAndroid：用于将Python程序
chatgpt赋能python：Python怎么打包成APK vacvefito ChatGpt python chatgpt 开发语言计算机
Python怎么打包成APK如果你是一位有10年Python编程经验的工程师，并且想要将自己的Python应用程序打包成APK，那么你来对地方了。本文将会介绍如何使用Python来打包成APK，以及在不同平台上的一些注意事项。在阅读本文之后，你应该可以顺利地将自己的Python应用程序打包成APK了。什么是Python的APKAPK是AndroidPackage的缩写，它是Android系统中的一
小红书获取笔记详情API接口的开发、应用与收益。前端后端运维数据挖掘api
一、开发基础（一）技术选型在开发小红书获取笔记详情API接口时，后端语言可选用Python搭配Django框架。Django具有强大的路由系统、数据库管理功能以及内置的安全机制，能极大提高开发效率。数据库方面，MySQL以其稳定性和广泛的应用场景成为不错选择，可高效存储笔记的各类信息，包括文字内容、图片链接、点赞数、评论数等。（二）接口设计请求方式：采用HTTPGET请求，通过在URL中携带笔记的
1688商品类目API接口的开发应用与收益前端后端运维数据挖掘api
在电子商务领域，数据的获取与分析是企业决策的关键。阿里巴巴旗下的1688平台，作为全球领先的B2B在线交易市场，提供了丰富的API接口，助力企业高效获取商品信息，优化供应链管理，提升市场竞争力。本文将深入探讨1688商品类目API接口的开发应用，结合实际案例，展示其为企业带来的显著收益，并附上Python代码示例，以便开发者快速上手。一、1688商品类目API接口概述1688商品类目API接口允许
如何查看商品销量 API 接口的性能指标数据前端后端运维数据挖掘api
在当今电商蓬勃发展的时代，数据成为驱动业务决策的关键因素。商品销量作为衡量产品受欢迎程度和销售业绩的核心指标，其获取依赖于高效稳定的API接口。对于电商开发者、数据分析师以及业务决策者而言，了解如何查看商品销量API接口的性能指标数据至关重要。这些性能指标不仅能反映接口的运行状态，还能为优化接口、提升用户体验以及保障业务连续性提供有力依据。本文将深入探讨查看商品销量API接口性能指标数据的方法，并
[python][whl]pyltp的whl格式文件所有版本下载地址汇总 FL1623863129 Python python 开发语言
pyltp：Python中的中文自然语言处理工具在数字化时代，自然语言处理（NLP）成为了与机器进行交互的关键技术。对于中文，由于其独特的语言结构和复杂性，专门的工具和库显得尤为重要。pyltp正是这样一个为中文NLP任务设计的Python库，它封装了LTP（LanguageTechnologyPlatform）的核心功能，使得开发者能够轻松地在Python环境中进行中文文本的处理和分析。pylt
Python 应用打包成 APK【全流程】今晚务必早点睡 Python 运维 python 开发语言 apk
将Python应用打包成APK。文章目录步骤1:安装Buildozer和其依赖Linux(Ubuntu)环境下安装:步骤2:创建你的Python应用步骤3:配置Buildozer步骤4:打包成APK总结步骤1:安装Buildozer和其依赖首先确保你的系统中已安装Python和pip。接下来，我们需要安装Buildozer以及一些必要的系统依赖。Linux(Ubuntu)环境下安装:安装Pytho
【Python】已完美解决：ERROR: Could not find a version that satisfies the requirement re 屿小夏 python 开发语言
个人简介：某不知名博主，致力于全栈领域的优质博客分享|用最优质的内容带来最舒适的阅读体验！文末获取免费IT学习资料！文末获取更多信息精彩专栏推荐订阅收藏专栏系列直达链接相关介绍书籍分享点我跳转书籍作为获取知识的重要途径，对于IT从业者来说更是不可或缺的资源。不定期更新IT图书，并在评论区抽取随机粉丝，书籍免费包邮到家AI前沿点我跳转探讨人工智能技术领域的最新发展和创新，涵盖机器学习、深度学习、自然
基于Python的三种主流网络爬虫技术吃肉肉335 python 爬虫开发语言
一、网络爬虫是什么网络爬虫，通常也被称为网络蜘蛛或网络机器人，是一种按照一定方法，获取网络各种信息的自动化脚本程序，也可以将其理解为一个在互联网上自动提取网页信息并进行解析抓取的程序。网络爬虫的功能不仅局限于复制网页内容、下载音视频文件，更包括自动化执行行为链以及模拟用户登录等复杂操作。在当前大数据背景下，无论是人工智能应用还是数据分析工作，均依赖于海量的数据支持。如果仅依赖人工采集这一种方式，不
python md5加密计算机辅助工程 python 前端 javascript
在Python中，可以使用hashlib模块来进行MD5加密。以下是一个简单的例子：importhashlibdefmd5_encryption(data):md5=hashlib.md5()#创建一个md5对象md5.update(data.encode('utf-8'))#使用utf-8编码数据returnmd5.hexdigest()#返回加密后的十六进制字符串#使用函数data="Hell
Python网络爬虫核心面试题闲人编程程序员面试 python 爬虫开发语言面试网络编程
网络爬虫1.爬虫项目中如何处理请求失败的问题？2.解释HTTP协议中的持久连接和非持久连接。3.什么是HTTP的持久化Cookie和会话Cookie？4.如何在爬虫项目中检测并处理网络抖动和丢包？5.在爬虫项目中，如何使用HEAD请求提高效率？6.如何在爬虫项目中实现HTTP请求的限速？7.解释HTTP2相对于HTTP1.1的主要改进。8.如何在爬虫项目中模拟HTTP重试和重定向？9.什么是COR
Python全局解释器锁GIL与多线程程序媛一枚~ Python OpenCV 图像处理 Python进阶 Python OpenCV python 多线程全局解释器锁GIL
Python中如果是I/O密集型的操作，用多线程（协程Asyncio、线程Threading），如果I/O操作很慢，需要很多任务/线程协同操作，用Asyncio，如果需要有限数量的任务/线程，那么使用多线程。如果是CPU密集型操作，用多进程（multeprocessing）。一、GILGIL（GlobalInterpreterLock，即全局解释器锁），Python实质上并不存在真正的多线程，只有
Python 面试时需要知道的 10 个问题及详解迪小莫学AI python 面试开发语言
Python面试时需要知道的10个问题及详解在Python的面试中，考察的重点通常是基础知识、编程思维和实际应用能力。掌握Python的核心概念不仅能帮助你在面试中脱颖而出，还能让你在实际工作中高效编写代码。下面我们将详细解答10个Python面试中常见的问题，帮助你更加深入理解Python的基本特性和应用。1.Python中的全局、受保护和私有属性是什么？在Python中，属性的访问权限并不像J
python解奥赛运算题 Python数据分析与机器学习 python 开发语言算法贪心算法
有一个以文字代替数字的算术表达式如下图所示，已知4个替代数字的文字中没有重复，编写程序求出文字所替代的数字。按逻辑思维:如果3位数和3位数相加等于4位数，则“青”只能是1:“山”+“青”大于等于10，因此“山”只能是9，得出“龙”是0:个位的两个“山”相加，推得“外”等于8。而按计算思维，则注重于程序的实现，用穷举法设计嵌套的4层循环，把所有的数字都试一遍，找出4个数字不相互重复的合满足加法等式条
《CPython Internals》阅读笔记：p285-p328 codists 读书笔记 python
《CPythonInternals》学习第15天，p285-p328总结，总计44页。一、技术总结1.shallowcomparisonp285,InObjectsobject.c,thebaseimplementationoftheobjecttypeiswritteninpureCcode.Therearesomeconcreteimplementationsofbasiclogic,like
《CPython Internals》阅读笔记：p250-p284 codists 读书笔记 python
《CPythonInternals》学习第14天，250-p284总结，总计25页。一、技术总结介于我觉得作者写得乱七八糟的，读完我已经不想说话了，所以今日无技术总结。二、英语总结(生词：2)1.spawn(1)spawn:来自于词根expandere。(2)expandere:ex-(“out”)+pandere(“tospread”)spawn原来的意思是“spreadingoutoffish
《CPython Internals》阅读笔记：p221-p231 codists 笔记
《CPythonInternals》学习第12天，p221-p231总结，总计11页。一、技术总结无。二、英语总结(生词：2)1.atatimeidiom.separately(单独地)inthespecifiedgroups(一次)。示例：(1)Icanonlydoonethingatatim(我一次只能做一件事)。(2)Wecarriedtheboxestwoatatimeupthestair
《CPython Internals》阅读笔记：p152-p176 codists 读书笔记 python
《CPythonInternals》学习第10天，p152-p176总结，总计25页。一、技术总结1.addinganitemtoalistmy_list=[]my_list.append(obj)上面的代码涉及两个指令：LOAD_FAST,LIST_APPEND。整章看下来这有这点算是可以记的了，其它的只感觉作者在零零碎碎的罗列内容。二、英语总结(生词：1)无。关于英语的注解同步更新汇总到htt
《CPython Internals》阅读笔记：p1-p19 codists 笔记
《CPythonInternals》学习第1天，p1-p19总结，总计19页。一、技术总结无。二、英语总结(生词：2)1.humblevshumbled(1)humble:humus(“earth”)adj.字面意思是“ontheground”,后面引申为“lowlyinkind,state,condition(卑微)”,“notproudthatyouareimportant(谦卑)”。(2)h
Linux离线安装Python chudu
#下载openssl，如果不先安装openssl，后续pip、requests库使用会有很多问题wget--no-check-certificatehttps://www.openssl.org/source/openssl-1.1.1g.tar.gztar-zxvfopenssl-1.1.1g.tar.gzcdopenssl-1.1.1g./configshared--openssldir=/u
Bash语言的数据库交互清妍琉璃包罗万象 golang 开发语言后端
Bash语言的数据库交互引言随着信息技术的飞速发展，数据库在各行各业中扮演着越来越重要的角色。无论是企业管理、数据分析，还是大数据处理，数据库都是基础设施的重要组成部分。对于开发者和系统管理员而言，能够高效地与数据库进行交互是一项必不可少的技能。在众多编程语言中，Bash作为一种脚本语言，以其简洁、高效和易用的特点，逐渐在数据库管理和交互中获得了一席之地。本文将深入探讨如何使用Bash进行数据库交
深入解析：使用 Python 爬虫获取苏宁商品详情数据小爬虫@ python 爬虫开发语言
在当今数字化时代，电商数据已成为市场分析、用户研究和商业决策的重要依据。苏宁易购作为国内知名的电商平台，其商品详情页包含了丰富的信息，如商品价格、描述、评价等。这些数据对于商家和市场研究者来说具有极高的价值。本文将详细介绍如何使用Python爬虫获取苏宁商品的详细信息，并提供完整的代码示例。一、爬虫简介爬虫是一种自动化程序，用于从互联网上抓取网页内容。Python因其简洁的语法和强大的库支持，成为
【网络安全 | Python爬虫】URL、HTTP基础必知必会秋说爬虫 http 网络安全
文章目录URL概念及组成结构HTTP概念简述浏览器接收资源HTTP协议的结构请求结构请求行请求头请求体请求差异及参数说明响应结构状态行响应头响应体推广URL概念及组成结构在开始爬虫的开发实战前，需要了解的是URL的概念及组成结构，这具有基础性和必要性。URL（UniformResourceLocator，统一资源定位符）是用于在互联网上定位和标识资源的字符串。它提供了一种标准的方式来指示资源的位置
什么是网络爬虫？Python爬虫到底怎么学？糯米导航文末下载资源 python
最近我在研究Python网络爬虫，发现这玩意儿真是有趣，干脆和大家聊聊我的心得吧！咱们都知道，网络上的信息多得就像大海里的水，而网络爬虫就像一个勤劳的小矿工，能帮我们从这片浩瀚的信息海洋中挖掘出需要的内容。接下来，我就带你们一步步看看该怎么用Python搞定网络爬虫。为啥选择Python写爬虫？说到Python，简直是写爬虫的最佳选择！它有许多现成的库，就像拥有了各种好用的工具，使得我们的工作变得
《CPython Internals》阅读笔记：p329-p335 codists 读书笔记 python
《CPythonInternals》学习第16天，p329-p335总结，总计7页。一、技术总结1.debuggingp331,Therearetwotypesofdebugger,consoleandvisual——作者将debugger分为两类：(1)console：lldb(MAC系统使用),GDB(Linux系统使用))。(2)visual：VisualStudioDebugger,CLi
Java 大视界 -- Java 大数据文本分析与自然语言处理：从文本挖掘到智能对话一只蜗牛儿 java 大数据自然语言处理
在当今的信息化时代，数据成为了重要的资源。特别是文本数据，随处可见，如社交媒体、新闻网站、技术文档、客户反馈等，这些都包含着大量的潜在信息。因此，如何从海量的文本中提取有价值的信息，成为了大数据分析领域的重要课题。Java作为一种高效、灵活的编程语言，在大数据文本分析与自然语言处理（NLP）中发挥着至关重要的作用。本文将介绍如何利用Java开发大数据文本分析和自然语言处理（NLP）应用，带领你从文
大模型：LangChain技术讲解玉成226 【大模型】langchain
一、什么是LangChain1、介绍LangChain是一个用于开发由大型语言模型提供支持的Python框架。它提供了一系列工具和组件，帮助我们将语言模型集成到自己的应用程序中。有了它之后，我们可以更轻松地实现对话系统、文本生成、文本分类、问答系统等功能。2、LangChain官网文档官网：https://python.langchain.com/docs/introduction/3、LangC
lisp语言与python_Lisp 语言优点那么多，为什么国内很少运用？特殊后勤小干事 lisp语言与python
为什么Lisp没有流行起来本文探讨的是为什么Lisp语言不再被广泛使用的。很久以前，这种语言站在计算机科学研究的前沿，特别是人工智能的研究方面。现在，它很少被用到，这一切并不是因为古老,类似古老的语言却被广泛应用.其他类似的古老的语言有FORTRAN,COBOL,LISP,BASIC,和ALGOL家族,这些语言的唯一不同之处在于,他们为谁设计,FORTRAN是为科学家和工程师设计的,他们在计算机上
tomcat基础与部署发布暗黑小菠萝 Tomcat java web
从51cto搬家了，以后会更新在这里方便自己查看。做项目一直用tomcat，都是配置到eclipse中使用，这几天有时间整理一下使用心得，有一些自己配置遇到的细节问题。 Tomcat：一个Servlets和JSP页面的容器，以提供网站服务。一、Tomcat安装安装方式：①运行.exe安装包 &n
网站架构发展的过程 ayaoxinchao 数据库应用服务器网站架构
1.初始阶段网站架构：应用程序、数据库、文件等资源在同一个服务器上 2.应用服务和数据服务分离：应用服务器、数据库服务器、文件服务器 3.使用缓存改善网站性能：为应用服务器提供本地缓存，但受限于应用服务器的内存容量，可以使用专门的缓存服务器，提供分布式缓存服务器架构 4.使用应用服务器集群改善网站的并发处理能力：使用负载均衡调度服务器，将来自客户端浏览器的访问请求分发到应用服务器集群中的任何
[信息与安全]数据库的备份问题 comsci 数据库
如果你们建设的信息系统是采用中心-分支的模式,那么这里有一个问题如果你的数据来自中心数据库,那么中心数据库如果出现故障,你的分支机构的数据如何保证安全呢? 是否应该在这种信息系统结构的基础上进行改造,容许分支机构的信息系统也备份一个中心数据库的文件呢? &n
使用maven tomcat plugin插件debug关联源代码商人shang maven debug 查看源码 tomcat-plugin
*首先需要配置好'''maven-tomcat7-plugin'''，参见[[Maven开发Web项目]]的'''Tomcat'''部分。 *配置好后，在[[Eclipse]]中打开'''Debug Configurations'''界面，在'''Maven Build'''项下新建当前工程的调试。在'''Main'''选项卡中点击'''Browse Workspace...'''选择需要开发的
大访问量高并发 oloz 大访问量高并发
大访问量高并发的网站主要压力还是在于数据库的操作上，尽量避免频繁的请求数据库。下面简要列出几点解决方案： 01、优化你的代码和查询语句，合理使用索引 02、使用缓存技术例如memcache、ecache将不经常变化的数据放入缓存之中 03、采用服务器集群、负载均衡分担大访问量高并发压力 04、数据读写分离 05、合理选用框架，合理架构(推荐分布式架构)。
cache 服务器小猪猪08 cache
Cache 即高速缓存.那么cache是怎么样提高系统性能与运行速度呢？是不是在任何情况下用cache都能提高性能？是不是cache用的越多就越好呢？我在近期开发的项目中有所体会，写下来当作总结也希望能跟大家一起探讨探讨，有错误的地方希望大家批评指正。　　1.Cache 是怎么样工作的? 　　Cache 是分配在服务器上
mysql存储过程香水浓 mysql
Description:插入大量测试数据 use xmpl; drop procedure if exists mockup_test_data_sp; create procedure mockup_test_data_sp( in number_of_records int ) begin declare cnt int; declare name varch
CSS的class、id、css文件名的常用命名规则 agevs JavaScript UI 框架 Ajax css
CSS的class、id、css文件名的常用命名规则 (一)常用的CSS命名规则　　头：header 　　内容：content/container 　　尾：footer 　　导航：nav 　　侧栏：sidebar 　　栏目：column 　　页面外围控制整体布局宽度：wrapper 　　左右中：left right
全局数据源 AILIKES java tomcat mysql jdbc JNDI
实验目的：为了研究两个项目同时访问一个全局数据源的时候是创建了一个数据源对象，还是创建了两个数据源对象。 1：将diuid和mysql驱动包（druid-1.0.2.jar和mysql-connector-java-5.1.15.jar）copy至%TOMCAT_HOME%/lib下；2：配置数据源，将JNDI在%TOMCAT_HOME%/conf/context.xml中配置好,格式如下：&l
MYSQL的随机查询的实现方法 baalwolf mysql
MYSQL的随机抽取实现方法。举个例子，要从tablename表中随机提取一条记录，大家一般的写法就是：SELECT * FROM tablename ORDER BY RAND() LIMIT 1。但是，后来我查了一下MYSQL的官方手册，里面针对RAND()的提示大概意思就是，在ORDER BY从句里面不能使用RAND()函数，因为这样会导致数据列被多次扫描。但是在MYSQL 3.23版本中，
JAVA的getBytes()方法 bijian1013 java eclipse unix OS
在Java中，String的getBytes()方法是得到一个操作系统默认的编码格式的字节数组。这个表示在不同OS下，返回的东西不一样！ String.getBytes(String decode)方法会根据指定的decode编码返回某字符串在该编码下的byte数组表示，如： byte[] b_gbk = "
AngularJS中操作Cookies bijian1013 JavaScript AngularJS Cookies
如果你的应用足够大、足够复杂，那么你很快就会遇到这样一咱种情况：你需要在客户端存储一些状态信息，这些状态信息是跨session(会话)的。你可能还记得利用document.cookie接口直接操作纯文本cookie的痛苦经历。幸运的是，这种方式已经一去不复返了，在所有现代浏览器中几乎
[Maven学习笔记五]Maven聚合和继承特性 bit1129 maven
Maven聚合在实际的项目中，一个项目通常会划分为多个模块，为了说明问题，以用户登陆这个小web应用为例。通常一个web应用分为三个模块： 1. 模型和数据持久化层user-core, 2. 业务逻辑层user-service以 3. web展现层user-web， user-service依赖于user-core user-web依赖于user-core和use
【JVM七】JVM知识点总结 bit1129 jvm
1. JVM运行模式 1.1 JVM运行时分为-server和-client两种模式，在32位机器上只有client模式的JVM。通常，64位的JVM默认都是使用server模式，因为server模式的JVM虽然启动慢点，但是，在运行过程，JVM会尽可能的进行优化 1.2 JVM分为三种字节码解释执行方式：mixed mode, interpret mode以及compiler
linux下查看nginx、apache、mysql、php的编译参数 ronin47
在linux平台下的应用，最流行的莫过于nginx、apache、mysql、php几个。而这几个常用的应用，在手工编译完以后，在其他一些情况下（如：新增模块），往往想要查看当初都使用了那些参数进行的编译。这时候就可以利用以下方法查看。 1、nginx [root@361way ~]# /App/nginx/sbin/nginx -V nginx: nginx version: nginx/
unity中运用Resources.Load的方法？ brotherlamp unity视频 unity资料 unity自学 unity unity教程
问：unity中运用Resources.Load的方法？答：Resources.Load是unity本地动态加载资本所用的方法,也即是你想动态加载的时分才用到它,比方枪弹,特效,某些实时替换的图像什么的,主张此文件夹不要放太多东西,在打包的时分,它会独自把里边的一切东西都会集打包到一同,不论里边有没有你用的东西,所以大多数资本应该是自个建文件放置 1、unity实时替换的物体即是依据环境条件
线段树-入门 bylijinnan java 算法线段树
/** * 线段树入门 * 问题：已知线段[2,5] [4,6] [0,7]；求点2,4,7分别出现了多少次 * 以下代码建立的线段树用链表来保存，且树的叶子结点类似[i,i] * * 参考链接：http://hi.baidu.com/semluhiigubbqvq/item/be736a33a8864789f4e4ad18 * @author lijinna
全选与反选 chicony 全选
<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN" "http://www.w3.org/TR/html4/loose.dtd"> <html> <head> <title>全选与反选</title>
vim一些简单记录 chenchao051 vim
mac在/usr/share/vim/vimrc linux在/etc/vimrc 1、问：后退键不能删除数据，不能往后退怎么办？答：在vimrc中加入set backspace=2 2、问：如何控制tab键的缩进？答：在vimrc中加入set tabstop=4 (任何
Sublime Text 快捷键 daizj 快捷键 sublime
[size=large][/size]Sublime Text快捷键：Ctrl+Shift+P：打开命令面板Ctrl+P：搜索项目中的文件Ctrl+G：跳转到第几行Ctrl+W：关闭当前打开文件Ctrl+Shift+W：关闭所有打开文件Ctrl+Shift+V：粘贴并格式化Ctrl+D：选择单词，重复可增加选择下一个相同的单词Ctrl+L：选择行，重复可依次增加选择下一行Ctrl+Shift+L：
php 引用(&)详解 dcj3sjt126com PHP
在PHP 中引用的意思是：不同的名字访问同一个变量内容. 与Ｃ语言中的指针是有差别的．Ｃ语言中的指针里面存储的是变量的内容在内存中存放的地址变量的引用 PHP 的引用允许你用两个变量来指向同一个内容复制代码代码如下: <? $a="ABC"; $b =&$a; echo
SVN中trunk,branches,tags用法详解 dcj3sjt126com SVN
Subversion有一个很标准的目录结构，是这样的。比如项目是proj，svn地址为svn://proj/，那么标准的svn布局是svn://proj/|+-trunk+-branches+-tags这是一个标准的布局，trunk为主开发目录，branches为分支开发目录，tags为tag存档目录（不允许修改）。但是具体这几个目录应该如何使用，svn并没有明确的规范，更多的还是用户自己的习惯。
对软件设计的思考 e200702084 设计模式数据结构算法 ssh 活动
软件设计的宏观与微观软件开发是一种高智商的开发活动。一个优秀的软件设计人员不仅要从宏观上把握软件之间的开发，也要从微观上把握软件之间的开发。宏观上，可以应用面向对象设计，采用流行的SSH架构，采用web层，业务逻辑层，持久层分层架构。采用设计模式提供系统的健壮性和可维护性。微观上，对于一个类，甚至方法的调用，从计算机的角度模拟程序的运行情况。了解内存分配，参数传
同步、异步、阻塞、非阻塞 geeksun 非阻塞
同步、异步、阻塞、非阻塞这几个概念有时有点混淆，在此文试图解释一下。同步：发出方法调用后，当没有返回结果，当前线程会一直在等待（阻塞）状态。场景：打电话，营业厅窗口办业务、B/S架构的http请求-响应模式。异步：方法调用后不立即返回结果，调用结果通过状态、通知或回调通知方法调用者或接收者。异步方法调用后，当前线程不会阻塞，会继续执行其他任务。实现：
Reverse SSH Tunnel 反向打洞實錄 hongtoushizi ssh
實際的操作步驟： # 首先，在客戶那理的機器下指令連回我們自己的 Server，並設定自己 Server 上的 12345 port 會對應到幾器上的 SSH port ssh -NfR 12345:localhost:22 [email protected] # 然後在 myhost 的機器上連自己的 12345 port，就可以連回在客戶那的機器 ssh localhost -p 1
Hibernate中的缓存 Josh_Persistence 一级缓存 Hiberante缓存查询缓存二级缓存
Hibernate中的缓存一、Hiberante中常见的三大缓存：一级缓存，二级缓存和查询缓存。 Hibernate中提供了两级Cache，第一级别的缓存是Session级别的缓存，它是属于事务范围的缓存。这一级别的缓存是由hibernate管理的，一般情况下无需进行干预；第二级别的缓存是SessionFactory级别的缓存，它是属于进程范围或群集范围的缓存。这一级别的缓存
对象关系行为模式之延迟加载 home198979 PHP 架构延迟加载
形象化设计模式实战 HELLO!架构一、概念 Lazy Load：一个对象，它虽然不包含所需要的所有数据，但是知道怎么获取这些数据。延迟加载貌似很简单，就是在数据需要时再从数据库获取，减少数据库的消耗。但这其中还是有不少技巧的。二、实现延迟加载实现Lazy Load主要有四种方法：延迟初始化、虚
xml 验证 pengfeicao521 xml xml解析
有些字符，xml不能识别，用jdom或者dom4j解析的时候就报错 public static void testPattern() { // 含有非法字符的串 String str = "Jamey친Ñ&#1282
div设置半透明效果 spjich css 半透明
为div设置如下样式： div{filter:alpha(Opacity=80);-moz-opacity:0.5;opacity: 0.5;} 说明： 1、filter：对win IE设置半透明滤镜效果，filter:alpha(Opacity=80)代表该对象80%半透明，火狐浏览器不认2、-moz-opaci
你真的了解单例模式么？ w574240966 java 单例设计模式 jvm
单例模式，很多初学者认为单例模式很简单，并且认为自己已经掌握了这种设计模式。但事实上，你真的了解单例模式了么。一，单例模式的5中写法。（回字的四种写法，哈哈。） 1，懒汉式（1）线程不安全的懒汉式 public cla

按字母分类： A B C D E F G H I J K L M N O P Q R S T U V W X Y Z 其他