Wheeehan

正则表达式学习

前言

20161112
晃了几天，寻找下阶段项目；
这感觉就像有力气找不到地方使，
三个项目
’分析一段文字作曲‘
’爬取facebook做情感趋势变化曲线‘
’爬取微博头像进行相似头像查询‘
最后决定，先研究研究爬虫

爬虫多处使用正则表达式，这不是第一次遇到正则了，再次遇到便好好研究一番；

20161116.选定api分析爬虫数据已经一个多星期了感觉，进展很慢；
原因总结：
1 知识面很窄，这次需要用到的html/php/javascript等相关网页网站服务端的知识点，我基本上一无所知，导致xpath和css解析html对象的时候一直null
2 一旦遇到bug卡壳的情况，总感觉不把这个问题解决不太好，死磕到底的代价效率太低。有时候感觉莫名其妙就是达不到预期效果，调试这些小问题浪费很多时间，不过时间充足的话我觉得去好好研究是值得的，时不时的就发现另一个方面的知识，加深对其深层的理解。这次的xpath和css还有正则，饶了一大圈，还是正则靠谱，xpath和css在某些情况会出现选取失败的情况，具体原因还没有找到。

20161117 正则表达式才是正确的选择，css/xpath在JS返回数据的网页都无效（具体原因不明）；
webmagic自带regex也无发解析正确的正则表达式，这作者难道没有发现这个问题。
使用java8库自带的正则表达式才能成功，这又是一大圈

苦尽甘来，我实现了！

WebMagic框架抓取 + 正则表达式解析 （webmagic自带解析方式都失效）
NBA球员 DwyaneWade
的所有微博！

以下内容来自各大论坛博客，已给出链接，只做为我个人总结

正文

正则表达式刚刚入门
参考链接：正则表达式 - 语法
参考链接：正则表达式练习题集(附答案)
参考链接：在线测试正则表达式
参考链接：别在迷恋正则表达式解析html了，好吗？
参考链接：非常强大的正则表达式,解析HTML
参考链接：实用正则表达式匹配和替换
参考链接：正则表达式30分钟入门教程
正则表达式测试工具有
正则工具RegexBuddy百度下载
正则表达式测试器
正则表达式转 java String
参考链接：在线工具

JAVA正则表达式的用法（循环匹配）
http://blog.csdn.net/xrt95050/article/details/7165938
http://blog.csdn.net/shamoyuu/article/details/40048281多行匹配处理

JFC 折线图，直接借用了这为仁兄的 GUI代码显示抓取的数据
java实现各种数据统计图（柱形图，饼图，折线图）

谢了

表达式一
^\d+$
解释：

所以，去掉^和$后剩下

\d+

d 匹配一个数字字符。等价于 [0-9]
\D 匹配一个非数字字符。等价于 [^0-9]
+ 匹配前面的子表达式一次或多次。例如，’zo+’ 能匹配 “zo” 以及 “zoo”，但不能匹配 “z”。+ 等价于 {1,}。

所以，^\d+$ 是匹配一个或多个，且以数字开头，且以数字结尾的串，即非负的整数

表达式二

^[1-9]*[1-9][0-9]*$

解释：
^和$同上，
* 匹配前面的子表达式零次或多次。例如，zo* 能匹配 “z” 以及 “zoo”。* 等价于{0,}。
[xyz] 字符集合。匹配所包含的任意一个字符。例如， ‘[abc]’ 可以匹配 “plain” 中的 ‘a’。
[^xyz] 负值字符集合。匹配未包含的任意字符。例如， ‘[^abc]’ 可以匹配 “plain” 中的’p’、’l’、’i’、’n’。
[a-z] 字符范围。匹配指定范围内的任意字符。例如，’[a-z]’ 可以匹配 ‘a’ 到 ‘z’ 范围内的任意小写字母字符。
[^a-z] 负值字符范围。匹配任何不在指定范围内的任意字符。例如，’[^a-z]’ 可以匹配任何不在 ‘a’ 到 ‘z’ 范围内的任意字符。

即匹配正整数
注意的是：这个表达式里面 * 符号，每次只能最靠近的左边的一个子表达式起作用，

表达式三

^(-\d+|(0+))$

( ) 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符，请使用 $ 和 $。

非正整数

笔记

\(?0\d{2}[) -]?\d{8}

中的[) -]?

左中括号右括号空格减号右中括号问号
的意思是匹配)或-或空格中的一个或零个

2[0-4]\d|25[0-5]|[01]?\d\d?

匹配 000-255的数字

(\\t\b)+

匹配

\t\t\t\t\t\t \t\t \t\t\t  \t

 
  中的 
 \t\t\t\t\t\t和\t\t和\t\t\t和\t 
 因为\b匹配单词的开始或结束是字母，的开始和结束，这里不\b没有作用 
   
  使用或 | 的时候,在（）里面使用能匹配，在[ ]里面就会多匹配多余的东西。 
  (?<=(\Wclass=\\"WB_text\WW_f14\\"\Wnode-type=\\"feed_list_content\\"\W[(>\\\w)|(.{10}\\"\w+\\">\\n)])).*?(?=<(\\\/div>\\n)) 
   
   
  基础就这样 
 边学便用 暂记 
   
  摘抄： 
 1、长度为8-10的用户密码（以字母开头、数字、下划线） 
 ^[a-zA-Z]\w{7,10} 2、验证输入只能是汉字：[\u4e00−\u9fa5]0,  
 3、电子邮箱验证：^\w+([-+.]\w+)@\w+([-.]\w+).\w+([-.]\w+)*$ 
 4、URL地址验证：^http://([\w-]+.)+[\w-]+(/[\w-./?%&=]*)?$ 
 5、电话号码的验证：请参考：http://blog.csdn.net/kiritor/article/details/8733469 
 6、简单的身份证号验证：\d{15}|\d{18}$ 
  end

WatsonAPI之Conversation(使用Flask调用Conversation) teitiyuu
使用Flask和Conversation做一个小的对话程序使用Flask做一个对话程序事前准备做成一个conversation的workspace示例代码1初始化conversation对象username和password是api的用户名密码，version是api的版本号def__init__(self):self.cvsn=ConversationV1(username=CVSN.USERN
第一章 Python开发环境配置灰太狼_black
欢迎关注微信公众号watson_python，及时获取最新的更新。Watson是IBM的AI产品，是IBM推行的认知商业的核心产品，以2011年参加综艺节目《危险边缘》中，Watson打败了最高奖金得主布拉德•鲁特尔和连胜纪录保持者肯•詹宁斯而闻名于世界。本章主要介绍一下IBM近年推出的云平台Bluemix提供的WatsonAPI和Python的开发环境的配置，为你开启认知之旅。IBMCEOGin
WatsonAPI之Natural Language Classifier teitiyuu
说明NLC服务使用机器学习算法返回短文本输入的匹配预定义类。创建和训练一个分类器，将预定义分类与示例文本连接起来，以便服务可以将这些分类器可以对新的输入进行分类认证方式使用HTTPBasicAuthentication方式认证。即用户名/密码方式创建一个分类器CURL命令curl-u"USERNAME":"PASSWORD"^-Ftraining_data=@weather_data_train.
HQL之投影查询归来朝歌 HQL Hibernate 查询语句投影查询
在HQL查询中，常常面临这样一个场景，对于多表查询，是要将一个表的对象查出来还是要只需要每个表中的几个字段，最后放在一起显示？针对上面的场景，如果需要将一个对象查出来： HQL语句写“from 对象”即可 Session session = HibernateUtil.openSession();
Spring整合redis bylijinnan redis
pom.xml <dependencies>  <dependency> <groupId>org.springframework.data</groupId> <artifactId>spring-data-redi
org.hibernate.NonUniqueResultException: query did not return a unique result: 2 0624chenhong Hibernate
参考：http://blog.csdn.net/qingfeilee/article/details/7052736 org.hibernate.NonUniqueResultException: query did not return a unique result: 2 在项目中出现了org.hiber
android动画效果不懂事的小屁孩 android动画
前几天弄alertdialog和popupwindow的时候，用到了android的动画效果，今天专门研究了一下关于android的动画效果，列出来，方便以后使用。 Android 平台提供了两类动画。一类是Tween动画，就是对场景里的对象不断的进行图像变化来产生动画效果（旋转、平移、放缩和渐变）。第二类就是 Frame动画，即顺序的播放事先做好的图像，与gif图片原理类似。
js delete 删除机理以及它的内存泄露问题的解决方案换个号韩国红果果 JavaScript
delete删除属性时只是解除了属性与对象的绑定，故当属性值为一个对象时，删除时会造成内存泄露（其实还未删除）举例： var person={name:{firstname:'bob'}} var p=person.name delete person.name p.firstname -->'bob' // 依然可以访问p.firstname，存在内存泄露
Oracle将零干预分析加入网络即服务计划蓝儿唯美 oracle
由Oracle通信技术部门主导的演示项目并没有在本月较早前法国南斯举行的行业集团TM论坛大会中获得嘉奖。但是，Oracle通信官员解雇致力于打造一个支持零干预分配和编制功能的网络即服务（NaaS）平台，帮助企业以更灵活和更适合云的方式实现通信服务提供商（CSP）的连接产品。这个Oracle主导的项目属于TM Forum Live!活动上展示的Catalyst计划的19个项目之一。Catalyst计
spring学习——springmvc（二） a-john springMVC
Spring MVC提供了非常方便的文件上传功能。 1，配置Spring支持文件上传： DispatcherServlet本身并不知道如何处理multipart的表单数据，需要一个multipart解析器把POST请求的multipart数据中抽取出来，这样DispatcherServlet就能将其传递给我们的控制器了。为了在Spring中注册multipart解析器，需要声明一个实现了Mul
POJ-2828-Buy Tickets aijuans ACM_POJ
POJ-2828-Buy Tickets http://poj.org/problem?id=2828 线段树，逆序插入 #include<iostream>#include<cstdio>#include<cstring>#include<cstdlib>using namespace std;#define N 200010struct
Java Ant build.xml详解 asia007 build.xml
1,什么是antant是构建工具2,什么是构建概念到处可查到，形象来说，你要把代码从某个地方拿来，编译，再拷贝到某个地方去等等操作，当然不仅与此，但是主要用来干这个3,ant的好处跨平台 --因为ant是使用java实现的，所以它跨平台使用简单--与ant的兄弟make比起来语法清晰--同样是和make相比功能强大--ant能做的事情很多，可能你用了很久，你仍然不知道它能有
android按钮监听器的四种技术百合不是茶 android xml配置监听器实现接口
android开发中经常会用到各种各样的监听器,android监听器的写法与java又有不同的地方; 1,activity中使用内部类实现接口 ,创建内部类实例使用add方法与java类似创建监听器的实例 myLis lis = new myLis(); 使用add方法给按钮添加监听器
软件架构师不等同于资深程序员 bijian1013 程序员架构师架构设计
本文的作者Armel Nene是ETAPIX Global公司的首席架构师，他居住在伦敦，他参与过的开源项目包括 Apache Lucene,，Apache Nutch， Liferay 和 Pentaho等。如今很多的公司
TeamForge Wiki Syntax & CollabNet User Information Center sunjing TeamForge How do Attachement Anchor Wiki Syntax
the CollabNet user information center http://help.collab.net/ How do I create a new Wiki page? A CollabNet TeamForge project can have any number of Wiki pages. All Wiki pages are linked, and
【Redis四】Redis数据类型 bit1129 redis
概述 Redis是一个高性能的数据结构服务器，称之为数据结构服务器的原因是，它提供了丰富的数据类型以满足不同的应用场景，本文对Redis的数据类型以及对这些类型可能的操作进行总结。 Redis常用的数据类型包括string、set、list、hash以及sorted set.Redis本身是K/V系统，这里的数据类型指的是value的类型，而不是key的类型，key的类型只有一种即string
SSH2整合-附源码白糖_ eclipse spring tomcat Hibernate Google
今天用eclipse终于整合出了struts2+hibernate+spring框架。我创建的是tomcat项目，需要有tomcat插件。导入项目以后，鼠标右键选择属性，然后再找到“tomcat”项，勾选一下“Is a tomcat project”即可。具体方法见源码里的jsp图片，sql也在源码里。补充1：项目中部分jar包不是最新版的，可能导
[转]开源项目代码的学习方法 braveCS 学习方法
转自： http://blog.sina.com.cn/s/blog_693458530100lk5m.html http://www.cnblogs.com/west-link/archive/2011/06/07/2074466.html 1）阅读features。以此来搞清楚该项目有哪些特性2）思考。想想如果自己来做有这些features的项目该如何构架3）下载并安装d
编程之美-子数组的最大和（二维） bylijinnan 编程之美
package beautyOfCoding; import java.util.Arrays; import java.util.Random; public class MaxSubArraySum2 { /** * 编程之美子数组之和的最大值（二维） */ private static final int ROW = 5; private stat
读书笔记-3 chengxuyuancsdn jquery笔记 resultMap配置 ibatis一对多配置
1、resultMap配置 2、ibatis一对多配置 3、jquery笔记 1、resultMap配置当<select resultMap="topic_data"> <resultMap id="topic_data">必须一一对应。 (1)<resultMap class="tblTopic&q
[物理与天文]物理学新进展 comsci
如果我们必须获得某种地球上没有的矿石,才能够进行某些能量输出装置的设计和建造,而要获得这种矿石,又必须首先进行深空探测,而要进行深空探测,又必须获得这种能量输出装置,这个矛盾的循环,会导致地球联盟在与宇宙文明建立关系的时候,陷入困境怎么办呢?
Oracle 11g新特性:Automatic Diagnostic Repository daizj oracle ADR
Oracle Database 11g的FDI（Fault Diagnosability Infrastructure）是自动化诊断方面的又一增强。 FDI的一个关键组件是自动诊断库（Automatic Diagnostic Repository-ADR）。在oracle 11g中，alert文件的信息是以xml的文件格式存在的，另外提供了普通文本格式的alert文件。这两份log文
简单排序:选择排序 dieslrae 选择排序
public void selectSort(int[] array){ int select; for(int i=0;i<array.length;i++){ select = i; for(int k=i+1;k<array.leng
C语言学习六指针的经典程序，互换两个数字 dcj3sjt126com c
示例程序，swap_1和swap_2都是错误的，推理从1开始推到2，2没完成，推到3就完成了 # include <stdio.h> void swap_1(int, int); void swap_2(int *, int *); void swap_3(int *, int *); int main(void) { int a = 3; int b =
php 5.4中php-fpm 的重启、终止操作命令 dcj3sjt126com PHP
php 5.4中php-fpm 的重启、终止操作命令: 查看php运行目录命令：which php/usr/bin/php 查看php-fpm进程数：ps aux | grep -c php-fpm 查看运行内存/usr/bin/php -i|grep mem 重启php-fpm/etc/init.d/php-fpm restart 在phpinfo()输出内容可以看到php
线程同步工具类 shuizhaosi888 同步工具类
同步工具类包括信号量（Semaphore）、栅栏（barrier）、闭锁（CountDownLatch）闭锁（CountDownLatch） public class RunMain { public long timeTasks(int nThreads, final Runnable task) throws InterruptedException { fin
bleeding edge是什么意思 haojinghua DI
不止一次，看到很多讲技术的文章里面出现过这个词语。今天终于弄懂了——通过朋友给的浏览软件，上了wiki。我再一次感到，没有辞典能像WiKi一样，给出这样体贴人心、一清二楚的解释了。为了表达我对WiKi的喜爱，只好在此一一中英对照，给大家上次课。 In computer science, bleeding edge is a term that
c中实现utf8和gbk的互转 jimmee c iconv utf8&gbk编码
#include <iconv.h> #include <stdlib.h> #include <stdio.h> #include <unistd.h> #include <fcntl.h> #include <string.h> #include <sys/stat.h> int code_c
大型分布式网站架构设计与实践 lilin530 应用服务器搜索引擎
1.大型网站软件系统的特点？ a.高并发，大流量。 b.高可用。 c.海量数据。 d.用户分布广泛，网络情况复杂。 e.安全环境恶劣。 f.需求快速变更，发布频繁。 g.渐进式发展。 2.大型网站架构演化发展历程？ a.初始阶段的网站架构。应用程序，数据库，文件等所有的资源都在一台服务器上。 b.应用服务器和数据服务器分离。 c.使用缓存改善网站性能。 d.使用应用
在代码中获取Android theme中的attr属性值 OliveExcel android theme
Android的Theme是由各种attr组合而成, 每个attr对应了这个属性的一个引用, 这个引用又可以是各种东西. 在某些情况下, 我们需要获取非自定义的主题下某个属性的内容 (比如拿到系统默认的配色colorAccent), 操作方式举例一则: int defaultColor = 0xFF000000; int[] attrsArray = { andorid.r.
基于Zookeeper的分布式共享锁 roadrunners zookeeper 分布式共享锁
首先，说说我们的场景，订单服务是做成集群的，当两个以上结点同时收到一个相同订单的创建指令，这时并发就产生了，系统就会重复创建订单。等等......场景。这时，分布式共享锁就闪亮登场了。共享锁在同一个进程中是很容易实现的，但在跨进程或者在不同Server之间就不好实现了。Zookeeper就很容易实现。具体的实现原理官网和其它网站也有翻译，这里就不在赘述了。官
两个容易被忽略的MySQL知识 tomcat_oracle mysql
1、varchar(5)可以存储多少个汉字，多少个字母数字？　　相信有好多人应该跟我一样，对这个已经很熟悉了，根据经验我们能很快的做出决定，比如说用varchar(200)去存储url等等，但是，即使你用了很多次也很熟悉了，也有可能对上面的问题做出错误的回答。　　这个问题我查了好多资料，有的人说是可以存储5个字符，2.5个汉字（每个汉字占用两个字节的话），有的人说这个要区分版本，5.0
zoj 3827 Information Entropy(水题) 阿尔萨斯 format
题目链接：zoj 3827 Information Entropy 题目大意：三种底，计算和。解题思路：调用库函数就可以直接算了，不过要注意Pi = 0的时候，不过它题目里居然也讲了。。。limp→0+plogb(p)=0，因为p是logp的高阶。 #include <cstdio> #include <cstring> #include <cmath&

正则表达式 学习

前言

苦尽甘来，我实现了！

正文

笔记

你可能感兴趣的:(WatsonAPI)

正则表达式学习