Life is short, use python.

前一阵子看书《Head First Python》学了一下Python,最近在实践中又小试了一把,某些场景用起来确实很爽。

我有一个100M的CSV文件,记录数在120万行左右。
单条记录如下:
211.136.115.11|www.baidu.com|20130228105956|119.75.218.77;119.75.217.56|0
我想找出这个文件里排名前10的域名。
下面是华丽丽的Python代码:
# coding=utf-8
import csv
import datetime

filename = "E:/220_01_20130228100039.txt"
rownum = 0  # 文件行号
rank = 10  # 排名数
result = dict()

start = datetime.datetime.now()
with open(filename, 'rU', encoding="utf-8", errors='ignore') as csvfile:
    reader = csv.reader(csvfile, delimiter="|")
    for line in reader:
        rownum += 1
        
        if len(line) < 1:  # 空行
            continue
        elif len(line) < 2:
            print("错误行号:" + str(rownum))
            continue
        elif result.get(line[1], None) is None:
            result[line[1]] = 1
        else:
            result[line[1]] += 1
print("~~~~~~~~~~~~~~~~~~~~~~~~")
print("域名数:" + str(len(result)))
count = rank
result = sorted(result.items(), key=lambda d:d[1], reverse=True)
for item in result:
    count -= 1
    print("排名" + str(rank - count) + ":" + str(item))
    if count == 0:
        break;
end = datetime.datetime.now()
print("耗时:" + str(end - start))

35行代码搞定,如果换成java,估摸着要60行上下了。

从5万多个域名里找出前十,3个是QQ域名,2个是Google域名,2个是baidu域名,1个是apple域名,1个是新浪微博,还有1个居然是移动广告的flurry。

哪天有时间,可以尝试用shell来写。

你可能感兴趣的:(python)