pyquery爬取知乎发现

import requests
from pyquery import PyQuery as pq
url = 'https://www.zhihu.com/explore'
headers = {'User-Agent' : '*******'}
html = requests.get(url, headers=headers).text
doc = pq(html)
items = doc('.explore-feed.feed-item').items()
for item in items:
question = item.find('h2').text()
author = item.find('.author-link').text()
answer = pq(item.find('.content').html()).text()
file = open('explore.txt', 'a', encoding='utf-8')
file.write('\n'.join([question, author, answer]))
file.write('\n' + '='*50 + '\n')

file.close()


是的,崔大佬书上的例子,但是因为知乎更改网页标题,所以其中有更改。

answer = pq(item.find('.content').html()).text()

此句是提取完整回答是个动态,还不懂。以后回来补上。。

这里.html()其实是返回网页模块。认真看了一下。这个class=content的网页标签里面就是回答的全部。但是里面有html的格式。所以崔大佬在这里应该是返回回答的完整内容,再用一个pq初始化,直接提取内容,而将文字格式丢弃。

你可能感兴趣的:(爬虫)