python爬取喜马拉雅vip音频安卓_Python爬虫:爬取喜马拉雅音频数据详解

前言

喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,FM电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?

今天带大家爬取喜马拉雅音频数据,一起期待吧!!

项目目标

爬取喜马拉雅音频数据

受害者地址

https://www.ximalaya.com/

本文知识点:

1、系统分析网页性质

2、多层数据解析

3、海量音频数据保存

环境:

python 3.6

pycharm

requests

parsel

思路:(爬虫案例)

1.确定数据所在的链接地址(url)

2.通过代码发送url地址的请求

3.解析数据(要的, 筛选不要的)

4.数据持久化(保存)

案例思路:

1. 在静态数据中获取音频的id值

2. 发送指定id值json数据请求(src)

3. 从json数据中解析音频所对应的URL地址

开始写代码

先导入所需的模块

import requests

import parsel # 数据解析模块

import re

1.确定数据所在的链接地址(url) 逆向分析 网页性质(静态网页/动态网页)

打开开发者工具,播放一个音频,在Madie里面可以找到一个数据包

你可能感兴趣的:(python爬取喜马拉雅vip音频安卓_Python爬虫:爬取喜马拉雅音频数据详解)