Font size
Worksheets随堂测验-网络爬虫
Total questions: 15
Worksheet time: 5mins
通用网络爬虫基本工作流程包含( )
打开浏览器
抓取网页
数据存储
预处理
常见的爬虫语言有( )
HTML
Python
Java
PHP
JsonPath表达式有两种表示方法,分别是( )
点记法
括号记法
逗号记法
操作符记法
节点有多种类型,分别是( )
元素、属性、文本
元素、属性、文本
注释、文档节点
属性值
JSON核心概念包括( )
数组
对象
属性
路径
下面哪个不是Python Requests库提供的方法?
head()
post()
push()
get()
Requests库中,下面哪个是检查Response对象返回是否成功的状态属性?
raise_for_status
headers
status_code
status
Requests库中,下面哪个属性代表了从服务器返回HTTP协议头所推荐的编码方式?
headers
apparent_encoding
text
encoding
在Requests库的get()方法中,能够定制向服务器提交HTTP请求头的参数是什么?
data
json
cookies
headers
Requests库中的get()方法最常用,下面哪个说法正确?
网络爬虫主要进行信息获取,所以,get()方法最常用。
服务器因为安全原因对其他方法进行限制,所以,get()方法最常用。
get()方法是其它方法的基础,所以最常用。
HTTP协议中GET方法应用最广泛,所以,get()方法最常用。
爬虫爬取的是网站后台的数据。
正确
错误
每个网站都有robots.txt文件
正确
错误
通用爬虫用于将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。
正确
错误
XPath语言,也称为HTML路径语言。
正确
错误
Cookie登录的方式不需要输入账号和密码,直接打开网页就是登录状态。
正确
错误
