wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

随堂测验-网络爬虫

Total questions: 15

Worksheet time: 5mins

Name
Class
Date
1.

通用网络爬虫基本工作流程包含( )

a)

打开浏览器

b)

抓取网页

c)

数据存储

d)

预处理

2.

常见的爬虫语言有( )

a)

HTML

b)

Python

c)

Java

d)

PHP

3.

JsonPath表达式有两种表示方法,分别是( )

a)

点记法

b)

括号记法

c)

逗号记法

d)

操作符记法

4.

节点有多种类型,分别是( )

a)

元素、属性、文本

b)

元素、属性、文本

c)

注释、文档节点

d)

属性值

5.

JSON核心概念包括( )

a)

数组

b)

对象

c)

属性

d)

路径

6.

下面哪个不是Python Requests库提供的方法?

a)

head()

b)

post()

c)

push()

d)

get()

7.

Requests库中,下面哪个是检查Response对象返回是否成功的状态属性?

a)

raise_for_status

b)

headers

c)

status_code

d)

status

8.

Requests库中,下面哪个属性代表了从服务器返回HTTP协议头所推荐的编码方式?

a)

headers

b)

apparent_encoding

c)

text

d)

encoding

9.

在Requests库的get()方法中,能够定制向服务器提交HTTP请求头的参数是什么?

a)

data

b)

json

c)

cookies

d)

headers

10.

Requests库中的get()方法最常用,下面哪个说法正确?

a)

网络爬虫主要进行信息获取,所以,get()方法最常用。

b)

服务器因为安全原因对其他方法进行限制,所以,get()方法最常用。

c)

get()方法是其它方法的基础,所以最常用。

d)

HTTP协议中GET方法应用最广泛,所以,get()方法最常用。

11.

爬虫爬取的是网站后台的数据。

a)

正确

b)

错误

12.

每个网站都有robots.txt文件

a)

正确

b)

错误

13.

通用爬虫用于将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。

a)

正确

b)

错误

14.

XPath语言,也称为HTML路径语言。

a)

正确

b)

错误

15.

Cookie登录的方式不需要输入账号和密码,直接打开网页就是登录状态。

a)

正确

b)

错误