标签:标签 BeautifulSoup li soup print find select
1.BeautifulSoup简称:bs4 2.BeautifulSoup,和lxml一样,是一个html的解析器,主要功能也是解析和提取数据 3.优缺点?缺点:效率没有lxml的效率高。优点:接口设计人性化,使用方便 安装以及创建 1.安装 pip install bs4 2.导入 from bs4 import BeautifulSoup 3.创建对象 服务器响应的文件生成对象 soup = BeautifulSoup(response.read().decode(), 'lxml') 本地文件生成对象 soup = BeautifulSoup(open('1.html'), 'lxml') 注意:默认打开文件的编码格式gbk所以需要指定打开编码格式 节点定位 1.根据标签名查找节点 soup.a 【注】只能找到第一个a soup.a.name soup.a.attrs 2.函数 (1).find(返回一个对象) find('a'):只找到第一个a标签 find('a', title='名字') find('a', class_='名字') (2).find_all(返回一个列表) find_all('a') 查找到所有的a find_all(['a', 'span']) 返回所有的a和span find_all('a', limit=2) 只找前两个a (3).select(根据选择器得到节点对象)【推荐】 1.element eg:p 2..class eg:.firstname 3.#id eg:#firstname 4.属性选择器 [attribute] eg:li = soup.select('li[class]') [attribute=value] eg:li = soup.select('li[class="hengheng1"]') 5.层级选择器 element element div p element>element div>p element,element div,p eg:soup = soup.select('a,span') 节点信息 (1).获取节点内容:适用于标签中嵌套标签的结构 obj.string obj.get_text()【推荐】 (2).节点的属性 tag.name 获取标签名 eg:tag = find('li) print(tag.name) tag.attrs将属性值作为一个字典返回 (3).获取节点属性 obj.attrs.get('title')【常用】 obj.get('title') obj['title']<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8"> <title>bs4基本使用</title> </head> <body> <div> <ul> <li id="l1">张三</li> <li id="l2">李四</li> <li>王五</li> <a href="" id="" class="a1">嘤嘤嘤</a> <span>嘿嘿嘿</span> </ul> </div> <a href="" title="a2">百度</a> <div id="d1"> <span> 哈哈哈 </span> </div> <p id="p1" class="p1">呵呵呵</p> </body> </html>
from bs4 import BeautifulSoup # 通过解析本地文件 来将bs4的基础语法进行讲解 # 默认打开的文件的编码格式是gbk 所以在打开文件的时候需要指定编码
# 本地文件生成对象 soup = BeautifulSoup(open('bs4的基本使用.html',encoding='utf-8'),'lxml') # 根据标签名查找节点 # 找到的是第一个符合条件的数据 # print(soup.a) # 获取标签的属性和属性值 # print(soup.a.attrs) # bs4的一些函数
# (1)find
# 返回的是第一个符合条件的数据 # print(soup.find('a')) # 根据title的值来找到对应的标签对象 # print(soup.find('a',title="a2")) # 根据class的值来找到对应的标签对象 注意的是class需要添加下划线 # print(soup.find('a',class_="a1"))
# (2)find_all 返回的是一个列表 并且返回了所有的a标签
# print(soup.find_all('a')) # 如果想获取的是多个标签的数据 那么需要在find_all的参数中添加的是列表的数据 # print(soup.find_all(['a','span'])) # limit的作用是查找前几个数据,limit=2前两个 # print(soup.find_all('li',limit=2))
# (3)select(推荐) # select方法返回的是一个列表 并且会返回多个数据 # print(soup.select('a')) # 可以通过.代表class 我们把这种操作叫做类选择器 # print(soup.select('.a1')) # print(soup.select('#l1'))
# 属性选择器---通过属性来寻找对应的标签 # 查找到li标签中有id的标签 # print(soup.select('li[id]')) # 查找到li标签中id为l2的标签 # print(soup.select('li[id="l2"]'))
# 层级选择器 # 后代选择器 # 找到的是div下面的li # print(soup.select('div li'))
# 子代选择器 # 某标签的第一级子标签 # 注意:很多的计算机编程语言中 如果不加空格不会输出内容 但是在bs4中 不会报错 会显示内容 # print(soup.select('div > ul > li')) # 找到a标签和li标签的所有的对象 # print(soup.select('a,li'))
# 节点信息 # 获取节点内容 # obj = soup.select('#d1')[0] # 如果标签对象中 只有内容 那么string和get_text()都可以使用 # 如果标签对象中 除了内容还有标签 那么string就获取不到数据 而get_text()是可以获取数据 # 我们一般情况下 推荐使用get_text() # print(obj.string) # print(obj.get_text()) # 节点的属性 # obj = soup.select('#p1')[0] # name是标签的名字 # print(obj.name) # 将属性值左右一个字典返回 # print(obj.attrs) # 获取节点的属性 obj = soup.select('#p1')[0] print(obj.attrs.get('class')) print(obj.get('class')) print(obj['class'])
标签:标签,BeautifulSoup,li,soup,print,find,select 来源: https://www.cnblogs.com/cpcpn/p/15524244.html
本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享; 2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关; 3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关; 4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除; 5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。