文章详情页
python - 正则表达式匹配html的问题。
浏览:47日期:2022-09-05 14:29:29
问题描述
<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>用BeautifulSoup html.parser解析的网页,现在用re模块想抓取**第7行**的中文内容,放在一个组里面(.*?)。正则老是匹配不上,用换行符也匹配不上,不知道怎么写了。。。
问题解答
回答1:既然你都用bs4解析了,为什么不用它提取哪?bs4内有一个stripped_string的函数正好满足你的需要。
回答2:import repattern = re.compile(r’</span>.*?</span>(.*?)</dd>’, re.S)str = ’’’<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>’’’print(pattern.search(str).group(1))===> 中文内容 #需要抓取的内容回答3:
const re = /^</span>(.*)</dd>$/
这样可以不?
相关文章:
1. centos - apache配置django报错:cannot be loaded as Python modules2. javascript - 微信小程序里怎么把页面转成图片分享3. python3.x - Python中出现AttributeError: object has no attribute4. 【python小白】 问关于property的顺序问题5. 微信端电子书翻页效果6. mysql - SQL问个基础例子,书上的,我怎么看都看不懂..谁帮我解释一下第2个为什么和第1个一样?7. mysql服务无法启动1067错误,谁知道正确的解决方法?8. mysql事务日志的一些问题9. mysql - 我用SQL语句 更新 行的时候,发现全部 中文都被清空了,请问怎么解决?10. 数据库 - mysql boolean型无法插入true
排行榜
