python - Scrapy中xpath用到中文报错
问题描述
问题描述links = sel.xpath(’//i[contains(@title,'置顶')]/following-sibling::a/@href’).extract()
报错:ValueError: All strings must be XML compatible: Unicode or ASCII, no NULL bytes or control characters
问题解答
回答1:参见文章:解决Scrapy中xpath用到中文报错问题
解决方法方法一:将整个xpath语句转成Unicode
links = sel.xpath(u’//i[contains(@title,'置顶')]/following-sibling::a/@href’).extract()
方法二:xpath语句用已转成Unicode的title变量
title = u'置顶'links = sel.xpath(’//i[contains(@title,'%s')]/following-sibling::a/@href’ %(title)).extract()
方法三:直接用xpath中变量语法($符号加变量名)$title, 传参title即可
links = sel.xpath(’//i[contains(@title,$title)]/following-sibling::a/@href’,).extract()回答2:
整个字符串前加个u试试
相关文章:
1. mysql - phpMyAdmin无法导入数据2. 网页爬虫 - 关于Python的编码与解码问题3. linux - 为什么我在mysql的my.cnf下找不到bind-address?4. python - django 项目的 migrations 目录是否应该提交到 git5. 网页爬虫 - python爬虫用BeautifulSoup爬取<s>元素并写入字典,但某些div下没有这一元素,导致自动写入下一条,如何解决?6. mysql按照时间热度排序7. python - 字符串里的u’u00a1’怎么打印成中文8. python - celery beat 调度如何运行期间动态添加任务?9. angular.js使用$resource服务把数据存入mongodb的问题。10. python3.x - python多进程,不能在同一窗口吗

网公网安备