我相信这是Lxml的HTML解析器的错误。尝试:
from bs4 import BeautifulSoupimport urllib2html = urllib2.urlopen ("http://www.beppegrillo.it")prova = html.read()soup = BeautifulSoup(prova.replace('ISO-8859-1', 'utf-8'))print soup这是解决该问题的方法。我相信该问题已在lxml 3.0 alpha 2和lxml 2.3.6中修复,因此值得检查是否需要升级到较新版本。
如果您想了解有关该错误的更多信息,请先在此处提交:
https://bugs.launchpad.net/beautifulsoup/+bug/972466
希望这可以帮助,



