说到底,调试爬虫不是堆日志,而是让变量“开口说话”。最常被跳过的一步,也是最重要的一步:在发请求之后、解析之前,亲手看看 response.status_code、response.url 和 response.text[:200] —— 这三行代码,比写十个正则都管用。

PyCharm 里打不了断点?检查调试配置是否启用 Python Debugger
断点不生效,十有八九是你点错了按钮——用了 Run 而不是 Debug。PyCharm 默认的 Run 模式会直接跳过所有断点,哪怕是代码里写死了 breakpoint() 也不会停。
- 检查右上角的运行配置下拉菜单,点开「Edit Configurations…」,关键要确认
Run with Python Console未被勾选。一旦勾选,它会绕过调试器,断点自然就失效了。 - 启动前,瞄一眼右下角的状态栏:出现
Python Debug字样才算进入了调试模式。如果只显示Python,说明还在普通运行,断点当然不会停。 - 最稳妥的方法还是用快捷键:
Shift + F9启动调试,别用Shift + F10来运行。
requests 返回 200 却拿不到数据?在断点处 inspect response.text 和 response.content
表面上看 HTTP 200,但数据就是拿不到,这种坑其实最常见。调用 response.json() 报错,或者 response.text 返回的是空字符串或登录页的 HTML,这通常意味着服务端做了反爬或重定向,而你拿到的响应体,已经被悄悄替换掉了。
- 在
response = requests.get(...)这行后面立刻下个断点。在 Debug 工具窗口里,或者直接鼠标悬停,仔细看看response.status_code、response.url(确认是否被重定向到了 login 页面)以及response.headers.get('content-type')。 - 对比一下
response.text(解码后的字符串)和response.content(原始字节)。如果前者乱码或为空,很可能是编码识别出了问题。这时候,可以试试直接用response.content.decode('utf-8')手动解码。 - 一个典型的翻车案例:请求头里没带
headers={'User-Agent': '...'},服务器返回了 200,但返回的是一段空白 HTML。断点一看,response.text里全是类似这样的反爬代码。
BeautifulSoup 解析结果为空?在断点中验证 soup.title 和 soup.find('div', class_='item')
很多朋友一拿到 response.text,就急着用 soup = BeautifulSoup(response.text, 'html.parser') 然后直接调 find_all,结果返回的是空列表。根本原因无非两个:HTML 结构和你预想的不一样,或者解析器选错了。
- 断点停在解析后的第一行,直接在 Debug 控制台输入
soup.title。如果结果是None,说明页面根本没加载成功(比如这是个 JS 渲染的页面,用requests拿不到 DOM)。如果标题正常,再查目标元素。 soup.find('div', class_='item')返回None?注意,class是 Python 的关键字,必须写成class_='item',或者用字典的形式{'class': 'item'}。写成class='item'会直接报语法错误。- 不同的解析器,行为差异很大。
'html.parser'比较宽松,但可能会补全错误标签;'lxml'又快又准,但需要额外安装;'html5lib'最接近浏览器,但速度也最慢。调试时,优先换lxml试试,看结果会不会有变化。
Scrapy 的 parse 方法变量看不见?用 breakpoint() 替代 IDE 断点
PyCharm 的图形化断点在 Scrapy 里经常耍脾气,尤其在 parse(self, response) 方法里设断点,程序可能直接就跳过去了,因为 Scrapy 跑在 Twisted 的异步循环里。
- 删掉所有 IDE 断点,直接在代码里写
breakpoint()(Python 3.7+ 版本支持)。然后用命令行运行:scrapy crawl myspider -s LOG_LEVEL=INFO。终端会暂停并进入pdb调试模式,此时可以自由地打印response.url、response.css('title::text').get()等变量。 - 注意,别在
breakpoint()后面立刻打印print(response.body)这种巨量内容,很容易卡住终端。正确的做法是先len(response.body)看看长度,或者用response.body[:200]快速确认内容开头。 - Scrapy 默认开启了
REDIRECT_ENABLED = True,所以你拿到的response可能不是你最初请求的地址。在断点里,务必检查response.request.url和response.url是否一致。