折腾本地大模型、RAG 知识库或者写 Agent 的朋友应该深有感触,抓网页转成纯净 Markdown 这道工序最磨人。

之前像 Firecrawl 之类的商业云端提取服务,动辄一个月几十刀,按页计费成本偏高。

GitHub 上这个开源项目 crawl4ai 最近很火,星数已经破 5 万了。作者当时也是觉得商业爬虫按月收费太狠,索性自己写了个专为大模型提取语料的开源爬虫。

Crawl4AI 开源网页爬虫架构

它最大的特点是专为 LLM 做过文本清洗优化,把页面丢进去后,会自动剔除那些冗余广告、导航栏、脚本弹窗,直接输出排版干净的高质量 Markdown 或 JSON,省去了大量手动清洗正则的工作。

对于带 JS 动态渲染、无限滚动的现代单页应用也支持得很完善,自带伪装机制。

本地装个 Python 包或者起个 Docker 镜像就能直接开跑,不需要注册账号绑卡,适合自己搭建本地知识库或者做自动化 Agent 的朋友。

项目地址:
https://github.com/unclecode/crawl4ai