烧饼论坛 LZ.SB
登录

给大模型喂数据不用买商业 API 了,5 万星开源爬虫 Crawl4AI 挺好用

2464
  • SkyLightVPS
    UID 8292Lv.4 渐入佳境

    折腾本地大模型、RAG 知识库或者写 Agent 的朋友应该深有感触,抓网页转成纯净 Markdown 这道工序最磨人。

    之前像 Firecrawl 之类的商业云端提取服务,动辄一个月几十刀,按页计费成本偏高。

    GitHub 上这个开源项目 crawl4ai 最近很火,星数已经破 5 万了。作者当时也是觉得商业爬虫按月收费太狠,索性自己写了个专为大模型提取语料的开源爬虫。

    Crawl4AI 开源网页爬虫架构

    它最大的特点是专为 LLM 做过文本清洗优化,把页面丢进去后,会自动剔除那些冗余广告、导航栏、脚本弹窗,直接输出排版干净的高质量 Markdown 或 JSON,省去了大量手动清洗正则的工作。

    对于带 JS 动态渲染、无限滚动的现代单页应用也支持得很完善,自带伪装机制。

    本地装个 Python 包或者起个 Docker 镜像就能直接开跑,不需要注册账号绑卡,适合自己搭建本地知识库或者做自动化 Agent 的朋友。

    项目地址:
    https://github.com/unclecode/crawl4ai

  • 收藏支持反对打赏

4 条回复

  • 炎龙尊者
    UID 8275Lv.2 新手上路 禁访禁言
    #1
    该用户已被禁言,内容已隐藏
  • sun
    UID 2824Lv.3 初识社区
    #2

    正好适合我的一个项目,可以试试

  • is
    UID 7520Lv.3 初识社区
    #3

    感觉挺实用

  • etuos
    UID 661Lv.7 熟悉面孔
    #4

    有佬搞个喂饭教程?

发表回复