不要API Key就能扒光全网!这款GitHub 13万星爬虫神器,每月白送1000次
写代码抓网页数据,最崩溃的时刻是什么?刚写两行代码就遇上反爬——验证码弹出来,IP 被封,页面还是 JS 动态渲染的,抓回来一堆空 div。折腾一下午,啥也没捞着。
今天介绍一个狠货。GitHub 上有个项目叫 Firecrawl,130k 颗星星,全球排名前 100 的开源仓库。APPle、Canva、Stanford、Zapier 这些大厂都在用。它干的事儿特简单:你把网址扔给它,它还你一份干干净净的 Markdown 或者结构化数据。导航栏、广告、页脚这些乱七八糟的东西,全给你剔除了。
更离谱的是——不要 API Key 了。每月还白送 1000 次免费额度,用完再考虑注册也不迟。
它能做什么
- Search:不是只返回标题链接的敷衍搜索,而是直接把网页内容全抓回来,返回完整 Markdown,AI 直接就能读。
- Scrape:给一个 URL,转成干净的 Markdown、HTML 或结构化 JSON。JS 渲染的页面?没问题。动态加载?照样搞定。还能截图,或按你定义的 schema 提取数据。
- Crawl:丢一个网站首页,它能把整个站点的页面全爬一遍,自动跟进链接,打包一份完整内容。
- Map:输入一个域名,秒秒钟把站点地图列出来,所有 URL 一览无余。
- Interact:让 AI 在网页上点击、填表、翻页,甚至走登录流程。想抓一个得先登录才能看的页面?它真能帮你模拟操作。
- Agent:啥 URL 都不用给,直接用大白话描述你要什么。比如"帮我查一下 Notion 的定价方案",它自己就会去搜、去翻、去整理,最后把结构化结果给你。
五种接入方式
方式一:CLI(推荐)
有 Node.js 环境的话,直接敲:
firecrawl-cli@latest
装完以后,终端里直接玩:
firecrawl search "最好的AI数据工具"
firecrawl scrape https://firecrawl.dev
firecrawl crawl https://docs.firecrawl.dev
firecrawl map https://firecrawl.dev
firecrawl agent "找出 Stripe 的创始人有哪些"
解析本地文件也行,PDF、WOrd、Excel 都能转 Markdown:
firecrawl parse ./document.pdf
方式二:Python SDK
pip install firecrawl-py
几行代码就能跑:
import { Firecrawl } from 'firecrawl';
app = Firecrawl()
# 抓单个页面
doc = app.scrape("https://firecrawl.dev", formats=["markdown"])
print(doc.markdown)
# 搜索
results = app.search("AI 绘画工具推荐", limit=10)
# 爬整站
docs = app.crawl("https://docs.firecrawl.dev", limit=50)
for doc in docs.data:
print(doc.metadata.source_url)
方式三:Node.js SDK
npm install firecrawl
import { Firecrawl } from 'firecrawl';
const app = new Firecrawl();
const doc = await app.scrape('https://firecrawl.dev', { formats: ['markdown'] });
const results = await app.search('AI 绘画工具推荐', { limit: 10 });
方式四:MCP 接入 Claude Code
如果你在用 Claude Code、Cursor 这些支持 MCP 的工具,一行命令搞定:
claude mcp add --transport http firecrawl https://mcp.firecrawl.dev/v2/mcp
Agent 自己就能完成接入,根本不需要你手动传 Key。以前想让 Agent 联网,得先注册拿 Key 再配,现在 Agent 自己想用,直接就接上了。
方式五:直接调 API
连 HTTP 请求里的 Authorization header 都不用写:
curl https://api.firecrawl.dev/v2/scrape
每月 1000 次免费额度自动给,什么操作都不用。
适合什么场景
- AI Agent 开发:Agent 最大的痛点就是"看不见"网页。Firecrawl 就是 Agent 的眼睛和手,让它能看网页、能操作网页。
- RAG 系统:直接整站内容抓回来切片入库,比自己写爬虫省心太多。
- 竞品监控:定时抓对手网站,内容变了自动通知你。
- 学术研究:能搜 arXiv、读论文,帮你整理引用关系。
定价
- 免费版:每月 1000 次
- Hobby 版:16 美元 / 月,5000 次
- Standard 版:83 美元 / 月,10 万次
成功才扣积分,失败的不收钱。比那些按请求复杂度算钱的平台透明多了。
写在最后
这个项目是开源的,AGPL-3.0 协议。代码在 GitHub 上,130k 星星,社区活跃得很。如果你担心数据隐私或者成本问题,完全可以自己部署。
互联网正在从"人浏览的资源"变成"AI 调用的接口"。Firecrawl 这波无 Key 操作,等于提前押注了这个趋势。以后 Agent 越来越多,API 的主要消费者可能就不是人了,而是 AI。到那时候,无 Key 调用可能就是标配。
GitHub 仓库:mendableai/firecrawl
信息来源:GitHub 开源项目 mendableai/firecrawl,AGPL-3.0 协议。具体功能与定价以官方最新版本为准。
- 随机文章
- 热门文章
- 热评文章
- 超级好用的装机神器——Ventoy多合一u盘启动盘
- 被吸空心的日本乡村,还有救吗?
- 鸿蒙开源三方组件--跨平台自适应布局yoga组件
- Windows11升级你需要关注的事项!停在35%的解决方法
- Win7系统英雄联盟为什么进不去游戏怎么办(3分钟解决LOL进不了游戏方法)
- 刚刚,微软决定将Edge浏览器改成Edge OS
- 「微信文件传输助手网页版」由腾讯官方出品,亲测超级方便
- 国家又开始发福利,个人所得税APP的这笔钱可别忘了退!
扫描二维码推送至手机访问。
版权声明:本文由格熊发布,如需转载请注明出处。
免责声明:本站收集的内容,都来自网络,版权争议与本站无关。



