网页抓取
Firecrawl
支持 JavaScript 渲染、爬取和结构化数据提取的 Web 抓取 MCP 服务器。
安装
npx -y firecrawl-mcp
Firecrawl 是一个 Web 抓取 MCP 服务器,支持 JavaScript 渲染、全站爬取和结构化数据提取。它将任何网站转换为 LLM 可以处理的干净 markdown 或结构化数据。
## 功能
- 使用完整 JavaScript 渲染抓取单个 URL
- 以可配置深度爬取整个网站
- 使用 LLM 驱动的提取获取结构化数据
- 将页面转换为干净的 markdown 供 LLM 使用
- 处理动态内容、SPA 和反爬虫措施
- 批量抓取多个 URL
## 用法
```json
{
"mcpServers": {
"firecrawl": {
"command": "npx",
"args": ["-y", "firecrawl-mcp"],
"env": {
"FIRECRAWL_API_KEY": "<YOUR_API_KEY>"
}
}
}
}
```
## 主要工具
- `firecrawl_scrape` — 抓取单个 URL
- `firecrawl_crawl` — 爬取整个网站
- `firecrawl_extract` — 从页面提取结构化数据
- `firecrawl_map` — 发现网站上的所有 URL