[ PROMPT_NODE_27870 ]
scrape
[ SKILL_DOCUMENTATION ]
# Bright Data - 网页抓取器
使用 Bright Data 的 Web Unlocker API 抓取任何网页并获取整洁的 Markdown 内容。自动绕过机器人检测和 CAPTCHA。
## 设置
**1. 获取 API Key:**
从 [Bright Data 控制面板](https://brightdata.com/cp) 获取密钥。
**2. 创建 Web Unlocker 区域:**
在 brightdata.com/cp 点击“添加”(右上角),选择“Unlocker zone”创建一个区域。
**3. 设置环境变量:**
bash
export BRIGHTDATA_API_KEY="your-api-key"
export BRIGHTDATA_UNLOCKER_ZONE="your-zone-name"
## 使用方法
bash
bash scripts/scrape.sh "url"
**参数:**
- `url` (必填):要抓取的网页 URL
**示例:**
bash
# 抓取新闻文章
bash scripts/scrape.sh "https://example.com/article"
# 抓取产品页面
bash scripts/scrape.sh "https://shop.example.com/product/123"
## 输出格式
返回从网页提取的整洁 Markdown 内容:
markdown
# 页面标题
转换为 Markdown 格式的页面主要内容...
## 章节标题
更多内容...
## 功能特点
- **绕过机器人检测**:自动处理反爬虫措施
- **CAPTCHA 解决**:绕过 CAPTCHA 挑战
- **整洁的 Markdown**:返回格式良好的 Markdown 内容
- **JavaScript 渲染**:处理重度依赖 JavaScript 的页面
## 依赖
- `curl` - 用于 API 请求