葫芦流 · 文档中心
开始使用
面向业务与开发者的托管网页抓取工作流
葫芦流把公开网页变成可调度、可下载、可通知的表格——在画布上搭 URL 生成 → 抓取 → 存储 → 通知,不必手写选择器或运维爬虫。
为什么选葫芦流
| 痛点 | 自建方案 | 葫芦流 |
|---|---|---|
| 选择器维护 | 手写 CSS,站点一改就挂 | AI 字段发现 + 画布配置 |
| 多页抓取 | 自写翻页与队列 | URL 生成节点 + 调度运行 |
| 调度与存储 | 自建 cron + 数据库 | 工作流 + 数据集一体 |
| 变化通知 | 自写 diff + 邮件 | 通知节点(新数据 / 字段变化) |
| 规模化与 API | 自建 REST 与重试 | Bearer Key + `/api/v1/*` |
三个核心能力
分析 — 发现字段
粘贴公开 URL,用自然语言描述关心的列;首页分析或 API 预览返回字段与样例行。
curl -X POST https://huluflow.com/analyze \
-H "Content-Type: application/json" \
-d '{"url": "https://books.toscrape.com/", "requirement": "title, price, url"}'
# Or preview inside a workflow:
curl -X POST https://huluflow.com/api/v1/workflows/{id}/preview \
-H "Authorization: Bearer $HULU_KEY" \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com/list", "fields": ["title", "price"]}'
运行 — 执行流水线
触发工作流运行:按图依次执行 URL 生成、抓取、存储、通知。额度按实际请求网页次数计。
curl -X POST https://huluflow.com/api/v1/workflows/{id}/run \
-H "Authorization: Bearer $HULU_KEY"
导出 — 读取数据集
分页读取行或导出 CSV/JSON,供 BI、脚本或下游系统消费。
curl "https://huluflow.com/api/v1/datasets/{id}/rows?page=1&page_size=50" \
-H "Authorization: Bearer $HULU_KEY"
curl -L "https://huluflow.com/api/v1/datasets/{id}/export?format=csv" \
-H "Authorization: Bearer $HULU_KEY" \
-o table.csv