葫芦流 · 浏览器插件
Chrome 插件完全入门
不用写代码、不用懂爬虫——在浏览器里对着网页说你要什么,三步保存成可重复运行的采集任务。
如果你第一次听说「工作流」「抓取」「数据集」,完全没关系。本页假设你只会用 Chrome 浏览网页,目标是:打开一个商品列表或文章目录,把标题、价格、链接等整理成表格,并在葫芦流网站里随时查看或导出。插件是在浏览器右侧打开的小面板,不会改动你正在看的网页。
读者:零基础用户。需要 Chrome 浏览器、葫芦流免费账号、以及你有权访问的公开网页(无需登录即可打开的那种)。
- 安装登录
- 分析字段
- 选方案保存
- 插件运行
- 看数据
- 暂停/定时
插件到底帮你做什么?
想象你在 Excel 里做一张表,列是「标题」「价格」「链接」,行是网页上的每个商品。手工复制粘贴很慢。葫芦流插件的作用是:你告诉它「我要这些列」,它先读当前页面、猜出对应位置,再帮你生成一条自动化流水线,以后可以一键再跑、或定时再跑。
和控制台(网站里的画布编辑器)相比,插件更适合「我现在正开着这个页,就想从这个页开始」的场景。复杂改图、定时、邮件通知仍可在控制台完成;插件负责快速起步。
你不需要安装 Python、不需要写 CSS 选择器、不需要懂 XPath。插件会读取当前页面 HTML 并上传到葫芦流做字段识别(与控制台同一套 AI);真正抓取时则在浏览器后台按 XPath 打开标签页读取内容,并把数据流式写入你的数据集。
插件负责「从当前页快速建任务 + 在浏览器里跑抓取」;控制台负责「改图、定时、云端跑、导出」。两者共用同一账号、同一批工作流和数据集。
重要:请只采集你有权使用的公开数据。需要登录、验证码或明确禁止抓取的网站,可能分析或运行失败——这不是插件坏了,而是产品故意不做绕过。
开始之前,请确认这些
第一次使用建议选一个简单的公开列表页练手(例如书籍目录、公开商品列表),成功一次后再换目标站点。
- 01 已安装 Chrome(或基于 Chromium 的浏览器,如 Edge 需自行确认插件兼容)。
- 02 已在 huluflow.com 注册账号(免费套餐含每月 20 次网页请求额度,保存工作流本身不扣额度)。
- 03 练手用的 URL 在无痕窗口能直接打开,不需要登录。
- 04 知道你想采什么:用中文写几个词即可,例如「标题、价格、商品链接」。
- 05 若公司网络拦截扩展,请联系管理员允许安装 Chrome 扩展。
- 06 保存的工作流里应包含「抓取 → 存储」连线,否则运行后数据无法入库。
第一次见这些词?
插件和控制台里会出现下面几个词,先混个脸熟即可,不必背诵。
工作流 — 保存下来的整套采集方案,有名字,可在控制台打开编辑。
字段 — 表格的「列」,如 title、price、url;分析后会出现勾选列表。
分析 — 插件读取当前页并识别可能有哪些列;不等于已经采完整站。
数据集 — 存数据的表,在控制台「数据集」里查看,可导出 CSV。
列表页 / 详情页 — 列表页一行代表一条商品;详情页通常只有一个商品的长页。
额度 — 每次运行中,抓取节点每请求 1 个网页扣 1 额度;保存不扣。
运行 — 按工作流执行一次采集;可手动点,也可在控制台设定时。
侧边栏 — 插件界面贴在浏览器窗口右侧,切换标签页时「当前页面」URL 会跟着变。
插件运行 — 在「工作流」标签对已保存任务发起抓取;后台自动开页、可暂停/继续,适合大量 URL。
Checkpoint — 流式运行中每抓若干条就向服务器提交一次进度并入库(默认每 5 条一批),避免一次上传过多数据。
两个标签页:构建 vs 工作流
顶栏有两个主标签,用途不同。第一次用多在「构建」;保存后日常运行多在「工作流」。
-
构建
对着当前打开的网页:写抓取要求 → 分析 → 三步向导 → 保存(可选立即运行一次)。适合从 0 创建新任务。
-
工作流
列出账号下已保存的工作流。可对每条任务「插件运行」「暂停」「继续运行」,或「加载到这里」回到构建页修改后再保存。
-
何时用哪个?
新站点 / 页面改版 → 构建 + 重新分析。已配好、要定期或大批量抓 → 工作流 → 插件运行。定时调度仍在控制台设置。
打开插件后,界面长什么样?
下面按从上到下顺序说明。若某块是灰的或隐藏的,说明还没登录或还没分析,按步骤做就会出来。
-
01 顶栏:品牌、构建/工作流、语言
「构建」用于新建采集;「工作流」列出你已保存的任务。右上角 EN/中 可切换界面语言(中文下品牌显示「葫芦流」)。
-
02 登录横幅
未登录时提示去网站登录;登录成功后会显示你的邮箱。插件不单独存密码,与浏览器里 huluflow.com 的登录态共享。
-
03 当前页面 + 使用说明
显示正在分析的标签页地址;右侧「使用说明」链到本文档。换标签后地址会变,需重新分析。
-
04 抓取要求 + 分析按钮
在输入框用日常语言写想要的列,点「分析这个页面」。分析完成前按钮会显示进度(读取页面、上传、识别字段)。
-
05 步骤条 1 → 2 → 3
分析完成后出现:① 确认字段 ② 选择工作流方案 ③ 命名保存。可点步骤数字回看,底部有「下一步」按钮。
-
06 构建页:底部固定按钮
步骤 1、2 显示「下一步」;步骤 3 显示「保存工作流」。滚动时顶栏与底栏保持可见。
-
07 工作流标签:列表与运行
每条工作流显示名称、状态(启用/暂停)、节点数、上次运行时间。运行中会显示进度徽章(如 detail 3/10)。按钮:控制台查看、加载到这里、插件运行、暂停、继续运行。
-
08 设置(⚙)
可改「服务地址」(默认 https://huluflow.com,仅自建部署需改)和界面语言。修改后点保存;登录态仍依赖浏览器 Cookie。
三步构建在干什么?
可以把它理解成:先确认列 → 再选自动化方案 → 最后起名保存。
| 步骤 | 你要做什么 | 完成后得到什么 |
|---|---|---|
| ① 确认字段 | 勾选要保留的列,左右滑动看样例数据 | 确定这张表有哪些列 |
| ② 选择工作流 | 点选推荐方案,可改页码范围、数据集名称等 | 后台生成可运行的流水线草图 |
| ③ 命名保存 | 必填工作流名称,可选保存后立即运行 | 工作流出现在你的账号里,可在控制台继续编辑 |
跟着做:从零到第一次保存
建议电脑旁打开一个练手列表页,边读边操作。每步下面的「你应该看到」和「若卡住」帮助自查。
-
01
安装并打开侧边栏
在 Chrome 网上应用店搜索「葫芦流」或「HuluFlow」安装(内测阶段也可能由团队提供解压文件夹,在 chrome://extensions 开启「开发者模式」→「加载已解压的扩展程序」)。
安装后点击工具栏上的扩展图标,选择「打开侧边栏」。建议右键图标 →「固定」,以后一点就开。
侧边栏较窄,可拖拽浏览器窗口变宽以便看清预览卡片。
你应该看到: 侧边栏打开,顶部显示 HuluFlow/葫芦流 和「构建」「工作流」两个标签。
卡住时: 若图标菜单里没有侧边栏,更新 Chrome 到较新版本,或重新加载扩展。
-
02
注册并登录
若还没有账号:在浏览器新标签打开 huluflow.com/zh/register 注册(邮箱验证后登录)。
在插件里点「去登录」,会在新标签打开登录页;登录成功后回到侧边栏,横幅应显示「已登录」和你的邮箱。
若一直显示未登录:确认插件设置里的「服务地址」是 https://huluflow.com(自建部署才需改)。
你应该看到: 登录横幅变绿或显示邮箱;「去登录」按钮消失。
卡住时: 登录态依赖浏览器 Cookie。若你清过 Cookie,需要重新登录一次。
-
03
描述需求并分析(步骤 ① 之前)
在 Chrome 里打开你的练手列表页,确保侧边栏顶部「当前页面」的 URL 正确。
在「提出你的抓取要求」输入框写想要的列,例如:标题、价格、链接。不必写技术术语。
点击「分析这个页面」。等待进度条走完(通常十几秒到一分钟,取决于页面大小)。
你应该看到: 出现步骤条 1-2-3,自动进入步骤 ①;上方有「列表页」或「详情页」标签。
卡住时: 分析会消耗一点时间和网络,请保持该标签页在前台或至少未被浏览器休眠。
-
04
步骤 ① — 确认要采集的内容
「要采集的内容」下列出 AI 找到的字段,默认全选。不需要的列取消勾选即可。
下方「数据预览」可左右滑动,查看页面上真实样例行,确认价格、标题没有对错列。
若列表页含商品链接,插件可能在后台再分析一个详情页,以便步骤 ② 推荐「列表→详情」方案——此时可能短暂显示「正在分析详情页」,属正常现象。
你应该看到: 预览里每卡片的多列与勾选的字段一致;明显乱码或空列应回到上一步改要求或换 URL。
卡住时: 字段名来自网页本身(常为英文),界面语言不会翻译字段名,这是预期行为。
-
05
步骤 ② — 选择工作流方案
点击「下一步」进入方案列表。每个卡片是一种常见用法,例如:只采当前页、翻多页列表、列表进详情再入库等。
点选最贴近你目标的一条。下方可能出现可调项:页码范围(从第几页到第几页)、数据集名称、通知邮箱等。
数据集名称会按网站自动生成(可在控制台「数据集」里找到),也可改成你记得住的名字,如「京东图书 2026-03」。
你应该看到: 选中的方案有高亮;页码范围 Preview 合理(不要一次生成几百页)。
卡住时: 不确定选哪个时,先选最简单的「单页抓取」跑通一次,再在控制台加翻页或详情。
-
06
步骤 ③ — 命名、保存,(可选)立即运行
「起个名字」必填,例如「练手-图书列表-3月」。插件不会替你自动填,避免一堆叫 Untitled 的任务。
勾选「保存后立即运行」会在保存后立刻采一次(会扣额度)。第一次建议勾选,方便马上看有没有数据。
点「保存工作流」。若勾选了立即运行,会在当前页用浏览器抓一次(一次性提交,适合快速验证)。若未勾选,之后请到「工作流」标签点「插件运行」做正式抓取。
你应该看到: 控制台 → 工作流 里出现新名字;若立即运行了,构建页下方会显示采到多少行。
卡住时: 保存本身不扣额度。立即运行与插件运行都会扣抓取额度(每请求 1 个网页约 1 额度)。
-
07
在工作流标签 — 插件运行
切到「工作流」标签,找到刚保存的任务,点「插件运行」。插件会在后台依次打开 URL 抓取(不必保持原列表页在前台),顶部显示 Running 与进度。
运行采用流式模式:服务端创建 Run → 每抓一批数据 checkpoint 入库 → 全部完成后 finish。数据集可在控制台实时刷新查看。
运行中可点「暂停」;暂停会关闭当前抓取标签并保存进度,之后点「继续运行」从断点续抓。同一工作流同时只能有一个活跃任务。
你应该看到: 进度徽章更新;完成后显示采到行数或 partial/error;控制台数据集行数增加。
卡住时: 大批量(多页列表、列表→详情)请用插件运行而非「保存后立即运行」,以便暂停与流式入库。
插件运行是怎么工作的?
「插件运行」是工作流标签里的正式抓取方式,与构建页「保存后立即运行」不同,适合多 URL、可暂停、大数据量。
-
1. 启动 Run
点击插件运行后,插件向服务器 POST /run/start,创建一次 WorkflowRun 并占用 1 点启动额度。
-
2. 后台开 tab 抓取
Background 按工作流图拓扑执行:URL 生成 → 抓取节点。对每个 URL 在后台打开标签页,用 content script 按 XPath 提取字段(支持翻页配置:页码链接、无限滚动、加载更多)。
-
3. 流式 checkpoint 入库
每抓一批行(默认 5 条)POST /run/{id}/checkpoint,服务器 upsert 到 store 节点关联的数据集。不必等全部抓完才看到数据。
-
4. Finish 收尾
全部 URL 处理完后 POST /run/{id}/finish,服务端跑剩余节点(store 若已入库则跳过、notify 等),标记 Run 为 ok/partial/error。
-
5. 暂停与继续
暂停时:中止当前 tab、保存 checkpoint(completed_urls、next_index)。继续时从断点续跑,不重复已入库的行。暂停状态同步到服务器。
-
6. 前提条件
工作流图必须有 scrape → store 连线;否则 checkpoint 会丢弃数据。抓取额度足够;插件已登录且 Background 未被浏览器杀掉(长时间运行请保持 Chrome 打开)。
技术说明:插件运行不经过 bulk POST /run 一次性提交全部 items,而是 start → checkpoint × N → finish。控制台「运行」按钮走的是云端 crawld 路径,无需扩展参与。
两种运行方式对比
| 保存后立即运行(构建页) | 插件运行(工作流标签) |
|---|---|
| 保存后当场在浏览器抓当前图 | 对已保存工作流随时发起,不依赖当前前台页 |
| 一次性提交 browser_payload | 流式 checkpoint,默认每 5 条入库一次 |
| 无暂停/进度徽章 | 可暂停/继续,列表显示进度与状态 |
设置
点顶栏 ⚙ 打开设置面板。
- 01服务地址:连接 huluflow.com 或你的自建实例;必须与登录网站一致,否则 Cookie 无法同步。
- 02语言:切换后界面与文档链接(使用说明)会切到中文或英文路径。
保存之后,还可以做什么?
插件完成了「从 0 到 1」。日常抓取、改图、定时与导出主要在控制台完成。
- 01 工作流标签 →「插件运行」:对已保存任务做正式、可暂停的大批量抓取。
- 02 控制台 → 数据集:浏览表格、分页、导出 CSV/JSON、删除单行或清空数据。
- 03 控制台 → 工作流 → 打开:在画布上改节点、设 interval_minutes 定时、加邮件通知。
- 04 工作流标签 →「加载到这里」:把已有任务载入构建页,改字段或方案后另存。
- 05 页面改版或换 URL 后:在构建页点「重新分析」,不要直接跑旧配置。
- 06 需要纯云端抓取(不开浏览器 tab)时:在控制台点「运行」,由 crawld 在服务端执行。
常见疑问(小白版)
我完全不懂编程,能用吗?
可以。全程点按钮和填中文描述即可。只有在你要把葫芦流接到自己服务器时才需要看 API 文档。
插件和控制台是什么关系?
同一个账号、同一批工作流和数据集。插件是快捷入口;控制台是完整编辑器。在插件保存的工作流,打开控制台能看到同样画布。
分析免费吗?会扣额度吗?
分析页面(字段识别)不扣抓取额度。额度在「运行」工作流、且抓取节点请求网页时才扣。
为什么字段名是英文?
字段名来自网页 HTML 结构或 AI 命名,方便和技术列对应。你可以在控制台给列改显示名,或导出后用 Excel 改表头。
可以采需要登录的网站吗?
第一版面向公开页。若必须登录才能看到内容,请在已登录的浏览器标签打开该页再分析——有时能采到,但不保证,且请勿采集无权限的数据。
换了个标签页,为什么还是旧数据?
插件按 URL 记住进度。切换标签后看顶部 URL 是否变了;变了请点「重新分析」。
保存时必须填名字吗?
是。必填,且不会自动填。这样日后在列表和邮件里能认出是哪次任务。
Chrome 以外可以吗?
官方以 Chrome 为主。Edge 等 Chromium 浏览器可能可加载,Safari/Firefox 目前不支持此插件。
「插件运行」和「保存后立即运行」有什么区别?
立即运行适合保存后快速试一次(当前页、一次性提交)。插件运行适合多 URL、可暂停续跑、流式入库,在工作流标签发起。
为什么运行完数据集还是空的?
常见原因:工作流没有 store 节点或未连线;字段勾选不对;站点结构变了;额度不足。打开控制台该次 Run 的节点输出查看 failures。
插件运行和云端定时跑有什么区别?
插件运行在本地 Chrome 开 tab 抓取(需电脑开着 Chrome)。云端 run/worker 用 crawld 在服务器抓,适合定时任务、电脑关机也能跑。
出错了怎么办?
大多数问题属于「页面不合适」或「还没登录」,按下面逐项排查。
分析一直转圈或失败
检查:① 是否登录 ② 网络是否正常 ③ 页面是否需登录/CAPTCHA ④ 页面是否过大。换一个简单的公开列表页重试。
提示请先登录
在新标签打开 huluflow.com 登录后关闭该标签,回插件点刷新或重新打开侧边栏。确认服务地址正确。
预览数据是空的或明显不对
改「抓取要求」文案,写清你要的列;或换结构更规整的列表页。动态加载很多的站可能需要多等几秒再分析。
保存成功但运行 0 行
打开控制台看该次运行详情与 failures。常见:无 store 节点、字段不对、站点改版、额度 402。插件运行若显示 0 行但 failures 有记录,按失败 URL 排查。
切换中文后顶栏仍显示 HuluFlow
点 EN/中 切换后应显示「葫芦流」。若否,在扩展管理页重新加载插件。
提示「该工作流已在运行中」
同一工作流只能有一个 running/queued 任务。到工作流标签看是否仍在跑或卡在 pausing;等待完成或暂停后再试。也可刷新列表。
暂停后还在抓 / 暂停无效
更新到最新版插件后,暂停会关闭当前抓取 tab。若刚点暂停,可能需等当前页加载/提取完成(通常几秒内)。重新加载扩展后再试。
无法连接页面 / Receiving end
目标页刷新后重试。插件运行会在后台自动开 tab,不依赖 content script 预先注入当前页。若仍失败,检查是否拦截了扩展权限。
失败时先打开该次运行的节点 error,不要只看工作流列表。
第一次保存前的自检清单
全部打勾再点保存,成功率最高。
- 01 练手 URL 在无痕窗口能打开,无需登录
- 02 插件横幅显示已登录邮箱
- 03 当前页面 URL 与你要采的页一致
- 04 步骤 ① 预览里标题、价格等看起来对
- 05 步骤 ② 选了合适的方案,数据集名称看得懂
- 06 步骤 ③ 工作流名称已填;若立即运行,额度够用
- 07 工作流方案含 store 节点(或推荐方案已自动带上)
- 08 正式大批量抓取:保存后到工作流标签用「插件运行」,而非仅依赖立即运行
接下来
第一次保存并插件运行成功后,建议阅读《入门》了解控制台全貌,《工作流与节点》学习定时与通知,或《概念》理解运行与数据集。