Skyvern 浏览器自动化:自然语言任务到可回放执行的实操指南
2026/9/16 0:47:59 网站建设 项目流程

Skyvern 浏览器自动化:自然语言任务到可回放执行的实操指南

【免费下载链接】skyvernAutomate browser based workflows with AI项目地址: https://gitcode.com/GitHub_Trending/sk/skyvern

Skyvern 是一个开源浏览器自动化项目:用视觉大模型驱动浏览器执行网页操作,输入一段自然语言指令,输出操作录屏、逐步截图和结构化数据。

Skyvern 自动化最小可跑通路径(docker-compose 启动)

git clone https://gitcode.com/GitHub_Trending/sk/skyvern cd skyvern cp .env.example .env docker compose up -d
  • 克隆仓库到本地工作目录
  • 进入项目根目录
  • 生成环境配置,填入 LLM API 密钥(如OPENAI_API_KEY
  • 启动 postgres、API、UI 三个容器

在浏览器打开http://localhost:8080即进入 Skyvern 任务追踪界面,首页有一个自然语言任务输入框。首次启动约 3 分钟,compose 健康检查最长等待 180 秒,用docker compose ps确认三个服务都变为 healthy 再刷新页面。若 LLM 密钥没配对,任务会在界面上直接报模型调用失败,这是第一个要排除的坑。

不想装 Docker 也可以走 pip:pip install "skyvern[all]"后执行skyvern quickstart,默认用~/.skyvern/data.db这个 SQLite 文件当数据库,不用 Postgres。

三个可验证用例(由浅入深)

用例一:单任务抓取

  • 任务描述:Find the top post on hackernews today
  • Skyvern 做了什么:通过 SDK 一行代码await skyvern.run_task(prompt=...)把指令交给任务引擎;浏览器自动导航到 Hacker News 首页,按视觉推理识别出积分最高的帖子并读取其内容。
  • 可观察产出:任务完成后的提取结果——标题、链接、积分三个字段;./videos目录里同步生成该次运行的浏览器录屏。

用例二:固定输出 Schema 的数据提取

  • 任务描述:同一句抓取指令,但要求输出严格符合给定结构
  • Skyvern 做了什么:给run_taskdata_extraction_schema参数,用 JSON Schema 锁定titleurlpoints三个字段的类型;引擎按 Schema 约束提取并返回。
  • 可观察产出:结构化 JSON 而非自由文本,可以直接喂给下游代码;README 的 "Get consistent output schema from your run" 一节有完整示例代码。

用例三:多任务组合成 Workflow

  • 任务描述:下载某账户 1 月 1 日之后的全部发票
  • Skyvern 做了什么:在 workflows 页面把多个任务块串成流程——浏览器任务打开发票列表页,提取出符合条件的发票链接列表,for loop 块逐条进入详情页下载 PDF,每轮下载落盘。
  • 可观察产出./downloads目录下的一批 PDF 文件;workflow 页面上可以看到每个块的执行状态,形成"提取列表 → 循环下载"的固定流程,换一批目标站点不用重新编排。

深入一层:可观测性与调优入口

执行过程在哪里看:History 页面点击任意一次运行进入任务详情页,有四个标签。actions 标签逐步列出 Skyvern 的每个动作及其执行后的屏幕截图;recording 标签是整段浏览过程的回放;diagnostics 标签包含标注截图、元素树、页面 HTML 和原始 LLM 请求日志。某一步动作失败时,先看 actions 里的截图,再去 diagnostics 找对应时刻的元素树和 LLM 请求定位原因。这两部分在仓库文档里有对应章节:fern/running-tasks/visualizing-results.mdx、fern/observability/overview.mdx。

一个最常见的调优项MAX_STEPS_PER_TASK_V2,定义在 skyvern/config.py 第 156 行,默认值 25,控制单个任务最多执行多少步。任务反复跳转、迟迟不结束时可以调高它;但每一步都触发一次视觉 LLM 调用,步数与成本、耗时同步上升,调高之前建议先在 diagnostics 里确认卡在哪一步。

适用边界与已知限制

  • 开源版本本身不包含反爬对抗、验证码求解和代理网络——这些是托管云服务的内置能力。目标站点反爬严格时,需要自行配置代理与浏览器指纹,否则任务可能卡在登录或验证环节。
  • 成本模型:每个动作都依赖一次视觉 LLM 调用,长任务的成本随步数线性增长。批量跑之前建议先单跑一个任务,用 diagnostics 确认步数和耗时量级。
  • 认证覆盖:支持密码凭据与 TOTP 双因素(Google Authenticator 类)登录;短信类验证码流程需要额外集成邮箱转发等外部服务,不是开箱即用。
  • 许可证:仓库使用 AGPL-3.0,若计划把 Skyvern 能力嵌入闭源商业产品,需要先评估该许可证的传染性条款。

【免费下载链接】skyvernAutomate browser based workflows with AI项目地址: https://gitcode.com/GitHub_Trending/sk/skyvern

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询