Browse AI 是什么?
Browse AI 是托管式无代码网页提取与监控平台。用户安装 Recorder,演示导航并选择字段或列表,系统将操作转为“Robot”:可接受参数、翻页、抓取结构化行、截图并定时重复。部分常见来源也有预置机器人。
结果可保留在工作区,也可通过 CSV、Google Sheets、Airtable、Amazon S3、REST API、Webhook、Zapier、Make、Pabbly 等进入工作流;官方还将它定位为 LLM/RAG 的实时网页上下文。因此它不只是一次性爬虫,而可能成为正式数据源,必须同时管理可靠性、授权、隐私和血缘。
机器人、监控与可靠性
机器人可以打开页面、登录、点击、输入参数、展开隐藏内容、翻页、访问详情页、捕获字段并比较后续运行。Deep Scraping 能把列表和详情合成完整记录,但每个详情页都是独立 Task 与成本。
无代码不等于免维护。按钮改名、DOM 变化、A/B Test、地区语言、Cookie 弹窗、Session 过期、代理被封、无限滚动或 JS 延迟,都可能造成缺失、错位甚至“成功但空”。CAPTCHA 与住宅代理也不能保证完整或合法。
生产环境应定义预期行数与必填字段,校验类型/唯一性,定期与来源抽样对账,保留来源 URL 和提取时间,对漂移告警并隔离大幅变化,同时准备授权数据源或人工备用。登录/未登录、桌面、地区、翻页和错误状态都要测试。
当前价格与 Credit 成本
Free 每月 50 Credits、2 个域名、3 用户;Personal 年付 $228 含全年 12,000 Credits、5 域名、3 用户,月付方案 $48/2,000;Professional 年付 $828 含全年 60,000、10 域名、10 用户,月付起价 $87/5,000;Premium 年付起价折合 $500/月,含 600,000+、定制上限和托管配置。另有更高额度、域名 Add-on 与 Top-up。年付额度全年可灵活使用,但周期末清零;标准数据保留显示为 90 天。
标准网站每个 Task 至少 1 Credit,10 行或 1 张截图为 1。Premium 来源最低/倍数为 2–10。100 项列表约 10 Credits,但继续访问 100 个详情页至少再加 100;每三天监控 10 个详情页约每月 100,还未算 Premium、重试、截图或下游步骤。必须用真实 PoC 估算并预留失败和重训空间。
凭证、数据与安全
隐私政策称需登录时可能收集 Origin URL、用户名、Session Cookie、Local Storage 参数与密码,密码加密。Browse AI 表示加密输入不会记入日志,支持人员看不到加密输入,只有在用户明确请求后才可访问 Robot 且行为受监控;其称已完成 SOC 2 Type II,并提供 Trust Center。
价格表的标准保留为 90 天,而隐私政策对其他个人信息采用目的和法定义务期限。应分别确认结果、截图、运行日志、Cookie、凭证、备份、导出、支持材料和删号后的保留。使用专用最小权限账户,避免个人凭证,限制 Workspace 角色/API Key,停用 Robot 时立即撤权和轮换。
条款称客户保留 Customer Data 权利,但授予提供/改进服务及生成聚合数据所需的处理许可。隐私政策明确“不用于训练通用 AI/ML”的仅是 Google Workspace API 数据,不能扩展成所有数据的统一不训练承诺;敏感场景需审查正式 DPA 和 Trust 证据。
抓取权利与下游 AI
能打开页面不等于获准收集、再发布、画像或出售内容。自动化前记录来源所有者、访问方式、条款、robots 指引、Rate Limit、版权/数据库权、个人数据法律基础、告知/删除义务、合同限制和允许的下游目的。登录数据、人物档案、医疗/金融、未成年人、版权媒体与竞争性再发布需要更高审查。
采用缓慢可预测的计划、缓存未变化页面、只采必要字段、执行删除/抑制并按需署名。若输出进入 LLM,模型供应商成为新的数据目的地,有独立训练、保留、地区与 Prompt Injection 风险。每行保留 Provenance,把抓来的指令当不可信数据而非可执行命令。
结论
Browse AI 是手工浏览与工程化数据管线之间的实用桥梁。Recorder、监控、集成和低门槛免费档,适合验证一个获授权来源能否形成有用工作流。
上线仍需生产纪律:校验 Schema/完整性,按详情页和频率计算 Credits,隔离凭证,缩短保留,记录来源许可并治理每个导出。最好的机器人不只是持续运行,而是数据始终准确、获授权、可追踪且经济。
