说实话现在各种CLI、SKILL、MCP太多了我习惯性每天都要上Github看最新的AI插件因为我经常要用WorkBuddy、DeepSeek Harness干活偷懒这两个Agent太依赖插件了。这两天在Github上发现一个CLI数据采集工具专门用来复杂网页大规模爬虫叫作Brightdata CLI到目前Star数已经超过6K在AI爬虫开源项目里算很高的热度配置到WorkBuddy上用非常惊艳后面会有案例。简单说这个CLI是终端直接调用的轻量工具使用Bright Data采集API来实现爬虫不用写复杂的Python代码甚至压根不需要代码。在终端输入一行指令就能完成网页抓取、控制浏览器、搜索引擎批量检索、AI关键词自动采集等操作堪称网络数据采集百宝箱。相比较之前用的requests、playwright脚本这个CLI把数据请求求、HTML解析的活都干了接受url和字段需求自动返回数据集。比如你可以让它批量采集几万条亚马逊商品的价格、名称、销量等信息也可以直接关键词搜索获得谷歌结果实时监测热度或者抓取领英岗位、帖子列表这些都可以实现。这里面涉及到一个很重要的网络采集技术那就是针对网站爬虫检测的处理能力。看readme介绍Brightdata CLI能自动处理人机验证、动态页面渲染、浏览器指纹等于打通了公开数据的采集通道不需要再写脚本去处理反爬替代了爬虫工程师的工作。例如通过CLI采集领英上相关AI博主的公开信息直接拿到明细数据采集到的结果能直接导出Markdown、CSV这样的结构化格式很适合AI进行训练、分析。除了CLI命令行形式你还可以通过SKILL服务接入到WorkBuddy、DeepSeek Harness上随时调用口语化聊天就能采集复杂的网页数据。以部署WorkBuddy为例首先你需要在命令行安装Bright Data CLI在mac终端输入以下命令当然你的电脑得有Node.js。curl -fsSL https://cli.brightdata.com/install.sh | sh安装好后再在终端输入brightdata init出现下面界面代表安装好了。然后你需要去Bright data官网注册key配置到该CLI上现在这个key是免费用的每个月有5000次采集额度测试数据完全够用了。在以下链接注册并获取key有5000次额度。https://get.brightdata.com/weijun拿到key后在终端去配置。# 直接配置key brightdata login --api-key your-api-key # 设置环境变量可完全跳过登录 export BRIGHTDATA_API_KEYyour-api-key配置好后就可以直接在CLI上采集数据比如抓取指定网站。在谷歌、必应、Yandex上进行搜索。自动化操作浏览器比Playwright、Chrome MCP还要好用。若想要在Wrokbuddy上配置Bright Data CLI输入以下命令brightdata skill add这个命令会导出SKILL文件到agent上如果没有Workbuddy直接配置选项可以先配置到Codex或者Trae上然后找到SKILL md文件再配置到WorkBuddy上。假如你已经获取到SKILL打开WorkBuddy上的技能-添加技能上传该SKILL文件。配置好就能在“我安装的“技能库里找到Bright Data CLI。接着使用WorkBuddy来调用Bright Data CLI采集数据。比如搜索谷歌上“agent”相关的新闻。WorkBuddy会调用后台CLI来请求谷歌拿到相应的搜索结果既有json明细也有html可视化报告。json明细数据如下html可视化报告如下再来个高难度的查询亚马逊上销量前20的智能手机需要搜集价格、名称、图片、优惠等信息。最终结果交付了json、csv、html三种文件。csv明细表格如下html可视化报告如下是不是很惊艳这就是Bright Data CLI搭配Workbuddy的神奇效果。如果想要用可以注册个key每月5000次免费额度可以抓很多数据了。https://get.brightdata.com/dataforai我感觉这类数据采集还非常适合大模型训练数据比如视频、图片、音频等多模态数据也可以作为电商运营数据源。现在很多工具都CLI化从速度、兼容性、系统支持上来说比传统app要好用很多搭配Workbuddy用几乎零门槛。