Memoh浏览器与桌面自动化实战如何教会AI替你操作Chrome和计算机【免费下载链接】Memoh✨ The open-source multi-agent platform. Every agent gets its own computer, desktop, network, and long-term memory. You can bring your own key, or host your coding agent like Claude Code, Codex and so on.项目地址: https://gitcode.com/gh_mirrors/me/Memoh想让 AI 替你打开网页、点按钮、填表单甚至直接操作整台计算机开源多智能体平台Memoh让每个 AI 智能体Agent都拥有一台专属云电脑独立的文件系统、浏览器、桌面和网络24 小时在线。通过内置的浏览器自动化Browser Use与桌面自动化Computer Use能力你可以直接对 AI 说帮我登录后台导出报表它会自己打开 Chrome、观察页面、一步步完成操作。为什么 AI 需要自己的电脑传统大模型只能说不能做它给你一段操作步骤剩下的还得你自己点。Memoh 的思路是——给每个 Agent 分配一个隔离的工作区容器workspace里面跑着一台虚拟电脑️独立桌面Xvnc 虚拟显示AI 能截屏、点击、输入独立浏览器有界面的 Chrome通过 CDPChrome DevTools Protocol受控长期记忆跨会话、跨平台记住你的偏好⏰定时任务你合上笔记本任务照样在跑这正是 Memoh 浏览器与桌面自动化的基础AI 不是在模拟操作而是在一台真实电脑上真实地操作。一步开启打开 Bot 的 Display 开关浏览器与桌面工具默认不会注册给 Agent需要在 Bot 设置中打开Display显示/桌面开关开启后该 Bot 的工作区容器会启动 Xvnc 虚拟桌面和有界面 ChromeCDP 端口9222Web 端随之出现可视化的 Display 面板你可以实时看到 AI 的屏幕。相关逻辑位于设置项定义internal/settings/types.godisplay_enabled桌面服务Xvnc/RFB WebRTC 推流internal/display/service.go前端开关组件apps/web/src/pages/bots/components/bot-desktop.vue容器内桥接程序负责监管 Xvnc 与 Chrome 进程cmd/bridge/浏览器自动化AI 如何看见并操作 Chrome开启 Display 后Agent 会获得两组核心工具定义见 internal/agent/tool/browser.go工具作用常用子命令browser_observe只看不动观察当前页面snapshot元素快照、get_content正文、screenshot_annotate带标注截图、pdf、tab_listbrowser_action执行操作navigate、click、fill、type、press、scroll、drag、upload、tab_new等这套设计的精髓是先观察再行动Observe before actingAI 先调用snapshot拿到页面上可交互元素的可访问性树和引用如e12再用这些 ref 去执行click、fill而不是瞎猜 CSS 选择器——稳定性大幅提升页面状态变化后再观察一次形成观察 → 行动 → 再观察的闭环。你帮我查一下明天北京到上海的航班 AIbrowser_action → navigate 打开机票网站 AIbrowser_observe → snapshot 获取搜索框 ref AIbrowser_action → fill 输入北京 上海click 搜索按钮 AIbrowser_observe → get_content 读取航班列表并汇总给你截图类观察结果会保存在工作区的.memoh/screenshots路径下AI 需要时再读取不会无谓地塞满上下文见 internal/agent/tool/browser.go 的screenshotSubdir常量。桌面自动化Computer Use不止浏览器还能操作整台电脑浏览器解决不了的问题——原生弹窗、非浏览器应用、拖拽文件——交给Computer Use。它由computer_observe/computer_action两个工具组成见 internal/agent/tool/computer_a11y.go快照优先snapshot通过AT-SPI 无障碍树枚举桌面 UI 元素。无障碍服务由仓库自带的 Rust 小工具a11y-cli提供位于 crates/a11y-cli/打包进工作区镜像的/opt/memoh/toolkit/display/bin/a11y-cli️输入回退当无障碍树够不到目标如某些原生对话框时自动退化为 RFB远程帧缓冲原始鼠标/键盘事件用坐标点击兜底默认分辨率1280×800internal/agent/tool/browser.go坐标即所见即所得。工具的使用策略写在给模型的提示里internal/agent/tool/browser.go浏览器能做的优先走浏览器Computer Use 是整桌面兜底。这套分层设计让 AI 优先选择更稳定、更省资源的路径。进阶玩法把 Playwright 接进 AI 的浏览器如果你有更复杂的批量场景比如循环采集 200 个页面可以让 Agent 直接写代码。browser_remote_session工具会把工作区 Chrome 的 CDP 端点暴露出来127.0.0.1:9222AI 即可在工作区内用chromium.connectOverCDP启动 Playwright 会话create创建/激活一个标签页会话status查看当前所有标签页close结束会话。也就是说AI 亲自点鼠标与AI 写 Playwright 脚本两条路线可以混用——GUI 工具负责灵活应变CDP 代码负责规模化。新手避坑指南先开 Display 开关不开启时这些工具根本不会注册AI 只会回答我做不到给它看得见的结果AI 的截图保存在工作区里需要图像理解时它可自行读取不必你在对话里贴图复杂登录任务首次登录遇到验证码/滑块时可借助 Web 端的 Display 面板自己上手接管之后 AI 会带着会话继续跑模型建议选带视觉的浏览器观察、无障碍树、截图理解搭配支持图像输入的大模型效果最佳隔离是特性不是缺点每个 Bot 一台电脑误操作只发生在容器内可随时重建放心让 AI 放手试。相关模块速查 代码地图架构总览docs/codebase-map.md Agent 运行时说明含 Browser Use / Computer Usedocs/agent-runtime.md 浏览器/桌面工具核心实现internal/agent/tool/browser.go️ 桌面显示服务Xvnc/RFB/WebRTCinternal/display/ 容器桥接监管 Xvnc 与 Chromecmd/bridge/ 工作区容器生命周期管理internal/workspace/⌨️ 无障碍辅助 CLIRustcrates/a11y-cli/现在打开 Memoh给 Bot 打开 Display 开关然后用一句话试试打开知乎帮我找三篇关于 AI 自动化办公的热门文章并总结——剩下的交给它自己的那台电脑吧。【免费下载链接】Memoh✨ The open-source multi-agent platform. Every agent gets its own computer, desktop, network, and long-term memory. You can bring your own key, or host your coding agent like Claude Code, Codex and so on.项目地址: https://gitcode.com/gh_mirrors/me/Memoh创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考