UI-TARS 桌面应用上手从安装到跑通一个 GUI Agent 任务【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS 桌面应用是一个视觉语言模型驱动的 GUI Agent你用一句自然语言下指令它看屏幕、点鼠标、敲键盘替你完成跨应用操作。读完本文你能装好应用、配好模型并让它替你在电脑上跑完第一个真实任务。下载安装应用这一节你要做的只有一件事把应用装进系统拿到一个能打开的窗口。优先去 releases 页面下载对应系统的安装包macOS 用户也可以直接用 Homebrewbrew install --cask ui-tarsmacOS 安装时把 UI-TARS 图标拖进 Applications 文件夹即可。装完先别急着跑任务去系统设置里开两个权限这一步最容易漏「系统设置 → 隐私与安全性 → 辅助功能」授权后它才能模拟鼠标键盘「系统设置 → 隐私与安全性 → 屏幕录制」授权后它才能截屏看懂界面打开应用看到欢迎页和左侧的「New Chat」按钮就说明装好了。如果你是想从源码构建自己的版本也可以git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm run build配置视觉语言模型应用本身不带大脑识别界面、决定动作都靠外部接入的视觉语言模型VLM。这一节你先选一家提供商把连接信息填对。点左下角的 Settings打开 VLM Settings 面板四个参数都要填Language模型输出语言、VLM Provider、VLM Base URL、VLM API Key外加 VLM Model Name。以 Hugging Face 托管的 UI-TARS-1.5-7B 为例Language: en VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://xxx/v1/ VLM API KEY: your-api-key VLM Model Name: xxx两个高频坑先记住Provider 要和你实际部署的模型版本对上Base URL 要以 /v1/ 结尾。填完点「Check Model Availability」弹出成功提示再保存。微调任务行为参数默认值先跑通再按需微调。可调项不多每个改它会影响什么参数默认改它会影响什么Languageen只改模型输出语言不改应用界面Max Loop100单轮任务最多执行多少步任务越复杂给越大Loop Wait Time1000 毫秒每步操作后等多久再截屏动画慢的场景调大不想逐个手填可以在 VLM Settings 里点「Import Preset Config」用 YAML 文件或 URL 一次性导入整套配置。原理速览不需要看源码先记住这条链路就够用了你输入指令 → 模型看当前屏幕截图决定下一步动作点击/输入/滚动→ 操作器在本机执行 → 截一张新屏幕图 → 循环直到任务完成或触到 Max Loop 上限。换句话说它不依赖写死的坐标每一步都是看一眼、再决定。这也解释了为什么界面上会实时显示每步截图——那就是模型正在做的判断依据。场景演练挑三个真实场景看你输入什么 → 它做了什么。场景一改本地应用设置你输入帮我打开 VS Code把自动保存延迟改成 500 毫秒它做了打开 VS Code → 进入设置页 → 搜索 auto save → 把 Delay 改成 500 → 回报完成场景二查网页信息你输入查一下 UI-TARS-Desktop 项目最新的一个 issue它做了打开浏览器 → 进入项目页 → 点开 issue 列表 → 把第一条的标题和内容读给你场景三浏览器内连续操作你输入打开浏览器搜索多模态 AI Agent把前三条结果标题记下来它做了启动默认浏览器 → 输入关键词搜索 → 逐条读取结果页 → 汇总返回踩坑备忘现象执行任务时应用说看不到屏幕或者操作总是落空。原因macOS 的屏幕录制权限没开它拿不到截图。解决到「隐私与安全性 → 屏幕录制」勾选 UI-TARS然后完全退出再打开应用。现象点「Check Model Availability」报连接失败。原因Base URL 没以 /v1/ 结尾或 API Key 填错。解决回模型托管平台抄一遍连接信息重点核对结尾的 /v1/。现象Provider 换成 1.5 之后动作解析明显变差。原因Provider 选项和实际部署的模型版本没对上。解决把 VLM Provider 改回与部署模型匹配的那一项再保存。现象多块屏幕时点击坐标明显跑偏。原因当前版本只适配单显示器环境。解决任务期间只接一块屏或先关掉副屏再跑。现象选 Browser Use 场景后没有浏览器被打开。原因本机没装受支持的 Chrome、Edge 或 Firefox。解决装一个稳定版浏览器再重新发起任务。延伸阅读docs/quick-start.md完整快速入门含 Hugging Face 与火山引擎两种接法适合第一次部署模型的人docs/setting.md全部配置项的详细说明适合准备逐项调参的人docs/preset.md预设配置的导入与管理适合想团队共享同一套配置的人docs/deployment.md模型自部署入口适合想自己跑 UI-TARS-1.5 的人docs/sdk.mdUI-TARS SDK 手册适合想自己写 GUI 自动化程序的人packages/ui-tars/sdk/SDK 源码目录适合想读实现细节的开发者【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考