
UI-TARS Desktop 完整教程5 步用自然语言接管你的电脑与浏览器【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop晚上九点你想起 VS Code 的自动保存还没开。不用打开菜单一层层找只要在 UI-TARS Desktop 的输入框里敲一句「帮我打开 VS Code 的 autosave延迟设为 500 毫秒」它会自己点开应用、找到设置项、把值填好全程约二十秒。UI-TARS Desktop 是一个开源的多模态 AI Agent 桌面应用你下达一句自然语言指令它通过截图和视觉识别看懂屏幕再用真实的鼠标键盘替你操作Windows 和 macOS 都能跑。它能替你干的活先不吹概念看三个真实场景。场景一改一个藏得深的设置。之前的流程是打开应用 → 展开菜单 → 搜索设置项 → 定位数值框 → 输入保存。之后的流程是一句话模型自己完成「找界面 → 读界面 → 点选 → 输入」的闭环你在旁边看着它点就行。场景二查信息 汇报。「去 GitHub 上看 UI-TARS-Desktop 项目最新的 open issue」——它会自己启动浏览器、导航到仓库、切换 issue 列表、定位最新的 issue然后把标题和内容读回来给你省掉了开标签页、敲 URL、排序筛选这一串机械动作。场景三不占本地资源的网页任务。远程浏览器操作模式下任务在云端浏览器里执行你本地连浏览器都不用开适合批量跑网页类任务或者不想动本地环境的场合。共同点是这三类事之前都要你「手动 盯」现在只需要「描述 等」。从零到跑通一条连续流程整个过程不需要 clone 代码装好应用、配一个模型端点就能出第一个任务。第 1 步安装。macOS 可以从 Homebrew 直接装brew install --cask ui-tars也可以去发布页下载 dmg把应用拖进「应用程序」文件夹完成安装Windows 用户双击安装包按向导走即可。第 2 步给系统开权限。这一步不做后面鼠标根本不会动。macOS 进入 系统设置 → 隐私与安全性分别给 UI TARS 打开辅助功能Accessibility和屏幕录制Screen Recording两项第 3 步准备模型。UI-TARS Desktop 本身不带模型需要一个 OpenAI 兼容的 VLM 端点官方最省事的路线是 Hugging Face 上的 UI-TARS-1.5-7B。打开 Hugging Face 端点目录点右上角Deploy from Hugging Face部署部署完成后从端点详情页拿到三样东西Base URL、API Key、模型名。第 4 步写进应用设置。打开 UI-TARS Desktop 的设置面板把刚才三样东西填进去VLM Provider 选Hugging Face for UI-TARS-1.5Language: en VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: UI-TARS-1.5-7B两个高频坑先记一下Base URL必须以/v1/结尾Provider 一定要选和模型版本对应的那一项动作解析依赖它。填完可以点Check Model Availability验证连通性。国内网络环境更顺的替代是火山引擎的 Doubao-1.5-UI-TARS 端点流程相同Provider 选VolcEngine Ark for Doubao-1.5-UI-TARS第 5 步发第一个任务。回主界面点「开始新对话」选择操作模式本地计算机操作、本地浏览器操作或远程浏览器操作。选了浏览器模式的话确保本机装了 Chrome、Edge 或 Firefox 之一。然后直接输入指令回车到这里就算跑通了。设置界面整体长这样后面调优会用到的都在里面看它怎么干活四条可以直接复制的指令下面这几句是从仓库 showcase 里挑出来、实测路径最短的指令可以直接贴进输入框。改应用设置本地计算机模式Please help me open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds in the VS Code setting.预期自动打开 VS Code → 进入 Settings → 搜索 autosave → 把延迟改成 500ms → 自行收尾。适合验证「精确到单个输入框」的能力。查项目动态本地浏览器模式Could you help me check the latest open issue of the UI-TARS-Desktop project on GitHub?预期拉起浏览器 → 导航到项目页 → 切到 issue 列表 → 按时间排序 → 把最新 issue 的标题和摘要汇报给你。批量信息核对打开天气预报网站查询北京本周的逐日天气并总结哪天最冷。预期自行完成搜索、翻页、读数最后给你一段结论而不是原始页面。远程浏览器里跑任务帮我在电商网站搜索 iPhone 15 的价格列出前三家店铺并比较差价。预期任务全程在云端浏览器执行本地屏幕不参与结束后同样回传结论。本地与浏览器两种模式的界面差异可以对照这两张官方演示图它是怎么看懂屏幕的剥掉外壳UI-TARS Desktop 内部是一个循环每圈做四件事截图当前的 Operator执行器抓取屏幕得到 base64 图像和物理分辨率预测把「你的指令 动作空间说明 最近若干帧截图」喂给多模态视觉语言模型模型返回一条结构化动作形如click(start_box(27,496))执行Operator 把模型预测的坐标换算成真实屏幕坐标做出真实的点击/输入/滚动判定模型说finished()就停否则带着新截图进入下一圈直到完成或触及最大圈数上限。这里有两个值得注意的设计。第一它不依赖 DOM 或无障碍树靠的是视觉识别——这意味着它面对的和你看到的是同一张图任何「人眼能操作」的界面原则上它都能摸到代价是模型必须足够强、坐标必须足够准这也是为什么模型选型和端点稳定性直接影响执行质量。第二控制闭环跑在你本机截图、动作执行、状态展示都在桌面应用里完成模型端点可以是云上也可以是自托管报告默认存在本地整条链路里没有必须经过的第三方中转。整个应用的事件与报告流向可以参考这张 UTIO 流程图让它更顺手调优与预设跑通之后四个参数最影响体验都在设置面板里参数默认值作用Max Loop100区间 25–200单轮任务最大步数长流程任务多页操作可适当调大Loop Wait Time1000ms区间 0–3000每次截图前的等待页面动画/加载慢就调大动作响应快就调小Languageen控制 VLM 输出语言不影响应用界面本身本地浏览器搜索引擎Google浏览器模式打开搜索页时用的引擎可换 Bing、Baidu预设Preset适合把一套配置打包分发。UI-TARS Desktop 支持从本地 YAML 文件或远程 URL 导入URL 方式的预设在应用启动时会自动拉取更新预设就是一个设置集合的 YAML仓库里有一份模板可以照着改详见 预设文档name: UI TARS Desktop Example Preset language: en vlmProvider: Hugging Face for UI-TARS-1.5 vlmBaseUrl: https://your-endpoint.huggingface.cloud/v1 vlmApiKey: your_api_key vlmModelName: your_model_name另外两个实用功能模型支持 Responses API 时开启该选项可降低 token 消耗、加快响应任务结束后点Export as HTML可把整轮执行含每步截图与动作导出成报告文件配置了报告存储地址时还能直接上传并复制分享链接精度调优的经验法则指令写得越具体给出应用名、菜单路径、目标数值模型走弯路越少长任务宁可拆成两三个短指令也不要指望一步到位截图总「早一拍」就加 Loop Wait Time。开发者入口SDK 与自定义 Operator如果你不想停留在桌面应用仓库里的 SDK 包ui-tars/sdk把上面那个「截图 → 预测 → 执行」循环做成了库Node.js 和浏览器环境都能用import { GUIAgent } from ui-tars/sdk; import { NutJSOperator } from ui-tars/operator-nut-js; const guiAgent new GUIAgent({ model: { baseURL, apiKey, model }, operator: new NutJSOperator(), }); await guiAgent.run(send hello world to x.com);想最快上手可以先跑官方 CLInpx ui-tars/cli start输入端点配置后就能在终端里发指令控制电脑。扩展点也很清晰Operator 接口只需实现screenshot()和execute()两个方法仓库里已经内置了四个实现可以参考——Nut.js 桌面操作器、浏览器操作器、ADB 安卓操作器 和 Browserbase 远程操作器。把GUIAgent和任何自研 Operator 组合就可以把这套 GUI Agent 嵌进你自己的产品SDK 文档里还给了接推理模型做任务规划的进阶写法。避坑清单现象任务开始后鼠标纹丝不动应用无报错。原因macOS 权限没给全。解法同时确认「辅助功能」和「屏幕录制」两项都开了只开一项不够改完后重启应用。现象Check Model Availability失败或第一轮就报请求错误。原因Base URL 没以/v1/结尾或 API Key 与端点不匹配。解法回模型端点详情页核对三要素注意 Key 复制时别带空格。现象模型能回话但动作解析异常、点击位置漂移。原因VLM Provider 选的版本和实际模型不匹配比如用 1.5 模型选了 1.0 的 Provider。解法Provider 严格对应模型版本两者都要和端点一致。现象多显示器环境下部分任务定位错乱。原因桌面版目前仅支持单显示器配置。解法任务期间只接一块屏或把任务改到远程浏览器模式执行。现象选浏览器模式后起不来。原因本机没有装受支持的浏览器。解法安装 Chrome、Edge 或 Firefox 任意一个再重试。现象任务执行到一半被截断。原因触达 Max Loop 上限默认 100 步。解法调大 Max Loop或把长流程拆成多轮短指令。现象截图总是「快半拍」拍到的是动画过程而不是结果。原因Loop Wait Time 默认 1000ms 对慢速页面不够。解法逐步上调到 1500–2000ms观察报告里的每步截图确认。延伸继续深入配套文档都放在 docs/ 目录快速开始 覆盖了 Hugging Face 与火山引擎两条完整部署路线设置指南 逐项解释了每个配置项SDK 文档 是开发者主入口部署文档 讲云端部署细节。示例配置可以直接复用默认预设模板 和进阶运行时配置。项目节奏上桌面端在 v0.2.0 加入了免费的远程计算机与远程浏览器操作器同一仓库下的 Agent TARS CLI 也在持续更新事件流调试、工具调用统计等整体方向是「GUI Agent 视觉 MCP 工具」这条多模态 Agent 栈的不断加厚。下一步建议先用上面的四条指令把本地模式和浏览器模式各跑一遍再对照报告导出功能复盘每一步动作——你会对「模型在哪一步走歪了」有非常直观的判断这也是调优一切参数的前提。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考