ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UI-TARS Desktop 完整指南:视觉大模型驱动 GUI 自动化,5 步跑通本地部署

UI-TARS Desktop 完整指南:视觉大模型驱动 GUI 自动化,5 步跑通本地部署 UI-TARS Desktop 完整指南视觉大模型驱动 GUI 自动化5 步跑通本地部署【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS Desktop 是一个基于 UI-TARS 视觉大模型VLM能看懂截图并给出操作建议的大模型的 GUI 自动化桌面应用。你输入一句人话它替你截屏、识别、点击、回看结果。省掉写脚本和记坐标两件事软件界面改版后任务照样能跑。它是什么凭什么不一样先看一张对照表把传统做法和它的做法摆在一起维度传统 GUI 自动化脚本UI-TARS Desktop定位元素写死坐标或用选择器改版即失效看截图找元素改版后能重新识别描述任务先学框架再写代码直接打一句话跨平台每个系统一套 API同一份指令跑 Windows 和 macOS出错排查翻日志猜每一步有截图和动作记录可回放核心能力一共 4 条每条给一个具体例子视觉理解VLM 直接读截图定位控件。比如你说点右下角那个蓝色按钮它不靠坐标靠看图。自然语言驱动一句话就是一个任务。比如打开计算器算 37×41全程不用写代码。双操作器Computer Operator 管键鼠Browser Operator 管网页。后者支持 Chrome、Edge、Firefox适合填表单、抓信息。任务闭环每执行一步就回看结果模型自己判断做完了没有多步任务不用你盯着。5 分钟跑起来安装前的 4 项环境检查项目要求是否必须Node.js20.x 及以上是pnpm9.x仓库已锁定 packageManager是Chrome / Edge / Firefox任意一个仅 Browser Operator 需要显示器单显示器多屏可能导致部分任务失败是5 条命令完成构建与启动先确认 Node 版本然后克隆、装依赖、以开发模式启动一条不多一条不少node -v git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm run dev:ui-tars如果你没有 pnpm先执行corepack enableNode 20 自带 corepack 会帮你装对版本。想打正式安装包再跑pnpm run build。macOS 权限配置2 项必开macOS 上要手动开两个权限Windows 目前无需额外授权。辅助功能不开鼠标键盘模拟不了它只能看不能动。屏幕录制不开截屏是黑的VLM 等于闭着眼睛工作。入口都在 系统设置 → 隐私与安全性给完权限后重启应用。安装包拖进 Applications 的过程长这样它是怎么工作的1 张图看懂 5 步执行链路主链路一句话指令进来 → 截屏 → VLM 看图给出动作如click(x, y)→ 操作器执行 → 再截屏确认循环到模型判定完成。整条链路由 UTIO通用任务输入输出框架串起来核心环节和源码位置如下步骤说明源码位置1. 接收指令解析自然语言任务apps/ui-tars/src/main/agent/2. 截屏送模型抓屏截图发给 VLMapps/ui-tars/src/main/utils/3. 解析动作模型输出转成点击、输入等动作packages/ui-tars/action-parser/4. 执行操作器模拟键鼠或驱动浏览器packages/ui-tars/operators/5. 回看结果再截屏模型判断是否完成packages/ui-tars/utio/桌面端主进程的代码结构3 层以内apps/ui-tars/src/ ├── main/ │ ├── agent/ # 模型调用与动作解析 │ ├── services/ # UTIO 任务、截屏、窗口服务 │ └── ipcRoutes/ # 主进程与界面的通信 └── renderer/src/ # React 界面进阶玩法模型配置方法换提供商只填 4 个字段场景你从 Hugging Face 切到火山方舟或者想换更新的 UI-TARS-1.5。做法打开设置页只填 4 项。注意 Base URL 必须以/v1/结尾Provider 要选和模型版本匹配的那一档。VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://xxx/v1/ VLM API KEY: your_api_key VLM Model Name: uitars-1.5-7b收益模型循环完全不用改换个后端一处生效。字段细节见 设置配置指南。接入自定义操作器实现 2 个方法场景想控制内置键鼠、浏览器之外的目标比如用 ADB 接安卓设备。做法用 SDK 的GUIAgent操作器只需实现screenshot()和execute()两个方法。import { GUIAgent } from ui-tars/sdk; import { NutJSOperator } from ui-tars/operator-nut-js; const agent new GUIAgent({ model: { baseURL: https://xxx/v1, apiKey: sk-xxx, model: uitars-1.5-7b }, operator: new NutJSOperator(), onData: ({ data }) console.log(data.status), }); await agent.run(在记事本里新建文件并输入 hello);收益同一条截屏—识别—执行循环直接复用换执行端就行。接口定义在 SDK 文档 和 packages/ui-tars/sdk/。2 类任务先跑起来场景刚装好不知道从哪下手。做法先用 Computer Operator 跑本地重复操作比如开软件、移动文件、填桌面表单再用 Browser Operator 跑网页任务填表单、核对信息前提是装了 Chrome、Edge 或 Firefox。收益两类任务覆盖大多数日常练熟后再上批量场景。避坑手册截屏失败屏幕录制权限没开症状任务一启动就拿不到画面或点了没反应。原因macOS 上屏幕录制或辅助功能没给。最短解决系统设置 → 隐私与安全性两项都勾选 UI TARS重启应用。模型请求报错Base URL 少了 /v1症状设置页保存后发指令直接报错。原因Base URL 结尾漏了/v1/或 Provider 和模型版本不匹配。最短解决把 Base URL 改成/v1/结尾Provider 选对应 UI-TARS-1.5 的选项。多显示器下任务失败症状双屏时部分任务定位错乱。原因当前版本只支持单显示器配置。最短解决把要操作的窗口全部挪到主屏。浏览器操作器不可用症状选了 Browser Operator 却启动不了。原因系统里没装 Chrome、Edge 或 Firefox。最短解决装三者任意一个。接下来这样做node -v确认版本 ≥ 20。git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktoppnpm install pnpm run dev:ui-tarsmacOS 打开辅助功能和屏幕录制权限。在设置页填 4 个 VLM 字段发出第一条指令。仓库把 SDK、操作器和 快速上手文档 都开源在同一处同一条模型循环以后可以直接在 Node.js 脚本里调用桌面端只是它的其中一个出口。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表