ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UI-TARS 快速指南:把 GUI 模型的输出跑成自动化动作

UI-TARS 快速指南:把 GUI 模型的输出跑成自动化动作 UI-TARS 快速指南把 GUI 模型的输出跑成自动化动作【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS你让视觉模型看一张截图它回你一行字Thought: 点一下发送键 Action: click(start_box(100,200))。可这行字还只是打算做什么不是做完了。坐标是模型自己的坐标系离真正在屏幕上落下鼠标还差一步。UI-TARS 的解析库就补这一步它把模型的 Thought/Action 输出解析成结构化动作换算坐标后生成可直接执行的 pyautogui 脚本是 GUI 自动化里模型输出 → 真机操作的桥梁。UI-TARS 安装步骤5 分钟跑通第一段代码先装库pip install ui-tars然后喂给解析器一段模型输出两步拿到可执行的自动化代码from ui_tars.action_parser import ( parse_action_to_structure_output, parsing_response_to_pyautogui_code, ) response Thought: 点一下发送键\nAction: click(start_box(100,200)) parsed parse_action_to_structure_output( response, factor1000, origin_resized_height1080, origin_resized_width1920, model_typedoubao, ) print(parsing_response_to_pyautogui_code(parsed, 1080, 1920))四个参数逐个说origin_resized_width / height你传给模型的截图原始分辨率例子里是 1920×1080factor坐标缩放因子doubao 体系下模型把坐标归一到 0~1000model_type声明模型走哪套坐标体系doubao 和 qwen25vl 各一套。第一个函数把文本拆成action_type、action_inputs等字段的结构化数据第二个函数再把数据翻译成 pyautogui 脚本字符串。中间那步坐标换算就是下面要讲的重点。看懂模型输出一个 Thought 加一个 Action模型每次输出固定是两段。Thought是它先想一想再动手Action才是要执行的动作。解析时这两段都会被保留thought字段留作排查action_type决定生成哪种 pyautogui 调用点击、输入、拖拽、快捷键等。调试时盯着action_inputs里的start_box看它是不是你想点的那个位置不是的话问题多半出在下一节说的分辨率换算上。UI-TARS 坐标对齐不同分辨率为什么还能点准模型看到的不是原图而是被 smart_resize 等比缩放过的一版。它输出的坐标是缩小图坐标系里的值直接拿去动鼠标必然点偏。UI-TARS 解析函数内置了这套换算按 smart_resize 的缩放比例把坐标映射回原图。doubao 体系把坐标归一在 0~1000Qwen2.5-VL 体系则直接输出绝对像素坐标两套都靠对齐缩放 → 反算原图落地。点的位置总差一点时用仓库自带脚本把坐标画回截图from PIL import Image, ImageDraw img Image.open(data/coordinate_process_image.png) start_box parsed[0][action_inputs][start_box] x, y eval(start_box) draw ImageDraw.Draw(img) draw.ellipse((x - 5, y - 5, x 5, y 5), fillred) img.show()红点落在按钮上就说明对齐正确。仓库的 README_coordinates.md 里有完整推导示例图见下UI-TARS 提示词选择桌面、手机、只定位三套提示词模板都放在 codes/ui_tars/prompt.py区别在动作空间模板适用平台提供的动作COMPUTER_USEWindows / Linux / macOS 桌面单击、双击、右键、拖拽、滚动、快捷键、文本输入MOBILE_USE手机或安卓模拟器额外提供 long_press、open_app、press_home、press_backGROUNDING模型训练与评估只输出 Action不带 Thought选模板就是选设备操作电脑用第一套做手机端自动化选第二套长按、启动应用这类手机专属动作只在它里面只想测模型找得准不准用第三套。UI-TARS 1.5 基准成功率与局限先看三个有代表性的数字评测集任务UI-TARS-1.5OSWorld桌面任务成功率100 步42.5ScreenSpot-V2界面元素定位准确率94.2AndroidWorld手机任务成功率64.2系统整体由感知、动作、推理、学习四块组成其中先想后做的推理模块是 Thought 机制的来源也直接贡献了上面的分数说清楚边界免得期望错位开源的 7B 版本侧重通用电脑操作游戏场景与完整版 1.5 还有差距长任务下计算开销不小模型偶尔会认错元素、点偏位置。所以自动化流程里建议保留人工确认或校验步骤。三步开始动手装解析库跑通上面两段代码确认能从模型输出拿到 pyautogui 脚本用坐标可视化脚本核对截图上的红点确认分辨率换算无误按目标平台选提示词模板桌面选 COMPUTER_USE手机选 MOBILE_USE。细节都写在 README_deploy.md 里部署模型和调用 API 的步骤也在那一篇。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表