
UI-TARS 教程3 步跑通 Android 零代码自动化测试完整指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS不会写元素定位器也能做 Android 自动化测试吗UI-TARS 是一个基于视觉语言模型的开源自动化智能体主打零代码测试它直接看截图、用一句自然语言理解界面并输出可执行的操作代码。在 Android World 基准上它取得 64.2 分高于此前最佳的 59.5 分。本教程带你用 3 步完成从安装到跑通完整流程的搭建过程。谁需要它零代码测试的三类典型场景如果你的工作命中下面任何一种情况UI-TARS 值得试试回归测试维护成本高测试团队依赖 Appium 或 EspressoUI 一改定位脚本就要跟着改。UI-TARS 靠看截图识别控件界面小改动的代价明显更低。跨设备兼容性验证需要在多台模拟器或真机上跑同一套流程分辨率各不相同。它的坐标系统会自动适配不同分辨率不用逐台写适配逻辑。非开发人员做轻自动化产品、运营或 QA 想用一句话描述测试步骤让系统替自己执行而不必先学会一套自动化框架。UI-TARS 是什么不依赖元素 ID 的核心能力一句话概括UI-TARS 是一个看屏幕、再决定做什么的多模态智能体底座是视觉语言模型。对测试工作真正有用的能力有四点视觉定位界面不需要元素 ID、不需要可访问性树直接从当前截图里找到目标控件。自然语言下指令用大白话描述测试步骤例如打开电商应用搜索机械键盘不必学习任何 DSL。移动端专属动作模板内置 MOBILE_USE 模板覆盖手机场景的常用指令——open_app启动应用、press_home回主屏、press_back返回键、long_press长按、swipe滑动拖拽。输出可直接执行模型输出能被解析成结构化动作再生成可运行的 pyautogui 脚本坐标随原始屏幕分辨率自动换算。三步跑通环境从安装到验证第一步一键安装解析包模型本体的部署方式见 README_deploy.md测试链路里真正高频使用的轻量后处理包一行命令即可装上pip install ui-tars第二步配置测试对象启动 Android 模拟器或连接开启 adb 调试的真机。记下设备屏幕分辨率如 1080×1920后续坐标解析要用这两个参数。第三步最小示例验证下面的代码能打印出结构化动作说明环境已就绪from ui_tars.action_parser import parse_action_to_structure_output response Thought: Click the search box\nAction: click(pointpoint500 300/point) parsed parse_action_to_structure_output( response, factor1000, origin_resized_height1920, origin_resized_width1080, model_typeqwen25vl, ) print(parsed)一个完整工作流演示自动完成商品搜索拿电商里最常见的任务走一遍打开应用 → 搜索机械键盘 → 点开第一个结果 → 加入购物车。第 1 步用自然语言写任务。用 MOBILE_USE 模板定义在 codes/ui_tars/prompt.py拼好提示词任务描述就是一句人话打开电商应用搜索机械键盘点开第一个商品点击加入购物车。第 2 步模型返回思考 动作。面对每一帧截图模型先输出一行推理Thought再给出一个动作Action比如click(pointpoint500 300/point)。第 3 步解析动作并适配坐标。模型输出的坐标是相对缩放后图像的parse_action_to_structure_output会按你传入的原始分辨率把它换算回真实屏幕位置。下面这张原图就是解析前用于定位的截图换算后的落点用红点标回截图上效果如下可以直观确认点得准不准第 4 步生成脚本闭环执行。最后把结构化动作转成 pyautogui 代码执行循环就是截图 → 模型推理 → 解析 → 执行动作 → 再截图from ui_tars.action_parser import parsing_response_to_pyautogui_code code parsing_response_to_pyautogui_code( responsesparsed, image_height1920, image_width1080, )循环一旦接通换个任务描述就能复用到下单、发布内容、填写表单等流程。它是怎么做到的三层结构背后的 Android 自动化智能体别把 UI-TARS 当成识别 点击的简单两步。从内到外它是三层结构底层是环境模拟器或真机承担真实用户的操作环境角色——提供截图、执行点击与输入并回传新的界面状态。中层是核心模型由四个模块协同感知负责元素描述与屏幕文字识别动作把各类操作统一到一个动作空间里并支持多步轨迹推理让模型先想清楚再动手学习通过轨迹自举、Agent DPO 等手段持续优化模型表现。上层是人机交互你用自然语言下达指令随时可以观察中间过程并修正方向。先想后做的设计也解释了它为什么比纯模板匹配更稳界面变了模型会基于新画面重新推理而不是照着旧脚本盲点。数据说话Android World 拿到 64.2Android 场景里最关键的数字是UI-TARS 在 Android World 基准上得 64.2 分此前 SOTA 为 59.5 分。其他测试项上它的成绩也值得一提桌面操作 OSWorld42.5 分GUI 元素定位 ScreenSpotPro61.6 分此前 SOTA 43.6 分和 Appium/Espresso 手写定位器的传统路线相比它的价值不只是分数不依赖元素 ID 树意味着 UI 改动后通常不用整体重写脚本跨设备、跨应用的维护成本更低。稳定性与避坑Android 自动化测试的四个高频问题坐标偏了怎么办先核对解析时传入的分辨率参数是否和真实截图一致。坐标系统就是按这两个数做比例换算参数错了点就会按比例偏。动态界面不稳定关键步骤之间加短暂等待重要操作失败后重新截图再试。动作空间里本身就提供了wait类动作可供使用。个别元素识别不到换一张更清晰的截图或在指令里把元素特征写具体一点——位置、颜色、旁边有什么文字。不要完全信任模型官方也把幻觉列为已知局限模糊界面上模型可能误判元素。断言环节建议加一次截图复核确认结果后再下结论。写在最后 资源导航一句话总结UI-TARS 把 Android 自动化测试里定位元素、维护脚本的部分换成了视觉理解让零代码测试变成一条可复现的路线。三步搭好环境一段自然语言描述就能跑完完整流程足够你先把手上的回归用例迁移过来。想继续深入资料都在仓库里项目总览与快速开始README.md模型部署指南README_deploy.md坐标处理教程README_coordinates.md核心源码提示词模板与动作解析器codes/ui_tars/测试消息示例数据data/test_messages.json需要完整源码时git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考