
Agent TARS 快速上手指南从零完成浏览器研究型任务【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopAgent TARS 是一个开源多模态智能体通过视觉方式解读网页并打通命令行与文件系统来完成复杂的浏览器与研究型任务。本文围绕仓库内官方文档 multimodal/websites/main/src/docs/source/docs/guide/quick-start.md 展开系统讲解运行环境准备、模型提供商与搜索服务配置、首个任务完整执行流程、人在回路干预以及任务线程的分享机制。阅读完本文你将能独立完成一次“从提问到研究报告产出”的 Agent TARS 端到端实战并掌握各项配置的验证与排错手段。需要说明本文介绍的桌面应用App交互流程对应 Agent TARS 的技术预览阶段文档根据仓库根 README.md 的说明Agent TARS 目前主要以 CLI 与 Web UI 的形式交付本文聚焦的核心玩法——模型配置、搜索配置、任务执行与线程分享——在整体产品演进中保持一致。Agent TARS 在项目中的定位仓库根 README 将整个仓库定义为TARSMultimodal AI Agent Stack同时承载两个项目Agent TARS与UI-TARS Desktop。二者容易混淆仓库内的官方博客 Understanding the Difference Between UI TARS Desktop and Agent TARS App 做了明确区分Agent TARS通用型多模态 AI Agent以“视觉理解网页 搜索 浏览器操作 文件系统/命令行”为核心主打浏览器任务与深度研究类任务UI-TARS Desktop基于 UI-TARS 模型的桌面 GUI 智能体专注于系统级桌面 GUI 自动化。本文关联的快速开始文档描述的正是 Agent TARS 的工作方式规划Planning→ 执行Execution→ 搜索/浏览 → 汇总产出。整条链路的能力已被沉淀进仓库的multimodal/agent-tars目录核心实现见 core/src其环境按aio、base、local分层组织入口为 environments/index.ts。下面以一个贯穿全文的示例指令作为实战目标Tell me the top 5 most popular projects on ProductHunt today, analyze them in depth, and output a report to me.运行环境准备根据官方快速开始文档启动前的环境要求如下项目要求操作系统macOS技术预览阶段官方主要针对 Mac 开发必要软件安装 Chrome 浏览器应用获取从项目的 Releases 页面下载 Agent TARS 桌面安装包⚠️平台限制提醒文档原文提示Agent TARS 仍处于technical preview阶段开发者主要精力在 Mac 上Windows 侧的不稳定问题排查难度大因此当前阶段官方不提供 Windows 支持。如需关注 Windows 支持进度可订阅对应的 GitHub Issue 跟踪更新。首次打开应用后需要先点击左下角入口按钮打开 Settings设置页完成模型与搜索两项必要配置之后才能正常发起任务。配置模型提供商在设置页中完成模型提供商Model Provider与 API Key 的配置即可启用 Agent 的大脑。基础模型配置要点Model Provider选择模型提供商例如 AnthropicClaude、OpenAI、DeepSeek 等API Key填入对应提供商的有效密钥Azure OpenAI 扩展参数若使用 Azure OpenAI还可进一步配置apiVersionAPI 版本、deploymentName部署名称与endpoint端点地址。 若后续模型调用出现异常官方文档指引前往 故障排查指南 检查配置是否正确。仓库内另有独立的 模型配置文档 model.md可用于更细致的模型参数查阅。各模型提供商的实测对比预览阶段官方快速开始文档指出Agent TARS 尚处alpha阶段Claude 3.x 是当时综合表现最好的模型但仍非最优官方计划在beta阶段提供更完善的模型支持。下表为文档给出的、基于当时已知模型提供商的初步对比模型提供商Planning规划Executing执行Stability稳定性Claude 3.7 SonnetMediumMediumMediumClaude 3.5 SonnetMediumMediumMediumGPT-4oMedium⚠️ Low❓UnknownDeepSeekMedium⚠️ Low❓UnknownOthers❓Unknown❓Unknown❓Unknown⚠️文档免责声明上表结论仅基于当前阶段的项目测试结果与 GitHub Issues 汇总未来应替换为官方 Benchmark 数据。为反映这一不确定性设置页中已对相应模型附加提示文案。GPT-4o、DeepSeek等其他模型目前处于实验状态Agent TARS 不保证其效果请谨慎使用。一键测试模型提供商官方文档说明自v0.0.1-alpha.8版本起设置页提供Test Model Provider测试模型提供商按钮用于快速校验当前模型配置是否可用。常见的测试失败场景如下错误类型说明Invalid API KeyAPI Key 无效请核对并重新填写Not support tools当前模型不支持工具调用不满足 Agent 执行要求Not respond tool_calls模型未能正确响应tool_calls说明其工具调用能力不可靠当出现以上任一错误时说明该模型/密钥组合尚不适合驱动 Agent TARS需要更换配置。更详细的排错手段如用 curl 直接验证 Anthropic / OpenAI API Key可在 trouble-shooting.md 中找到。配置搜索服务研究型任务高度依赖搜索能力。在设置页中可以独立配置搜索提供商并拥有与模型类似的一键自检能力。各搜索服务对比搜索提供商是否需要 API Key速度Local Browser Search默认否慢Tavily是快Bing Search是快SearXNG Search否❓UnknownDuckduckgo Search否⚠️ 不稳定从当前仓库源码看这些搜索服务已被实现进 Agent TARS 核心代码本地环境的搜索工具位于 multimodal/agent-tars/core/src/environments/local/search/search-tool.ts其中即可检索到tavily、searxng、duckduckgo、bing等搜索提供商的实现痕迹说明文档中列出的能力并不仅停留在界面层而是有真实底层工具支撑。仓库内另有 搜索文档 search.md 可继续深入。测试搜索服务设置页提供Test Search Service测试搜索服务按钮点击即可校验当前搜索配置是否生效。若搜索异常可参考 故障排查文档 中的搜索验证章节——官方提供了针对 Tavily 与 DuckDuckGo 的 curl 命令行校验方式DuckDuckGo 作为免费服务官方特别提示其偶尔不稳定属正常现象。启动你的第一个任务完成模型与搜索配置后即可开始实战在输入框中输入问题并按下回车发送。以下沿用开篇的示例指令Tell me the top 5 most popular projects on ProductHunt today, analyze them in depth, and output a report to me.任务执行全流程拆解对照官方文档你会看到 Agent TARS 依次完成以下动作先规划后执行Agent 首先完成任务规划Planning随后触发一次搜索通过 MCP 拉起浏览器Agent 通过MCPModel Context Protocol连接到下方的browser use浏览器使用服务自动打开 “Product Hunt” 站点MCP 的接入方式与配置说明见仓库内 MCP 配置指南 mcp.md按规划浏览细节依据既定规划Agent 继续逐个浏览这 5 个热门产品的详情页面从页面中视觉提取并汇总信息等待并产出报告经过数分钟或更久的等待、信息综合与文件写入后Agent TARS 为你生成一份研究分析报告。整套流程验证了 Agent TARS 的设计取向它并非简单“调用一次模型”而是通过 agent 工作流编排workflow orchestration将规划、搜索、浏览、链接探索、信息综合串成一条可观测的任务链并通过事件流Event Stream实时反馈到界面上。关于该能力的进一步说明可见仓库内博客 Announcing Agent TARS App (Preview)。Human In the Loop任务执行中实时干预Agent TARS 支持Human In the Loop人在回路机制你可以在 Agent 工作过程中通过顶部专门的输入框插入你的想法并回车发送从而中途调整当前任务的执行方向——例如“不要继续深挖第 3 个产品先聚焦第 1 个”这类即时指示。这一机制使 Agent TARS 的任务执行具备可交互性当自动规划与你的真实意图出现偏差时无需中止重来即可像“同屏协作”一样介入调整。分享你的任务线程Agent TARS 提供任务线程分享能力点击顶部菜单中的分享Share按钮即可将整条任务线程含过程与结果打包分享给他人。分享有两种模式Local Html本地 HTMLAgent TARS 将整条线程打包成一个 HTML 文件可直接分享该文件Remote Server Url远端 URLAgent TARS 将 HTML 产物上传到远端服务器生成可分享的 URL。本地分享点击分享按钮打开分享弹窗选择Local Html按钮应用会为你生成一个包含完整任务过程的 HTML bundle拿到这个文件即可与任何人分享。远端分享远端模式需要在分享弹窗中先配置Remote Server Url远端服务器地址。随后 Agent TARS 会向该服务器发起一次上传请求请求规格文档原文如下Method:POSTBody:file: 需要上传的 html bundle 文件类型multipart/form-dataResponse:data:{ url: string }服务器返回一个包含url字段的对象该url即为可对外分享的线程地址。完成分享流程后打开得到的 bundle/URL 即可预览并回放整条任务过程——从规划、搜索、浏览器操作到最终报告完整再现 Agent 的工作轨迹。后续排错路径快速开始只是第一步实际运行中可能遇到模型 403/401、TypeError: Invalid URL端点配置错误、余额不足DeepSeek 402等常见问题。官方为此提供了一套基于日志的自助排错流程详见仓库内文档 trouble-shooting.md其核心思路包括通过应用左上角菜单Help View Logs打开主进程完整日志并过滤[Error]快速定位运行期异常用官方提供的 curl 命令分别验证 Anthropic / OpenAI / Tavily / DuckDuckGo 的密钥与连通性依据错误关键字如 401 Incorrect API key、403 Request not allowed、Invalid URL、400 invalid model、402 Insufficient Balance对照解决方案逐项排查。从仓库源码结构看日志化的排错体系也与 Agent TARS 的分层环境设计见 multimodal/agent-tars/core/src/environments相辅相成——不同执行环境aio、local、base分别承担不同运行形态的抽象便于在统一 core 之上扩展桌面、CLI 与 Web UI 等前端。小结本文围绕官方快速开始文档走通了 Agent TARS 的完整上手路径准备 macOS 环境与 Chrome → 配置模型提供商并一键自检 → 配置搜索服务并验证 → 发起首个“研究型”任务 → 在任务中随时人工干预 → 将线程以本地 HTML 或远端 URL 分享。掌握这些步骤后你就可以用同一套方法把 Agent TARS 运用到更复杂的浏览器自动化、深度资料调研与多步骤任务中并借助文档化的日志排查手段稳定运行。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考