
agents-cli 负载测试实战指南如何配置 load_test 模板与 Staging 环境压力测试【免费下载链接】agents-cliThe CLI and skills that turn any coding assistant into an expert at creating, evaluating, and deploying AI agents on Google Cloud.项目地址: https://gitcode.com/GitHub_Trending/ag/agents-cliAI Agent 上线前如何确认它在高并发下依然稳定响应agents-cli 是 Google 官方推出的命令行工具负责把编码助手变成创建、评估、部署 Google Cloud AI Agent 的专家。它内置了load_test 负载测试模板覆盖 Python、Go、Java、TypeScript 四种语言并支持将 Agent 部署到staging 环境做压力测试。本文将带你从零理解这些模板的设计思路并给出一套可落地的压测配置清单。为什么 AI Agent 需要负载测试与普通 API 不同AI Agent 的单次请求往往意味着一次完整的模型推理 工具调用延迟高、耗资源、还会触发上游429 限流。agents-cli 的 load_test 模板正是针对这些痛点设计的模拟真实用户每个虚拟用户独立创建会话、发起流式SSE对话输出可量化指标吞吐量req/sec、P50/P95/P99 延迟、失败率、429 限流次数✅自带验收阈值失败率超过 10% 即判定测试失败可直接接入 CI 门禁4 套语言模板总览找到你的 load_test 入口agents-cli 通过create脚手架生成的项目中按语言内置了不同的负载测试实现模板源码都在 src/google/agents/cli/scaffold/ 下语言测试框架测试入口本地一键运行PythonLocusttests/load_test/load_test.pylocust -f ... --headlessGo原生go testbuild tag 隔离load_test.gomake load-testJavaMaven FailsafeLoadTest.javamake load-testTypeScript独立脚本load_test.tsmake load-test所有模板共享同一组核心参数DURATION时长、USERS并发用户数、RAMP每秒新增用户数这让不同语言项目之间的压测结果可以直接横向对比。本地压测最快上手一条 make load-test 命令以 Go 模板为例其 Makefile 中已封装好load-test目标流程如下1. 终端 A启动本地服务go run . web --port 80002. 终端 B运行负载测试_STAGING_URLhttp://127.0.0.1:8000 go test -v -tagsload -timeout5m ./e2e/load_test/... \ -duration30s -users10 -ramp2Go 模板用 build tag-tagsload把压测代码与日常单测隔离日常go test不会误触发压测这个设计非常值得借鉴详见 load_test.go 的参数定义。Java 与 TypeScript 模板同样提供make load-test只需追加参数即可调压例如make load-test DURATION60 USERS20 RAMP5各模板的详细操作步骤可查阅项目内自带的说明文档Go 压测指南、Java 压测指南、TypeScript 压测指南。Staging 环境压力测试把测试打向远端服务本地压测通过不代表云端没问题。真正的验证要针对staging 环境如 Cloud Run 预发实例进行各模板都预留了远端模式TypeScript 模板一个环境变量切换目标STAGING_URLhttps://your-cloud-run-service.run.app make load-testGo / Java 模板URL 身份令牌export _STAGING_URLhttps://your-cloud-run-service-url.run.app export _ID_TOKEN$(gcloud auth print-identity-token -q) go test -v -tagsload -timeout5m ./e2e/load_test/... -duration30s -users60 -ramp2⚠️ 前提你的账号需要 Cloud Run 的roles/run.invoker角色才能调用服务。Python 模板先部署再用 Locust 无头模式压测Python 场景Agent Runtime / Cloud Run / GKE 部署目标的压测依赖 Locust步骤见 压测 README# 1. 先把后端部署到远端 agents-cli deploy # 2. 为 Locust 建独立虚拟环境避免污染项目依赖 python3 -m venv .locust_env source .locust_env/bin/activate pip install locust2.31.1 # 3. 执行 30 秒压测5 个并发用户、每 2 秒新增 1 个 export _AUTH_TOKEN$(gcloud auth print-access-token -q) locust -f tests/load_test/load_test.py \ --headless -t 30s -u 5 -r 2 \ --csvtests/load_test/.results/results \ --htmltests/load_test/.results/report.htmlLocust 的--csv与--html参数会产出可存档的 CSV 结果与可视化 HTML 报告方便团队复盘压测结果。此外load_test.py 会把 SSE 流中的 429 事件单独计为一类指标帮你判断是Agent 变慢了还是被限流了。让 staging 压测自动化接入 CI/CD 流水线手动压测终究是临时方案agents-cli 推荐把负载测试固化进 CI/CD。一条命令即可完成整条流水线的搭建文档CI/CD Productionagents-cli infra cicd \ --staging-project my-staging-project \ --prod-project my-prod-project搭建后的三阶段流水线CIPull Request 触发运行单元与集成测试Staging CD合并到 main 触发构建镜像 → 部署到staging 环境→自动执行负载测试Productionstaging 通过后人工审批后部署与 staging 完全相同的镜像这样staging 环境的压测结果就成了生产发布的自动门禁——失败率超 10% 的请求直接挡在审批之前。部署细节可参考 部署指南。压测结果怎么看关键指标清单各模板的输出虽格式不同但都围绕同一套核心指标以 Go 模板输出 为例指标含义健康参考值Throughput每秒完成请求数req/sec满足业务峰值即可P50 / P95 / P99延迟分位数毫秒P99 明显高于 P50 说明有长尾Success Rate成功请求占比失败率需 10%Rate Limited429 限流次数应为 0 或极少Min / Avg / Max延迟极值关注 Max 是否异常尖刺 模板内置的硬规则失败率 10% 时测试直接判定失败。如果你的业务对延迟更敏感可在此基础上把 P99 阈值也纳入 CI 断言。总结一份 5 步压测检查清单用agents-cli create生成项目确认已带load_test目录本地服务启动后先用make load-test跑通默认参数30 秒 / 10 用户调参到业务峰值的 1.5 倍如-users60 -ramp2记录 P99 与 429 次数通过agents-cli deploy/agents-cli infra cicd部署 staging用STAGING_URL/_STAGING_URL指向远端复测接入 CI/CD让 staging 压测成为生产发布门禁掌握了这套模板你的 AI Agent 就拥有了从本地到 staging、再到生产的完整压测闭环。更多命令细节可运行agents-cli --help或在 官方文档 中查阅。【免费下载链接】agents-cliThe CLI and skills that turn any coding assistant into an expert at creating, evaluating, and deploying AI agents on Google Cloud.项目地址: https://gitcode.com/GitHub_Trending/ag/agents-cli创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考