ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

139、LangSmith评估与监控实战

139、LangSmith评估与监控实战 139、LangSmith评估与监控实战昨天凌晨两点,客服机器人突然开始胡言乱语。我们没发过代码,没动过Prompt模板,唯一变化的是后端模型供应商悄悄把GPT-4换成了GPT-4-Turbo,这事他们不主动公告。用户投诉截图里,机器人把“退款”理解成了“退货”,还自作主张给用户发了个优惠券。我第一反应是查日志,但传统日志里只有HTTP状态码和延迟,根本看不出模型内部发生了什么。直到把聊天记录扔进LangSmith,才发现问题链:某个Tool节点的输入居然是上一轮的残缺token,LLM在中间层就把意图分类错了。那篇文章就是来聊LangSmith怎么在真实项目里帮你把这种脏水捞干净。先别急着写评估,把追踪打开LangSmith最值钱的东西不是你写的那几行评测函数,而是它默认给你埋好的追踪(Trace)。每个Chain/Agent的调用都会自动记录输入输出、Token消耗、延迟、模型ID,甚至包括工具调用的每一步参数。你不需要额外插桩,只要在初始化LangChain时设置好环境变量:importosfromlangsmithimportClient os.environ[
返回列表