ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

交互:观察与动作空间的扩展

交互:观察与动作空间的扩展 上下文工程、工具、Coding Agent与通用Agent、用户记忆与知识库是观察与动作空间的内容本文主要是观察与动作空间模态和触发时机的扩展。工具有感知、执行、协作、事件处理、用户沟通五类。本文主要梳理后两类工具。1. 以事件驱动异步Agent处理任务的架构为啥要异步处理任务很多任务执行时间很长不能一直阻塞用户所以一定要异步处理(你去点餐不用站在那一直等餐后了会有屏幕语音叫你。顺便说下阻塞:你在等着被叫期间啥也不能干非阻塞你能刷短视频)。2. Agent评估体系的两个维度LLM模型本身和Harness体系四个步骤什么算作成功任务从哪来由谁验证如何把分数转化成决策3. 模型后训练Pre Raining 模型预训练提供基础。Mid Raining 继续模型预训练/中期训练在模型分布上补充知识和基础能力。SFT(Super Fine-Tuning)监督微调给出标准答案让模型学习大量案例和标准答案对比。RL(Reinforcement Learning) 强化学习不给标准答案通过打分系统评估(作对加分做错减分)。四种模式一个直观的类比预训练“通读图书馆所有知识”继续训练“针对数学这一学科做深入研究”监督学习”老师给标准答案给出回答范式和流程“深度学习下场答题根据得分反复打磨。
返回列表