Agent 系统很容易被抽象成“模型会调用工具”,但真正决定系统是否可靠的,往往是更靠外层的工程边界。
上下文
上下文不是越多越好。长期记忆、短期任务状态、工具返回值和用户偏好应该分层管理,否则模型会在噪声里丢失当前目标。
规划
规划需要有可检查的中间状态。一个可维护的 Agent 不应该只输出最终答案,而应该能说明当前任务处在哪一步、下一步需要什么输入、失败后如何回退。
工具
工具调用要有明确契约:输入 schema、输出结构、错误类型和重试策略。工具越多,越需要把权限、速率限制和副作用隔离清楚。
评估
评估不只是看一次回复是否“像是对的”。更实用的方式是记录任务闭环率、工具失败率、人工接管点和回归样例。