01 / 我把任务拆成四层
在个人实验中,我把一个任务拆成目标层、计划层、执行层和验证层。模型可以在四层之间往返,但每一次往返都需要留下可读的状态。
- 目标:最终要交付什么。
- 计划:下一步为什么这样做。
- 执行:实际调用了哪些工具。
- 验证:结果是否足够支撑下一步。
02 / 失败必须成为一等公民
如果系统只展示“成功完成”,用户很难理解它什么时候可靠。一次失败的工具调用、一次被拒绝的权限、一次空结果检索,都是工作流的重要组成部分。
好的 Agent 不是永远不犯错,而是能让错误可见、可恢复、可复盘。
03 / 下一步实验
接下来会尝试让系统在执行前先生成任务契约,在执行后输出证据清单。这样评估重点就从“像不像人在工作”转向“能不能让人放心接手”。
FIELD TEST
本页为个人实验记录,示例流程不代表生产系统建议。
本页为个人实验记录,示例流程不代表生产系统建议。