01 / 我把任务拆成四层

在个人实验中,我把一个任务拆成目标层、计划层、执行层和验证层。模型可以在四层之间往返,但每一次往返都需要留下可读的状态。

  • 目标:最终要交付什么。
  • 计划:下一步为什么这样做。
  • 执行:实际调用了哪些工具。
  • 验证:结果是否足够支撑下一步。

02 / 失败必须成为一等公民

如果系统只展示“成功完成”,用户很难理解它什么时候可靠。一次失败的工具调用、一次被拒绝的权限、一次空结果检索,都是工作流的重要组成部分。

好的 Agent 不是永远不犯错,而是能让错误可见、可恢复、可复盘。

03 / 下一步实验

接下来会尝试让系统在执行前先生成任务契约,在执行后输出证据清单。这样评估重点就从“像不像人在工作”转向“能不能让人放心接手”。

FIELD TEST
本页为个人实验记录,示例流程不代表生产系统建议。