任务输入
只处理三个虚构文本,创建带来源的 summary.md。
观察:目标、输入、限制和验收标准进入当前上下文。
模型、上下文、工具、Agent 循环和权限确认分别负责什么?
这是课程的第四篇。你不会修改配置,而是用上一篇的文件任务拆开 Hermes 的工作过程。看完后,你应该能解释它为什么会先读文件、再写结果,以及为什么“已经批准”仍不等于“结果一定正确”。
上一篇交给 Hermes 的任务包含输入、限制和交付物,过程可以压缩成一行:
读取三个指定文件 → 整理事实 → 创建 summary.md → 检查结果如果只靠模型生成文字,它看不到你电脑里的文件,也无法真的创建 summary.md。Hermes 能完成这件事,是因为模型之外还有上下文、工具和执行循环。
模型会根据每一步返回的结果决定接下来做什么。任务完成、需要你决定或触及限制时,循环停止。
Desktop、CLI 和消息平台都是入口。入口影响操作方式、可见信息和默认工具边界,但不会把模型本身变成另一个产品。
上一篇从练习目录启动 Hermes,是为了让“当前目录”成为清楚的任务环境。如果入口没有指向正确目录,再好的提示词也可能读错位置。
上下文是模型这一次判断实际拿到的信息,通常包括:
上一篇中,三个文件的内容不是自动永久进入模型。Hermes 先调用文件工具读取内容,再把读取结果带回当前执行过程。
因此会出现两种常见情况:
因此,关键限制应写在任务里,而不是期待 Agent 从很早以前的对话中猜出来。
模型更像大脑。它可以理解目标、比较信息、形成计划,并决定下一步需要什么工具。
在文件任务中,模型可能判断:
summary.md;模型也可能判断错。它可能漏掉限制、误解原文,或者把“建议”写成已经发生的事实。模型负责提出动作,不代表动作天然正确。
工具负责接触模型外部的世界,例如:
工具有两个重要边界。没有对应工具,模型就无法完成相应的真实操作。它可以解释怎样创建文件,但没有文件工具时,不能声称文件已经存在。
工具返回的也是观察结果,不会自动成为最终结论。“命令退出码为 0”只能说明命令正常结束,不一定说明业务结果正确;“文件存在”也不代表内容准确。
普通问答常常是一次输入、一次输出。Agent 任务需要多轮内部循环:
上图中的“模型判断—执行与观察”会重复发生,直到任务完成、需要人工决定,或触及限制。
上一篇在写完以后重新读取 summary.md,再对照任务要求。这个复查动作才让文件写入变成可验收的结果。
但循环越长,不代表质量越高。目标模糊时,Agent 可能做很多无关动作。限制工具范围、写清验收标准,通常比要求它“多思考几轮”更有效。
权限确认只回答一个问题:这个动作是否在当前授权范围内?
例如,任务只允许新建 summary.md:
| 动作 | 是否符合边界 | 原因 |
|---|---|---|
| 读取三个指定输入 | 是 | 完成任务所需 |
新建 summary.md | 是 | 明确交付物 |
修改 event-notes.txt | 否 | 原文件禁止修改 |
| 搜索整个主目录 | 否 | 超出当前目录 |
| 联网补充活动背景 | 否 | 任务明确不联网 |
即使你批准创建 summary.md,文件里仍可能有事实错误。批准动作和验收结果是两道不同的门。
权限提示无法提供完整沙箱。Hermes 的本地工具通常在运行 Hermes 的系统用户权限内工作。审批能降低误操作,还需要目录隔离、最小权限、备份和人工检查配合。
file、terminal 或 web。可以用下面的命令查看当前工具状态:
hermes tools list本篇不要求修改工具配置。新人阶段的原则是:任务不需要的能力,不必为了“以后可能会用”全部打开。
常见原因有四类:
“帮我整理一下”没有说明输入、输出和完成标准。模型只能自行猜测。
模型计划创建文件,但工具可能因路径、权限或依赖失败。必须读取真实工具结果。
文件成功写入,但 Agent 没有重新读取,也没有检查是否漏掉章节。
只检查“文件存在”,没有检查事实和来源。形式通过,内容仍可能错误。
Hermes 说:“我已经把报告保存到 report.md。”但没有显示任何写文件工具结果。
判断: 不能确认完成。先检查文件是否真实存在。
终端命令返回退出码 0,但生成的网页打开后是空白页。
判断: 命令执行成功,业务验收失败。需要检查构建产物和页面,而不是只看退出码。
你只让 Hermes 查看日志,它请求修改生产配置以“顺手解决问题”。
判断: 超出授权。拒绝修改,要求先交付只读诊断结果。
Hermes 请求读取练习目录内的三个指定文件。
判断: 与任务直接相关,可以批准,但仍需检查最终整理是否准确。
互动实验室
这条轨迹完全由课程内置的虚构事件组成。按时间顺序播放,区分模型判断、工具动作、观察结果和人工决定。
只处理三个虚构文本,创建带来源的 summary.md。
观察:目标、输入、限制和验收标准进入当前上下文。
本篇不调用工具,也不修改系统。练习只要求你判断动作和结果的关系。
需要长期保留的原则:
下一篇会把这些判断变成一套安全方法:怎样评估动作风险,怎样处理凭据,哪些操作可以批准,哪些操作必须停下来确认。
课末检查
文件工具执行;模型负责决定需要读取并提供调用参数。
它会在行动后观察结果,再判断下一步,直到完成、遇到限制或需要人的决定。
它帮助人决定某个动作是否允许发生,但不是完整沙箱,也不证明结果正确。
快速回顾