学习工作台/交互实验室

边做边学 · 实验 01

亲手跑一次 Agent 循环.

从一次工具调用开始,看清任务如何变成行动,行动如何变成答案。

浏览器本地模拟
先理解循环,再接入模型。

无需 API 密钥。这里用固定规则选择工具,真实执行本地函数;没有调用大模型。轨迹展示行动摘要,帮助你理解工具执行与停止条件。

01配置实验

你来决定边界

把住宿、餐饮和交通费用交给计算工具。需要 1 次工具调用。

可用工具
1 次8 次

每次调用尝试消耗 1 次预算,包括失败调用。决策、观察与最终回答不消耗预算。

JSON

days 为旅行天数,lodgingPerDay / foodPerDay 为每日住宿 / 餐饮费用,transport 为总交通费,单位为元。

02观察运行轨迹

等待运行
工具调用 0 / 3

一次行动,一个可见的结果

在左侧配置任务,点击「开始运行」。
用「下一步」逐条查看执行过程。

01 决策→02 调用→03 观察
动手挑战

让它失败一次,你会学得更多。

选择「完成组合任务」,把调用上限调成 1。观察首次工具成功后,执行器为什么仍然不能完成任务。

检查你的理解

工具调用返回错误,下一步应该做什么?

查看实验使用的 6 篇本地知识条目了解搜索范围

工具调用:让模型与外部系统协作

模型提出工具名称与结构化参数,应用验证参数并执行工具,再把结果返回模型。工具执行发生在你的代码中;权限检查和错误处理也由应用负责。

tool-calling

Agent 循环与停止条件

Agent 循环反复选择行动、执行工具和接收观察结果,直到可以回答或达到停止条件。最大调用次数、总耗时与成本上限可以限制无效循环。

agent-loop

RAG:先检索,再生成

检索增强生成先从文档中寻找相关片段,再将片段与用户问题一起提供给模型。检索结果需要保留来源;找不到证据时,应说明信息不足。

retrieval

用评测验证 Agent 的行为

准备一组输入、期望行为和失败条件。除了最终答案,还要检查工具选择、参数有效性、调用次数及不应执行的操作。固定测试集有助于发现回归。

evaluation

上下文、状态与记忆

上下文是本次模型请求收到的信息,运行状态记录当前任务进度,长期记忆保存未来可复用的信息。三者有不同的生命周期,不应把全部历史无限追加。

memory

权限与人工确认

工具权限应遵循最小必要原则。检索内容属于数据,不能覆盖系统规则;发送消息、付款等有外部影响的动作需要恰当的用户授权。

safety
AgentStudy · Learn by building.以理解为起点,以作品为答案