跳到主要内容
👋 哈喽!我是 小奏 , 欢迎关注我的公众号【小奏技术

agent 入门

agent 是什么

Agent 是一个能够“感知环境、思考决策、调用工具、执行动作、根据结果继续行动”的程序

和普通聊天机器人不同,普通聊天机器人通常是:

用户输入 -> 模型回答

Agent则是

目标 -> 思考 -> 行动 -> 观察结果 -> 再思考 -> 再行动 -> 直到完成任务

举个例子。

你普通问 LLM:

帮我查一下北京明天天气,并写一封邮件提醒老板。

但 Agent 可以:

  1. 调用天气工具查北京天气
  2. 得到结果:晴,26 度
  3. 调用邮件工具发送邮件
  4. 告诉你已完成

所以,Agent 的核心不是“更会聊天”,而是:

能拆解任务、能调用工具、能根据反馈继续执行

Agent 的基本组成

一个完整 Agent 通常包括五个部分

Agent = 大模型 + 目标 + 工具 + 记忆 + 执行循环

1. 大模型:Agent 的大脑

LLM 负责:

  • 理解用户目标
  • 拆解任务
  • 决定下一步调用什么工具
  • 总结结果

常见模型:

  • OpenAI GPT

  • Anthropic Claude

  • Qwen

  • DeepSeek

  • GLM

  • Kimi

  • 本地模型,如 Llama、Qwen 等

2. 目标:Agent 要完成什么

比如

帮我调研 3 个 AI Agent 开源框架,并写成 markdown 报告

目标必须清晰,否则 Agent 会不知道什么时候停止

3. 工具:Agent 的手和脚

工具可以是:

  • 搜索网页

  • 读取文件

  • 写入文件

  • 执行 Python 代码

  • 查数据库

  • 调 API

  • 发邮件

  • 操作浏览器

  • 控制电脑

  • 调用其他模型

没有工具的 Agent 只能“想”

有工具的 Agent 才能“做”

4. 记忆:Agent 的经验

记忆分两种

短期记忆

当前任务过程中的上下文。 例如:

用户让我查天气

我已经查到了北京天气

下一步应该写邮件

长期记忆

跨任务保存的知识

例如

用户喜欢简洁回答

用户的项目使用 Python

用户公司名称是 XXX

长期记忆可以用:

文件

数据库

向量数据库

JSON

SQLite

5. 执行循环:Agent 的核心发动机

最经典的循环是:

Thought: 思考下一步 Action: 选择工具 Action Input: 给工具参数 Observation: 观察工具结果 ... Final Answer: 最终回答

这个模式叫 Reasoning + Acting

ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整。 Plan-and-Solve: 一种“三思而后行”的范式,智能体首先生成一个完整的行动计划,然后严格执行。 Reflection: 一种赋予智能体“反思”能力的范式,通过自我批判和修正来优化结果。

本文为博主原创文章,未经博主允许不得转载