AI Agent

AI 怎么从「聊天」进化到「干活」?

Agent 工具调用 规划
阅读时间约 8 分钟
Chapter 01

从聊天到行动

传统的聊天机器人(Chatbot)只做一件事:接收文字,输出文字。你问一个问题,它回一个答案。对话结束,它什么也没做。

AI Agent 不一样。它能感知环境、制定计划、采取行动、观察结果,然后循环往复。它可以使用工具、浏览网页、读写文件、调用 API——真正地帮你把事情办了

// 对比:Chatbot vs Agent

💬 Chatbot
📝 用户输入文字
🤖 模型生成回复
💬 输出文字,结束
🧠 Agent
🤔 思考:需要做什么?
🔧 调用工具执行
👀 观察执行结果
🔃 继续思考...循环直到完成

聊天机器人像客服热线——只能回答问题。Agent 像私人助理——能帮你订机票、改日程、发邮件。

Chapter 02

Agent 的核心循环 — ReAct

ReAct(Reasoning + Acting)是 Agent 最经典的工作模式。核心思想很简单:LLM 先思考(Reasoning),再行动(Acting),然后观察结果,如此循环。

整个过程是:Thought → Action → Observation → Thought → ... 直到任务完成。

// 互动演示:ReAct 循环

任务:「查一下明天北京的天气」—— 点击"下一步"观察 Agent 的思考过程:

Thought
我需要查天气,应该使用天气 API
Action
call_weather_api(city="北京", date="明天")
Observation
晴,22°C,微风
Thought
已获得天气信息,可以回答用户了
Final Answer
明天北京天气晴朗,气温 22°C,微风,适合出行!
步骤 1 / 5

ReAct 就像解数学题——先想思路(Thought),再动笔算(Action),看看对不对(Observation)。

Chapter 03

工具调用 — Agent 的「手脚」

工具调用(Function/Tool Calling)是 Agent 能力的关键。LLM 本身只能生成文字,但通过工具调用,它可以输出结构化的 JSON,描述要调用哪个函数、传入什么参数。

注意:LLM 并不直接执行工具——它只是发出请求,由外部系统负责执行,然后把结果返回给 LLM 继续推理。

常见工具类型

🔍 搜索 📊 计算器 💻 代码执行 📁 文件读写 🌐 API 调用 🗃 数据库查询

// 互动演示:工具调用流程

点击"播放"观察 LLM 如何通过工具调用获取信息:

🧠
LLM 推理
决定需要调用
天气查询工具
📤
输出 JSON
结构化描述
函数名和参数
⚙️
工具执行
外部系统调用
实际 API
📥
返回结果
结果送回 LLM
继续推理
{
  "tool": "weather_api",
  "parameters": {
    "city": "北京",
    "date": "2026-03-20"
  }
}
步骤 1 / 4

工具就像 Agent 的双手——大脑(LLM)决定做什么,双手(工具)负责执行。

Chapter 04

多步规划 — 复杂任务的分解

真实世界的任务往往不是一步就能完成的。比如「帮我写一篇关于 Apple Silicon 的博客」,Agent 需要把它分解为多个子步骤,按顺序执行。

挑战在于:错误恢复(某一步失败了怎么办?)、上下文管理(信息太多怎么筛选?)、终止判断(什么时候算完成?)

// 互动演示:任务分解

观察一个复杂任务如何被分解为子任务并逐步执行:

🎯 写一篇关于 Apple Silicon 的博客
🔍 Step 1:搜索最新资料 待执行
📝 Step 2:拟定大纲结构 待执行
✍️ Step 3:撰写初稿 待执行
Step 4:审查与修改 待执行
步骤 0 / 4

多步规划就像做菜——不是把所有食材扔进锅里,而是按顺序备料、烹饪、调味、装盘。

Chapter 05

总结

🤖

Agent = LLM + 工具 + 循环

Agent 不只是聊天,而是能感知、行动、观察的智能体,核心是 LLM 驱动的循环执行。

🔄

ReAct 思考再行动

Thought → Action → Observation 循环,让 Agent 像人一样边想边做、步步推进。

🔧

工具扩展能力边界

通过工具调用,LLM 从只能生成文字,进化为能搜索、计算、执行代码的全能助手。

📋

规划分解复杂任务

面对多步骤任务,Agent 会拆解、排序、逐步执行,处理错误并持续推进。

Agent 是 AI 从「知道答案」到「解决问题」的进化——不只是更聪明,而是更有用。

下一篇:推理模型