AI 怎么从「聊天」进化到「干活」?
阅读时间约 8 分钟传统的聊天机器人(Chatbot)只做一件事:接收文字,输出文字。你问一个问题,它回一个答案。对话结束,它什么也没做。
而 AI Agent 不一样。它能感知环境、制定计划、采取行动、观察结果,然后循环往复。它可以使用工具、浏览网页、读写文件、调用 API——真正地帮你把事情办了。
聊天机器人像客服热线——只能回答问题。Agent 像私人助理——能帮你订机票、改日程、发邮件。
ReAct(Reasoning + Acting)是 Agent 最经典的工作模式。核心思想很简单:LLM 先思考(Reasoning),再行动(Acting),然后观察结果,如此循环。
整个过程是:Thought → Action → Observation → Thought → ... 直到任务完成。
任务:「查一下明天北京的天气」—— 点击"下一步"观察 Agent 的思考过程:
call_weather_api(city="北京", date="明天")ReAct 就像解数学题——先想思路(Thought),再动笔算(Action),看看对不对(Observation)。
工具调用(Function/Tool Calling)是 Agent 能力的关键。LLM 本身只能生成文字,但通过工具调用,它可以输出结构化的 JSON,描述要调用哪个函数、传入什么参数。
注意:LLM 并不直接执行工具——它只是发出请求,由外部系统负责执行,然后把结果返回给 LLM 继续推理。
点击"播放"观察 LLM 如何通过工具调用获取信息:
工具就像 Agent 的双手——大脑(LLM)决定做什么,双手(工具)负责执行。
真实世界的任务往往不是一步就能完成的。比如「帮我写一篇关于 Apple Silicon 的博客」,Agent 需要把它分解为多个子步骤,按顺序执行。
挑战在于:错误恢复(某一步失败了怎么办?)、上下文管理(信息太多怎么筛选?)、终止判断(什么时候算完成?)
观察一个复杂任务如何被分解为子任务并逐步执行:
多步规划就像做菜——不是把所有食材扔进锅里,而是按顺序备料、烹饪、调味、装盘。
Agent 不只是聊天,而是能感知、行动、观察的智能体,核心是 LLM 驱动的循环执行。
Thought → Action → Observation 循环,让 Agent 像人一样边想边做、步步推进。
通过工具调用,LLM 从只能生成文字,进化为能搜索、计算、执行代码的全能助手。
面对多步骤任务,Agent 会拆解、排序、逐步执行,处理错误并持续推进。
Agent 是 AI 从「知道答案」到「解决问题」的进化——不只是更聪明,而是更有用。