ReAct 是什么?说说它的原理
大约 2 分钟ReAct推理Agent
ReAct 是什么?说说它的原理
这道题考的是 ReAct 推理框架的核心原理,本质是"大模型如何把思考和行动结合起来"这个问题。面试官想看你能不能说清楚:为什么需要 ReAct?它比 CoT 好在哪?它是怎么工作的?
我分四个部分来讲:先说 CoT 的局限性,再说 ReAct 的原理,接着说为什么它有效,最后说现代 LLM 对它的进化。
先有 CoT 推理,才有 ReAct 行动
在说 ReAct 之前,得先说它的前身——CoT(Chain of Thought)思维链。
CoT 干的事情很简单:让大模型在回答问题的时候,把推理步骤一步一步写出来。比如问"小明有5个苹果,给了小红2个,还剩几个?",CoT 会让模型输出"5 - 2 = 3,所以还剩3个"。
这比直接蹦答案强多了。模型能把中间过程暴露出来,推理更稳,答案更准。
但 CoT 有个根本问题:它只让模型"想",不让模型"做"。
模型在脑子里推理了半天,最后还是只能给你一段文字。它没法去查天气、没法算数学、没法查数据库,所有"需要动手干的事",它都干不了。
这就好比一个学霸,解题步骤写得漂漂亮亮,但最后算结果的时候,只能靠猜。
ReAct 就是来解决这个问题的——它让模型不仅能想,还得能行动。
阅读全文
ReAct 的工作原理——推理链中插入行动
ReAct = Reasoning + Acting,翻译过来就是"推理 + 行动"。
它的核心思想是:在模型的推理链里,插入"行动"这个环节。模型推理到一半,可以调用外部工具,完成后再把结果接回来继续推理。
怎么实现的?
通过 prompt 格式约束。
给大模型一套固定的"剧本格式",让它按这个格式输出。这套格式长这样:
Thought: 我现在要做什么
Action: 我要调用什么工具
