返回文章列表

AI 上下文

为什么 AI 需要一个长期读得懂你的上下文

AI 不是缺少能力,而是缺少你的长期上下文。KnowMe 想解决的是让 AI 越来越懂你,而不是每次重新开始。

嘉龙|人生不完全指南·2026-05-20·6 min

为什么 AI 需要一个长期读得懂你的上下文

什么是 Agent?

Agent 直译过来中文就是代理,跟 AI 相关的 Agent 也经常被翻译成智能体。

聊天机器人本质上擅长理解文字、回答我们的问题,通常在帮我们完成一些相对简单的事,比如说改改邮件、问一些问题、聊聊天。但是,面对更复杂、需要多步骤执行、跟外界有点交互的任务时,它就有点无能为力了。很多时候任务能不能完成,还得我们自己动手。

但是我们想要的 AI 显然不止是这样,于是 Agent 的概念就很必要了。它的核心就是要让 AI 能够真正实现自主完成任务。简单来说就是当 AI 收到一个任务的时候,它不仅要自己去想应该怎么做,还得要自己真的去做。所谓 AI 代理,就是代表人类去完成具体任务的 AI。

当然,实际上 Agent 的这个概念在人工智能领域也有一些经典的定义值得参考。结合以上这些经典定义,我们可以得出一种比较全面的理解:

AI Agent 就是一种能够感知环境、独立的自己做出决策,并且能够主动地去执行行动的人工智能系统。

Agent 的四大核心能力

1. 感知能力 (Perception)

单纯的大语言模型是依靠海量的文本数据训练出来的,基础的感知方式就是接收用户输入的文本。

但是,我想把图片或者 PDF 传给它看,或者是能不能跟它语音交流呢?

中间方案:利用 OCR 这种中间工具把图片、PDF 转成文本,再输入给大模型。但人们会发现只提取其中的文字,势必是少掉了非常多的信息,比如说图片的颜色布局、声音的语气语调。
多模态初阶:于是 2023 年 GPT-4 有了 Vision 版本,开启了多模态模型的初阶状态。这个时候再输入图片,它就是可以直接理解图片上的所有信息了,颜色、图形,这个时候大模型就有了视觉感知能力
端到端多模态:再到去年,GPT 又发布了 GPT-4o,直接把图片、声音这样的多模态数据都喂给大模型,端到端的去训练。也就是说它现在已经能够理解和识别声音中语气语调和那种图片细节的信息了。

甚至后来还出现了一些能够很好识别视频时序的多模态模型。也就是这个时候,大模型的耳朵、眼睛、嘴巴都有了。

2. 规划能力 (Planning)

最早的时候,大模型回答什么问题都是张口就来,一旦遇到稍微复杂的、需要推理一下的问题(比如说小学数学),它都会错。所以研究人员就发现,它这样张口就来是不行的。我们中国也叫“无谋不成事”。

思维链 (CoT):于是就提出了一种叫做 CoT (Chain of Thought) 思维链的方法。简单讲,就是说让模型在给出最终答案之前,先主动地去拆解一下问题,比如说先第一步考虑该干什么,然后第二步再干什么,最后再把以上这些步骤综合起来得出结论。
思维树 (Tree of Thoughts):在此基础上,又有人提出了更进一步的规划方法,叫做思维树,就是说让这个大模型想好几种不同的思路,选最好的那个。但是其实这样效果也一般,因为早期的大模型它本质上就不擅长规划,它没有这么学过。
多智能体工作流 (MOTIENT):既然大模型自己想的不够好,人们就还有另一个思路:它分好几个模型,各个 AI 各司其职协作来完成任务。这个负责规划,那个负责推敲检查,这样循环一下,这个就叫 MOTIENT 多智能体工作流。不过了解 CozDify 这一类平台的朋友应该都有感受,这都治标不治本,它中间的步骤都是我们人定好的,一旦换了新任务就还得重新设计。
内化推理能力:所以,为了让大模型真正的有自主规划的能力,能处理更复杂的思考,OpenAI 去年研究并发布了 O1O 系列模型,也就是让大模型内化的学会了在每一次回答问题之前,都有一个自主的推理过程。
端到端自主规划:基于这个更强的规划能力,今年 2 月 2 号,OpenAI 出了一个尊贵的 Deep ResearchDeep Research 背后用的实际上是端到端训练过后的 O3 模型。这意味着是模型它在自主决定什么时候要去搜一下信息,什么时候应该整理一下现在的信息,什么时候又应该进入深度的搜索再分析总结。整个过程完全是它自己控制的,并不是依赖预先设计好的工作流或者是人为指定的步骤。

简单总结一下,Agent 的规划能力是一步一步演进的:最基础靠提示词提醒它一步步思考,其次是人为的去定义一些工作流,再然后发展出自主推理的这种推理模型,再去端到端的训练它。

3. 行动能力 (Action)

规划大概知道了,但它这个搜索和阅读是怎么来的呢?这就是我们马上要说到的行动。

原本的大语言模型它只能输出文字,如果说想要使用工具来做一些什么行动,是不是它也得通过文字向外界发出一点信号呢?

API 调用 (Function Calling):大模型最早跟外界沟通的最基础方式,就是通过 API 的调用了。更早的时候,研究者是通过提供了一些事例去做监督微调,让模型学会了去调用工具。也就是说让他学会,当他觉得自己感觉要调用工具的时候,它就会生成一段 API 的调用文本。
直接控制电脑/浏览器:但是 API 调用其实也有明显的局限,现实中并不是所有的东西都有 API。那怎么办呢?直接学人类用电脑吧!
统一协议与基建:人们发现每个工具都要单独去接入、开发,实在太麻烦了。于是 Anthropic 2024年11月推出了一个非常重要的协议:MCP (模型上下文协议)。简单来说,MCP 就像一个多孔 Type-C 转接头,要求所有人都按这个规格来做接口,用什么工具,直接往上插就行了。

4. 记忆能力 (Memory)

短期记忆 (上下文长度):大模型早期的上下文长度非常的短,或者说短期记忆力很差。稍微多跟它聊两句,它就翻篇了,忘记你前面说过啥了。于是业内就卷了一阵子上下文长度,也就是增加它的短期记忆长度。

长期记忆 (RAG):但是光上下文长度也不够,有的东西我们还是希望它永远不要忘记。所以还有另一个方案叫 RAG (检索增强生成)。简单的理解就是把大模型需要记住的知识,事先存到一个外部的向量数据库里,每一次你需要的时候再去里面找,有没有相关的内容。像是给大模型开了一个长期记忆的小外挂,还顺带能够减少它乱编的一些幻觉问题。

任务过程记忆Agent 要是执行任务的过程当中产生的这些东西,它也是需要被记住的。所以中途就得对前面发生的事做一定的总结存起来,自己偶尔去回顾一下之前的这些内容,这样就形成了一个记忆模块。

不过相比人类的记忆,人类还是要复杂多了,还有什么遗忘机制、注意力机制等等。所以研究人员也都在不断的尝试新方法,比如说 DeepSeek 开发的 NSA (稀疏注意力机制),也是想解决一些模型的记忆问题。

什么是Prompt?

用户提示词(User Prompt

由用户发给AI模型的背景信息、提出的问题,就和日常的对话一样。

系统提示词(System Prompt

主要是用来描述AI的角色、性格、背景信息、语气等等。只要不是用户直接说出来的内容,都可以放进 System Prompt 里面。

我们自己设计的AI结构化的提示词,比如“每日复盘助手”,已经为AI模型设定里角色、背景、任务流程等内容,也可以看作是系统提示词。

什么是MCP协议?

把 Tool 变成服务统一托管,让所有的 Agent 都来调用,这就是 MCP。

MCP (Multi-Tool Co-Protocol) 是一个通信协议,专门用来规范 Agent 和 Tool 服务之间如何交互。

运行 Tool 的服务叫做 MCP Server
调用它的 Agent 叫做 MCP Client

MCP 规定了 Server 如何和 Client 通信,以及 Server 要提供哪些接口,比如查询有哪些 Tool、Tool 的功能描述、参数格式等等。MCP Server 既可以和 Agent 跑在同一台机器上,也可以被部署在网络上,通过HTTP进行通信。

需要注意的是,虽然 MCP 是为AI定制的标准,但它本身和AI模型没有关系,它只负责帮 Agent 管理工具、资源和提示词。

全流程演示

最后,我们梳理一下整个流程:

我:(对 AI Agent / MCP Client 说)“我的肚子好疼应该怎么办?”
Agent: 将问题包装在 User Prompt 中,并通过 MCP 协议从 MCP Server 获取所有可用的 Tool 信息。
Agent: 将这些 Tool 的信息转化成 System Prompt 或 Function Calling 的格式,和用户的 User Prompt 一起打包发送给 AI模型
AI模型: 发现有一个叫做 Web Browse (网页浏览) 的工具,于是产生一个调用该工具的请求,希望去网上搜索答案。
Agent: 收到请求后,通过 MCP 协议去调用 MCP Server 里的 Web Browse 工具。
Tool: Web Browse 访问指定网站后,将内容返回给 Agent。
Agent: 将网页内容转发给 AI模型
AI模型: 根据网页内容和自己的“头脑风暴”,生成最终答案:“多喝热水”。
Agent: 把结果展示给我。

总之,这就是 System Prompt、User Prompt、AI Agent、Agent Tool、Function Calling、MCP 和AI模型之间的联系与区别了。它们不是彼此取代的关系,而是像齿轮一样,共同构成了AI自动化协作的完整体系。