模型能力逼近饱和后,Context Management成了AI创业最后的高地
当前沿模型开始独立发现新数学定理,很多人以为“智能”本身已经不再是瓶颈。真正卡住企业落地的,往往不是模型不够强,而是上下文(context)根本管不住。
我起初也觉得,只要把Claude、GPT接进Slack、Notion、代码仓库,Agent就能自己干活。深入看完过去半年从个人知识库到企业级“公司大脑”的落地案例后,才发现:真正决定Agent能否长期进化、团队能否规模化使用的,不是模型参数,而是那一层持续积累、可协作、可版本控制的Context层。
这正是当前AI创业里,少有几条还没被完全卷烂的赛道之一。无论你叫它context graph、company brain,还是LLM wiki,本质都是同一件事——为明天的Agent工作力,提前存好数据和上下文。
从生态视角看,Context Management几乎踩中了高增长创业或内部创新团队的所有关键点。
Jevons悖论正在加速。代码和写作的成本(时间、摩擦、人力)大幅下降后,文本数据量会爆炸式增长。Slack、Notion、GitHub这些工具,本来就不是为海量Agent生成内容设计的。我们现在还只站在曲线的早期,Agent渗透率一旦提升,现有工具会迅速显得吃力。
自改进的愿景更诱人。想象一个几乎不需要人类干预、Agent自己越用越好的系统——捕获并管理上下文,是实现这个闭环的关键一环。对高管来说,这个叙事也很好卖:现在不建自己的Context层,等对手建好了,你可能永远追不上。
数据主权是顺风。企业和政府越来越担心前沿实验室拿内部数据做训练。找一个可信的外部方来存管数据,会变得越来越重要。
Context本身就是护城河。上一代SaaS靠高切换成本建立垄断,公司级Context管理几乎具备同样的属性——一旦嵌入日常工作流,就很难拔掉。对某些商业模式(比如法律AI),服务客户的过程本身就能积累专属Context,形成反向信息悖论。
模型能力饱和则是技术侧的推手。越来越多人相信:只要给对Context,模型几乎能做任何事。当智能本身不再稀缺,瓶颈就变成了Context。这条赛道也相对不在大实验室的核心射程内,至少短期内不会被它们一锅端。
所有道路都通向罗马。
有意思的是,哪怕起点完全不同,最终产品形态却越来越像。一方面是Agent把产品形态压扁了——写代码的Agent和写营销文案的Agent,底层差别没有想象中大。另一方面,赛道还早,大家都在抢先定义一个还模糊的领域。
可以粗略分成几条路径:
- 个人知识库:GitHub仓库、Gbrain、Claude Code + Obsidian。本质是一堆Markdown,当技能和记忆用。个人实验很爽,一旦扩展到团队就崩。
- Agent记忆层:Letta、Honcho、Engram。按时间纵向扩展,偏研究向,目标是超长时程Agent。内部还分裂成token空间派和weight空间派。
- 可观测工具:Braintrust、Raindrop。抓生产Agent的trace,输出主要是dashboard和eval,不是给未来Agent用的持续数据仓。
- Agent开发工具:Entire、Mintlify。给内部Coding Agent用,产出文档,减少幻觉、拉长运行时间。
- 数据护城河建设者:Applied Compute、Prime Intellect。卖企业定制模型和Context层,半研究半咨询半算力,想端到端吃下客户关系。
- 老玩家转型:Notion、ClickUp、Airbyte、Glean、PromptQL。从相邻领域杀进来分一杯羹。
- AI员工方向:Viktor、Lindy。从个人用户切入,靠PLG积累组织级Context。Claude的某些功能被批评像特洛伊木马,小公司阻力反而小一点。
- 垂直原生服务公司:太多了。做端到端工作流的同时,自然积累Context,用垂直深度对抗水平玩家。
- 原生Company Brain:Stash(披露:我们自己)、Sentra、Hyperspell、Supermemory。从第一天就直奔组织级Context问题,赌专注能赢过侧向切入的玩家。
再加上前沿实验室的FDE和产品团队、Pinecone往上扩、Exa从网页搜索转企业搜索、各种编排和集成工具……几乎所有人都能横向杀进来。一个开放问题是:模型再聪明一点,是不是光做集成就够了?
尽管营销话术越来越像,但不同玩家其实在服务不同客户、不同用例、不同技术栈位置。Context Management是未来用Agent的人迟早要解决的问题。如果热度属实,“任何人”很快会变成“所有人”。温度降下来后,这个词会从buzzword变成一门正经生意,也会出现分层——卖给4人设计工作室的产品和卖给十亿级科技公司的产品,本质却可以长得很像。
几条已经清晰的模式也在浮现。
多人协作与版本控制必须有。单人Agent已经需要版本控制(不是每一次几千行PR都想要),多人场景下更关键——团队成员和Agent要能协作、fork、回滚。
技能要能累积。一次Agent消耗的token,不该只服务当前任务,还应该让整个组织受益。Context层变成“推理缓存”,让后续Agent越跑越好,自动化的工作流也会越来越多。
检索必须是混合的。向量、知识图谱、Agentic搜索再加关键词,没有单一银弹。
做梦与睡眠计算要分离。干活的Agent(Claude Code会话、工作流Agent)和守护知识库的Agent要分开。后者负责索引、去重、更新——像夜间值班的图书管理员,白天大家只管用。
外部连接要尽可能多。从Granola、邮件、日历、Slack、CRM全拉进来,当作只读的原始数据源,继承它们原有的权限范围,权限和隔离会简单很多。
这些实现很快就会过时。我们前几周办过一场Company Brain与记忆的活动,大多数人认为当前范式撑不了太久。
真正缺的东西还很多。
结构化与非结构化数据怎么统一?该用数据库表还是文件系统?Slack这种非结构化流怎么处理?有些记忆如果进了权重而非纯文本,权限模型、形状、更新频率全都不一样。人可以无缝切换上下文,Agent需要更明确的引导。
数据接入必须无处不在。Company Brain只有信息密度过了临界点才有用,否则直接去源系统更快。这意味着要从PDF到数据库表全格式接入,对接组织里所有工具。销售周期因此被安全审查和重度集成工作拉得很长。
访问控制要精细。谁能看到什么、谁绝对不能看到,架构不同取舍就不同。要不要给每个Agent单独开用户?团队间共享还是私有?怎么防泄漏?
评估体系几乎空白。Company Brain真的让团队更高效,还是只是极客的自嗨?什么指标能证明一个实现比另一个好?记忆本身是长时程问题,评估会越来越贵、越来越难。
长期稳定性。本质上是持续学习问题。加一个新技能或数据源,会不会稀释已有能力?知识库会不会随着时间“变烂”(context rot)?今天的LLM里这还是真问题。
爆炸半径(我们内部叫法)。检索到的信息要被时间、上下文、优先级严格约束。纯检索已经不够,还得让系统具备常识:哪些信息更重要。
最关键的是杀手级用例。尽管Context Graph和Company Brain喊得很响,清晰的商业案例和ROI还在摸索。几个目前还算站得住的方向是:跨源检索(Glean最早验证过)、工作流自动化、token成本和延迟下降60-90%、让Agent完成原本做不到的任务。
这些正是我们现在天天在解的题。
如果把公司比作一座不断扩建的图书馆,模型是最聪明的读者,Context层就是那个既要分类、又要去重、还要在夜里悄悄整理书架的系统。没有它,再聪明的读者也会在堆积如山的新书里迷路。
另一个更贴近日常的画面:Context管理像城市的地下管网。地上的高楼(各种Agent应用)可以建得很快,但真正决定这座城能撑多久、能长多大的,是看不见的管网是否够稳、够智能、够能扩展。
现在这个赛道还早,机会也足够大。不同起点的玩家最终可能都会走到同一条路上,但真正能活下来的,一定是那些把Context当成长期资产、而不是一次性功能去建的人。
你现在负责的团队,是把Context当成临时缓存,还是当成会随时间自我增值的核心资产?这个问题值得认真想一想。
我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。
