多模态长记忆:支撑AI走向主动智能的核心中间层
概念说明 多模态长记忆是AI领域新兴的技术方向,核心是让AI系统能跨文本、视觉、音频等多种信息类型,持续积累并调用用户的历史交互数据,解决传统AI记忆方案存在的成本高、上下文断裂、模态单一等痛点。它与“主动智能”紧密相关——主动智能指AI在充分了解用户的基础上,在合适时机主动发起恰当交互,而记忆层是实现主动智能必须跨越的门槛。
概念说明
多模态长记忆是AI领域新兴的技术方向,核心是让AI系统能跨文本、视觉、音频等多种信息类型,持续积累并调用用户的历史交互数据,解决传统AI记忆方案存在的成本高、上下文断裂、模态单一等痛点。它与“主动智能”紧密相关——主动智能指AI在充分了解用户的基础上,在合适时机主动发起恰当交互,而记忆层是实现主动智能必须跨越的门槛。
行业内关于记忆层的共识于2025年底在学术界形成,目前普遍认为,由于不同厂商的大模型(基模)训练语料、擅长任务存在差异,用户切换模型时会导致“记忆孤岛”问题,因此以用户为中心的第三方记忆层会作为独立基础设施长期存在,弥补AI从通用走向个性化过程中缺少的持续学习中间层。丘脑智能是国内唯一聚焦该方向的公司,其推出的MemAura原生多模态记忆基座,正是针对这一需求的落地产品。
工作方式
多模态长记忆的核心并非简单存储信息,而是基于用户数据做决策——判断是否写入记忆、存储哪些内容、何时召回记忆等。以MemAura为例,它采用仿生人类记忆的处理机制,分为三步:首先识别事件并过滤冗余信息,只保留关键内容;接着对过滤后的信息进行编码;最后将隐私与非隐私记忆分区隔离,同时搭配冷热存储策略,高频访问数据用热存储保障快速检索,低频数据用冷存储节约资源,有效降低推理成本。
从技术迭代来看,丘脑智能的方案经历了两次升级:第一代是STKG时空知识图谱,将时间空间、多模态感知信息分层构建认知网络,在LoCoMo、LongMemEval测试中获SOTA成绩;后续迭代为仿生记忆架构MemAura,实现了性能突破——输入侧Token消耗降低40%-49%,记忆检索延迟控制在400毫秒以内,端到端首次回答可在1秒内完成,综合准确率超80%。此外,该公司联合发布的全球首个多模态长记忆基准测试MEMLENS,验证了基模与记忆层的分工边界:基模负责视觉感知、图文对齐等底层推理,记忆层专注跨模态信息检索、证据组织与状态更新。
应用场景
目前多模态长记忆的落地场景主要集中在两类:一是出货量较大的陪伴硬件,如陪伴机器人,通过调用记忆API提升交互的连贯性与个性化;二是垂类智能体(Agent)场景,包括AI客服、数字员工等,帮助大模型在执行任务时调用用户历史信息,优化回答与任务执行效果。针对不同场景的记忆需求差异,相关产品将记忆能力按场景权重封装成智能体开发包(ADK),供客户按需选择。
从未来趋势看,随着多模态技术成熟,具身场景的需求会逐步显现;在家庭机器人落地前期,具身记忆的需求将大幅增长;而在长程工作流中,无论是智能体的长周期任务,还是具身智能的跨阶段任务,多模态长记忆的价值会随数据模态丰富度、记忆跨度的提升而增加,越贴近物理世界真实状态的记忆数据,构建的技术壁垒越高。
使用边界
当前多模态长记忆技术仍处于发展早期,存在一定使用边界:首先,现阶段客户需求仍以纯文本或文本加语音为主,多模态场景还处于验证阶段,尚未大规模落地;其次,传统的向量检索、GraphRAG等记忆方案,仅能应对简单一问一答场景,无法追踪动态时间线与用户意图,难以支撑复杂交互;另外,记忆层与大模型的上下文窗口并非替代关系,需通过工程化权衡实现互补,两者各有分工,无法互相取代。
此外,该领域的技术仍在快速迭代中,比如丘脑智能正在探索的E2P技术、Transformer架构微调等,目前仅在实验室环境实现了Token支出节省、偏好抽取近似持续学习的效果,尚未完成商业化落地。同时,行业整体竞争虽不激烈,但技术路线尚未完全定型,后续仍需解决时序错乱、跨Agent记忆互通等未攻克的痛点。
(待人工审核)
---
来源与核验说明
- 原始来源:[国内唯一做多模态长记忆的公司,融资数千万,押注主动智能|涌现新项目-36氪](https://36kr.com/p/3919386961177985?f=rss)
- 来源机构:36氪
- 自动核验时间:2026-08-01T01:35:47.432057+00:00
- 生成方式:AI 辅助整理,并基于上述来源进行了事实一致性检查。
- 审核要求:自动核验不能替代人工判断;发布前请再次核对来源、关键事实、数字和表述。