多元记忆系统的信号采集、提炼与应用
千问智能的记忆系统在三个环节上做差异化:信号采集、记忆提炼、记忆应用。目标是构建全局/全域的用户理解能力。
主流厂商现状:
主流厂商现状:
主流厂商现状:
三个核心环节
信号采集
主流厂商现状:
- 目前国内主流手机厂商的记忆基本只覆盖对话数据和主动收藏/记忆两种形态
- 其中主动收藏的形态转换很低(用户想不起来用)
- 对话数据经常不全(更多信号沉淀在豆包等 App 中)
- 难以全面完整地捕捉到用户的兴趣偏好、状态等
- 全局/全域的信号采集(对齐 Google 和 OpenAI)
- 端侧信号补齐(未来)
- 一期支持对话和 Push 的捕捉
记忆提炼
主流厂商现状:
- 记忆提炼过程往往不是全量数据提取,而是根据自己的设计进行提取
- 有些甚至单独做个垂类
- 提炼时更倾向于提取身份和兴趣偏好
- 记忆的提炼是不全的,缺少认知状态、情景状态的提炼
- 依赖模型能力做散点提取,不能充分发挥模型对即将发生事件的推理能力
| 记忆类别 | 举例 |
|---|---|
| 身份记忆 | 姓名、职业、家庭结构 |
| 认知状态 | 当前关注的问题、正在学习的领域 |
| 情绪状态 | 近期情绪波动、压力源 |
| 情景状态 | 出差中、旅行中、居家中 |
| 偏好记忆 | 饮食偏好、消费习惯、审美偏好 |
记忆应用
主流厂商现状:
- 主流厂商对记忆的宣传和应用多集中在查找身份证等低频问答场景
- 推测原因:缺少敏捷的后验实验体系和卖点逻辑牵引
- 一些更深入结合记忆的能力(个性化追问、回复风格个性化、类比关联等)对方注意不到
- 记忆应用重点围绕主动服务去搞
- 支撑 QA 场景和主动服务场景
底层模型
- 目前基于 397B 对齐产品理想态做后训练(截止 9 月底)
- 需要单独训练更小的模型,完成一阶段主动服务机会判断
相关 PRD
- 《【记忆提炼】理想态对齐 V1.1》
- 《P 项目-记忆整体思路及 MVP 版本对齐》