DeepSeek V3.2 技术笔记
一、模型核心定位
- 主打效率优先,用算法优化弥补算力不足,以低成本跻身大模型第一梯队
- 核心思路:DSA 降本 → 支撑大规模后训练 → 强化智能体能力
二、三大核心创新
- DSA(奇数注意力/闪电注意力) 解决推理效率、长上下文成本问题
- 大规模后训练 带来能力显著提升,支撑智能体泛化
- 大规模合成数据 降低智能体训练成本,让泛化落地可行
三、DSA 注意力机制(核心重点)
1. 原理
- 传统注意力:复杂度 O(L²),随长度暴增
- DSA:新来 token 先快速筛选 top-k,只对少量 token 做 full attention
- 快筛用 FP8 低精度 + 快速算法,整体接近线性增长
2. 训练流程
- 热身阶段:只训练快筛,逼近标准注意力分布
- 悉数训练:全参数一起训练,适配快筛结果
3. 价值
- 大幅降低长上下文 token 成本
- 让后续高耗 token 的强化学习后训练成为可能
四、后训练与专家蒸馏
1. 6 大基础智能体(分两组)
- 能力组:数学、代码、逻辑推理
- 应用组:搜索、代码、通用智能
2. 蒸馏思路
- 用专项专家模型生成数据,反向蒸馏主模型 V3.2
- 类似“单科老师教全科学霸”,专攻短板
五、GRPO 强化学习(4 大优化)
- 优化 1:修正 KL 散度,防止梯度爆炸
- 优化 2:屏蔽过远负样本,减少训练波动
- 优化 3:适配 MoE 架构,保证参考模型与训练模型激活专家一致
- 优化 4:固定采样候选 token,保持训练稳定
关键改进
- 多任务合并训练,避免灾难性遗忘
六、智能体合成数据方案
- 任务设计:复杂但易验证
- 流程:给定任务 → 爬取数据 → 合成工具 → 生成任务与解 → 筛选有效数据
- 优势:低成本、规模化生产智能体训练数据
七、上下文管理策略
- 保留每一步思考过程,不只存结果
- 依赖 DSA 支撑超长上下文
- 超 128K 处理:直接清空工具调用历史,简单高效
八、模型局限(官方坦诚)
- 通识世界知识不足
- Token 效率偏低、智能密度低
- 顶尖任务略弱
- 根源:算力有限,而非架构不行
九、核心结论
- DSA 是整个架构的基石,效率决定上限
- 后训练 + GRPO + 合成数据 = 能力爆发
- 用算法创新替代算力堆料,走低成本高效路线
要不要我把这份笔记整理成可直接打印的一页纸速记版?
📎 参考文章
- 一些引用
- 引用文章
欢迎您在底部评论区留言,一起交流~
Loading...
