DeepSeek V3.2 技术笔记

😀
 

DeepSeek V3.2 技术笔记

一、模型核心定位

  • 主打效率优先,用算法优化弥补算力不足,以低成本跻身大模型第一梯队
  • 核心思路:DSA 降本 → 支撑大规模后训练 → 强化智能体能力

二、三大核心创新

  1. DSA(奇数注意力/闪电注意力) 解决推理效率、长上下文成本问题
  1. 大规模后训练 带来能力显著提升,支撑智能体泛化
  1. 大规模合成数据 降低智能体训练成本,让泛化落地可行

三、DSA 注意力机制(核心重点)

1. 原理

  • 传统注意力:复杂度 O(L²),随长度暴增
  • DSA:新来 token 先快速筛选 top-k,只对少量 token 做 full attention
  • 快筛用 FP8 低精度 + 快速算法,整体接近线性增长

2. 训练流程

  1. 热身阶段:只训练快筛,逼近标准注意力分布
  1. 悉数训练:全参数一起训练,适配快筛结果

3. 价值

  • 大幅降低长上下文 token 成本
  • 让后续高耗 token 的强化学习后训练成为可能

四、后训练与专家蒸馏

1. 6 大基础智能体(分两组)

  • 能力组:数学、代码、逻辑推理
  • 应用组:搜索、代码、通用智能

2. 蒸馏思路

  • 专项专家模型生成数据,反向蒸馏主模型 V3.2
  • 类似“单科老师教全科学霸”,专攻短板

五、GRPO 强化学习(4 大优化)

  • 优化 1:修正 KL 散度,防止梯度爆炸
  • 优化 2:屏蔽过远负样本,减少训练波动
  • 优化 3:适配 MoE 架构,保证参考模型与训练模型激活专家一致
  • 优化 4:固定采样候选 token,保持训练稳定

关键改进

  • 多任务合并训练,避免灾难性遗忘

六、智能体合成数据方案

  • 任务设计:复杂但易验证
  • 流程:给定任务 → 爬取数据 → 合成工具 → 生成任务与解 → 筛选有效数据
  • 优势:低成本、规模化生产智能体训练数据

七、上下文管理策略

  • 保留每一步思考过程,不只存结果
  • 依赖 DSA 支撑超长上下文
  • 超 128K 处理:直接清空工具调用历史,简单高效

八、模型局限(官方坦诚)

  1. 通识世界知识不足
  1. Token 效率偏低、智能密度低
  1. 顶尖任务略弱
  • 根源:算力有限,而非架构不行

九、核心结论

  1. DSA 是整个架构的基石,效率决定上限
  1. 后训练 + GRPO + 合成数据 = 能力爆发
  1. 算法创新替代算力堆料,走低成本高效路线
要不要我把这份笔记整理成可直接打印的一页纸速记版

📎 参考文章

  • 一些引用
  • 引用文章
 
💡
欢迎您在底部评论区留言,一起交流~
上一篇
第一节 大脑:重新认识你自己
下一篇
临时
Loading...