📌 上期解析了 DeepSeek V4.1 Flash 模型架构改进,本期解析 DeepSeek V4.1 Flash 预训练/后训练技术:
🌟 预训练:45T 文本 + 多模态混合语料、直接训练 sparse attention(取消 DeepSeek V4 的 dense 冷启动)、DeepSeek-ViT 通过 contrastive pre-training + autoregressive fine-tuning 两阶段预训练。
🌟 后训练:复用 V4 后训练 Pipeline,不引入新的后训练算法,投入在数据和环境 Scaling。包括大规模 Agent 任务-环境合成、Scaffold + Compute 的异步 RL Scaling、40+ Teacher full-vocabulary OPD。
【清华代码熊】DeepSeek V4.1 Flash 后训练详解
张小明
前端开发工程师
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...
文章主要内容和创新点 主要内容 本文聚焦于多模态大语言模型(MLLM)强化学习(RL)训练中的效率问题,提出了一个名为Shuffle-R1的框架。研究发现,当前RL训练存在两个关键缺陷: 优势值坍缩(Advantage Collapsing):批次中大多数优势值集中在零附近,导致有效梯度信号被淹…
AI编码代理上下文压缩后如何接续?long_mem与engram策略实测
1. 这个实验到底在折腾什么先把背景交代清楚。AI 编码代理(AI Coding Agent)这类工具,比如 Codex 这类命令行形态的编码助手,本质上是把大模型塞进一个能读写文件、执行命令、跑测试的循环里。它跟你聊天不一样,它要在…
公共场所危险物品检测数据集:1431张VOC+YOLO双格式训练指南
简介:本数据集面向安防监控、公共场景智能检测方向的算法工程师与深度学习学习者,提供可直接用于目标检测训练与验证的标注数据,覆盖刀具、手枪、纸币、钱包、智能手机、卡片等六类公共场所常见危险或敏感物品。资源共2000个文件,…
AI安全全链路防护:从提示词注入到Agent权限管控实战指南
上个月我们上线了一个Agent产品,灰度不到一周,就有用户用一句精心构造的输入把底层模型"带偏",然后顺着工具链拿到了不该拿的数据。坦白讲,那一刻我才真正意识到,AI安全风险不是一个"加个审核框"就…
MRAM与PIC18F86K90工业存储方案:SPI驱动与掉电保护实战
1. 项目缘起与方案选型:为什么是 MRAM 加 PIC18F86K90工业现场的数据记录仪、智能电表、PLC 扩展模块、医疗泵控制器,这类设备有一个共同特征:它们需要频繁记录关键状态,掉电不能丢,而且现场环境往往伴随高温、振动和电…
眼动追踪中的动态AOI分析:从静态画框到兴趣区跟随的完整实战指南
眼动数据分析里有一个很隐蔽的门槛:静态图片上的AOI分析,随便找个教程就能上手,画个矩形框,统计注视时长,完事。可一旦刺激物动起来——视频广告、驾驶模拟界面、人机交互操作过程,很多人立刻卡壳。为什么&…