6月AI论文速览:AI Papers of the Week 10篇全解析
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
每周新AI论文成堆,光看标题就已经劝退。开源项目 AI Papers of the Week 每周精选机器学习顶流论文并配好摘要,本文以 2025 年 6 月 23-29 这一期为例,带你完成一份 2025年6月AI论文速读:扩散语言模型如何提速 10 倍、记忆恒定的多智能体怎么做、罕见病诊断推理链如何做到可追溯。读完后你能带走三样东西:判断当前热点方向的坐标、每篇论文的关键指标、一套可持续追论文的方法。
先花 1 分钟认识这个项目
AI Papers of the Week 由 DAIR.AI 团队维护,每周更新一期精选论文,按年份归档成years/目录下的年度文件,每期 10 篇左右,每篇附一句亮点和要点。想快速追更,克隆下来直接翻年度档案即可:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week # 打开 years/2025.md,定位到 "Top AI Papers of the Week (June 23 - June 29)"本期看点 · 一分钟速览
| 论文 / 主题 | 一句话亮点 | 适合谁看 |
|---|---|---|
| Mercury(扩散语言模型) | 并行生成,H100 上达 1109 tokens/sec,比速度优化的前沿模型快至多 10× | 推理工程师、补全工具开发者 |
| MEM1(记忆 RL) | 单条内部状态恒定更新,内存省 3.7×,推理快 1.78× | 长任务 Agent 开发者 |
| AI Search Paradigm(多智能体搜索) | 四智能体分工 + DAG 规划,MCP 动态选工具子集 | 搜索引擎、RAG 实践者 |
| RLT(RL 教师模型) | 7B 模型生成解释,蒸馏效果超 32B+ 大模型管道 | 推理模型研究者 |
| DeepRare(罕见病诊断) | 1013 种疾病 100% 准确率,Recall@1 57.18%,推理链可追溯 | 医疗 AI 工程师 |
| AlphaGenome(基因调控) | 单碱基分辨率预测最长 100 万碱基对,24/26 变异效应基准领先 | 计算生物学研究者 |
| Claude for Affective Use(使用研究) | 450 万次对话分析,仅 2.9% 属于情感支持类 | 产品与伦理关注者 |
| Agent Communication Protocols(安全综述) | 三阶段梳理提示注入、伪造智能体、记忆中毒与防御 | 智能体安全工程师 |
| DSRL(扩散策略调优) | 在潜噪声空间适配策略,样本效率提升 5–10× | 具身智能研究者 |
| PEVA(第一视角视频预测) | 用 3D 人体动作预测第一视角视频,支持长时 rollout | 视频生成、AR 方向 |
一句话总结本期主线:要么更快(Mercury、DSRL),要么更省(MEM1),要么落地(DeepRare、AlphaGenome)。下面按这三个聚类展开。
⚡ 推理提速:10 倍生成速度与更省的教师训练
10 倍提速:Mercury 扩散语言模型
它卡住了什么问题:自回归语言模型一次只能吐一个 token,代码补全的延迟是绕不开的墙。机制上,Mercury 把 Transformer 改造成扩散式生成,靠粗到精的迭代细化并行产出多个 token;H100 上 Coder Mini 与 Small 分别做到 1109 和 737 tokens/sec,据项目周报,比速度优化的前沿模型快至多 10 倍,HumanEval、MBPP 与 Claude 3.5 Haiku、Gemini 2.0 Flash Lite 持平,FIM 中间填充任务上超越 Codestral 2501 和 GPT-4o Mini,Mini 版在 Copilot Arena 以 25ms 延迟拿到第二高 Elo。谁该在意:做补全服务或 IDE 插件的团队,这是可以直接对标的新速度线。
图1:项目 2023 年周选档案中收录的论文图(DreamerV3 世界模型与耦合扩散概率模型),与 Mercury 押注的扩散范式同源:用迭代细化换生成速度。
只教不解题:RLT 强化学习教师模型
它卡住了什么问题:推理模型的 RL 训练被探索难、奖励稀疏卡住,蒸馏管道又贵。机制上,RLT 把问题和答案都交给模型,只用 RL 优化它产出的"解释",奖励由两部分构成:学生模型能否复现解法、解释本身是否逻辑自洽。7B 的原始解释在 AIME、MATH、GPQA 上超过 DeepSeek R1、QwQ 等 32B+ 蒸馏管道的产物,训练只需 125 步、1 个 epoch,无需后处理或验证器。谁该在意:做推理蒸馏的团队,这是一份低成本可复现的配方。
速度问题聊完了,下一个瓶颈是记忆——上下文越滚越大怎么办?
🧠 记忆与多智能体:让上下文变轻、搜索变狠
恒定内存:MEM1 记忆整合框架
它卡住了什么问题:传统智能体把全部历史交互往上下文里堆,任务一长内存爆炸、性能反降。机制上,MEM1 不存全量历史,每轮只更新一个共享内部状态 并丢弃过时上下文,再用 PPO 风格 RL 加掩码轨迹技巧端到端训练。7B 版在 16 目标多跳 QA 上跑赢 Qwen2.5-14B-Instruct,内存少用 3.7 倍、推理快 1.78 倍,内部状态分析还发现它自发学会了结构化记忆管理和查询重构。谁该在意:做多轮长任务 Agent 的开发者,"恒定内存"是个能直接抄的设计。
DAG 规划:AI Search 多智能体搜索系统
它卡住了什么问题:RAG 式搜索要么取文档要么生答案,缺多步拆解与失败重规划能力。机制上,Master、Planner、Executor、Writer 四个智能体分工:Planner 把任务拆成有向无环图,Executor 用 RankGPT 和 TourRank 把搜索结果对齐到 LLM 偏好,并通过 MCP 抽象动态挑选工具子集、迭代精修工具文档(DRAFT);Writer 经对抗调优(ATM)抵抗噪声检索,保证引用质量。谁该在意:正从 RAG 升级到 agentic search 的团队,这是一份完整蓝图。
从通用能力切到具体行业,看看本期两篇落地最狠的工作。
🩺 垂直领域落地:医学、基因组学与人文观察
可追溯推理链:DeepRare 罕见病诊断
它卡住了什么问题:临床 AI 常常只给答案不给依据,医生没法采信。机制上,DeepRare 采用三层 MCP 式架构:中央 LLM 主机 + 表型提取、变异排序等专业智能体服务器 + 40 余工具和联网医学源,输入可组合文本、HPO 术语和 VCF 文件。在 8 个数据集 6401 个病例、2919 种罕见病上,1013 种疾病准确率 100%,HPO-only 评估 Recall@1 57.18%,高出次优方法(Claude-3.7-Sonnet-thinking)23.79 个百分点;180 条诊断推理链的专家评审一致性达 95.4%。谁该在意:做诊断辅助的团队,它的"推理链 + 可追溯来源"评估方式值得整套搬走。
百万碱基对:AlphaGenome 基因调控预测
它卡住了什么问题:基因组 98% 是非编码区,而旧模型在序列长度和分辨率之间互相牺牲。机制上,AlphaGenome 组合卷积与 Transformer 层,在单碱基分辨率下建模最长 100 万个碱基对,一次预测基因起止点、RNA 表达、剪接、染色质可及性与蛋白结合,算力只要 Enformer 的一半,在 24/26 个变异效应基准上领先,还是首个显式预测 RNA 剪接位点及表达水平的序列模型。谁该在意:想找非编码变异解释新路径的计算生物学研究者。
450 万次对话:Claude 情感支持使用研究
它卡住了什么问题:"AI 情感陪伴"到底多普遍、长什么样,一直缺大规模实证。机制上,Anthropic 用匿名化工具 Clio 分析 450 万次对话,筛出 13.1 万条有效情感支持会话:仅 2.9% 的对话属于建议、辅导、咨询或陪伴类,浪漫/性角色扮演不足 0.1%;Claude 在不到 10% 的情感对话中拒绝请求,主要用于劝阻伤害风险或说明专业边界;情绪分析显示用户会话结束时情绪平均更积极。谁该在意:做情感向产品的人,这是目前少有的安全设计基线。
按你的角色划重点
- 算法研究者:先读 RLT 和 DeepRare。前者证明"教会学生"本身可以当优化目标,后者给出完整的 agentic 评估模板;重点盯 Recall@1 与专家评审一致性两个指标。
- 工程落地者:先读 Mercury 和 MEM1。前者给你 1109 tokens/sec、25ms 延迟的对标线,后者给你恒定内存设计,都能直接映射到你的推理服务和 Agent 上下文管理。
- 泛科技读者:先读 AlphaGenome 和 Claude 使用研究。前者回答"AI 怎么读懂非编码区突变",后者回答"人们真的把多少情绪交给了 AI"。
持续跟踪指南
项目每周更新一期,2025 与 2026 年的档案已归档在years/目录,README 也提供了 newsletter 订阅与 Discord 社区入口(在 README 末尾)。以本期为线索,建议持续盯两个方向:用迭代细化换速度的扩散语言模型,以及智能体的记忆与上下文管理——years/2026.md里已排到 7 月,下一波看点大概率还在它们身上。如果这份 6 月速读帮到你,不妨收藏本文,等下一期更新时再来对一对答案。
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考