LongCat-Flash-Lite-Sparse震撼发布:美团69B稀疏专家模型如何突破1M上下文处理极限?
【免费下载链接】LongCat-Flash-Lite-Sparse项目地址: https://ai.gitcode.com/meituan-longcat/LongCat-Flash-Lite-Sparse
LongCat-Flash-Lite-Sparse是美团最新发布的69B稀疏专家模型,作为LongCat-Flash-Lite的升级版本,它创新性地采用了LongCat稀疏注意力(LSA)技术,在保持推理性能的同时,原生支持高达1M tokens的超长上下文处理能力,为AI应用带来了革命性的突破。
🌟 核心技术解析:三大创新机制突破上下文瓶颈
LongCat稀疏注意力(LSA)框架
LSA是LongCat-Flash-Lite-Sparse的核心创新,它在DeepSeek稀疏注意力(DSA)基础上扩展了三种互补的索引机制:
🚀 流式感知索引(SI)
将部分token选择预算重新分配给固定sink和本地滑动窗口,同时为其余token保留动态稀疏选择。这种设计将碎片化的KV访问转换为更可预测的连续读取,显著提高了HBM访问效率和有效带宽。
🔄 跨层索引(CLI)
利用相邻层注意力显著性的稳定性,允许多个连续层在推理时重用单次索引传递的结果。这一能力通过训练过程中的跨层蒸馏习得,大幅降低了计算开销。
🔍 分层索引(HI)
采用从粗到细的两阶段评分方案:首先使用粗粒度分数召回候选块,然后在这些块内执行细粒度token选择。通过减少每个查询处理的候选空间,HI降低了索引开销,且无需额外训练即可在推理时启用。
原生1M-Token上下文支持
为增强长上下文能力,LongCat-Flash-Lite-Sparse在LongCat-Flash-Lite的长上下文扩展阶段进行了升级,采用丰富的语料库和渐进式调度,将上下文长度扩展至1,024K,实现了对1M tokens上下文的原生支持。
强大的智能体性能
相比其密集型前身,LongCat-Flash-Lite-Sparse在智能体编码、搜索和工具使用任务上表现更出色,为构建高效AI助手奠定了坚实基础。
📊 性能评估:多项指标领先同类模型
标准基准测试
在标准基准测试中,LongCat-Flash-Lite-Sparse展现了卓越的性能:
| 基准测试 | Lite-Dense | Lite-Sparse (w/o HI) | Lite-Sparse (w/ HI) |
|---|---|---|---|
| 智能体编码 | |||
| SWE-Bench Verified(acc) | 54.40 | 68.20 | 65.20 |
| SWE-Bench Pro(acc) | - | 40.63 | 39.40 |
| SWE-Bench Multilingual(acc) | 38.10 | 59.33 | 56.00 |
| 智能体工具使用 | |||
| τ²-Telecom(avg@4) | 72.80 | 95.18 | 96.05 |
| VitaBench(avg@4) | 7.00 | 21.67 | 20.42 |
| 通用领域 | |||
| MMLU(acc) | 85.52 | 85.31 | 85.14 |
| CMMLU(acc) | 82.48 | 84.25 | 84.51 |
注:Lite-Dense表示LongCat-Flash-Lite,指标来源于其技术报告。Lite-Sparse (w/o HI)和Lite-Sparse (w/ HI)分别表示未启用和启用分层索引的稀疏变体。
长上下文基准测试
在长上下文能力方面,LongCat-Flash-Lite-Sparse同样表现优异:
| 能力维度 | 基准测试 | Lite-Sparse (w/o HI) | Lite-Sparse (w/ HI) |
|---|---|---|---|
| 基础能力 | |||
| 检索 | MRCR (8-needle) | 44.66 | 44.47 |
| 聚合 | OOLong-Synth | 38.42 | 37.88 |
| 多步推理 | GraphWalks Extend | 66.27 | 65.63 |
| 应用能力 | |||
| 问答 | LOFT Retrieval Extend | 43.75 | 44.38 |
| 上下文学习 | HELMET-ICL Extend | 91.63 | 90.50 |
| 代码理解 | LongCodeQA | 62.30 | 59.37 |
🚀 快速部署指南
LongCat-Flash-Lite-Sparse已在SGLang中实现基本适配,可在单个节点(如1xH20-141G)上部署。启动服务器的命令如下:
python3 -m sglang.launch_server \ --trust-remote-code \ --model meituan-longcat/LongCat-Flash-Lite-Sparse \ --host 0.0.0.0 \ --port 30000 \ --max-running-requests 64 \ --mem-fraction-static 0.93 \ --chunked-prefill-size 2048 \ --nsa-prefill-backend fa3 \ --kv-cache-dtype bfloat16要获取仓库,请使用以下命令:
git clone https://gitcode.com/meituan-longcat/LongCat-Flash-Lite-Sparse📄 技术细节与资源
- 技术报告:tech_report.pdf
- 许可证信息:LICENSE
- 配置文件:config.json
⚠️ 使用注意事项
LongCat-Flash-Lite-Sparse并非为所有可能的下游应用专门设计或全面评估。开发人员应考虑大型语言模型的已知局限性,包括不同语言间的性能差异,并在敏感或高风险场景中部署模型前仔细评估准确性、安全性和公平性。
开发人员和下游用户有责任了解并遵守与其用例相关的所有适用法律法规,包括但不限于数据保护、隐私和内容安全要求。
📧 联系我们
如有任何问题,请通过邮箱联系我们:longcat-team@meituan.com 或在项目中提交issue。
【免费下载链接】LongCat-Flash-Lite-Sparse项目地址: https://ai.gitcode.com/meituan-longcat/LongCat-Flash-Lite-Sparse
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考