DeepSeek R2 尚未正式发布,但其下一代大模型的技术细节已在今年的 ACL(Association for Computational Linguistics)最佳论文中提前曝光。这篇由 DeepSeek 和北京大学联合完成的论文《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》斩获了 ACL 最佳论文奖,标志着 稀疏注意力(Sparse Attention)技术取得了突破性进展。这项技术的核心在于,能够在保持模型性能的同时,将推理速度提升高达 11 倍,尤其针对 长文本处理,具有颠覆性意义。
长文本处理的“痛点”:注意力机制的挑战
目前,大语言模型的核心技术之一是 注意力机制(Attention)。传统的全注意力机制在处理长文本时,计算量会随着文本长度的增加呈平方级增长,导致模型响应速度变慢,训练和推理成本高昂。例如,在 64k 上下文长度下,传统注意力机制的计算占据了整个推理延迟的 70%-80%。
DeepSeek 的解法:原生稀疏注意力(NSA)
DeepSeek 提出的 NSA 旨在解决这一问题。NSA 借鉴了人类阅读长篇报告时的策略,主要包含三种核心机制:
- Token Compression(压缩):将长文本内容打包成压缩块,快速把握全局信息。这有助于模型记住关键前提。
- Token Selection(选择):根据当前需要处理的内容,选择最相关的原文细节块进行精读。
- Sliding Window(滑动窗口):保留一个滑动窗口,对最近的上下文信息保持最精细的注意力。
最重要的是,NSA 通过一个 “门控机制”动态学习如何平衡这三种阅读策略。此外,NSA 是 “原生可训练”的,这意味着模型从预训练阶段就开始学习这种高效的注意力分配方法,使其稀疏模式与模型的其他部分能够完美协同。
技术革新带来的实际收益
DeepSeek 在论文中用详尽的实验数据证明了 NSA 的强大实力。在 MMLU、GSM8K 等标准测试中,搭载 NSA 的 27B 模型在多项指标中击败了传统的全注意力模型。在长文本理解方面,NSA 在 64k 超长文本中做到了 100% 的信息检索准确率。更令人振奋的是,与 FlashAttention-2 相比,NSA 在处理 64k 长度序列时,推理速度提升了惊人的 11.6 倍,训练速度也显著加快。这项技术对于 AI 文本摘要、长文档分析以及 多轮复杂对话等应用场景,都具有极大的推动作用。
产业趋势与未来展望
DeepSeek 的 NSA 技术,无疑将成为未来 DeepSeek 系列大模型的核心竞争力之一。NSA 已经在 27B、MoE 架构上完成了完整预训练验证,并基于 DeepSeek 自研的 MoE 系统,兼容 GQA 架构、FlashAttention-2 内核,并使用 Triton(英伟达开源的推理服务框架)重写了关键 kernel。这意味着,它不仅仅是一个研究成果,而是一个准备好落地的系统模块。未来,用户可以直接将整本书、几十份财报、一个完整的 GitHub 项目代码库扔给 AI,进行深度分析、总结和问答。DeepSeek 的响应速度会更快,而计算效率的巨大提升,最终会传导到 API 的价格上,降低用户的使用成本。DeepSeek 正在通过像 NSA 这样坚实的技术创新,构建自己的护城河。你认为,在 大模型领域,未来还会有哪些技术突破,能够进一步提升 AI处理长文本的能力?
