DeepSeek代码开源第一弹Flash MLA，揭秘大模型训练低成本关键-AI资讯-资讯-创佳网

2月24日消息，随着DeepSeek大模型开源引发全球热潮后，2月21日DeepSeek在社交平台X发文称，这周起会陆续开源5个代码库。

今天DeepSeek开源首个代码库Flash MLA，引发极大关注，截至目前github Star星数已经超过4.5k。

Flash MLA是DeepSeek针对英伟达Hopper GPU优化的高效MLA解码内核，其特别针对可变长度序列作了优化，现已投入生产。

FlashMLA的使用基准为：Hopper GPU、CUDA 12.3及以上版本、PyTorch 2.0及以上版本。

经实测，FlashMLA在H800 SXM5平台上（CUDA 12.6），在内存受限配置下可达最高3000GB/s，在计算受限配置下可达峰值580 TFLOPS。

这种优化可以确保FlashMLA在高性能硬件上有效地处理大语言模型和其他AI应用程序的密集计算需求。

目前已经发布的内容包括：采用BF16，块大小为64的分页kvcache（键值缓存）。

团队在致谢部分表示，FlashMLA的设计参考了FlashAttention 2&3以及CUTLASS的技术实现。

资料显示，FlashAttention 是一种针对Transformer模型注意力计算的高效优化算法，由斯坦福团队于2022年提出，核心目标是通过硬件感知的内存管理和计算流程重构，显著降低长序列处理时的显存占用与计算延迟。

CUTLASS（CUDA Templates for Linear Algebra Subroutines）是NVIDIA推出的开源高性能计算库，专为GPU加速的线性代数计算（尤其是矩阵乘法和卷积）设计。其核心目标是通过模块化模板和硬件级优化，为开发者提供灵活、高效的底层计算内核，支撑AI训练、科学计算与图形渲染等领域。

根据DeepSeek过往提交的论文，DeepSeek大模型训练成本大幅下降有两项关键技术，一是MoE，另一个就是今天开源的MLA（多头潜注意力）。

DeepSeek的成本涉及两项关键的技术：一个是MoE，一个就是MLA（Multi-head Latent Attention，多头潜注意力）。

MLA旨在优化传统Transformer架构的效率与性能，其核心原理包括：

KV压缩与潜在变量：将键（Key）和值（Value）联合压缩为低维潜在向量，显著减少推理时的KV缓存，降低内存占用。计算时通过升维恢复原始信息，平衡压缩效率与计算精度。

低秩降维技术：对查询（Queries）进行低秩压缩（降维后再升维），减少训练中的激活内存（activation memory），但需注意此操作不影响KV缓存。

动态序列处理：针对可变长度输入序列优化，支持高效处理不同长度的句子（如长文本对话场景）。

MLA可将每个查询KV缓存量减少93.3%，显著减少了大模型训练和推理过程中的内存占用

今天开源的MLA是DeepSeek在注意力机制上的重要创新，通过KV压缩、低秩降维等技术实现高效长序列处理与资源优化，成为其模型性能领先的关键技术之一。

本周后续，DeepSeek还将陆续开源4个代码库，期待一下！（宜月）

周鸿祎：未来每个家庭都会新增 “几十口人”

快科技12月27日消息，今日360集团创始人、董事长周鸿祎发文预测，未来每个家庭都会新增“几十口人”，因为家里所有的家电和硬件将一夜之间变为真正智能的AI伙伴。他还提到了英伟达近日推出的JetsonOrinNano，这是一...

英伟达联手谷歌，加速开发量子计算处理器

11月19日消息，英伟达与谷歌QuantumAI宣布达成合作，以NVIDIACUDA-Q平台助力谷歌研究人员开发量子计算机的海量数字模型，以解决设计难题。根据双方声明，谷歌QuantumAI部门将借助英伟达Eos超级计算机及混合量子-经典...

扎克伯格：Meta AI有望在年底前成为全球使用最广泛的AI助手

8月1日消息，据外媒报道，在Meta周三的财报电话会议上，CEO扎克伯格等高管分享了Meta在AI方面的最新想法和动向。扎克伯格再次预告，MetaAI助手有望在今年年底前成为全球使用最广泛的人工智能助手。Meta于去年9月发布...

IBM旗下AI平台将托管Meta大语言模型MetaLlama2

IBM宣布将在其企业人工智能平台WatsonX上托管MetaPlatform的AI语言模型MetaLlama2。据悉，Llama2是Meta于今年7月推出的开源人工智能语言模型的商业版本，由微软的Azure云服务分发。它在新兴的生成人工智能市场上与Op...

Meta发布Llama 3，高管：最智能开源大模型，最强版还在路上

4月19日消息，美国时间周四，Facebook的母公司Meta发布了其开源大语言模型的最新版本——Llama3。凸显了目前硅谷人工智能之战日益激烈。Meta此次推出了两个版本的Llama3模型：一个版本拥有80亿参数，另一个则有700亿...

DeepSeek代码开源第一弹Flash MLA，揭秘大模型训练低成本关键

如何选购kawai电钢琴？？2023年kawai选购攻略大全来了！

苹果招募生成式AI人才提供数十个大模型岗位

昆仑万维旗下Opera生成式AI服务海外用户数突破100万

创始人王慧文退出美团成AI公司光年之外唯一股东

DeepSeek代码开源第一弹Flash MLA，揭秘大模型训练低成本关键

如何选购kawai电钢琴？？2023年kawai选购攻略大全来了！

苹果招募生成式AI人才 提供数十个大模型岗位

昆仑万维旗下Opera生成式AI服务海外用户数突破100万

创始人王慧文退出 美团成AI公司光年之外唯一股东

苹果招募生成式AI人才提供数十个大模型岗位

创始人王慧文退出美团成AI公司光年之外唯一股东