当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

4个月前 (02-25)Deepseek最新资讯191

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。

据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。

贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。

上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

DeepSeek有望助力全球南方国家跨越数字鸿沟

DeepSeek有望助力全球南方国家跨越数字鸿沟

“我认为DeepSeek有潜力帮助全球南方国家缩小数字鸿沟并加速现代化。”日前在南非举行的数字化转型峰会上,南非人工智能企业Matogen首席执行官雅各布斯·艾蒂安说。随着全球数字化进程加速,人工智能...

除了不能当女婿,DeepSeek比董宇辉差到哪了?

除了不能当女婿,DeepSeek比董宇辉差到哪了?

原创 薛亚萍 字母榜“DeepSeek推荐”正在成为年轻人新的消费决策仪式。打开购物APP之前,在北京工作的白领刘雪先去寻求DeepSeek的帮助:“我27岁,敏感肌,请你帮我推荐几款适合我的防晒霜”...

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

明敏 发自 凹非寺量子位 | 公众号 QbitAI刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!而且这只是通过改进后训...

医疗机构如何部署DeepSeek?这一专家共识给出参考→

医疗机构如何部署DeepSeek?这一专家共识给出参考→

近日,《医疗机构部署DeepSeek专家共识》在京发布,引起业界关注。该共识从医疗需求适配性、数据质量保障、伦理合规等5大维度提出系统性部署框架,以期为人工智能(AI)落地医疗场景提供标准化路径。该共...

华西证券:DeepSeek有望开启AI产业的“安卓时刻”

华西证券:DeepSeek有望开启AI产业的“安卓时刻”

华西证券研报表示,DeepSeek的开源是真正通往AI下游应用生态繁荣之路:部署大模型成本大幅降低,下游行业已经全面铺开,如金融、政府、医疗等领域行业私有化部署如火如荼;大厂开启开源部署之路,腾讯、阿...

AI应用激活算力需求 昇腾大EP推理方案助力DeepSeek部署

AI应用激活算力需求 昇腾大EP推理方案助力DeepSeek部署

随着各行各业加速接入国产开源大模型DeepSeek,如何应对人工智能大范围落地应用带来的庞大算力需求,成为当下国内算力产业必须面对的机遇与挑战。在这样的大背景下,昇腾大EP(专家并行)推理方案凭借其独...