当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

9个月前 (02-24)Deepseek最新资讯446

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。


据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。


贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。


上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

德国对DeepSeek下手

德国对DeepSeek下手

据路透社报道,德国数据保护专员梅克·坎普27日在一份声明中声称,已要求苹果和谷歌公司从其在德国的应用商店下架中国初创公司自主研发的人工智能(AI)大语言模型“深度求索”(DeepSeek)应用,理由是...

Deepseek的算法创新主要体现在哪些方面

Deepseek的算法创新主要体现在哪些方面

DeepSeek的算法创新主要体现在以下几个方面:一、创新的架构设计混合专家架构(MoE):DeepSeek采用了细粒度专家分配策略,每个MoE层包含1个共享专家和多个路由专家(如256个)。通过动态...

怎么用deepseek写好文案?deepseek写材料,deepseek续写小说

怎么用deepseek写好文案?deepseek写材料,deepseek续写小说

DeepSeek在文案撰写、材料编写以及小说续写方面都能提供强大的辅助。以下是如何利用DeepSeek进行这些创作活动的具体方法:一、用DeepSeek写好文案明确核心信息:在使用DeepSeek写文...

ai.com跳转至DeepSeek

ai.com跳转至DeepSeek

鞭牛士 2月9日消息,近日有网友发现,输入ai.com域名会跳转到DeepSeek官网,以为DeepSeek买了该域名。输入该域名后,跳转至该页面:2023年,OpenAI的ChatGPT风靡全球,a...

优刻得携手360布局“DeepSeek一体机+大模型安全+AI应用”合作

优刻得携手360布局“DeepSeek一体机+大模型安全+AI应用”合作

人民财讯3月28日电,近日,优刻得与360集团(简称“360”)达成深度合作,双方将基于优刻得DeepSeek一体机与360大模型安全及纳米AI系列产品,拟推动国产大模型“安全筑基—算力赋能—场景创新...

中公携手 DeepSeek,教资备考超轻松

中公携手 DeepSeek,教资备考超轻松

怀揣教育梦想,欲踏入教育行业,教师资格考试无疑是第一道门槛。中公教育敏锐洞察到这一需求,联合前沿的人工智能技术 DeepSeek,精心打造了一套独具创新性的备考方案,致力于为广大考生带来前所未有的备考...