当前位置:首页 > DeepSeek技术交流 > 正文内容

400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

4个月前 (05-19)DeepSeek技术交流303

闻乐 发自 凹非寺量子位 | 公众号 QbitAI

打破科技巨头算力垄断,个人开发者联手也能训练超大规模AI模型?

Nous Research宣布推出Psyche Network,可以将全球算力整合起来训练强大的人工智能。

Psyche是一个基于Deepseek的V3 MLA架构的去中心化训练网络,测试网首次启动时直接对40B参数LLM进行预训练,可以在单个H/DGX上训练,并在3090 GPU上运行。

以往类似规模的模型训练往往需要耗费大量的资源和时间,并且通常是由大型科技公司或专业研究机构凭借其雄厚的资金和算力优势来完成的。

Psyche的出现让个人和小团体也可获取资源创建独特大规模模型。

对此,有网友表示,Nous Research有潜力成为新的前沿AI实验室。

技术突破和网络架构

DisTrO优化器

在传统AI训练中,数据需在中心服务器与分布式GPU之间高频传输,带宽不足会导致GPU利用率暴跌。

2024年Nous研发的DisTrO分布式训练优化器,通过梯度压缩(仅传输关键参数更新)和异步更新策略,将跨节点通信的数据量降低90%以上,突破了训练过程中的带宽限制,使得训练可以去中心化。

点对点网络堆栈

Psyche创建了一个自定义的点对点网络堆栈,用于协调全球分布式GPU运行DisTrO。

这个基于P2P(点对点)协议的专用网络层,无需依赖中心化服务器协调,全球GPU可直接通过加密通道交换梯度数据。

这一设计彻底摆脱了对传统云服务商高带宽网络的依赖,即使是家用宽带连接的GPU,也能稳定参与训练。

系统架构

Psyche网络架构有三个主要部分:

coordinator:协调器,存储有关训练运行状态和参与者列表的元数据。处理一轮训练中每个阶段之间的转换,且负责为运行中的所有客户端提供同步点。

clients:客户端,负责训练、见证和验证。每个客户端都保持自身状态与协调器同步。

data provider:负责提供训练所需的数据。可以是本地的也可以是HTTP或 CP提供者。

40B参数LLM预训练

此前互联网公开的大规模预训练多由Meta、Google等巨头主导(如LLaMA 2的700亿参数模型),Psyche以去中心化模式实现同等级别训练。

Psyche首次测试网运行使用的是Deepseek的V3 MLA架构。

MLA通过低秩联合压缩键值和矩阵分解技术,降低计算复杂度与内存占用,使 400 亿参数大语言模型在有限算力下高效训练。

多头注意力机制与潜空间表示学习相结合,提升模型语言理解与生成能力;并且,旋转位置嵌入的运用,有效解决长序列位置依赖问题,从多维度保障了训练的高效性与模型性能的优质性。

数据集:

使用了FineWeb(14T)、去除部分不常见语言的FineWeb-2(4T)和The Stack v2(1T),些数据集涵盖丰富信息,为模型训练提供了有力支持。

分布式训练策略:

模型并行与数据并行结合:将400亿参数拆解为128个分片,分布在不同节点进行 “模型并行” 训练,同时每个节点处理独立的数据批次(“数据并行”),通过DisTrO优化器同步梯度更新。动态自适应批量大小:根据节点网络延迟自动调整每个批次的训练数据量(如高延迟节点使用较小批次,减少等待时间),使全局训练效率提升25%。未来将是分布式训练的天下?

随着AI模型参数规模呈指数级增长,传统集中式训练模式正面临算力垄断、成本高昂和扩展性瓶颈的严峻挑战。

分布式训练的崛起,正在彻底改写这一格局。

就在几天前,Prime Intellect发布了首个分布式RL训练模型INTELLEC-2,引起了广泛关注。

Nous Research也称Psyche初始训练只是起点,后续计划整合监督微调、强化学习等完整的训练后阶段工作,以及推理和其他可并行工作负载。

谁能站稳分布式训练擂台?当然,我们期待更多更优秀的成果~

感兴趣的小伙伴可以到官方查看更加详细的内容。博客:https://nousresearch.com/nous-psyche/训练仪表板:https://psyche.network代码:https://github.com/PsycheFoundation/psyche文档:https://docs.psyche.network论坛:https://forum.psyche.networkHuggingFace:https://huggingface.co/PsycheFoundationDiscord:https://discord.com/invite/jqVphNsB4H参考链接:[1]https://x.com/NousResearch/status/1922744494002405444[2]https://x.com/PrimeIntellect/status/1921730059620196772

— 完 —


“400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署” 的相关文章

神州数码郭为:DeepSeek最大贡献在于通过开源推动AI惠普

神州数码郭为:DeepSeek最大贡献在于通过开源推动AI惠普

人民财讯4月3日电,在近日举行的神州数码2024年度业绩说明会上,神州数码董事长郭为表示,DeepSeek最大的贡献和价值在于通过开源,推动了AI的普惠,AI的开源和普惠,给各行各业带来了非常大的机会...

百度搜索宣布将全面接入DeepSeek及文心大模型深度搜索功能

百度搜索宣布将全面接入DeepSeek及文心大模型深度搜索功能

【百度搜索宣布将全面接入DeepSeek及文心大模型深度搜索功能】财联社2月16日电,百度搜索和文心智能体平台宣布将全面接入DeepSeek和文心大模型最新的深度搜索功能。搜索用户可免费使用DeepS...

2025全国DeepSeek 数字应用实训营(临沂站)即将开营

2025全国DeepSeek 数字应用实训营(临沂站)即将开营

2025全国DeepSeek数字应用实训营(临沂站)将于4月26日开营。该实训营由临沂市融媒体中心琅琊新闻网主办,已吸引160余名政企媒精英报名。作为临沂首场聚焦AI全场景落地的实训营,深度融合鲁南经...

国家知识产权局:驳回63枚恶意抢注的DeepSeek商标

国家知识产权局:驳回63枚恶意抢注的DeepSeek商标

大象新闻记者 王瑞麟2月24日,据国家知识产权局发文,近期,杭州深度求索人工智能基础技术研究有限公司研发的DeepSeek人工智能大模型在全球范围内引发了广泛关注。个别企业和自然人以社会公众普遍知悉的...

天融信:公司已发布DeepSeek安全智算一体机

天融信:公司已发布DeepSeek安全智算一体机

新京报贝壳财经讯(记者林子)2月28日,面对投资者询问公司日常是否会借助AI技术辅助工作,赛轮轮胎表示,公司积极探索AI等新技术在相关业务领域的应用,目前公司已私有化部署DeepSeek大模型,目前正...

福建泉州:部署DeepSeek大模型,助力智慧教学

福建泉州:部署DeepSeek大模型,助力智慧教学

 中国教育报-中国教育新闻网讯(记者 黄星)日前,福建省泉州市中小学校人工智能素养能力提升培训在泉州市晋光小学东海校区举行。  活动现场,泉州市晋光小学教师许榕鑫在语文课堂上运用AI生图技术,引导学生...