当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

4个月前 (03-26)DeepSeek技术交流292

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

中国信通院:启动DeepSeek国产化适配测试工作

中国信通院:启动DeepSeek国产化适配测试工作

中新网北京2月14日电(记者 宋宇晟)近期,DeepSeek陆续开源V3、R1系列高性能、低成本模型,人工智能软硬件协同创新重要性进一步凸显。记者从中国信息通信研究院(简称“中国信通院”)获悉,Dee...

DeepSeek是免费的吗?揭秘DeepSeek的使用方式与价值!

DeepSeek是免费的吗?揭秘DeepSeek的使用方式与价值!

标题:DeepSeek是免费的吗?揭秘DeepSeek的使用方式与价值!关键词:DeepSeek,免费,搜索工具,使用方式,功能,免费版,付费版描述:DeepSeek,作为一款全新推出的搜索工具,一直...

新版DeepSeek-V3接入每经大模型平台!小编亲测:敲代码、写报告、撰长文样样在行

新版DeepSeek-V3接入每经大模型平台!小编亲测:敲代码、写报告、撰长文样样在行

3月24日,DeepSeek悄悄上线了新版V3开源大模型——DeepSeek-V3-0324。专业AI模型评测机构Artificial Analysis最新排名显示,新版DeepSeek-V3在基准测...

Kimi和DeepSeek又又又撞车?

Kimi和DeepSeek又又又撞车?

摘要:据凤凰网科技了解,今年杨植麟的关注重心早已发生改变。2月底,Kimi内部在重点推进模型表现的提升,“杨植麟亲自带队”。近期,Kimi则专注垂直领域,核心都是提升模型能力上限。几个大模型初创企业里...

DeepSeek-R1内心世界首次曝光!AI显微镜破解R1大脑神秘推理机制

DeepSeek-R1内心世界首次曝光!AI显微镜破解R1大脑神秘推理机制

【新智元导读】推理模型与普通大语言模型有何本质不同?它们为何会「胡言乱语」甚至「故意撒谎」?Goodfire最新发布的开源稀疏自编码器(SAEs),基于DeepSeek-R1模型,为我们提供了一把「A...

文心一言:请详细介绍Deepseek在办公行业应用有哪些?

文心一言:请详细介绍Deepseek在办公行业应用有哪些?

文心一言:请详细介绍Deepseek在办公行业应用有哪些?DeepSeek在办公行业的应用十分广泛,以下是对其应用的具体介绍:一、文档处理与创作自动写作与编辑:DeepSeek能够辅助写作,如生成创意...