当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

4个月前 (03-26)DeepSeek技术交流289

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

DeepSeek之后,百度再一次拉高AI势能

DeepSeek之后,百度再一次拉高AI势能

AI产业从“技术神话”走向“工程实用”。在DeepSeek引发的AI大模型成本革命和开源生态冲击下,互联网科技大厂正经历从技术理想主义向工程实用主义的转型。这是一个“祛魅”过程,不仅涉及技术路径的调整...

量化派与DeepSeek等共同入选年度百大AI产品榜单

量化派与DeepSeek等共同入选年度百大AI产品榜单

自春节期间DeepSeek开始受到全网关注,热度依然在蔓延。作为一款更低成本、更优效能和更广泛应用场景的大模型,其表现出来的能力让人惊喜。在科技飞速发展的当下,人工智能已成为创新变革的前沿阵地。值得关...

黄仁勋:DeepSeek将人工智能计算需求提升了100至1000倍

黄仁勋:DeepSeek将人工智能计算需求提升了100至1000倍

英伟达公司首席执行官黄仁勋在公开场合发表观点指出,新兴人工智能模型DeepSeek的诞生,极大地推动了人工智能领域对计算资源的需求,其影响程度令人瞩目——该模型将人工智能计算的需求提升了100倍至高达...

美国斯坦福教授承认:DeepSeek的成功暴露了美国科技界的脆弱性

美国斯坦福教授承认:DeepSeek的成功暴露了美国科技界的脆弱性

DeepSeek让美国多位教授开始“反思”?在过去几周里,美国科技界对 DeepSeek 的讨论异常热烈,焦点集中在芯片供应和技术壁垒上。人们纷纷猜测,DeepSeek 到底囤积了多少芯片,又通过哪些...

DeepSeek总结最浪费时间的7大行为,看完我开始深度反思

DeepSeek总结最浪费时间的7大行为,看完我开始深度反思

作 者:每晚CC来 源:每晚一卷书(ID:JYXZ89896)鲁迅有句名言,影响了我很多年。他说:“生命是以时间为单位的,浪费别人的时间等于谋财害命;浪费自己的时间,等于慢性自杀。”而很多人几乎每天都...

腾讯:微信接入DeepSeek不使用用户信息和隐私,仅整合公众号等公开信息

腾讯:微信接入DeepSeek不使用用户信息和隐私,仅整合公众号等公开信息

微信回应灰度测试接入DeepSeek。2月16日,澎湃新闻记者获悉,微信搜一搜在调用混元大模型丰富AI搜索的同时,近日正式灰度测试接入DeepSeek。被灰度到的用户,可在对话框顶部搜索入口,看到“A...