当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

3个月前 (03-26)DeepSeek技术交流203

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

DeepSeek开源放大招:FlashMLA让H800算力狂飙!曝光低成本秘笈

DeepSeek开源放大招:FlashMLA让H800算力狂飙!曝光低成本秘笈

【新智元导读】DeepSeek开源周第一天就放大招!FlashMLA强势登场,这是专为英伟达Hopper GPU打造MLA解码内核。注意,DeepSeek训练成本极低的两大关键,一个是MoE,另一个就...

重庆银行:本行已于今年年初接入首个国产大模型DeepSeek

重庆银行:本行已于今年年初接入首个国产大模型DeepSeek

 同花顺(300033)金融研究中心04月18日讯,有投资者向重庆银行(601963)提问, 董秘您好!请问贵公司是否已经部署了DeepSeek?如果已经部署了,请问主要应用于哪些具体的业务?公司接入...

15+车企怕掉队,紧急宣布接入DeepSeek

15+车企怕掉队,紧急宣布接入DeepSeek

DeepSeek火爆全球,凭借一己之力,戳破英伟达算力“泡沫”,以低成本、开源、免费的形式“哪吒闹海”。这个中国的AI助手,拥有媲美ChatGPT的能力,甚至让美国战略部门高度重视。面对DeepSee...

升级版DeepSeek-V3模型开源!DeepSeek上可试用体验

升级版DeepSeek-V3模型开源!DeepSeek上可试用体验

【TechWeb】3月25日消息,DeepSeek在开源平台上线了升级后的DeepSeek-V3模型。新模型的版本号为DeepSeek-V3-0324,模型参数为6850亿,其早期版本参数为6710亿...

时隔3个月再访北京 曝黄仁勋会见DeepSeek创始人梁文锋

时隔3个月再访北京 曝黄仁勋会见DeepSeek创始人梁文锋

快科技4月18日消息,日前,应中国贸促会邀请,英伟达CEO黄仁勋抵达北京,中国贸促会会长任鸿斌与黄仁勋举行会谈。这是黄仁勋时隔3个月再次到访北京,行程备受外界关注。据媒体报道,黄仁勋在北京还见了中国生...

安徽率先完成DeepSeek满血版本地化部署全省试用推广

安徽率先完成DeepSeek满血版本地化部署全省试用推广

人民财讯3月11日电,据安徽日报,记者3月10日从安徽省数据资源管理局获悉,安徽省率先在全国省级层面完成DeepSeek满血版(671B)本地化部署,推出无差别综窗、公文写作、语音转文字等16个典型应...