当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

1个月前 (03-26)DeepSeek技术交流117

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

华自科技:公司水利水电智能运维大模型已完成DeepSeek全面接入

华自科技:公司水利水电智能运维大模型已完成DeepSeek全面接入

每经AI快讯,华自科技3月7日在互动平台表示,公司“共工”水利水电智能运维大模型已完成DeepSeek全面接入,将焕新升级“智能交互、数据驱动、深度思考、主动服务”四大核心能力,以AI深度协同赋能水利...

著名作家邱华栋评价DeepSeek:“写作还处在中等偏下水平”

著名作家邱华栋评价DeepSeek:“写作还处在中等偏下水平”

(来源:大江网-江南都市报 )“我认为DeepSeek的写作还处在中等偏下水平……”3月15日,中国作协副主席、著名作家邱华栋登上南昌市图书馆“豫章讲坛”,为南昌读者带来了“写作的长路没有尽头”的主题...

DeepSeek+昇腾云技术创享会重庆站成功举办

DeepSeek+昇腾云技术创享会重庆站成功举办

2月27日,以“山城论道 智链未来”为主题的“探秘DeepSeek行业影响暨华为云昇腾云技术创享会”在重庆成功举办。活动现场,政府代表、行业专家、企业决策者及技术开发者等300余人齐聚一堂,围绕人工智...

联想与沐曦DeepSeek一体机上市首月发货量突破千台

联想与沐曦DeepSeek一体机上市首月发货量突破千台

【联想与沐曦DeepSeek一体机上市首月发货量突破千台】《科创板日报》7日讯,《科创板日报》记者获悉,联想集团与沐曦股份合作的首个国产DeepSeek一体机解决方案发布一个月以来,截至今日,其累计发...

杭州城市大脑引入DeepSeek 支撑赋能“数智公务员”

杭州城市大脑引入DeepSeek 支撑赋能“数智公务员”

中国青年报客户端讯(中青报·中青网记者 李剑平)记者22日从浙江省杭州市数据资源局获悉,杭州市城市大脑引入和部署DeepSeek-R1系列模型,全面支撑赋能“数智公务员”,并应用于医疗、文旅等行业智能...

数坤科技、华为联手!助力深圳市人民医院完成DeepSeek本地化部署

数坤科技、华为联手!助力深圳市人民医院完成DeepSeek本地化部署

近日,深圳市人民医院、数坤科技与华为三方达成深度合作,实现了DeepSeek-R1模型及“数坤坤”多模态医疗健康大模型的院内部署,并共同打造基于医疗专业大模型的数智医院建设整体解决方案,将为医院的医疗...