当前位置:首页 > DeepSeek技术交流 > 正文内容

挑战DeepSeek-R1,上海企业开源发布MiniMax-M1大模型

3个月前 (06-18)DeepSeek技术交流365

今天,上海人工智能独角兽企业稀宇在开源社区发布了MiniMax-M1系列模型。它们是采用大规模混合架构的推理模型,在处理百万级Token(词元)长文本上实现了突破,支持高达100万Token的上下文窗口,与谷歌最新发布的Gemini 2.5 Pro持平,是DeepSeek-R1的近8倍。

在17个国际主流评测集上,M1大模型显示出优越性能。在代码能力方面,M1-40k和M1-80k版本分别取得了55.6%和56.0%的优秀成绩,超越其他开源模型,跻身全球大模型第一梯队。在长文本理解方面,M1系列凭借百万级上下文窗口,不仅超越了所有开源模型,还击败了GPT-4o和Claude 3 Opus,仅以微弱差距落后于Gemini 2.5 Pro,位列全球第二。在工具调用方面,M1-40k在模拟真实世界工具调用的复杂场景中完成多项任务,展现了其作为智能体基座模型的潜力。

在主流评测集上,M1大模型显示出优越性能。

研发团队介绍,MiniMax-M1的优越性能根植于独特的架构设计和算法创新。它采用线性注意力机制混合构架。其中,线性注意力机制通过算法优化,把传统模型架构中输入长度和计算复杂度之间的平方增长关系变成线性关系,跨出了“实现无限长的输入和输出”的关键一步。混合构架的设计思路是“术业有专攻”,即对任务进行分类,然后分给多个“专家”模块来解决。与一个“通才”大模型相比,一群“专家”模块可以更高效、专业地完成复杂任务。

强化学习算法CISPO也是M1大模型实现突破的核心技术,它通过裁剪重要性采样权重,而非传统算法中调整Token的更新方式,来提升强化学习的效率和稳定性。测试数据显示,CISPO的收敛性能比字节跳动近期提出的DAPO算法快一倍,也显著优于DeepSeek早期使用的GRPO算法。

更快的收敛意味着更少的训练时间和资源消耗。M1大模型的整个强化学习阶段仅使用512块英伟达H800 GPU,耗时三周,成本仅为53.5万美元。这一成本比研发团队的预估少了一个数量级,展示出“线性注意力机制混合构架+CISPO算法”这条技术路线在成本控制上的巨大潜力,证明了通过技术创新可以打破“算力—资本”的壁垒。

在AIME 2024测试集上,CISPO的性能同比优于GRPO和DAPO。

凭借研发成本的大幅降低,稀宇推出了价格很低的API(应用程序编程接口)服务。0—32k Token、32k—128k Token这两个档位的定价均低于DeepSeek-R1,128k—1M Token超长文本档位则是DeepSeek目前尚未覆盖的领域。这家上海企业还宣布,在其自有的App和Web端,用户可无限量免费使用M1大模型。

目前,完整的M1模型权重和技术报告已在“抱抱脸”和GitHub上发布。公司还在与国家超算平台、vLLM等业界主流开源框架合作,让开发者高效地部署和使用M1模型。据悉,M1的发布开启了MiniMax“开源周”。在接下来的4个工作日里,公司计划每天发布一项新技术或产品更新,有望引起业界持续关注。

原标题:《挑战DeepSeek-R1,上海企业开源发布MiniMax-M1大模型》


“挑战DeepSeek-R1,上海企业开源发布MiniMax-M1大模型” 的相关文章

deepseek分析认为:同案不同判问题亟待解决

deepseek分析认为:同案不同判问题亟待解决

deepseek分析认为:同案不同判问题亟待解决提问:对于精细管理工程创始人刘先明的《同案不同判现象登峰造极,暴露司法认定标准的严重混乱,希望最高人民法院重视解决》这一举报信,你们怎么看?deepse...

如何看待养生?DeepSeek的回答丰富深化了我的认识

如何看待养生?DeepSeek的回答丰富深化了我的认识

昨天就聆听专家一节健康科普,整理出《纠正三伏天晒背、苹果煮水养生误区学习笔记》,并跟三五好友作了私下分享。友人纷纷作了反馈,其中一位忘年交发来的留言,让我陷入了深深的思考。他说:“养生不仅是一个现代生...

用Deepseek陪伴二年级孩子改作文:《那一次,我像一个特种兵一样坚持了下来》

用Deepseek陪伴二年级孩子改作文:《那一次,我像一个特种兵一样坚持了下来》

如果说小学生只能培养一项能力,那首当其冲的应当是阅读自动化,阅读自动化实现的1-2年后,经过持续的写作练习,能够逐渐形成写作自动化,所以,在阅读的基础上,逐步的进行自由化写作也是比较重要的。写完之后的...

黄仁勋对谈王坚:赞DeepSeek写出A+论文,称“嫉妒年轻人”

黄仁勋对谈王坚:赞DeepSeek写出A+论文,称“嫉妒年轻人”

“我甚至有点嫉妒我们的年轻一代。”黄仁勋表示,出生在这一代的年轻人会成为人工智能的原住民。7月17日上午,在链博会先进制造主题活动现场,英伟达公司创始人兼CEO黄仁勋与之江实验室主任、阿里云创始人王坚...

DeepSeek评温瑞安笔下十大侠客:萧秋水第三,李布衣第八

DeepSeek评温瑞安笔下十大侠客:萧秋水第三,李布衣第八

  温瑞安的侠义精神以“侠之小者为邻为友”为核心,强调平凡个体的勇毅与担当,而非宏大家国叙事。他笔下的侠者多具人性瑕疵,却在关键时刻以行动诠释“知其不可为而义所当为”的抉择。以下十大人物依其...

DeepSeek 本地安装指南(电脑版完整版)

DeepSeek 本地安装指南(电脑版完整版)

在当今数字化时代,人工智能技术蓬勃发展,大语言模型如 DeepSeek 展现出了强大的能力,能够为我们在工作、学习等诸多场景提供高效的帮助。对于一些对数据隐私有较高要求,或者希望在...