MiniMax的M3旗舰机型及其指示器令人印象深刻,但也引发了褒贬不一的争议
大型语言模型的竞争持续白热化,人工智能初创公司MiniMax近日发布了其新款旗舰模型M3。根据技术报告中的基准测试结果,该模型表现令人印象深刻:在模拟真实世界软件工程任务的测试中得分达到59%,超越了GPT-5.5,并接近Opus4.7的水平。 该模型还具备百万令牌级上下文处理能力和原生多模态能力。然而,尽管取得了这些显著的技术成就,此次发布仍引发了开发者社区的强烈反响,尤其在中国网络论坛上出现了尖锐的批评声浪。
质疑的主要焦点集中在评估方法上。 技术细节显示,M3在编码能力测试中采用了竞争对手模型“Claude Code”作为评估框架。虽然使用现有工具链进行模型评估是常见做法,但批评者指出,MiniMax本质上是将自家模型与竞争对手的框架进行对比测试,并直接宣称取得了高分,还在公开宣传中将自身与该竞争对手进行比较。 许多开发者认为这种做法不诚实,因为这使得人们难以区分模型本身的原生能力与框架提供的增强效果。

另一个争议点在于其开源承诺的诚意。与其他发布包含完整权重的开源模型的供应商不同,MiniMax既未披露M3的规模,也未提供其权重。 该公司仅表示将在十天内将该模型开源,发布初期仅提供API访问权限。鉴于可重现性和可验证性是开源社区的核心价值,一边宣传开源一边隐瞒权重——尽管从商业角度来看可以理解——却疏远了那些期待透明度和实用性的开发者社区。

让重度用户最感到沮丧的是计费规则的突然变更。此前,MiniMax 以其宽松的使用限制而闻名,仅按请求次数限制,且没有每月代币上限。随着 M3 的发布,该公司引入了一种基于代币的新套餐,按总使用量收费。 尽管官方宣称 Plus 套餐提供了极高的令牌性价比,但重度用户——尤其是处理百万令牌级上下文的用户——发现每次调用都会消耗大量令牌,导致套餐配额迅速耗尽。这引发了老用户的广泛抱怨。
抛开运营层面的争议不谈,M3 在架构层面确实具备显著的创新。它引入了一种名为 MSA(MiniMax Sparse Attention)的自研稀疏注意力机制,通过对键值对应用高精度块划分和稀疏化处理,有效缓解了传统 Transformer 模型中计算量呈二次方级增长的问题。 在底层运算符层面,该模型采用了一种新型聚合计算方法,提升了内存访问的连续性,其速度比开源的 Flash-Sparse-Attention 快四倍。 因此,在百万令牌的上下文场景下,M3 将前向传播和解码速度分别提升了 9 倍和 15 倍,并将单令牌的计算量降至上一代模型的一半。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
大型语言模型的竞争持续白热化,人工智能初创公司MiniMax近日发布了其新款旗舰模型M3。根据技术报告中的基准测试结果,该模型表现令人印象深刻:在模拟真实世界软件工程任务的测试中得分达到59%,超越了GPT-5.5,并接近Opus4.7的水平。 该模型还具备百万令牌级上下文处理能力和原生多模态能力。然而,尽管取得了这些显著的技术成就,此次发布仍引发了开发者社区的强烈反响,尤其在中国网络论坛上出现了尖锐的批评声浪。
质疑的主要焦点集中在评估方法上。 技术细节显示,M3在编码能力测试中采用了竞争对手模型“Claude Code”作为评估框架。虽然使用现有工具链进行模型评估是常见做法,但批评者指出,MiniMax本质上是将自家模型与竞争对手的框架进行对比测试,并直接宣称取得了高分,还在公开宣传中将自身与该竞争对手进行比较。 许多开发者认为这种做法不诚实,因为这使得人们难以区分模型本身的原生能力与框架提供的增强效果。

另一个争议点在于其开源承诺的诚意。与其他发布包含完整权重的开源模型的供应商不同,MiniMax既未披露M3的规模,也未提供其权重。 该公司仅表示将在十天内将该模型开源,发布初期仅提供API访问权限。鉴于可重现性和可验证性是开源社区的核心价值,一边宣传开源一边隐瞒权重——尽管从商业角度来看可以理解——却疏远了那些期待透明度和实用性的开发者社区。

让重度用户最感到沮丧的是计费规则的突然变更。此前,MiniMax 以其宽松的使用限制而闻名,仅按请求次数限制,且没有每月代币上限。随着 M3 的发布,该公司引入了一种基于代币的新套餐,按总使用量收费。 尽管官方宣称 Plus 套餐提供了极高的令牌性价比,但重度用户——尤其是处理百万令牌级上下文的用户——发现每次调用都会消耗大量令牌,导致套餐配额迅速耗尽。这引发了老用户的广泛抱怨。
抛开运营层面的争议不谈,M3 在架构层面确实具备显著的创新。它引入了一种名为 MSA(MiniMax Sparse Attention)的自研稀疏注意力机制,通过对键值对应用高精度块划分和稀疏化处理,有效缓解了传统 Transformer 模型中计算量呈二次方级增长的问题。 在底层运算符层面,该模型采用了一种新型聚合计算方法,提升了内存访问的连续性,其速度比开源的 Flash-Sparse-Attention 快四倍。 因此,在百万令牌的上下文场景下,M3 将前向传播和解码速度分别提升了 9 倍和 15 倍,并将单令牌的计算量降至上一代模型的一半。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






