面向数学形式化证明:Mistral AI 发布 Leanstral 1.5 低使用成本开源模型

文章报道了欧洲AI公司Mistral AI于2026年7月2日发布面向数学形式化证明语言Lean 4的开源模型Leanstral 1.5。该模型共有119B参数、6B激活参数,采用Apache-2.0许可。性能方面:在miniF2F验证集和测试集均实现100%完成率;在PutnamBench的672道Lean 4题目中解出587道;FATE基准上硕士级FATE-H达87%、博士级FATE-X达34%,均为最佳表现。Mistral强调其成本优势:在PutnamBench上的平均解题开支约4美元,远低于Seed-Prover(>300美元)和Aleph Prover(54–68美元)。在实际代码库测试中,模型标记了47个违规属性,确认11个为真实缺陷,其中5个此前未在GitHub上报告。

7 月 6 日消息,欧洲人工智能企业 Mistral AI 当地时间本月 2 日宣布推出面向数学形式化证明程序语言 Lean 4 的 Leanstral 1.5 模型。该模型总共拥有 119B 参数,激活 6B 参数,以 Apache-2.0 许可开源。

Mistral AI 表示,Leanstral 1.5 模型在 miniF2F 形式数学基准测试的验证集和测试集上均实现了 100% 的完成率;在 PutnamBench 数学竞赛问题集的 672 道 Lean 4 问题中可解决 587 道;对于 FATE 系列抽象代数基准测试,其在硕士级 FATE-H 上实现了 87% 的达成率,博士级 FATE-X 达成率则为 34%,均为最佳表现。

Mistral AI 强调了新模型的成本优势:对于 PutnamBench 数据集中的问题,Leanstral 1.5 的平均解决开支仅有 4 美元,而 Seed-Prover 1.5 需要 300 美元以上,Aleph Prover 也需要 54~68 美元。

而在实际场景应用中,Leanstral 1.5 在测试的 57 个代码库中标记了 47 个违规属性,其中 11 个指向了真实的缺陷,包括 5 个此前未在 GitHub 上被报告过的问题

版权声明:本站文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明出处!

评论加载中...