OpenAI o3模型测试成绩现实性受质疑，基准测试分差异引发关注

摘要：【#OpenAIo3模型基准测试成绩遭质疑##OpenAIo3基准测试实测分数远不及宣称#】OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异，引发了外界对其公司透明度和模型测试实践的质疑。

【#OpenAIo3模型基准测试成绩遭质疑##OpenAIo3基准测试实测分数远不及宣称#】OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异，引发了外界对其公司透明度和模型测试实践的质疑。

去年 12 月，OpenAI 首次发布 o3 模型时宣称，该模型能够在 FrontierMath 这一极具挑战性的数学问题集上正确回答超过四分之一的问题。这一成绩远远超过了竞争对手 —— 排名第二的模型仅能正确回答约 2% 的 FrontierMath 问题。OpenAI 首席研究官 Mark Chen 在直播中表示：“目前市场上所有其他产品在 FrontierMath 上的成绩都不足 2%，而我们在内部测试中，使用 o3 模型在激进的测试时计算设置下，能够达到超过 25% 的正确率。”

然而，这一高分似乎是一个上限值，是通过一个计算资源更为强大的 o3 模型版本实现的，而并非是 OpenAI 上周公开发布的版本。负责 FrontierMath 的 Epoch 研究所于上周五公布了其对 o3 模型的独立基准测试结果，发现 o3 的得分仅为约 10%，远低于 OpenAI 此前声称的最高分数。

这并不意味着 OpenAI 故意撒谎，该公司在 12 月份公布的基准测试结果中也包含了一个与 Epoch 测试结果相符的较低分数。Epoch 还指出，其测试设置可能与 OpenAI 有所不同，并且其评估使用了更新版本的 FrontierMath。Epoch 在报告中写道：“我们与 OpenAI 的结果差异可能是因为 OpenAI 在内部评估时使用了更强大的计算框架、更多的测试时计算资源，或者是因为这些结果是在 FrontierMath 的不同子集上运行的（例如 2024 年 11 月 26 日版本的 180 个问题与 2025 年 2 月 28 日私有版本的 290 个问题）。”（IT之家）