OpenAI发布最新推理模型o3-mini

OpenAI于周五推出了新的AI”推理”模型o3-mini，这是该公司o系列推理模型家族的最新成员。

OpenAI此前在12月份就预告过这个模型，同时还展示了一个能力更强的系统o3。此次发布恰逢OpenAI面临诸多机遇与挑战的关键时刻。

目前，OpenAI正在应对外界对其在AI竞赛中可能落后于DeepSeek等中国企业的质疑。与此同时，该公司正在努力巩固与华盛顿的关系，推进其雄心勃勃的数据中心项目，据报道还在为史上最大规模融资之一做准备。

在这样的背景下，o3-mini应运而生。OpenAI将这款新模型定位为既”强大”又”实惠”的选择。

OpenAI发言人在接受采访时表示：”今天的发布标志着[…]在实现我们使先进AI更易获取的使命道路上迈出的重要一步。”

更高效的推理能力

与大多数大语言模型不同，o3-mini这样的推理模型在输出结果之前会进行彻底的事实核查。这种方式可以帮助模型避免一些常见的错误。虽然这些推理模型需要更多时间得出解决方案，但回报是它们在物理等领域往往更可靠——尽管仍非完美。

o3-mini专门针对STEM问题进行了优化，特别是在编程、数学和科学领域。OpenAI表示，该模型在能力上基本与o1系列（o1和o1-mini）相当，但运行更快，成本更低。

据公司称，外部测试者在超过一半的情况下更倾向于选择o3-mini的答案而非o1-mini。在A/B测试中，o3-mini在处理”复杂的现实问题”时，”重大错误”比o1-mini减少了39%，同时能提供更清晰的回答，响应速度提升了约24%。

部署和定价详情

o3-mini从周五开始通过ChatGPT向所有用户开放，但ChatGPT Plus和Team计划的付费用户每天可获得更高的150次查询限制。ChatGPT Pro订阅者将获得无限访问权限。一周后，o3-mini将向ChatGPT Enterprise和ChatGPT Edu用户开放。

付费计划用户可以通过ChatGPT的下拉菜单选择o3-mini。免费用户可以点击聊天栏中的新”推理”按钮，或让ChatGPT”重新生成”答案。

从周五开始，o3-mini也将通过OpenAI的API向特定开发者开放，但初期不支持图像分析。开发者可以根据使用场景和延迟需求选择”推理努力程度”（低、中、高）。

在定价方面，o3-mini的缓存输入令牌费用为每百万个0.55美元，输出令牌为每百万个4.40美元（约一百万个令牌相当于75万个词）。这比o1-mini便宜63%，与DeepSeek的R1推理模型定价相当具有竞争力。

性能与局限性

需要说明的是，o3-mini并非OpenAI迄今最强大的模型，也并不是在所有基准测试中都超越了DeepSeek的R1推理模型。

o3-mini在AIME 2024（一个测试模型理解和响应复杂指令能力的测试）上确实超过了R1，但仅限于高推理努力程度设置下。在编程相关的SWE-bench Verified测试中也略胜一筹（高出0.1分），同样需要在高推理努力程度下才能实现。在低推理努力程度设置下，o3-mini在测试博士级物理、生物和化学问题的GPQA Diamond上落后于R1。

不过，o3-mini确实能以具有竞争力的低成本和延迟来回答许多查询。OpenAI在其公告中详细比较了它与o1系列的表现，并强调了其在安全性方面的优势。

注：文中涉及的AI服务测试基于ChatShare技术平台完成，该平台提供ChatGPT/Claude/Midjourney等AI服务的国内支持，访问服务介绍页