Loading...
AI新浪潮观察 14min read 大招憋出来了!OpenAI发布最强推理模型o1,它真的会思考,但API比4o贵好几倍 Founder Park 2026/09/28 摘要 双版本发布,即日可用。 本文首发于 Founder Park 公众号 · 2024 年 9 月 13 日 OpenAI 的推理模型,也就是期待已久的 Strawberry 发布! 9 月 13 日凌晨,OpenAI 宣布,正式发布一款 OpenAI o1-preview 的推理模型,同时发布的还有一个更小、成本更低的版本——o1 mini。 OpenAI 将此次发布称为「预览版」,强调 o1 仍处于早期阶段。 OpenAI 的 API 负责人发文称:「如果你过去有个产品想法,当时的模型不太行,不够智能,现在你再试试」。 在权限开放方面,OpenAI 采取了分阶段推广策略。 ChatGPT Plus 和 Team 用户可以立即访问 o1-preview 和 o1-mini。 Enterprise 和 Edu 用户将在下周获得访问权。 API 使用等级 5(已消费 1,000 美元且自首次付款以来已超过 30 天)的开发者,今日起可使用这两款模型,速率限制为 20 RPM。 OpenAI 还计划在未来向所有 ChatGPT 的免费用户开放 o1-mini 的使用权。 对于开发者而言,通过 API 使用 o1 的成本不便宜。o1-preview 的定价为每百万输入 token 15 美元,每百万输出 token 60 美元,远高于 GPT-4o 的定价(输入 5 美元/百万 token,输出 15 美元/百万 token)。 点击关注,每天更新深度 AI 行业洞察 01 OpenAI 员工: o1 重新定义了游戏规则 在 OpenAI 员工的推文中,可以看到他们对于 o1 能力的赞许,以及一些关键的能力升级要点。 OpenAI API 负责人 Michelle Pokrass 推文: o1-preview 和 o1-mini 模型已经上线。它们是我们目前为止在推理方面表现最佳的模型,我们相信它们将为 API 解锁全新的应用场景。 如果你有一个产品创意,但时机尚未成熟,模型还不够智能——不妨再次尝试。 这些新模型并不能完全替代 4o。 你需要以不同的方式进行提示,并以新的方式构建你的应用程序,但我们认为它们将有助于缩小智能差距,帮助你开发出更好的产品。 (现在为 API 第五级用户推出,用户也将很快可以使用) Greg Brockman 的推文: OpenAI o1—我们第一个通过强化学习训练的模型,在回答问题之前会深入思考。团队的工作令人非常自豪! 这是一个充满巨大机遇的新范式。这一点在定量上(例如推理指标已经显著提升)和定性上(例如忠实的思维链使模型易于理解,因为它允许你以简单的英语「阅读模型的思维」)都很明显。 可以这样理解,我们的模型进行系统 I 思考,而思维链则解锁了系统 II 思考。人们已经发现,提示模型「一步步思考」可以提升性能。但是通过试错来训练模型,从头到尾这样做,则更为可靠,并且——正如我们在围棋或 Dota 等游戏中所见——可以产生极其令人印象深刻的结果。 o1 技术仍处于早期阶段。它提供了新的安全机会,我们正在积极探索,包括可靠性、幻觉和对抗攻击者的鲁棒性。例如,我们已经看到,通过思维链让模型推理策略,我们的安全指标有了很大的提升。 其准确性也有很大的改进空间——例如,从我们的发布帖子来看,我们的模型在今年的编程奥林匹克竞赛(IOI)中,在人类条件下(每个问题 50 次提交)取得了第 49 百分位/213 分。但是,如果允许模型问题提交 10000 次,模型取得了 32.14 分——超过了金牌门槛。因此,模型能够产生比最初看起来更大的输出。 OpenAI 研究员 Jason Wei 的推文: o1 是一个在给出最终答案之前会进行思考的模型。用我自己的话来描述,以下是对人工智能领域最大的更新: 不要仅仅通过提示来执行思维链,而是使用强化学习训练模型以更好地进行思维链。 在深度学习的历史中,我们一直试图扩展训练计算,但思维链是一种自适应计算,也可以在推理时进行扩展。 AIME 和 GPQA 的结果非常强大,但这并不一定转化为用户可以感受到的东西。即使是工作的人,也很难找到 GPT-4o 失败、o1 表现良好并且我可以评分的提示切片。但当你找到这样的提示时,o1 感觉完全像魔法一样。我们都需要找到更难的提示。 使用人类语言进行思维链的 AI 模型在很多方面都很棒。模型做了很多类似人类的事情,比如将棘手的步骤分解为更简单的步骤,识别和纠正错误,以及尝试不同的方法。强烈鼓励每个人都去看看博客文章中的思维链例子。 游戏规则已经完全被重新定义了。 0