OpenAI发布最强推理模型o1:可解答83%的奥数问题

北京时间9月13日凌晨,美国OpenAI公司发布全新模型技术产品o1,包括两种版本o1-preview和o1-mini,前者具有高级推理功能,在推理数学、编程、科学等问题的能力上有显著提高,性能接近理化生博士水平;后者则是一款更小巧、专为代码生成优化的模型。

这就是此前传言中高级推理能力强大模型的“Strawberry”项目。也有人分析称,o1是Orion大模型简称。

OpenAI表示,对于复杂推理任务而言,新模型代表着AI能力的崭新水平,因此值得将计数重置为1,给它一个有别于“GPT-4”系列的全新名号。同时,这也预示着,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型重要到来。

需要注意的是,o1目前的聊天体验还比较基础。不同于其前身GPT-4o,o1目前无法浏览网页或处理文件分析功能。尽管它具备图像分析功能,但该功能暂时关闭,等待进一步测试。此外,o1还有消息量限制——目前o1-preview每周限额30条、o1-mini每周50条。

即日起,o1-preview 和 o1-mini两个版本已经在ChatGPT Plus/Team和API接口渠道上线,企业和教育用户将于下周初获得优先访问权限。

OpenAI CEO奥尔特曼(Sam Altman)表示,“这是我们迄今为止功能最强大、最一致的模型系列 o1,也是迄今为止我们最好的推理模型。虽然o1仍然存在缺陷并有限,但使用时的感觉依然更加令人印象深刻。”

具体来看,OpenAIo1可以解决比以前GPT时期的科学、编码和数学模型更难的问题。

OpenAI的研究负责人Jerry Tworek透露,o1模型背后的训练与之前的产品有着根本性的区别。之前的GPT模型旨在模仿其训练数据中的模式,而o1的训练旨在让其独立解决问题。在强化学习的过程中,使用奖励和惩罚机制来“教育”AI使用“思维链”来处理问题,就像人类习得拆解、分析问题的方式一样。

o1上线之后,现在ChatGPT可以在回答问题前先仔细思考,而不是立即脱口而出答案。就像人类大脑的系统1和系统2,ChatGPT已经从仅使用系统1(快速、自动、直观、易出错)进化到了可使用系统2思维(缓慢、深思熟虑、有意识、可靠)。这让它能够解决以前无法解决的问题。

所谓推理大模型,就是AI会在回答之前花更多时间进行思考,就像人类思考解决问题的过程一样,而非预测单词生成的序列。比如通过文字点开AI思考的过程,还会出现AI表示“我在思考这个事情这么做行不行”、“啊时间不够了得尽快给出答案”等。OpenAI确认,这里展示的并不是原始的思维链,而是“模型生成的摘要”,公司也坦率承认这里有保持“竞争优势”的因素。

根据测试,在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅正确解答了13%的问题,而o1模型正确解答了83%的问题。而在编程能力比赛Codeforces中,o1模型拿到89%百分位的成绩,而GPT-4o只有11%。

OpenAI发现,随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1的性能持续提高。而且扩展这种方法的限制与大模型预训练的限制有很大不同,OpenAI也还在继续研究。

OpenAI技术文件称,实验结果表明:o1超越了人类专家的表现,性能接近理科博士水平,成为第一个在该基准测试中做到这一点的模型。而在下一个更新的版本中,AI在物理、化学和生物学的挑战性基准测试中,表现能够与博士生水平类似。

除了OpenAI o1-preview外,OpenAI今晨也同步推出了o1-mini模型,更快、更便宜,定价也比preview版本降低了80%,适用于需要推理但不需要广泛世界知识的场景。

很显然,尽管新的OpenAI o1还不具备更全面问题解决能力,但显著提升的推理能力使其在科学、编程、数学等专业领域具备了更大的用途,以及 AI Agent 相关技术的下限和上限被整体拉高,大幅提升科学研究和生产端的能力,对于消费端来说意义不算太大。

英伟达首席科学家Jim Fan表示,新的o1需要消耗更大的算力和数据,并且能够形成数据飞轮效应,正确的答案及其思考过程可以成为很好的训练数据。从而不断改进推理核心,类似AlphaGo的价值网络随着MCTS生成更多精炼数据而改进。

天风国际称,OpenAI o1系列模型大幅增强推理能力,并宣布新的Scaling范式:通过RL解锁Test time compute(推理时间)。

此外,9月11日彭博社报道称,OpenAI正在商谈以1500亿美元(约合10675.35亿元,1.07万亿元)的估值进行新一轮融资,有望从投资者那里筹集65亿美元,投资方包括苹果、英伟达、微软等。同时,OpenAI还在谈判以循环信贷安排的形式从银行借款50亿美元。

成立于2015年的OpenAI,一直处于科技行业向 AI 快速转变的中心,其发布的聊天机器人产品ChatGPT于2022年首次亮相,引发全球 AI 投资热潮。OpenAI首席财务官Sarah Friar近日在内部备忘录中表示,新一轮融资将支持公司对计算能力和其他运营费用的需求。她强调,该公司的目标是允许员工在今年晚些时候的收购要约中出售部分股份。

文章来源于网络。发布者:至诚财经网,转转请注明出处:https://www.nbdtoutiao.com/2024/09/14/34074.html

(0)
至诚财经网的头像至诚财经网
上一篇 2024 年 9 月 14 日 上午9:29
下一篇 2024 年 9 月 14 日 上午10:30

相关推荐

  • 继对商家调整后,腾讯视频号电商团队400人或临集体解散?

    文|罗曾 实习生 于琪 腾讯旗下的视频号电商团队或将面临重大变革? 日前,有消息称,腾讯视频号电商团队(交易基建部)的400名员工将在未来两个月内全部解散,而业务的后续管理将由微信团队负责人张晓龙接手。此外,有消息透露,腾讯内部尚未确定最终策略,未来可能会引入人工智能(AI)技术来与商家进行更高效的对接。 对此,接近腾讯广告的知情人士向媒体透露,基于业务发展…

    2024 年 7 月 19 日
    00
  • “换皮”上线 小游戏市场的灰色生意

    上市游戏企业陆续交出了上半年的业绩成绩单,对于正在布局和未来的项目规划,北京商报记者注意到了“小游戏”这一关键词,据不完全统计,40余家上市游戏企业中,半数以上提到了对小游戏市场的看好。公开数据显示,仅微信端的小游戏用户就已达10亿,月活用户5亿,用户使用时长持续增长,过去一年有240多款小游戏季度流水超过千万。 然而,欣欣向荣的发展背后,小游戏市场也暴露出…

    2024 年 9 月 9 日
    00
  • 上半年净赚70.79亿,暴增4倍!长城杀回来了:毛利率创7年新高

    曾经的“经营之王”长城汽车又杀回来了。 8月29日,长城汽车披露了其半年报。在2024年上半年,长城汽车实现营业收入914.29亿元,同比增长30.67%;而净利润达到了70.79亿元,同比暴增419.99%。这也是今年利润增长最多的车企。对于净利润的变化,长城汽车对此解释说,净利润增加的主要原因是公司实现海外销售增长、国内产品结构进一步优化。但实际上,还有…

    2024 年 8 月 30 日
    00
  • 苏宁818大促来了,线上线下服务迎多项升级

    8月1日,国家发改委在新闻发布会上指出,下一步将把促消费放在更加突出的位置,促进汽车、家电等大宗商品消费。作为家电行业重要力量,苏宁易购积极响应政策号召,全面启动818大促,以更大价格优惠、更优产品供给、更快换新服务,全力支持家电以旧换新,推动绿色、智能、健康产品普及。在服务举措方面,今年818,苏宁易购加大双线服务升级力度,以精细化服务深度融入用户生活、丰…

    2024 年 8 月 2 日
    00

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信