2026-05-10
拉齐奥迎战国际米兰前喜忧参半,吉戈特伤愈回归增强防线,扎卡尼缺阵或影响进攻火力。本文解析蓝鹰阵容变化及潜在战术调整。 ... [详细]
|
历经11年对AGI(通用人工智能)的不懈探索,OpenAI终于抛出震撼消息:AGI时代已然降临。 当地时间9月3日,OpenAI重磅发布新一代旗舰模型——GPT-6 Astra。在AI通用学习能力ARC-AGI-3测试中,这款模型最高斩获99.9%的惊人成绩。 OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)随即兴奋宣布:欢迎踏入AGI时代。 然而,在这耀眼的99.9%成绩背后,隐藏着一个关键细节:若切换至统一测试环境,其得分会从99.9%急剧下滑至62.7%。 回顾过去11年,OpenAI内部对AGI的定义频繁变动。首席执行官山姆·奥尔特曼甚至在几天前还直言,AGI不过是一个营销术语。 在收入、估值以及IPO速度被Anthropic全面超越的大背景下,OpenAI总裁此时高调宣布AGI,究竟是技术实现了质的飞跃,还是仅仅为了营销造势呢? GPT-6 Astra操纵电脑完成excel比赛(4倍速)视频来源:OpenAI 99.9%还是62.7%?GPT-6 Astra的AGI成绩单现双版本 OpenAI宣称GPT-6 Astra是其迄今为止“最智能、最对齐”的模型。 相较于此前版本,GPT-6 Astra的能力提升不再局限于聊天、写代码等单一任务,而是成功拓展至计算机操作、软件工程、专业工作以及网络安全等复杂领域。 OpenAI公布的数据显示,在电脑操作能力测试中,GPT-6 Astra得分达到72.6%,高于上一代GPT-5.6 Sol的65.7%;在专业工作自动化测试中,得分从18.1%大幅跃升至41.4%;在Terminal-Bench 4.0测试中,GPT-6 Astra得分57.9%,超越了Anthropic的Claude Fable 5.1。 网络安全能力的提升更是显著。 GPT-6 Astra在ExploitBench测试中斩获100%的成绩,成为OpenAI首个达到其Preparedness Framework中网络安全能力“关键”级别的模型。 OpenAI表示,在获得相应工具和权限后,GPT-6 Astra能够自主探寻此前未知的安全漏洞,并开发出新的利用方式,无需人类逐步指导。 ExploitBench 图片来源:OpenAI 但在所有成绩中,最受瞩目的当属ARC-AGI-3测试。 与数学、代码或知识问答不同,ARC-AGI-3测试的核心在于考察AI在面对全新环境时,能否通过探索、交互和试错,自行理解规则、明确目标并解决问题。 简单来讲,它测试的是AI能否“自主学会应对之策”。 在此次测试中,GPT-5.6 Sol的成绩仅为7.8%,而GPT-6 Astra最高达到了99.9%。测试机构ARC Prize Foundation表示,GPT-6 Astra在96%的测试关卡中,行动次数少于受测人类的中位数,行动效率已然达到甚至超越人类基准。 ARC-AGI-3 图片来源:OpenAI 也正是基于这项测试,布罗克曼认为GPT-6 Astra达到了AGI水平。 不过,GPT-6 Astra的AGI测试成绩存在明显矛盾。 GPT-6 Astra取得99.9%成绩的测试环境,主要依托Provider Adapter(供给适配层)框架。在这一模式下,GPT-6 Astra能够运用OpenAI专门设计的上下文管理机制,在连续操作之间保留内部推理状态,并对超长对话进行压缩,从而更充分地发挥模型能力,这相当于为GPT-6 Astra的测试“开了小灶”。 而在所有模型使用统一、中立的Standard Harness环境中,GPT-6 Astra的得分仅为62.7%。 测试机构认为,未来真正的AGI应具备在统一测试环境下解决ARC-AGI-3问题的能力。 ARC-AGI-3 图片来源:ARC Prize Foundation 在第三方机构Artificial Analysis的“智能指数4.1.1”测试中,GPT-6 Astra得分61.2,仅略高于GPT-5.6 Sol的60.9,低于Claude Fable 5.1的65.7和Claude Opus 5的63.1。 OpenAI至少5次修改AGI定义:超越人类、创造千亿美元利润、营销术语…… 2002年,DeepMind联合创始人Shane Legg提出AGI概念后,这一概念逐渐进入AI研究的主流视野。 过去几十年间,AI在国际象棋、围棋、图像识别、数学和编程等单项能力上多次超越人类,但这并不意味着机器已具备通用智能。 真正的AGI,关键在于“general”(通用)。 因此,一批研究者提出,判断AGI至少需同时考量能力强度和能力广度,自主性则是另一项需单独衡量的维度。 ARC测试创造者François Chollet认为,真正重要的并非AI已掌握多少技能。真正值得衡量的,是一个系统面对陌生任务时,以多高的效率获取新技能的能力,即泛化和学习能力。 然而,在OpenAI内部,AGI的定义却不断变化。
2015年底,OpenAI创立。山姆·奥尔特曼回忆称:“之所以选择在那个时间创办OpenAI,是因为我们坚信AGI有可能实现。”于是,OpenAI将公司的使命概括为“确保AGI造福全人类”,至今未变。 2018年,OpenAI在《章程》中给出了广为人知的定义版本:AGI是在大多数具有经济价值的工作上超越人类的高度自主系统。 2023年,OpenAI又将AGI概括为“总体上比人类更聪明的AI系统”。这一表述更为宏大,却也更难衡量——何为“总体上更聪明”,并无明确的验收标准。 2024年,OpenAI发布o1推理模型。当时,OpenAI员工Vahid Kazemi在X上发文:“我们已经实现了AGI”。他定义的AGI是“比大多数人在大多数任务上表现得更好”。 同年,OpenAI试图将通往AGI的道路拆分为五个等级:聊天、推理、行动、发明创新、组织工作。 但在OpenAI内部,AGI逐渐从一个技术概念,衍生出明确的经济门槛。 2023年,微软对OpenAI追加100亿美元融资协议规定,只有当OpenAI开发出的AI系统能够产生至少1000亿美元利润时,才被视为达到AGI门槛。 不过,2025年微软与OpenAI重新调整合作协议,规定OpenAI宣布实现AGI后,需经过独立专家小组验证。2026年4月,双方再次修改协议,取消了此前与AGI挂钩的重要合同安排。 在GPT-6 Astra发布会上,布罗克曼表示,“已经没有合同意义上的AGI触发条款了。”在他看来,AGI已从合同义务转变为“使命概念或精神概念”。 山姆·奥尔特曼本人对AGI的态度和预期也在持续变化。 2024年底,他曾认为AGI可能比外界预期更早到来。不到一年后,他又表示什么是AGI并不重要。今年8月26日,他接受采访时明确表示,OpenAI尚未达到AGI水平。 就在GPT-6 Astra发布的两天前的9月1日,奥尔特曼公开表示:“充其量,你可以说AGI是一个定义极为模糊的术语。我本来想说,它就像一个无关紧要的营销术语。” OpenAI的商业焦虑:急于为GPT-6 Astra贴上AGI标签 既然不存在公认标准,且没有了合同约束,为何OpenAI偏偏选择此时宣布“AGI来了”呢? 过去几年,OpenAI虽拥有ChatGPT这一全球最具影响力的AI产品,但在商业价值更高的企业市场,竞争格局已发生显著变化。 风投机构Menlo Ventures的调查显示,2023年,OpenAI在企业大模型支出方面占据约50%的份额,Anthropic仅为12%;到2025年,Anthropic的份额已升至40%,OpenAI则降至27%。 在编程这一AI最重要的商业化场景之一,Anthropic的优势更为明显:市场份额约54%,OpenAI约21%。Claude Code的流行成为Anthropic快速增长的重要推动力。 进入2026年,竞争压力进一步体现在收入和估值上。 7月底,Anthropic的ARR已超过650亿美元,相较于2025年底约90亿美元增长超过6倍;OpenAI ARR接近600亿美元。今年5月,Anthropic完成650亿美元融资后,估值达到9650亿美元,也超过了OpenAI此前的估值。 徽声在线甚至将GPT-6 Astra的发布视为OpenAI重新超越Anthropic的一次有力反击。 据媒体报道,OpenAI发布GPT-6 Astra,意在上市前重新确立技术领先地位。OpenAI最新估值达到8520亿美元,但仍处于高投入阶段。据《金融时报》披露,2025年OpenAI支出约340亿美元,收入约130亿美元,剔除一次性会计项目和部分非现金支出后仍亏损约80亿美元。 GPT-6 Astra发布后,OpenAI Pre-IPO衍生品(代号OAI)市值飙升21.6%,达1.48万亿美元。 没有统一“验收线”,谁有资格宣布AGI来了? 美国认知科学家、纽约大学心理学与神经科学荣誉退休教授加里・马库斯(Gary Marcus)在社交媒体上评论GPT-6 Astra时表示,格雷格・布罗克曼刻意模糊AGI的评判边界,期望外界不会察觉其中的漏洞。按照传统标准来看,这套模型并不符合AGI的定义。 2025年,由多名AI研究者和学者参与撰写的《AGI的定义》一文提出,AGI是能够达到甚至超过受过良好教育成年人所具备的认知广度与认知熟练度的人工智能。按照推理、记忆、感知等10个认知领域进行评估,不能仅依靠单一测试高分就宣称实现AGI。 加里・马库斯还指出,GPT-6 Astra在ARC AGI-3测试上取得的成绩固然出色,但即便这项测试名字带有AGI,也不能就此证明它就是通用人工智能。他推测,在开放式真实世界任务上,该模型还会暴露出大量问题。技术乐观派提前拿到了预览机会,持怀疑态度的研究者却没有。这是一套高明的营销策略,但往往容易产生误导。 有人工智能领域资深人士向《每日经济新闻》记者表示,GPT-6 Astra已经可以在部分困难任务上达到甚至超过专家水平,但尚未稳定覆盖“大多数具有经济价值的工作”。ARC-AGI-3接近满分尤其说明AGI判断不能由单项基准决定。 他对“AGI已经实现”的技术结论持审慎态度,但基本认同人工智能进入可以投入广泛的行业应用规模化闭环落地的阶段。 上海财经大学特聘教授胡延平向每经记者表示,GPT-6 Astra局部个别小目标接近或达到了AGI水平,但还不能说AGI已经完全到来。按照OpenAI所定义的AGI,首先“高度自主”这一点就没有实现。 判断是否达到AGI可以从六个维度考量,一是知识维度、二是泛化维度、三是任务维度、四是行动维度、五是感知维度、六是学习维度。这六个维度都需要逐步建立非常系统的基准测试体系和工程化的动态测试框架,才能对AGI的进展进行持续的“可视化”。 不过,胡延平也表示,对于AGI,业界没有特别清晰和一致的共识,不过有被广泛引用的模糊内涵:AI在所有认知任务中达到甚至超越人类表现的能力。问题是达到还是超过?达到人类平均水平还是各领域顶级专家水平?因此,AGI是AI行业模糊的共同目标。 上述人工智能资深人士告诉每经记者,目前业内对AGI没有统一定义,也没有一条得到普遍认可的“验收线”。“前沿人工智能机构正在向更通用、更自主、更强大的智能系统靠拢,但AGI并不是整个行业统一使用的最终目标。” 他认为,在巨额算力投入、激烈模型竞争和上市预期同时存在的情况下,把技术突破描述为“AGI时代到来”,显然有利于强化技术领导者形象、增强融资能力和提升客户预期。但是,AGI标签本身不会自动转化为利润,商业化最终取决于单位任务成本、可靠性和能够替代多少真实工作。“企业最终购买的是可稳定完成的工作,而不是某个模型是否获得了AGI称号。” 免责声明:本文内容与数据仅供参考,不构成投资建议,使用前请核实。据此操作,风险自担。 |
Sonos Play首发深度体验:揭秘Wi-Fi、蓝牙双模音响的独特魅力
SpaceX本周或提交IPO申请,航天领域迎资本盛宴
马斯克庭审揭秘:OpenAI往事浮出水面 谷歌创始人关系破裂
波音空客全球市场占有率各多少,空客和波音的乘坐感受哪个好?
国际空间站宇航员接紧急指令,随时准备撤离
SK海力士员工人均奖金610万?官方回应来了
腾讯云放大招!DeepSeek - V4系列模型价格大跳水,最高降幅97.5% 2026-05-10
拉齐奥迎战国际米兰前喜忧参半,吉戈特伤愈回归增强防线,扎卡尼缺阵或影响进攻火力。本文解析蓝鹰阵容变化及潜在战术调整。 ... [详细]
2026-07-27
美加墨世界杯期间,千问AI凭借精准预测和贴心陪伴,成为球迷们的观赛好搭档。从理性分析到趣味互动,千问AI展现了科技与体育的完美融合。 ... [详细]
2026-07-10
2026年NBA夏季联赛赛程公布,7月9日至19日在拉斯维加斯举行,76场比赛精彩纷呈,ESPN与Prime Video全球转播,新秀AJ·戴班萨成最大看点。 ... [详细]
2026-07-06
NBA夏季联赛加州经典赛,篮网89-69大胜雄鹿。萨利斯15分6板6助引领篮网胜利,波士顿18分难救主。 ... [详细]
2026-03-29
国足2-0战胜库拉索,邵佳一赛前动员强调态度决定一切。他传承米卢理念,有望带领国足再冲世界杯。未来与喀麦隆的比赛,球迷期待国足发挥出色。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
和尚也就是大家口中的僧人、出家人,据说在兴起之初,和尚是一个尊称,意思为师的意思,和为三
折耳根是一种在南方很常见的植物,北方人可能很少人知道折耳根是什么。下面就让我们先来
春天万物复苏,一片生机盎然,是时候出去舒活筋骨,抖擞精神,游览一下祖国的大好河山了。其实