立足娱乐圈·争做八卦帝!

徽声在线

AGI时代真的来临了吗?深度解析技术突破与叙事博弈

来源:未知 作者:佚名 发布时间:2026-09-09 20:17:45


本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫

9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,公开宣称:"我们正式步入AGI时代。"这一论断引发了科技圈的广泛讨论。

仅仅三天后,英伟达CEO黄仁勋在社交平台进一步强化这一观点:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间就实现了AGI的突破。"

这场突如其来的AGI宣言,是否意味着人类智能的终极形态已然降临?

现实情况远比宣言复杂得多。

就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼仍公开表示,AGI是"定义极其模糊的概念",甚至一度想将其称为"营销术语"。

负责该模型关键评测的ARC Prize团队也明确声明:虽然GPT-6 Astra展现了通用能力的显著进步,但"我们并未宣称它就是AGI"。

这种矛盾的表述背后,折射出科技界对AGI定义的激烈争论。

当前AGI领域最核心的争议在于:AI究竟需要达到什么标准,才能被认定为真正跨越了AGI的门槛?

■高评分榜单能否等同于AGI?

GPT-6 Astra最引人注目的成就,是在ARC-AGI-3评测中取得99.9%的惊人成绩。

这项评测的独特之处在于,它不提供明确规则,而是将模型置于陌生环境,要求其自主判断目标、理解反馈并寻找解决方案。

这种设计正是为了测试AI最受质疑的能力:面对全新问题时能否实现现场学习。

99.9%的得分看似完美,但背后存在关键前提:

在ARC Prize提供的标准测试框架中,GPT-6 Astra实际得分为62.7%;只有接入OpenAI专用适配框架后,得分才飙升至99.9%。

后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续之前的探索经验。

虽然不能简单将这种优化视为"作弊"——毕竟现实中的AI系统本就需要记忆、工具和运行框架的支持——但62.7%与99.9%的差异揭示了重要事实:前者测量的是单个模型的基础能力,后者测量的是经过专门优化的完整系统。

将99.9%的测试得分直接等同于"99.9%的AGI",显然是概念混淆。更值得关注的是,GPT-6 Astra在其他评测中的表现:

  • 高难数学测试FrontierMath Tier 4:97.6%
  • 计算机操作测试OSWorld 2.0:72.6%
  • 真实办公流程测试AutomationBench:41.4%
  • 复杂专业任务测试Agents’Last Exam:59.3%

这些数据表明,当任务规则明确、答案可验证时,Astra已能接近甚至超越人类水平;但在流程冗长、目标模糊的现实场景中,其表现仍差强人意。

AI在封闭考试中的优异表现并非新鲜事。深蓝击败国际象棋冠军、Watson赢得《危险边缘》、AlphaGo走出"神之一手"时,都曾引发类似"通用智能即将到来"的猜测。

但规则明确、反馈即时、有自动裁判的测试环境,与复杂多变的现实世界存在本质差异。

■AGI:科技巨头们的不同解读

当前AGI领域最突出的问题,是缺乏统一定义。

OpenAI采用经济导向的定义:其在2018年公司章程中将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。

这一定义包含三个核心要素:广泛的工作覆盖范围、超越人类的表现水平、高度自主的运行能力。值得注意的是,意识、情感和人类式思维并未被纳入必要条件。

这种标准与OpenAI的产品路线高度契合:推理模型提升复杂任务处理能力,智能体强化工具调用和计算机操作,Codex等产品深入软件开发流程——所有努力都指向同一个目标:让AI承担更完整的工作,将模型能力转化为可规模化部署的生产力。

Anthropic对AGI的态度更为谨慎。CEO达里奥·阿莫迪认为该术语承载过多模糊含义,因此更倾向使用"强大的AI"这一表述。

在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统:

它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。

这幅图景包含能力、自主性和复制规模三个变量,三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。

基于这种判断,Anthropic将能力扩展与风险治理紧密结合,其战略重点可概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。

Google DeepMind则专注于AGI的测量标准。其2023年发布的《Levels of AGI》文章,以"性能"和"通用性"为双轴,将通用智能划分为"新兴""胜任""专家""大师"和"超人类"五个等级,并将自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。评估流程采用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。为完善这套体系,DeepMind还与Kaggle合作设立20万美元奖金,征集五个薄弱维度的测试方案。

这种思路将AGI从单一标签转化为可比较的认知能力图谱,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。

AGI的定义之争远不止是学术讨论。采用何种标准,就会将何种能力视为关键进展;将何种能力视为关键进展,就会决定公司的产品路线、资源配置和安全重点。定义看似在描述未来,实则在塑造未来。

■AGI之争:一场精心设计的叙事博弈

人类总是倾向于将技术革命想象为某个明确的瞬间:莱特兄弟的飞机离地、第一颗原子弹爆炸、阿波罗11号登月——历史需要标志性日期,也偏爱戏剧性画面。

回到当前的AGI争论,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"这两种表述,本质上是不同性质的论断。

前者是可被质疑和检验的技术结论:若称其为AGI,需说明采用的定义、满足的条件,以及在哪些测试中获得独立验证。

后者则是更具象征意义的时代判断。布罗克曼的"欢迎来到AGI时代"既制造了历史时刻,又保留了足够大的解释空间。

对模型公司和AI产业链而言,"AGI"首先是强大的产品叙事工具。模型能力的进步通常是零散而不均匀的,准确描述这些变化需要一长串评测、条件和限定语。而"AGI时代来了"这种表述,则能将技术升级压缩为历史节点,将算力投入、技术路线和商业前景整合进同一个故事。

对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值可能不亚于模型能力的重大突破。黄仁勋的表态就需放在这个框架下理解:

2025年9月,英伟达与OpenAI宣布达成战略合作意向。根据计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施落地,向OpenAI投资最高1000亿美元。虽然这只是一份意向书,后续可能调整,但在最初设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。

近期黄仁勋宣布"AGI已经到来"时,特意强调训练Astra所使用的英伟达计算系统,以及即将上线的GPU。这段话隐含的因果链清晰可见:大规模算力投入带来智能跃迁,因此更大规模的算力投入仍然必要。作为全球AI算力扩张的主要受益者,英伟达有充分理由强调这是一场时代转折。

事实上,这并非黄仁勋首次宣布AGI到来。2024年他曾表示,若将AGI定义为能通过几乎所有人类设计的考试,这一目标可能在五年内实现;2026年3月,他又在Lex Fridman的播客中直言:"我认为我们已经实现了AGI。"

由此可见,AGI不仅是等待技术跨越的终点,更是影响资本、市场、政策和产业预期的重要叙事资源。那么,AGI究竟如何才算真正到来?是一次模型发布、一项评测纪录,还是一家公司的宣告?

或许,这是一个所有人都身处其中、潜移默化的过程。正如OpenAI创始成员Andrej Karpathy所言:AGI不会带来陡然拐起的曲线,它会平滑地融入现有增长趋势,事后人们甚至找不到明确的拐点。

本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]

本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

    责任编辑:
    5.8亿美金门票收入!纽约尼克斯疯狂表现引爆全城,文班亚马面临终极挑战

    2026-06-08

    尼克斯队季后赛表现疯狂,门票收入创纪录高达5.8亿美金,文班亚马面临高压挑战,能否带领马刺队逆转? ... [详细]

    迪马济奥确认:米兰与科莫敲定里奇租借框架 买断条款存特殊条件

    2026-09-07

    转会专家迪马济奥披露,AC米兰与科莫就萨穆埃莱·里奇达成租借协议,交易包含选择性买断条款且薪资由科莫承担,交易完成需满足科莫中场球员离队条件。 ... [详细]

    世界杯决赛名哨正式退役!判阿根廷25犯规+5黄1红,拒听梅西投诉显权威

    2026-07-28

    46岁斯洛文尼亚裁判温契奇结束14年执法生涯,世界杯决赛控场表现获权威认可,详细解析关键判罚与争议瞬间。 ... [详细]

    数据占优却输球,海港vs铜梁龙全场控球七三开射门15-3

    2026-05-03

    中超第7轮,上海海港主场1-2不敌重庆铜梁龙,全场数据占优却未能赢球。 ... [详细]

    查洛巴自曝世界杯补招内幕:时代广场狂奔两小时 六年推文预言成真

    2026-06-22

    切尔西中卫查洛巴独家揭秘世界杯补招细节:在纽约时代广场逛街时错过图赫尔电话,重发2018年预言推文引发热议。详解与图赫尔特殊关系及切尔西生涯起伏。 ... [详细]

    图酷

    图说天下

    资讯排行

    首页 - 娱乐圈事 - 体育圈事 - 两性情感 - 星座命运 - 奇闻怪事 - 历史故事 - 科技资讯 - 图说天下 - 知识百科 - 图酷 - 娱乐八卦 - 开云体育登录_官网入口_安全便捷 - 乐鱼体育_乐鱼APP_体育赛事_在线娱乐平台
    电脑版 | 移动端
    Copyright © 2002-2019 徽声在线 版权所有
    删帖请联系邮箱:[email protected]