立足娱乐圈·争做八卦帝!

徽声在线

OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启

来源:未知 作者:佚名 发布时间:2026-09-04 11:56:34

北京时间9月4日凌晨,OpenAI正式推出其最新一代旗舰级大模型——GPT-6 Astra。在开发者社区发布的公告中,OpenAI将这款模型定义为“当前全球智能水平最高且对齐能力最强的模型”。作为继GPT-5系列之后的重大升级,GPT-6 Astra不仅是OpenAI首次采用“Astra”作为旗舰模型后缀的尝试,更标志着公司在通用人工智能(AGI)领域迈出了关键一步。OpenAI联合创始人兼总裁格雷格・布罗克曼在发布会上直言:“AGI时代已经到来。”

根据OpenAI公布的滚动部署计划,GPT-6 Astra将分阶段开放使用:即日起,模型将率先向“可信访问”(Trusted Access)计划参与者及Daybreak网络安全项目中的企业用户开放;未来几天内,覆盖范围将扩展至ChatGPT Plus、Pro、Business和Enterprise订阅用户;同时,模型将通过OpenAI API和亚马逊AWS平台向全球开发者提供服务。

相较于上一代GPT-5.6Sol,GPT-6 Astra在数学推理、网络安全、计算机操作和科学研究等核心领域实现了质的飞跃。OpenAI官方技术文档显示,这款模型整合了多年来在预训练、强化学习及对齐技术上的研究成果,其核心突破集中在智能体执行能力和深度推理能力两大维度,为复杂任务处理提供了更强大的支持。

<


官方测试数据显示,在衡量自主科学研究能力的Terminal-BenchScience0.1基准测试中,GPT-6 Astra以64.6%的得分显著领先于Anthropic两天前发布的Claude Fable5.1(52.6%),且在同等任务下,其API成本较Claude Fable5.1低约31%。即便在更低成本设置下,Astra仍能保持61.1%的得分,远超GPT-5.6Sol的最佳表现(22.4%),同时成本降低约27%。在终端编程能力测试Terminal-Bench4.0中,Astra以57.9%的得分再次超越Claude Fable5.1(55.8%)和GPT-5.6Sol(37.3%),展现出强大的代码生成能力。


Frontier Math Tier4(v2)测试

在被誉为“数学领域最难基准之一”的Frontier Math Tier4(v2)测试中,GPT-6 Astra取得了97.6%的惊人成绩,而Claude Fable5.1和Claude Fable5仅并列获得87.8%,上一代Opus5的得分更是低至73.2%。这一结果不仅证明了Astra在数学推理上的绝对优势,更凸显了其在解决复杂数学问题上的突破性进展。

OpenAI官方透露,GPT-6 Astra已在数学领域取得两项重要理论成果,包括在素数间隔研究中的新发现。尤为值得一提的是,在衡量模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra以99.9%的接近满分成绩碾压对手(GPT-5.6Sol仅为7.8%),实现了短短一代模型间十余倍的性能提升,为通用人工智能的发展奠定了坚实基础。

计算机操作与任务自动化能力的显著提升,使GPT-6 Astra真正具备了“替代人类完成工作”的潜力。在OSWorld2.0测试中,Astra以72.6%的得分超越GPT-5.6Sol(65.7%),且完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。这一改进意味着AI操作电脑已具备实际生产价值,用户无需再因速度问题而选择手动操作。


OSWorld2.0测试

在业务流程自动化测试Automation Bench中,GPT-6 Astra以41.4%的得分较GPT-5.6Sol(18.1%)翻倍有余,同时领先于Claude Fable5.1(31.4%)。官方演示视频显示,Astra可独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板及创建3D游戏场景等复杂任务。用户仅需提供最终目标,模型即可自动规划步骤、切换工具并修正错误,全程无需人工分步指令。


Automation Bench测试

定价方面,GPT-6 Astra的API调用价格为每百万输入Token 10美元、每百万输出Token 50美元,虽为GPT-5.6Sol当前价格的2.5倍,但与Claude Fable5.1基本持平。模型支持缓存读取享受90%折扣、缓存写入加收25%溢价,并提供五级推理强度调节功能(从low到max),用户可根据任务难度灵活平衡成本与深度。上下文窗口方面,Astra总上下文长度达105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日(略晚于Claude Fable5.1的2026年6月)。此外,模型还支持流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等功能。

OpenAI强调,GPT-6 Astra是公司“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面取得了实质性改进。为此,公司专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra的这一比例降至0%。这一改进对企业级应用至关重要,因为当模型被授权访问内部系统和数据时,能否严格遵守权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可用于发现软件漏洞,但禁止用于开发漏洞利用程序。

值得注意的是,短短一周内,除了OpenAI发布GPT-6 Astra外,Anthropic推出了Claude Fable5.1、谷歌发布了Gemini 3.8 Flash、Muse发布了Spark 1.3,头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,GPT-6 Astra并非全面碾压对手,其优势主要集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未与竞争对手拉开明显差距。这表明,当前AI市场竞争正朝着精细化、场景化方向深化,没有任何一家厂商能够在所有领域保持绝对领先,各家均在不同赛道上展现独特优势。

    责任编辑:
    比亚迪9分钟闪充引众怒,奇瑞蔚来等车企为何集体力挺换电?

    2026-04-10

    各位车友们,快搬好小板凳来吃瓜!最近新能源汽车领域那可是热闹非凡,热闹程度远超想象,相信关注电动汽车的朋友,肯定都刷到过比亚迪那波震撼操作吧?9分钟就能把电充满!比亚迪这一数 ... [详细]

    虎父无犬子!关键时刻力挽狂澜,2战狂轰65分,名记:21岁未来可期

    2026-04-11

    103比98!深圳队在客场挑战山西队的比赛中,尽管身处“魔鬼主场”且面临诸多困难与不利因素,但他们凭借着顽强的斗志和坚韧的毅力,与山西队展开了四节激烈的鏖战。场上局势紧张,双 ... [详细]

    威廉姆斯火线复出!雷霆西决祭出双保险迎战马刺

    2026-05-22

    雷霆锋线核心杰伦·威廉姆斯确认西部决赛复出,与状态火热的米切尔组成侧翼双星,球队阵容深度迎来关键升级。 ... [详细]

    CBA最新动态!广东引援计划全面启动,贝罗卡尔瞄准尤特赛文,萨姆纳续约在望

    2026-08-31

    广东宏远休赛期大变革,外籍主帅贝罗卡尔上任后引援计划全面启动,内线锁定尤特赛文,外线萨姆纳续约在望,新赛季阵容值得期待。 ... [详细]

    惊天逆转!黄友政混双决胜局力挽狂澜,双打天才再显神威

    2026-06-20

    北京时间6月19日,WTT球星挑战赛卢布尔雅那站混双1/4决赛,黄友政/陈熠3-2逆转户上隼辅/大藤沙月晋级四强,黄友政展现强大心理素质,双打项目成绩斐然。 ... [详细]

    图酷

    图说天下

    资讯排行

    首页 - 娱乐圈事 - 体育圈事 - 两性情感 - 星座命运 - 奇闻怪事 - 历史故事 - 科技资讯 - 图说天下 - 知识百科 - 图酷 - 娱乐八卦 - 开云体育登录_官网入口_安全便捷 - 乐鱼体育_乐鱼APP_体育赛事_在线娱乐平台
    电脑版 | 移动端
    Copyright © 2002-2019 徽声在线 版权所有
    删帖请联系邮箱:[email protected]