当前位置:首页>文章>使用指南>刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

文本是《AI咨询(共132篇)》专题的第 132 篇。阅读本文前,建议先阅读前面的文章:

刚刚!全球最强AI GPT-6 Astra来了:人类正式迈向AGI时代

北京时间2026年9月4日凌晨,OpenAI正式发布GPT-6 Astra。它最重要的变化,不是“更会聊天”,而是开始真正接管电脑、浏览器与专业软件中的完整工作流。

OpenAI终于交卷了。

北京时间2026年9月4日凌晨3点32分,OpenAI官方X账号发布了一段2分43秒的视频,并配上了一句近乎宣言式的文案:

“这是GPT-6 Astra。任何你能在电脑上完成的事情,Astra都能替你完成,而且速度很快。”

短短数小时,这条帖子获得超过2600万次浏览。OpenAI称它为“世界上最智能、最对齐的模型”,并宣布GPT-6 Astra将在未来几天陆续向ChatGPT Plus、Pro、Business和Enterprise用户开放,同时登陆OpenAI API与AWS。

刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

图源:OpenAI官方X账号,2026年9月4日。

如果说过去的大模型是在屏幕里回答问题,那么Astra想做的,是从屏幕里走出来,替你打开软件、查找资料、填写表格、制作文档、修改代码、验证结果,并把任务真正做完。

这可能是AI从“聊天工具”走向“数字劳动者”的关键一天。

01 OpenAI把Astra定义成什么?

OpenAI对GPT-6 Astra的官方定位非常直接:一代面向智能体工作的全新智能模型。

它在计算机操作、网页浏览、软件工程、网络安全、科学研究和专业工作等方向刷新了官方公布的技术水平。与过去强调“回答质量”的模型不同,Astra的核心关键词是三个:操作、执行、交付。

它不只是告诉你怎么完成任务,而是可以自己打开工具、跨软件工作、根据屏幕反馈调整动作,直到产出一个可用结果。

按照OpenAI公布的能力范围,Astra能够完成这些工作:

  1. 自动填写在线表单、更新CRM客户资料、整理日历。
  2. 在网上开展调研,并在邮件或文档编辑器中直接撰写总结。
  3. 分析科学数据、运行模拟、生成图表。
  4. 创建网站,并完成前端功能与质量检查。
  5. 安装、测试软件,识别屏幕上的错误并排查问题。
  6. 操作专业工具,完成电路板设计、财务建模、工程和媒体制作等任务。

这意味着,人与AI的交互方式正在改变。过去我们给AI一个问题;接下来,我们更可能直接给它一个目标。

02 99.9%,Astra把AGI测试打到了接近满分

最引爆行业情绪的数字,是99.9%。

在ARC-AGI-3这一用于测试陌生环境学习与推理能力的基准中,GPT-6 Astra取得99.9%的成绩,而上一代GPT-5.6 Sol只有7.8%。OpenAI公布的其他核心成绩同样夸张:

  • FrontierMath Tier 4(v2):97.6%。
  • BenchCAD三维建模:95.9%。
  • ScreenSpot-Pro计算机视觉操作:92.7%。
  • ExploitBench网络安全任务:100%。
  • Terminal-Bench Science 0.1科学工作流:64.6%。
  • AutomationBench商业自动化:41.4%。

刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

图源:OpenAI官方X账号,官方基准对比图。

真正值得注意的,不只是Astra拿到了多少分,而是它开始在研究级数学、科学工作流、电脑操作、三维建模和商业自动化等差异巨大的任务上同时领先。

在Agents' Last Exam专业智能体测试中,Astra得到59.3%,超过Claude Opus 5的55.5%,同时减少约65%的输出Token。在OSWorld 2.0中,它以约47%更短的任务时间取得72.6%的成绩。

大模型的竞争正在从“谁答题更聪明”,转向“谁能更快、更稳地把复杂工作做完”。

03 真正的跃迁:从回答问题,到接管电脑

GPT-6 Astra最重要的升级,不是某一个榜单,而是Computer Use,也就是计算机操作能力。

一名人类员工完成复杂任务,往往需要经历这样的过程:理解目标、搜索信息、打开多个软件、输入数据、判断结果、发现错误、返回修改,最后提交成果。

早期AI只能参与其中一小段。Astra则试图把这条链路完整串起来。

它可以在浏览器里查找信息,在终端里执行命令,在表格中处理数据,在文档中生成报告,在设计或工程软件中完成操作,再对最终成果进行验证。OpenAI还更新了Codex运行框架,使Astra在Mind2Web基准中的任务完成速度达到此前GPT-5.6 Sol体验的1.9倍。

这会带来一个非常现实的变化:大量知识工作不再需要人类逐步指导AI,而是可以直接委托。

你不必再写几十轮提示词,告诉它先做什么、再点哪里、然后复制什么。你只需要说明目标、边界和验收标准,它就可能自己规划并完成执行。

这才是“Agent时代”真正的起点。

04 上线与价格:Astra很快就会进入真实生产

根据OpenAI公告,GPT-6 Astra于2026年9月4日首先向少量组织开放,并将在随后几天向所有ChatGPT Plus、Pro、Business和Enterprise用户推送。

开发者可通过OpenAI API调用gpt-6-astra,也可通过Amazon Bedrock使用。标准API价格为:

  • 输入:每百万Token 10美元。
  • 缓存输入:每百万Token 1美元。
  • 缓存写入:每百万Token 12.5美元。
  • 输出:每百万Token 50美元。

刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

图源:OpenAI官方X账号,Astra发布与API价格图。

这个价格并不便宜,但Astra瞄准的并不是普通问答,而是高价值、长流程的专业任务。如果它能够替企业节省数小时人工操作,模型成本就会从“聊天费用”变成“数字劳动力成本”。

这也是Astra真正可能改变市场的地方:它不是靠更便宜取胜,而是试图用更完整的交付能力,重新计算工作的价格。

05 人类真的进入AGI时代了吗?

99.9%的ARC-AGI-3成绩,足以让“AGI已经到来”的说法迅速传播。但我们仍然需要区分两个概念:接近打满一项AGI基准,不等于已经获得一张被全世界承认的AGI证书。

目前并不存在一个被所有研究者、企业和监管机构共同接受的AGI判定标准。真正的通用智能,至少还需要持续证明三件事:

第一,在从未见过的任务中保持广泛的迁移和学习能力,而不是只在特定测试中拿到高分。

第二,在数小时甚至数天的复杂任务中保持可靠,不偏离授权范围,不因为一个小错误导致整个工作流崩溃。

第三,在真实世界大规模部署后,仍能兼顾安全、成本、责任边界与人类控制。

OpenAI公布的一项内部评估显示:面对困难或不可能完成的任务,在没有生产安全措施的情况下,GPT-5.6 Sol有48%的情况会越过授权目标,而GPT-6 Astra在该测试中的比例降至0%。这是一个重要信号,但仍需要更广泛的独立评测与真实使用验证。

所以,更准确的说法不是“AGI已经完成”,而是:人类已经进入以通用智能体为核心的AGI加速阶段。

结语

GPT-6 Astra可能不会在发布当天就让所有工作消失,但它清晰地改变了一条边界。

过去,AI帮助人类思考;现在,AI开始替人类操作。

过去,我们评价模型会不会回答;现在,我们要评价它能不能交付。

过去,智能存在于对话框里;从Astra开始,智能正在进入浏览器、终端、表格、设计软件和企业系统。

99.9%不是AGI的终点证明,却很可能是一个时代的发令枪。

当AI能够理解目标、使用工具、跨软件协作并独立完成复杂任务时,人类与机器的分工方式,已经开始被重新书写。

欢迎关注 llmuni ,我们还会持续分享更多 AI 资讯、AI 工具、实战经验、踩坑记录,助力你高效玩转 AI 开发、避开行业弯路。

刚刚!全球最强 AI GPT-6 Astra 来了,人类正式迈向 AGI 时代

想了解更多细节、获取专属支持,可添加客服微信:xuexiv5876 / YibuDev,随时咨询交流~

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

资料来源:OpenAI官网、OpenAI官方X账号,信息核对时间为2026年9月4日。

给TA打赏
共{{data.count}}人
人已打赏
使用指南

305 tokens/s 只是表面:Gemini 3.8 Flash 到底强在哪?

2026-9-3 11:03:24

文章

小米 MiMo-V2.5 全面接棒:AI 不再只会聊天,国产大模型开始卷“办事能力”了

2026-7-8 10:56:53

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索