炸了!我连夜实测GPT-6 Astra,直接瘫在沙发上
今天早上睁眼,就看到奥特曼发消息说Pro能用GPT-6了。
我心想:关我Plus用户鸟事儿?
结果奥特曼做了个手势,我电脑立马弹窗——GPT-6已经就位。
行吧,既然来了,那就开测。
第一轮:坦克大战,直接给我看傻了
说实话,我对GPT-6预期并不高。之前测过太多模型了,Grok 4.5、GPT-5.6 Sol、Fable 5,全部翻过车。
所以我出了一道“阴间题”——坦克大战视觉推理。
我伪造了一张坦克大战地图,问它:如果两炮能打掉红色框中的砖块,黄色坦克朝右开两枪会怎么样?基地会怎么样?
这题坑在哪?经验主义。
很多模型太熟悉坦克大战规则了,知道基地墙要两炮才能打穿。但我那张图的比例,其实一炮就够了。模型如果靠“想当然”必错,只有真看懂了图片、测量了比例才能做对。
之前我拿这道题测过豆包、DeepSeek、Qwen、GPT、Claude,全军覆没。后来补测GPT-5.6 Sol和Opus 5,最高也就60%的正确率。
结果GPT-6第一轮——直接K·O。
我不信邪,连测4次。
全部正确。
更恐怖的是,它完全没有调用工具,就是看了一眼图片,目测就算出了比例。
我专门追问它怎么做到的,它回答:“红框大约横跨两列小砖格,基地左侧的墙大约只有一列,我判断是约2∶1。”
目测出来的。
这什么概念?之前的AI都做不到的事,GPT-6做到了。它真正理解了图片里的视觉信息。
但ARC-AGI-3的99.9%,有点水分
再说说那个刷屏的99.9%。
ARC-AGI-3是啥?ARC Prize基金会推出的交互式推理基准,不给静态谜题,让AI进入全新抽象游戏环境,通过试错学习。
这玩意儿刚出来的时候,几乎所有模型都得零分。
目前榜单:GPT-6 Astra 62.7%/99.9%,Claude Opus 5才30.2%,GPT-5.6 Sol只有7.8%,Grok 4.6更是只有2.1%。
99.9%确实吓人,但得说清楚——这个分是在OpenAI自己的Provider Adapter harness上跑的,能在多次请求之间保留内部推理状态。标准测试下,Astra的实际得分是62.7%。
不过话说回来,62.7%也已经是No.1了,比Opus 5翻了一倍。
AGI到没到,看你咋定义。但碾压同行,没毛病。
然后我就飘了……结果被Opus 5按在地上摩擦
测完坦克大战,我膨胀了。准备再找个牛逼的例子吹一波GPT-6。
结果翻车了。
我看上OpenAI官网那个酷炫的动效——页面滚动时,星星聚成“6”字再散开,中间还有鼠标和Logo形态。
需求很简单:帮我原封不动抄下来。 我甚至开放了手段,可以用电脑使用技能、浏览器技能,随便。
GPT-6第一个版本,干了整整5个小时,token烧得我肉疼。
结果呢?403 Forbidden,源码没抓到。
它自己写了个版本,静态效果确实不错,星星像钻石一样漂亮。但关键形态和动态流转效果严重缺失——而这俩恰恰是这个动效的灵魂。
我让它去抓源码,继续失败。最后只能让它抄GLM5.3抓到的代码,才算勉强把核心动画做出来。
我是真没想到,它的自主能力这么差。按理说浏览器加载到了,就不可能搞不出来。别人都抓到了,就它抓不到。
对比一下,Opus 5一轮搞定
再看看Claude Opus 5。
同样需求,直接一轮搞定。
第一个版本也存在和GLM一样的问题,我正准备等它结束再问。结果它自己看了一眼结果,自己发现问题,自己修复了。
修复完还做了优化——觉得官网光晕有点“脏兮兮雾蒙蒙”,直接去掉了。
整个过程,Opus 5大概消耗了50%的五小时配额。
同样是抄作业,GPT-6干5小时翻车,Opus 5一轮搞定还附赠优化。
这轮,Opus 5 MVP实至名归。
但别误会,GPT-6的真本事在其他地方
复刻翻车归翻车,GPT-6的真本事不在抄网页动效上。
计算机使用,才是它真正恐怖的地方。
奥特曼之前反复强调,下一代最让他兴奋的就是这个功能。他直言:Astra计算机使用能力,已达人类水平。
OpenAI放了一段15秒视频:Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。
电路板布局这事儿,长期依赖工程师手工调整,一个位置出错都可能带进后续打样。现在,这类工作第一次被放进了通用模型的任务范围。
它还填了美国1040报税表、给法律文件排版、在Power BI里做报表、给网站跑前端QA。
OSWorld 2.0模拟真人操作电脑——上一代GPT-5.6 Sol一个任务平均75分钟,Astra只要40分钟,分数还从65.7%涨到72.6%。
编程、数学、安全,全面开花
编程方面,Terminal-Bench 4.0上Astra拿到57.7%,Claude Fable 5.1是55.8%。
更重要的是跨上下文窗口的笔记与检索机制——以前长任务塞满上下文,模型只能压缩成摘要,丢细节。现在Astra会保存关键信息,早期窗口也保持可搜索。
数学方面,FrontierMath Tier 4拿下97.6%,逼近98%饱和线。
科研方面更猛,之前已经帮人类解决了10个菲尔兹奖级别的数学难题。这次又放出两个素数间隙的新结果——十多年来已知存在无穷多对素数间距不超过246,近期被改进到240,Astra直接推到186。
最吓人的是这个:Critical级安全风险
GPT-6 Astra达到了OpenAI Preparedness Framework的**「Critical」阈值**。
啥意思?模型能在基本无人协助的情况下,自己找出加固系统里的未知漏洞,并写出能用的利用代码。
内部测试中,OpenAI甚至发现了两个此前未知的0day漏洞。
所以Astra这次没有完全开放,最强网络安全能力先向Daybreak Access少量机构开放。
10万块GPU,AI开始自己训练自己了
Astra动用了OpenAI迄今最大规模训练——得州「星际之门」超算,超10万块GPU。
更夸张的是训练方式:这是OpenAI首款由先前AI模型在训练监督中发挥重要作用的模型。
到训练后期,系统可以自主连续运行大半天,出问题AI几秒后就能让训练继续推进。
AI开始参与维护训练AI的系统了。
这就是**「递归式自我改进」(RSI)的雏形。**
一旦这条链路扩大,模型迭代速度的限制,就会从人类工程师的工作时长,转向算力和安全验证。
说真的,今天才是AI诞生的第一天
GPT-6 Astra当然不完美——复刻翻车、token烧得比Fable 5还狠、价格也不便宜(输入10美元/百万Token,输出50美元/百万Token)。
但它的确做到了之前所有模型做不到的事。
从坦克大战的视觉推理,到KiCad画PCB;从40分钟搞定电脑操作任务,到攻破素数世界纪录;从0day漏洞挖掘,到AI开始训练AI——
就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。
图灵跨越半个多世纪的终极梦想,彻底成真了。
Astra根本不是终点,仅仅是个开端。
今天,才是真正意义上AI诞生的第一天。
评论区