侧边栏壁纸
  • 累计撰写 66 篇文章
  • 累计创建 48 个标签
  • 累计收到 2 条评论

目 录CONTENT

文章目录

GPT-6Astra很强吗?真实体验如何

炸了!我连夜实测GPT-6 Astra,直接瘫在沙发上

今天早上睁眼,就看到奥特曼发消息说Pro能用GPT-6了。

我心想:关我Plus用户鸟事儿?

结果奥特曼做了个手势,我电脑立马弹窗——GPT-6已经就位。

行吧,既然来了,那就开测。

第一轮:坦克大战,直接给我看傻了

说实话,我对GPT-6预期并不高。之前测过太多模型了,Grok 4.5、GPT-5.6 Sol、Fable 5,全部翻过车。

所以我出了一道“阴间题”——坦克大战视觉推理。

我伪造了一张坦克大战地图,问它:如果两炮能打掉红色框中的砖块,黄色坦克朝右开两枪会怎么样?基地会怎么样?

这题坑在哪?经验主义。

很多模型太熟悉坦克大战规则了,知道基地墙要两炮才能打穿。但我那张图的比例,其实一炮就够了。模型如果靠“想当然”必错,只有真看懂了图片、测量了比例才能做对。

之前我拿这道题测过豆包、DeepSeek、Qwen、GPT、Claude,全军覆没。后来补测GPT-5.6 Sol和Opus 5,最高也就60%的正确率。

结果GPT-6第一轮——直接K·O。

我不信邪,连测4次。

全部正确。

更恐怖的是,它完全没有调用工具,就是看了一眼图片,目测就算出了比例。

我专门追问它怎么做到的,它回答:“红框大约横跨两列小砖格,基地左侧的墙大约只有一列,我判断是约2∶1。”

目测出来的。

这什么概念?之前的AI都做不到的事,GPT-6做到了。它真正理解了图片里的视觉信息。

但ARC-AGI-3的99.9%,有点水分

再说说那个刷屏的99.9%。

ARC-AGI-3是啥?ARC Prize基金会推出的交互式推理基准,不给静态谜题,让AI进入全新抽象游戏环境,通过试错学习。

这玩意儿刚出来的时候,几乎所有模型都得零分。

目前榜单:GPT-6 Astra 62.7%/99.9%,Claude Opus 5才30.2%,GPT-5.6 Sol只有7.8%,Grok 4.6更是只有2.1%。

99.9%确实吓人,但得说清楚——这个分是在OpenAI自己的Provider Adapter harness上跑的,能在多次请求之间保留内部推理状态。标准测试下,Astra的实际得分是62.7%。

不过话说回来,62.7%也已经是No.1了,比Opus 5翻了一倍。

AGI到没到,看你咋定义。但碾压同行,没毛病。

然后我就飘了……结果被Opus 5按在地上摩擦

测完坦克大战,我膨胀了。准备再找个牛逼的例子吹一波GPT-6。

结果翻车了

我看上OpenAI官网那个酷炫的动效——页面滚动时,星星聚成“6”字再散开,中间还有鼠标和Logo形态。

需求很简单:帮我原封不动抄下来。 我甚至开放了手段,可以用电脑使用技能、浏览器技能,随便。

GPT-6第一个版本,干了整整5个小时,token烧得我肉疼。

结果呢?403 Forbidden,源码没抓到。

它自己写了个版本,静态效果确实不错,星星像钻石一样漂亮。但关键形态和动态流转效果严重缺失——而这俩恰恰是这个动效的灵魂。

我让它去抓源码,继续失败。最后只能让它抄GLM5.3抓到的代码,才算勉强把核心动画做出来。

我是真没想到,它的自主能力这么差。按理说浏览器加载到了,就不可能搞不出来。别人都抓到了,就它抓不到。

对比一下,Opus 5一轮搞定

再看看Claude Opus 5。

同样需求,直接一轮搞定。

第一个版本也存在和GLM一样的问题,我正准备等它结束再问。结果它自己看了一眼结果,自己发现问题,自己修复了。

修复完还做了优化——觉得官网光晕有点“脏兮兮雾蒙蒙”,直接去掉了。

整个过程,Opus 5大概消耗了50%的五小时配额。

同样是抄作业,GPT-6干5小时翻车,Opus 5一轮搞定还附赠优化。

这轮,Opus 5 MVP实至名归。

但别误会,GPT-6的真本事在其他地方

复刻翻车归翻车,GPT-6的真本事不在抄网页动效上。

计算机使用,才是它真正恐怖的地方。

奥特曼之前反复强调,下一代最让他兴奋的就是这个功能。他直言:Astra计算机使用能力,已达人类水平。

OpenAI放了一段15秒视频:Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB

电路板布局这事儿,长期依赖工程师手工调整,一个位置出错都可能带进后续打样。现在,这类工作第一次被放进了通用模型的任务范围。

它还填了美国1040报税表、给法律文件排版、在Power BI里做报表、给网站跑前端QA。

OSWorld 2.0模拟真人操作电脑——上一代GPT-5.6 Sol一个任务平均75分钟,Astra只要40分钟,分数还从65.7%涨到72.6%。

编程、数学、安全,全面开花

编程方面,Terminal-Bench 4.0上Astra拿到57.7%,Claude Fable 5.1是55.8%。

更重要的是跨上下文窗口的笔记与检索机制——以前长任务塞满上下文,模型只能压缩成摘要,丢细节。现在Astra会保存关键信息,早期窗口也保持可搜索。

数学方面,FrontierMath Tier 4拿下97.6%,逼近98%饱和线。

科研方面更猛,之前已经帮人类解决了10个菲尔兹奖级别的数学难题。这次又放出两个素数间隙的新结果——十多年来已知存在无穷多对素数间距不超过246,近期被改进到240,Astra直接推到186。

最吓人的是这个:Critical级安全风险

GPT-6 Astra达到了OpenAI Preparedness Framework的**「Critical」阈值**。

啥意思?模型能在基本无人协助的情况下,自己找出加固系统里的未知漏洞,并写出能用的利用代码。

内部测试中,OpenAI甚至发现了两个此前未知的0day漏洞

所以Astra这次没有完全开放,最强网络安全能力先向Daybreak Access少量机构开放。

10万块GPU,AI开始自己训练自己了

Astra动用了OpenAI迄今最大规模训练——得州「星际之门」超算,超10万块GPU。

更夸张的是训练方式:这是OpenAI首款由先前AI模型在训练监督中发挥重要作用的模型。

到训练后期,系统可以自主连续运行大半天,出问题AI几秒后就能让训练继续推进。

AI开始参与维护训练AI的系统了。

这就是**「递归式自我改进」(RSI)的雏形。**

一旦这条链路扩大,模型迭代速度的限制,就会从人类工程师的工作时长,转向算力和安全验证。

说真的,今天才是AI诞生的第一天

GPT-6 Astra当然不完美——复刻翻车、token烧得比Fable 5还狠、价格也不便宜(输入10美元/百万Token,输出50美元/百万Token)。

但它的确做到了之前所有模型做不到的事。

从坦克大战的视觉推理,到KiCad画PCB;从40分钟搞定电脑操作任务,到攻破素数世界纪录;从0day漏洞挖掘,到AI开始训练AI——

就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。

图灵跨越半个多世纪的终极梦想,彻底成真了。

Astra根本不是终点,仅仅是个开端。

今天,才是真正意义上AI诞生的第一天。

0

评论区