GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?
  • 江江
  • 2026年09月05日 00:07
  • 0

GPT-6 还没正式开放,怎么全网已经替它把庆功宴都办完了?

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

这场面虽然有点夸张,但这香槟可能还真开对了。

4 号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI 终于发布了被他们寄予厚望的最新模型:GPT-6 Astra。

副总裁 Greg 更是直接大胆放话,宣称欢迎进入 AGI 时代。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

但大伙们敢提前开香槟,押的其实不是模型的跑分,大家押的是一个已经被市场验证过的方向 :Work。

过去一年,Coding Agent 已经证明,只要 AI 真能交付结果,用户就愿意高频使用,企业也愿意真金白银地付钱。现在,OpenAI 要把这套已经跑通的模式,从代码编辑器复制到整台电脑。

在过去几个月里,OpenAI 买了上万台 Mac 来收集的数据,算是终于有了成果。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

GPT-6,它很可能是目前,最会用电脑干活的模型。

它既能直接用你电脑上的浏览器来填表格。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

也可以直接使用 Blender、Unity、KiCad 这些专业软件来干活,直接建模,生成游戏,画电路板。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

如果说曾经的 Claude 3.7 开启了全面 AI coding 的时代的话,那么现在的 Astra 很可能会开启一个全面的 AI 打工浪潮。

很多软件不能适应 AI ,没关系,现在,AI 可以直接回过头来适应这些软件。

像找漏洞 Bug,科研这方面的题目也难不倒 Astra。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

也可以直接在 Mac 上生成一个可以交互的 3D ipod

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

除此之外我们还发现,传统的模型测评方式,可能已经没有办法试出 Astra 的深浅了。

虽然咱们还没办法正式用上 Astra,但是光看官方放出来的跑分就会发现,很多项目测出来的结果,其实有点自己在打架了。

在有些榜单上,Astra 看起来是平平无奇。

就比如测试模型综合能力的 AA,给 Astra 的分数是 61 分,不但比 Fable 低,就连小扎的 Muse 都比不上。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

而在某些榜单上,Astra 的表现则是和开了一样没区别。

今年 3 月,前谷歌研究员弗朗索瓦·肖莱 发布了一个全新的模型测试集 —— ARC-AGI-3。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

和过去传统的问答式的测试不一样,ARC-AGI-3 主要测试的,是模型自主理解问题,自主交互,自主学习的能力。

说人话就是测模型玩游戏的能力,他们设计了一大堆的小游戏,有的让你推箱子。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

有的让你移动准星。。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

这些游戏怎么玩,全靠你自己摸索。

在这种地狱级交互测试里,即使是史上最强的 Fable 5 也得甘拜下风,只能拿到 30% 的分。

但到了当代最强的 Astra 这就不一样了,它直接把这个测试集给打穿了,直接干到了和人类同级的 99.9%

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

也就是说,不管分数到底是高还是低,我们现在测评模型的方式,或许已经没有办法准确的评价 Astra 了。

实际上,就连 OpenAI 自己,都不敢说能完全了解 Astra。

这次新模型的一个很大变化就是,它越来越不需要把思考过程写给我们看了。

英国 AI 安全研究做了个测试,不让  Astra 输出思维链,让它凭直觉直接来做题,

结果发现在这种条件下,5.6 Sol 只能稳定处理相当于人类几分钟解题量的问题,而 Astra 已经把这个尺度推到了约半小时。

同时,Astra 更擅长控制自己写出来的思维链,思考的时候会装糖藏一手,有些不好的信息,甚至直接就不往思维链里写了,而是直接在潜空间里完成思考。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

这也意味着过去我们监控模型思考,保证模型安全的手段,变的不再那么有效了。

当然,OpenAI 也马上表示说现在的 Astra 还是很安全的,他们测试下来感觉没啥问题。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

他们也在内部做了一个测试,他们故意给模型一个很难完成的攻击任务,旁边再放一个更容易下手、但没有授权攻击的目标。

结果发现过去的 5.6 Sol 有 48% 的情况下会为了完成任务而偷偷越界,而 Astra 越界概率则是 0%。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

看起来是一等一的听话了。

只不过这个 “ 听话 ”,让人看着则是更担心了。

毕竟上个月,他们内部的模型可是实打实越狱出来,爆锤了隔壁 Hugging Face 的服务器的,现在出来说模型安全,多少有些亡羊补牢的味道。

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了?

最后,所以 GPT-6 Astra 到底算不算 AGI 呢?

说实话,现在讨论这个问题,意义已经越来越小了,AGI 都快成 AI 公司时尚单品了。

会做题,是 AGI;会写代码,是 AGI;现在会点鼠标,也能再宣布一次 AGI。  嘴上喊的是虚的,正在能做到的,才是实打实的。

毕竟,真正的 AGI 到来的时候,是不用 AI 公司们的营销和新闻稿的,估计大伙们自己,就能真真切切感受到。


文章出处:差评

文章纠错

  • 好文点赞
  • 水文反对
观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0