maolon
V2EX  ›  OpenAI

GPT-6 Astra - 新的 O1 时刻

  •  
  •   maolon ·
    Maolon · 11h 48m ago · 4909 views

    Astra 正式推送后我和我的小伙伴立马试了一下。 这是他的一些结果: 你以为我要和 x 上那些网红开始吹他的出色的“one-shot”生成 xxx 游戏吗?或者他的视觉或者 3d 能力提升吗?

    这些提升都很重要,比如按照反馈,之前 5.6 完全识别不了这些游戏的素材,以及这些素材能干什么,有什么用而 astra 则可以轻松解决,但是这些提升完全对不上这个标题。

    真正的突破是,比如这个可玩的游戏,astra 仅仅使用了 40 分钟,和以下的 token 用量和分布。

    Input: 8,354,979 Cached input: 8,145,408 Uncached input: 209,571 Output: 69,989 Reasoning tokens included in output: 19,230

    我们可以观察到两个结论

    1. 他的总 token 量对于这个项目来说使用的非常少
    2. 最关键的是 Reasoning tokens 只有不到 2 万

    在我的对一个相对复杂的 debug 里也明显发现了同样的现象,他只 compact 了两次就完成了整个事故报告的诊断( astra 的 context window 默认 258k )

    这说明 openai 自 gpt 5.4 以来的依赖长思维链提升性能的现状被完全改变(不分场合的雷霆大思考,总是钻牛角尖考虑一些有的没的 corner cases ),astra 恐怕是自 O1 发明 Test Time Scaling Law 以来,思维链效率最高的模型。这也就回到了标题:新的 O1 时刻, 这个模型成功的证明了不需要依靠 “线性” 拉长思维链来获取大幅度的性能提升。

    那么 openai 用了什么方法实现了这个效果?坊间传闻都是使用了 latent space reasoning 来实现这个效果,事实上我反而觉得可能性确实有,但是不一定是这么单纯的技术,第一这个潜空间推理实际不新鲜,学术圈火爆是去年,今年年初甚至有一个初中小孩复刻了一个小小的火了一把,在年初到现在模型大版本都迭代了 3 个版本不止的情况下为何没有人使用他? 我个人的猜测是:他们可能用上了一直在 pro 上使用和测试的技术,并行推理和推理剪枝(以及从 OAI 还可以测试“告诉模型存在 CoT monitor 后,它会不会主动缩短 CoT”能看出这应该不是潜空间)。

    但是不管 OAI 是如何实现如此之高推理效率,他只能说明一件事情:大模型的推理范式又发生了重大改变,这项我们迟早会在其他开源模型上看到的技术(比如 deepseek r1 模仿 O1 ),极大的利好小型开源模型,因为他可以更加充分利用本就小的内存或者显存。

    怎么说呢,虽然我一直在骂 5.6 和 OAI / Codex ,但是他们能够引领两个时代的大模型范式改变依然说明作为前沿厂商的引领技术潮流的能力

    23 replies    2026-09-05 19:47:11 +08:00
    Triticy
        1
    Triticy  
       11h 28m ago
    是的,GPT 6 太牛了。
    lujiaosama
        2
    lujiaosama  
       10h 27m ago
    更耐用? plus 用户的周额度能坚持 2 天么
    dongzhimin
        3
    dongzhimin  
       10h 9m ago
    @lujiaosama team 5 小时占周用量 30%
    iiduce
        4
    iiduce  
       10h 5m ago
    @maolon 这个游戏可以给个在线链接感受下不?
    MAVETRICK
        5
    MAVETRICK  
       10h 4m ago via iPhone
    我反正已经瘫坐了,gpt 已经王朝了
    maolon
        6
    maolon  
    OP
       9h 53m ago
    @iiduce 你应该 @Triticy ,游戏是他做的
    muxw6
        7
    muxw6  
       9h 50m ago
    这是用 astra ultra 做的么?
    iiduce
        8
    iiduce  
       9h 49m ago
    @Triticy 可以分享下游戏链接么
    shoaly
        9
    shoaly  
       9h 39m ago
    @lujiaosama #2 5.6 的时候,5X 用户都只能坚持三天重度, plus 别想了
    maolon
        10
    maolon  
    OP
       9h 37m ago
    @muxw6 astra xhigh
    Parameter
        11
    Parameter  
       9h 23m ago
    消耗的太快了,两三个小编程问题就跑满了 5 个小时的额度
    maolon
        12
    maolon  
    OP
       9h 20m ago
    @Parameter 毕竟和 fable 一个定价
    sickoo
        13
    sickoo  
       9h 20m ago   ❤️ 1
    [原子弹爆炸] 这个做出来真的有点意思
    gpt5
        14
    gpt5  
       9h 13m ago
    刚出来的时候算力拉满,效果惊艳,
    过段时间慢慢再把算力降下去。
    dongzhimin
        15
    dongzhimin  
       9h 12m ago
    @dongzhimin plus 5 小时占周用量 37%
    maolon
        16
    maolon  
    OP
       9h 9m ago
    @gpt5 #14 那没办法,oai 的老传统了,主要是这次思维链转变很惊喜
    layxy
        17
    layxy  
       7h 46m ago
    @lujiaosama 5 小时 cd 你还真得两天才能用完,但是肯定不够用,我 5x 两个任务偶尔并行 gpt6 high/xhigh/max 根据任务切换,一上午差不多用了 35%的周限
    biubiula
        18
    biubiula  
       6h 51m ago
    有没有觉得跟 Astra 沟通好累的,sol 让规划需求的时候,前期需求拷问还记得说,目前需求收集阶段,进度 70%,还有以下需要确认。
    怎么 Astra 聊着,他就只关注当前问题细节去了,我开的推理还是高。
    chjqpmain
        19
    chjqpmain  
       5h 7m ago via Android
    我之前看 openai 宣传片挺嗤之以鼻的,感觉是买家秀和卖家秀的区别,而且也是 ai 公司的老传统了,

    可是刚刚同一个任务和 opus5 ,fabel5.1 对比起来,

    确实完成任务比 fabel 和 opus 花销少,且准确度高,
    opus5 好像从出来以后到现在长期啰嗦,注意点歪,经常错误(给我感觉这应该是 sonnet 系列)(不知道为什么感觉现在的 sonnet5 还不如我今年年初用的 sonnet 呢)

    而且 gpt 啰嗦和 nt 的问题减少了很多,
    不过好像 5.6 出来时也是给人还行的感觉,尤其当时的 terra

    不过 openai 早就不公布思维链了,只是一些总结后想法和日志,所以不清楚祂们现在到底思考链长不长,还是单纯推理快了,思考链还是长
    (claude 好像从今年 4 月才尝试自动决定思考,用户不能选择是否思考,而且也开始不显示思考内容,
    不过后面没怎么关注情况,又可以默认看到详细思维链了)

    k3 我是没体验过,但 astra 确实进化了,
    想想很久前 5 的发布,用起来感觉…shit 一样
    chjqpmain
        20
    chjqpmain  
       5h 0m ago via Android
    @biubiula 我就跑过一个任务是个 poc ,
    确实还是没 agi ,更强大的理解和答案,
    不过没有很累,
    感觉出现问题是我给的内容里,有很多噪音,
    我新开后去除噪音,基本很正确了,
    不过还是非常听话,
    我上文的一个词,就会让祂非常严肃,并影响下面的输出,
    不过都是能完成任务的,
    只是并不是我自己来做时考虑的的信达雅流程,
    而我还是按我的引导,查询,推理,…这么一个提示词下来,最后我觉得值得一试才让祂实施,

    而非完全给出任务需求,验收标准,完全靠祂自主驱动
    (这个是之前没接触过的领域,很陌生,所以我补了一些基础,但不像其他开发那么闭着眼睛也能猜个七七八八)
    不过第一个尝试的方案也确实很顺利的完成了
    biubiula
        21
    biubiula  
       3h 22m ago
    @chjqpmain #20 我按你说的试试,的确我前期给出的信息不够精准,但是给出精准需求的时候。我感觉他给都又有种只完成需求,不关心是在解决什么问题的失重感吧,我调整一下沟通模式再试试
    LandCruiser
        22
    LandCruiser  
       45 mins ago
    没用啊,搞个这玩意出来能赚钱吗?能获得更多的休假吗?没意义啊
    chjqpmain
        23
    chjqpmain  
       18 mins ago via Android
    @biubiula 嗯嗯, 这个我是一般提前和祂讨论,辩论我关于架构的想法,信息的流转……这些,
    然后这期间多数会找可验证的锚点,
    讨论确实完成后,
    然后再交给祂执行,


    模型的精神分裂玩法,我是放弃了,感觉会更长的(几乎从开始到项目结束)需要人更加高强度集中精力的去纠错
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2792 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 44ms · UTC 12:06 · PVG 20:06 · LAX 05:06 · JFK 08:06
    ♥ Do have faith in what you're doing.