LDa's recent timeline updates
LDa

LDa

V2EX member #386086, joined on 2019-02-22 13:12:25 +08:00
Today's activity rank 13667
Codex 雷达上线一段时间了,做个月度复盘
OpenAI  •  LDa  •  18h 18m ago  •  Lastly replied by tangguo
40
[GPT] 这次,真的是一句话做游戏了
程序员  •  LDa  •  14 days ago  •  Lastly replied by LDa
28
完犊子, mac 刚涨价屏幕出问题了
MacBook Pro  •  LDa  •  Jul 27  •  Lastly replied by LDa
6
codex 降智降麻了,版本末期恐怖如斯
程序员  •  LDa  •  Jun 23  •  Lastly replied by icefox21
11
一段的轻骑行后,身体给我的反馈
骑行  •  LDa  •  Jul 27  •  Lastly replied by LDa
15
找到问题的本质在于找到本质的问题
  •  3   
    程序员  •  LDa  •  Jun 15  •  Lastly replied by jiche
    8
    iPhone 上 APP 能感知到系统是否在录屏吗?
    问与答  •  LDa  •  Jun 12, 2025  •  Lastly replied by LDa
    12
    分享我的 follow 订阅源 曹贼主题
    分享邀请码  •  LDa  •  Oct 16, 2024  •  Lastly replied by LDa
    33
    升级到 14.4.1 后 两把蓝牙键盘都出现了故障
    macOS  •  LDa  •  Apr 2, 2024  •  Lastly replied by LDa
    1
    LDa's recent replies
    ![使用截图]( )
    4 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @menghuitangchao 哈哈哈 以前这个界面确实被吐槽了
    4 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @wzw 这就是分布式雷达评测的分数结果,Luna Max 实际使用下来在长上下文和复杂场景确实不如 Sol High 但是暂时没想好怎么通过测试集去构建这个差异。换句话说 Luna Max 在短任务上确实很牛
    4 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @e6f6d627f646 开不动了,被封麻了
    4 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @ltfree 核心功能就两个 1.预测重置时间 2.监测模型降智情况
    5 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @menghuitangchao 请问研判结论具体指哪块?我们回头看看
    5 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @zlo309618100727 现在用的测试能力集就是公开的 DeepSWE
    5 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @ktyang 现在流量费用很高 期待跟大佬交流
    5 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @Felldeadbird
    @msg7086
    @yming
    @EvanClausen
    @grindmule 感谢大家的支持鼓励 谢谢
    5 days ago
    Replied to a topic by LDa OpenAI Codex 雷达上线一段时间了,做个月度复盘
    @ktyang 这个意见非常中肯,其实我们也看了非常多的基准测试,但是日常使用评测的验收判断非常困难,暂时还没想到有啥好办法,所以大部分的评测还是围绕这可定义可验收的编程环节来的。不过最近上线的庞贝副本利用拼图测试对模型的视觉理解能力能一定程度进行评测,欢迎来玩
    https://deng.codexradar.com/?benchmark=pompeii-adjacency
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1198 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 22ms · UTC 23:32 · PVG 07:32 · LAX 16:32 · JFK 19:32
    ♥ Do have faith in what you're doing.