AutumnVerse
V2EX  ›  问与答

大哥们,多模态大模型,能给个对比吗?

  •  
  •   AutumnVerse · 6h 51m ago · 637 views
    让 ai 监控画面,然后自动执行处理,7*24 运行,哪家比较合适?另外不能太慢,那 chatgpt5.6 sol 跑了一天,效果挺不错的,但是太慢了,一次请求要 10s 左右,延长太高经常出问题。

    以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
    21 replies    2026-09-07 17:12:04 +08:00
    clemente
        1
    clemente  
       4h 37m ago
    哥们 NASA 都不敢这么用
    AutumnVerse
        2
    AutumnVerse  
    OP
       2h 47m ago via iPhone
    @clemente ?有啥问题吗?成本太高?

    sol 跑了一天,几千块钱成本而已,也可能是 sol 太慢了,10 秒左右才返回一次。
    ruanimal
        3
    ruanimal  
       2h 17m ago
    一天几千块而已。。
    clemente
        4
    clemente  
       2h 17m ago
    @AutumnVerse 首先多模态的模型不是干监控的。99%的多模态就是 画面描述器的胶水模型 和 LLM 投影沾到一起的

    我不知道你实际的工作需求,如果能走 cli 还是尽可能走 cli 或者 headless
    wizChen
        5
    wizChen  
       1h 7m ago
    这种本地部署比较好吧
    Nasdaq
        6
    Nasdaq  
       1h 5m ago
    这,OP 拿一张监控画面跑一下看看成本,要是 24 小时非常夸张的。。。
    AutumnVerse
        7
    AutumnVerse  
    OP
       57 mins ago via iPhone
    就是拿来跑监控的,把图片压缩到 480p ,token 消耗还行,唯一问题是 sol 太慢了,处理一帧要 10s ,取下一帧的时候已经过了 10 多秒了,这期间如果出现异常又消失了,ai 就监控不到了。

    成本那是老板考虑的,我知道 yolo ,也知道传统的 opencv 里面的算法,但是你用那些算法做出来,老板怎么给投资人吹牛逼,你连大模型都没用上,谁给你投资。
    @Nasdaq
    @ruanimal
    AutumnVerse
        8
    AutumnVerse  
    OP
       52 mins ago
    @clemente 现在是写了一个程序,把相关画面抽帧给 ai ,让 ai 发现某些事件,调用对应的 function 处理。

    主要问题是 sol 太慢了,导致抽帧非常少,两帧中间的内容就丢掉了。尝试了 gemini flash 3.8 ,看统计也要 4s 左右一次,也没快多少。
    Nasdaq
        9
    Nasdaq  
       50 mins ago
    @AutumnVerse #7 这是我一个类似项目用 gemini-3.7-flash 做图片理解(仅供参考),图片分辨率大概 1080p 左右

    Routing 197ms
    Google 2.6s
    Generation 8.5s
    Total 11.3s

    Cost $0.00632
    Throughput 179.0tok/s
    xujinkai
        10
    xujinkai  
       46 mins ago via Android
    并发呗,真有钱🤣
    AutumnVerse
        11
    AutumnVerse  
    OP
       44 mins ago via iPhone
    @Nasdaq 那跟我测试差不多,我用的 480p 会快一点。但是总耗时也要 4s 左右。
    tim9527
        12
    tim9527  
       43 mins ago
    想想就好贵,家底富裕啊
    clemente
        13
    clemente  
       43 mins ago
    @AutumnVerse 我 6 年前做过类似的,我做的是检测+跟踪。我的方法是帧不变走缓存,帧变了走识别那一套逻辑,但是有一点因为设备计算能力达不到实时,所以我加了异步队列和跳帧方法,这样能保证所有事件捕捉+某个场景能同步到实时
    cvooc
        14
    cvooc  
       42 mins ago
    误闯天家系列, 没这么用过...
    wysnxzm
        15
    wysnxzm  
       39 mins ago
    做异步,延迟 10s 而已不会漏数据
    winterx
        16
    winterx  
       35 mins ago
    你需要的是视频算法而不是 AI ,当然 AI 也能干这事就是太烧钱了
    如果成本受限可以考虑海康、商汤或者旷视
    AutumnVerse
        17
    AutumnVerse  
    OP
       30 mins ago via iPhone
    @cvooc
    @tim9527 做 cv 算法的工程师,一个月也得三四万,这一套下来,两三个人也得十来万了,这钱拿来买 token ,我觉得是帮公司省钱了。而且招人也要时间,开发也要时间,改 bug 也要时间。

    几天时间能跑通业务,完成商业验证,简直赚麻了。
    la9998372
        18
    la9998372  
       24 mins ago
    你是啥场景啊?非要用大模型来做?
    现在的 qwen3.8flash 和 glm5.3flash 都支持多模态了,应该性价比和性能都挺不错吧
    cvooc
        19
    cvooc  
       24 mins ago
    @AutumnVerse #17 哪怕让 ai 写算法呢...花点钱...上肥波,上 astra... 也比直接让 ai 识别强啊...
    gpt5
        20
    gpt5  
       19 mins ago
    我知道几家公司的主营业务就是这个。
    上百个监控全接进来,实时 ai 分析。
    AutumnVerse
        21
    AutumnVerse  
    OP
       17 mins ago via iPhone
    @gpt5 直接上大模型还是传统的 yolo 类的小模型?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5251 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 50ms · UTC 09:29 · PVG 17:29 · LAX 02:29 · JFK 05:29
    ♥ Do have faith in what you're doing.