• 请不要在回答技术问题时复制粘贴 AI 生成的内容
rizon
V2EX  ›  程序员

这里为什么感觉没人讨论国产模型。我发现 qwen 和豆包系列模型问题好多,生产直接没法用

  •  
  •   rizon ·
    othorizon · 2 days ago · 7385 views
    对话类产品。
    生产环境过去一直在用豆包,但是豆包 ttft 越来越大已经没法用了,所以想换 qwen 。
    而且豆包还有概率出现脱靶问题和工具调用幻觉问题

    结果 qwen3.7 plus 输出总是半截就中断,概率非常大没法用。
    换成 3.8 max ,先是专属 endpoint 输出内容缺少 role ,这事我就排查了很久。
    然后换成 dashscope 域继续用想着没事了,结果发现模型带图时输出质量严重下滑,区分不出注释内容和对话内容的角色概念。

    搞得我现在一个没得用。做角色扮演对话还有什么好的选择吗
    Supplement 1  ·  2 days ago
    最新进展。刚才实测终于排查出来。
    qwen3.7 plus 在有 tools 的情况下存在输出被截断的 bug 。
    Supplement 2  ·  2 days ago
    看回复大家都是 AIcoding 的场景,不是 AI 产品的开发。所以确实不在乎这些。但是做国内 AI 产品只能选这些国产模型。
    感觉 AI 时代即使大厂出品的品控也在下滑
    Supplement 3  ·  1 day ago
    感谢 v 友推荐,ds 也有视觉版,目前正在测 4.1 的 vision 版,但是 vision 版结构化输出支持的不是很好(如图),所以到时候只能不同的场景切换不同的模型去用了



    这个 http://llmapicheck.dev 是我做的一个开源浏览器本地工具,挺好用的,欢迎大家使用。
    79 replies    2026-09-11 07:46:47 +08:00
    rizon
        1
    rizon  
    OP
       2 days ago
    好吧,这会排查到原因了 。
    thinking:{type:disabled} 关闭思维链会导致思维链进入正文。
    hhsd
        2
    hhsd  
       2 days ago   ❤️ 1
    能上 v2 的 谁手上还没有个 gpt 了 再不济也有中转 图豆包会流口水么
    catinsides
        3
    catinsides  
       2 days ago   ❤️ 6
    部分国产模型向来是跑分没输过,体验没赢过,一用一个不吱声。以前好歹便宜量大,现在定价比国外的还贵,几个问题就用完 5 小时额度,让我再买是不可能了。
    lmmlwen
        4
    lmmlwen  
       2 days ago   ❤️ 7
    羊粪蛋子表面光,比如城市下水道,比如甲醛大白菜,比如 ChinaGT 也与老大爷救援人员
    7gugu
        5
    7gugu  
       2 days ago
    国产模型推荐 GLM 5.3 ,比肩 5.6 terra ,ttft 也更快
    yyttrr
        6
    yyttrr  
       2 days ago
    一直用 deepseek,平时 flash,负责紧急问题开一下 pro,也够用了,而且响应速度很快.最大的方便是每个月报销的时候直接能开发票,财务报销流程效率很多,其他同事用 claude 或者 gpt 的没发票流程复杂一些
    justxwy
        7
    justxwy  
       2 days ago
    qwen 3.8 max 我和我同事都非常好评啊,写代码很厉害。
    kimhooo
        8
    kimhooo  
       2 days ago   ❤️ 1
    “生产直接没法用”——谜底就在谜面上
    ebushicao
        9
    ebushicao  
       2 days ago   ❤️ 1
    国产模型只需要看 glm 、kimi 、deepseek ,图像和视频方面倒是可以看豆包。
    FreshOldMan
        10
    FreshOldMan  
       2 days ago
    能用最好的,肯定不用排第二的啊
    wat4me
        11
    wat4me  
       2 days ago   ❤️ 1
    国产只看 glm kimi DeepSeek ,qwen 的优势是小模型厉害,可以在特定领域微调
    413420
        12
    413420  
       2 days ago
    因为不在意,因为不在乎
    413420
        13
    413420  
       2 days ago
    来自 claude max 20x 和 chatgpt pro 20x 双持用户
    wang9571
        14
    wang9571  
       2 days ago
    喜欢什么用什么呗,有什么好讨论的
    jacketma
        15
    jacketma  
       2 days ago
    一言难尽吧,算力和算法都有差距,主要还是有参照物,如果没有海外模型的能力对比,国模也挺好的
    rizon
        16
    rizon  
    OP
       2 days ago
    @justxwy 常规使用没问题,但是在一些细节上 bug 挺多。也不知道为什么,是上线前测试 case 没覆盖吗。感觉 AI 时代各种大厂产品的可靠性都在下降。

    比如已经和 售后确认过的 qwen3.8max 的 maas endpoint 确实有某些情况下输出缺失 role 字段的 bug 。
    maocat
        17
    maocat  
       2 days ago
    使用的问题,openai 这些模型是不吐思考内容的,所以用他们的框架没问题,模型在进步,框架也在变,虽然明着说支持 openai sdk 格式,qwen ,ds 或多或少都有些问题,比如 ds 要求执行 tool 带上思考内容,或者每次执行都会先吐一段思考内容,再执行工具,这些 case
    latifrons
        18
    latifrons  
       2 days ago
    因为没法用,所以没人讨论
    rizon
        19
    rizon  
    OP
       2 days ago
    @maocat 是这样的,国内想找一个真的能用的模型其实选择范围非常小。看着百花齐放,但是线上产品想要换个模型的时候真能换的基本没有。

    而且因为参数兼容和模型内部的一些各自特性换模型时还很容易出事故。

    为此我专门做了一模型 api 兼容性测试网站: https://llmapicheck.dev/
    maocat
        20
    maocat  
       2 days ago
    @rizon #19 你这个工具。。。我得打击你一下,有很多服务商不允许跨域调用的
    dryadent
        21
    dryadent  
       2 days ago
    因为我没在生产环境用啊,gpt 6 都一堆问题,更何况这些蒸馏的
    crackself
        22
    crackself  
       2 days ago via Android
    v 友要生产力的,逗乐子看郭德纲于谦比国模更具性价比
    rizon
        23
    rizon  
    OP
       2 days ago   ❤️ 1
    @maocat 哈,是有这个问题,所以按说还得加自定义代理功能。另外我后面打算支持在服务器终端上跑,这样延迟测试也更准一些
    rizon
        24
    rizon  
    OP
       2 days ago
    @dryadent
    @crackself 哎,没得选啊,实时对话产品延迟敏感, 还有成本问题。如果有好的低延迟、低成本的 gpt 模型选择就好了。
    pmer
        25
    pmer  
       2 days ago
    要区分下具体模型,至少 seedance2.0/2.5 能打的,它是属于豆包系列模型(对外品牌名称)
    ReinXD
        26
    ReinXD  
       2 days ago
    @rizon 那也应该选 deepseek 不是 qwen ,qwen infra 水平真得不敢恭维
    ovtfkw
        27
    ovtfkw  
       2 days ago via iPhone
    k3 呢 直接不是说吊打 opus 吗 现在如何了
    f1ynnv2
        28
    f1ynnv2  
       2 days ago
    豆包只在用语音识别
    alsas
        29
    alsas  
       2 days ago
    因为默认不能用
    lovelive1024
        30
    lovelive1024  
       2 days ago
    如果是角色扮演用 ds 啊,那些玩酒馆的人很多都是用 ds
    qaq13037
        31
    qaq13037  
       2 days ago   ❤️ 3
    评论区怎么那么多崇洋媚外的,2026 年 9 月了,还搁这国模不可用呢? glm 、kimi 、deepseek 最新模型哪个不比你们当年吹的 opus4.6 强一个档?当年吹的像神一样的东西,放到国产上就成屎了对吗?
    wy315700
        32
    wy315700  
       2 days ago   ❤️ 1
    国产模型这么多,你好歹用几个能打的啊,用 qwen 和豆包干活是几个意思
    suxiaozi
        33
    suxiaozi  
       2 days ago
    我也是做 AI 产品的,这些模型已经让我泣不成声!😮‍💨
    tianjiyao
        34
    tianjiyao  
       2 days ago
    我用 DeepSeek 的 API 感觉还是挺稳定的,qwen 的用过质量一般般。豆包的就是搞笑的。。。上不了台面
    NQ
        35
    NQ  
       2 days ago
    用国模不如直接把钱丢水里,后者最多是短痛😁
    rizon
        36
    rizon  
    OP
       2 days ago
    @ReinXD
    @lovelive1024
    ds 是纯文本模型,不是多模态的。这就导致图像类的请求我得路由到其他模型或者图片转文字(损失细节)。所以只能说没什么更好的选择的话只能考虑 ds 了。
    rizon
        37
    rizon  
    OP
       2 days ago
    @wy315700 可以给推荐一下。ttft 足够低,最好是支持视觉理解的。
    rizon
        38
    rizon  
    OP
       2 days ago
    @suxiaozi
    @tianjiyao
    看到大家都是这个共识我就放心了,我一直以为是自己工程上做的还是不够好。不然怎么一直没看到人说国产不好,我一度怀疑是自己的问题
    sommio
        39
    sommio  
       2 days ago
    @rizon deepseek-v4.1-flash-expires-on-0910 和 deepseek-v4-flash-vision-exp 都支持多模态,明天 v4.1-flash 就要发正式版 + 降价了, 而且 ttft 都在 1s 以内;
    sommio
        40
    sommio  
       2 days ago
    role-play 要做好点还是得靠自托管微调模型吧?
    常规模型感觉最好还是 DeepSeek 了
    rizon
        41
    rizon  
    OP
       2 days ago
    @sommio 我看看 4.1 这个。 确实微调最好。但是 GPU 成本感觉有些高,一个 27b 以上模型满足并发和 ttft 需求的话 gpu 成本也不低
    lovelive1024
        42
    lovelive1024  
       2 days ago
    @rizon #36 ds 有多模态模型啊,而且明天出 4.1 也支持多模态
    garinluo
        43
    garinluo  
       2 days ago
    正常,看模型的投入就知道了。
    rizon
        44
    rizon  
    OP
       2 days ago
    @sommio 谢谢推荐 ds ,没想到都出了 vision 版了。明天做一下线上 case 回归看看。

    视觉版本的结构化输出支持上不完善。不过倒不是很大的问题。
    rizon
        45
    rizon  
    OP
       2 days ago
    @lovelive1024 嗯嗯,谢谢,看到了。明天试试。不知道它的视觉版内部怎么实现的,结构化输出支持的不太完善,倒不是太大问题。
    yungo8
        46
    yungo8  
       2 days ago via Android
    3.8max 还行,其它就差点意思,主要问题是高峰期时额度烧的太快了
    issakchill
        47
    issakchill  
       2 days ago
    你的后半句恰恰就回答了前半句
    Msxx
        48
    Msxx  
       2 days ago
    你都知道生产不能直接用了,还有什么可讨论的呢?另外,国模的隐私问题值得重点关注。国外大模型受环大陆监管,国内的大模型是 AI 之光是对抗老美的桥头堡,隐私和数据安全这些东西压根都不会放到台面上来说。
    5GA
        49
    5GA  
       2 days ago
    看着讨论氛围,感觉人人都是顶尖开发者,日常处理开发的都是了不得的产品,非顶尖非 Top 不行。
    zedpass
        50
    zedpass  
       1 day ago
    我用 3.7 plus 做 agent 产品没遇到你说的这些问题啊,不过模型确实性价比一般,主要是几个月不更新了,这个能力配不上定价
    ascend13
        51
    ascend13  
       1 day ago
    这种提升生产力的肯定用最好的,从不考虑国模
    Aaralyn
        52
    Aaralyn  
       1 day ago
    你不是已经自问自答了嘛
    sir283
        53
    sir283  
       1 day ago
    国产模型,不都是主打聊天跟陪伴吗?提供情绪价值的,你想要生产力的,肯定首选 gpt 啊。
    emSaVya
        54
    emSaVya  
       1 day ago
    @qaq13037 glm 、kimi 、deepseek 用户 be like
    songray
        55
    songray  
       1 day ago
    @rizon 我一直很想要这样的网站,如果 OP 可以贴出自己的测试结果在网站上作为参考就更好了,非常感谢
    GoogolChrome111
        56
    GoogolChrome111  
       1 day ago via iPhone
    我是小白。我感觉如果你真的想一次性一气呵成一个项目,只有 Codex 和 Claude Code 概率最高

    其他都不太行
    emptyqwer
        57
    emptyqwer  
       1 day ago
    @wat4me 还在 kimi 呢,都已经被实锤蒸馏了,现在新模型都不能在对话中切换模型了
    zpf124
        58
    zpf124  
       1 day ago
    @emptyqwer 实锤在哪呢?
    claude opus 曾经都说自己是 qwen 了,这都不不需要锤了也没见你们抵制啊。
    openAI 最近还陷入偷数学家用 codex 私有对话里的从未公开的草稿的风波也没见你们去抗议啊。
    装模做样。
    cooldong287671
        59
    cooldong287671  
       1 day ago
    @rizon kimi 也有 gpt 5.6 terra 偶尔也有
    gibber
        60
    gibber  
       1 day ago
    @5GA 说反了吧,就是因为不是顶尖开发者才需要顶尖工具弥补啊
    gloeaerris
        61
    gloeaerris  
       1 day ago   ❤️ 1
    @emptyqwer 如果一个强大的模型可以被蒸馏得到一个能力达到百分之八九十的新模型,那就说明这个大模型在技术上没有壁垒,在商业上就无法闭环,真是这样的话那对于被蒸馏的模型来说简直就是天塌了。
    所以,人家资本家拿蒸馏炒作玩玩估值你听听就行了,当真那就是。。。无言以对。
    蒸馏只能做到让大参数模型变成小参数模型,降低运行要求,但是智力会限制在一定范围,很容易测试出来。
    举个例子,你听一个行业顶尖教授 4 年课,你掌握这 4 年了教授传授的所有知识,那你问问自己,这时候你的能力=教授 80%~90%吗?
    wat4me
        62
    wat4me  
       1 day ago
    @emptyqwer 实锤在哪?那 Claude 前段时间说自己是 qwen ,也实锤蒸馏千问了呗,神人
    wat4me
        63
    wat4me  
       1 day ago
    @emptyqwer 而且你看看你这话,前后逻辑是啥?实锤蒸馏和在对话中切换模型的关系是?
    rizon
        64
    rizon  
    OP
       1 day ago
    @zedpass 3.7plus 带 tools 的请求会出现输出截断,finish_reason 重复出现两条的异常问题。反馈售后了,还没结论。 以前没事,这两天突然这样了。
    Meursau1T
        65
    Meursau1T  
       1 day ago
    如果不是 GPT 现在便宜,楼里根本不可能是这风向。
    国内模型不说什么吊打国外模型,至少 K3 GLM5.3 和 V4 完全可以达到国外顶尖模型 80%以上的水平。K3 V4 以及 5.6 sol 我天天用,没感觉有多大差别,国内模型还占个能说人话的好处。
    shunia
        66
    shunia  
       1 day ago
    别的不好说,qwen 那我只能是不推荐任何人用。
    公司提供和阿里合作的企业无限量 qwen 3.7 ,只能用 qoder+enterprise 端点。怎么说呢,做开发写代码也基本没法用,模型垃圾,haness 垃圾。
    再说 dashscope ,那更是一坨,售后倒确实还行,但是不顶用啊。

    目前用火山的套餐并且只使用 glm-5.3-flash (等一手 deepseek-4.1 ,4.0 实测不如 glm-5.3 ),另外就是自己买中转用 OpenAI 和 Anthropic 。
    Jack927
        67
    Jack927  
       1 day ago
    因为我用 GLM qwen-3.6 后很不稳
    rizon
        68
    rizon  
    OP
       1 day ago
    @sommio 请问知道 ds 今天什么时候正式上线吗,交流群也进不去了,网上没任何消息,我打算今天切 ds 试试里
    hidemyname
        69
    hidemyname  
       1 day ago
    http://llmapicheck.dev 这网站还要填自己的 api key???
    registerrr
        70
    registerrr  
       1 day ago
    工具挺好的,就是一个 benchmark ,能再附上一个天梯榜就更好了,可以是你自己测的主流模型的,也可以考虑收集脱敏之后用户测试的数据。
    yiranw09
        71
    yiranw09  
       1 day ago
    我怎么测试和你不一样...
    ykrank
        72
    ykrank  
       1 day ago
    @Msxx 闭源模型和开源模型比隐私和数据安全?你真是会比,你没发现你这句话里面的老美改成老中更确切吗?
    edisonwong
        73
    edisonwong  
       1 day ago
    这里点名阿里,百炼,qwen

    我有 300 阿里云代金券,2 天就用完了,关键能力也没多强,我 300 块用隔壁小米 mimo ,虽然不算十分聪明,起码能让我高强度干活用一个月啊。至于百炼送的那些 100 万 token 免费用的模型,有些都无法支撑我问一个问题,拉完了

    现在即便我有代金券我都不想用在 ai 上了,纯浪费钱,还不如买资源
    edisonwong
        74
    edisonwong  
       1 day ago
    @edisonwong 结论:免费给我我都不用 qwen ,我还不如充钱买量大管饱的,或者买好一点的 gpt
    zedpass
        75
    zedpass  
       1 day ago
    @rizon #64 换个方式接入试试呢?我一直用的 authropic message api 接入没啥问题
    wsseo
        76
    wsseo  
       1 day ago
    不是一直是这样的吗,又不是最近
    visitantzj
        77
    visitantzj  
       1 day ago
    @qaq13037 确实,论坛里现在这气氛确实有点诡异,搞得跟中转站卖 token 的开团建一样。按理说 LD 上卖 token 应该多得多,但感觉更就事论事。
    126ium
        78
    126ium  
       1 day ago via Android
    @qaq13037 喊口号并不能解决实际问题,用户用脚投票而已
    1235467
        79
    1235467  
       17h 5m ago via Android
    角色扮演一般都是用 deepseek v3.1 v3.2 v4 pro/flash, claude opus 4.6/4.8, claude fable 5/5.1, kimi k3 之类的东西吧, 至少社区里比较火的是这些
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1462 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 169ms · UTC 16:51 · PVG 00:51 · LAX 09:51 · JFK 12:51
    ♥ Do have faith in what you're doing.