yiranw09
V2EX  ›  Local LLM

请教一下,本地部署 deepseekV4flash 大概需要什么样的配置需求?

  •  
  •   yiranw09 · 11 days ago · 10565 views
    先说明背景,我们公司是半导体公司,我是生产的工程师,并不是信息部门的,但是生产这边有需求,做自己的数据分析跟踪平台,信息部那边又没人力,我们一个实验管理平台拖了半年了还没给我们做好,我拿 llm 自己都 vibe 了一个。
    现在有两个需求都需要用到 ai ,而且因为数据敏感,还必须是纯本地运行。
    一方面试生产工程师开发自己的数据平台需要 ai 做 vibecoding ,另一方面我们希望能用 ai 做数据分析和建模,这方面我们已经悄悄地通过 ai 输出验证了很多东西了
    之前是国产开源的模型能力一般,能力好的模型又太大,部署成本太高,但是近期 deepseekV4flash 的模型量较小,部署成本大幅度降低,能力也完全胜任我们的需求,前段时间的 dflash 技术也让速度能够显著上升。
    想问问有没有本地部署 deepseekV4flash 的方案,我可以借鉴一下
    然后下周拉着我们生产领导去找信息部领导 Battle
    98 replies    2026-08-17 11:40:03 +08:00
    duanxianze
        1
    duanxianze  
       11 days ago   ❤️ 1
    你为啥不直接问问 deepseek 呢
    duanxianze
        2
    duanxianze  
       11 days ago
    不过我可以提前提醒你一句,目前有钱你都不一定能搞定,到处都在缺货
    OutOfMemery
        3
    OutOfMemery  
       11 days ago
    有专门做内网部署的商家,包括硬件,某宝,视频平台可以找找了解一下
    Kinnice
        4
    Kinnice  
       11 days ago
    Mac Studio
    - M3 Ultra
    - 256GB 统一内存 推荐 512GB
    - 2TB SSD
    106npo
        5
    106npo  
       11 days ago   ❤️ 4
    yiranw09
        6
    yiranw09  
    OP
       11 days ago
    @duanxianze #1 问了啊,它给了好几个配置,有 mac studio 128/256 ,有 H100/A100*2 ,有 ada6000*4 ,但是我也不清楚具体效果如何,想问问实际方案和效果,有没有更适合生产的解
    yiranw09
        7
    yiranw09  
    OP
       11 days ago
    @duanxianze #2 我也在想这个问题...
    yiranw09
        8
    yiranw09  
    OP
       11 days ago
    @OutOfMemery 这要是还找商家我们信息部是真的不用干了 全外包得了
    vandort
        9
    vandort  
       11 days ago   ❤️ 5
    自己运行一个 DeepSeek V4 Flash 级别的大模型大概需要 200G 左右的显存,最便宜的方案是 4 个 48G 的 4090 。我不是很确定 4090 跑 DeepSeek V4 Flash 会不会有数据格式上的问题,但如果有问题的话可以选择 DeepSeek V4 Flash W4A*的版本,精度损失比较小,基本是可用的。问题是 48G 的 4090 目前市场上比较少,不一定能找到。如果没货,替代方案是一台 8 卡 5090 的机器。这两种方案都要花大概 30-50 万。还可以买二手的 910B4 ,应该不会超过 70 万。这些是 5 月底的价格,不知道最近涨价没有。我们的业务里包括了给客户提供各种形式的正规的大模型服务的,有需要可以找我们。
    uiosun
        10
    uiosun  
       11 days ago
    @vandort 涨了的,六月底咨询工作站,两家还不错的公司,问销售都说涨价了
    yiranw09
        11
    yiranw09  
    OP
       11 days ago
    @Kinnice 嘿,现在 Mac studio 涨价也太厉害了,而且 token 输出还是感觉有些慢,加上 mac 不支持 vllm ,而 deepseekv4flash 似乎还没有 MLX 模型吧
    yiranw09
        12
    yiranw09  
    OP
       11 days ago
    @106npo 打不开欸,不知道为什么
    106npo
        13
    106npo  
       11 days ago
    @yiranw09 应该不用翻墙.不过这样的网站挺多的 ,找个支持计算预期 tps 和 ttft 的网站看吧
    evil0harry
        14
    evil0harry  
       11 days ago
    我看有人推荐两台 NVIDIA DGX ,单台 35k 左右
    mzsongyan
        15
    mzsongyan  
       11 days ago
    看看 dgx spark
    levn
        16
    levn  
       11 days ago
    PRO 6000 x 2
    AAAAAAAAAAAAAAAA
        17
    AAAAAAAAAAAAAAAA  
       11 days ago
    个人用和公司很多人用是不一样的,吐字速度跟不上,找个专业的评估一下吧。
    yiranw09
        18
    yiranw09  
    OP
       11 days ago
    @AAAAAAAAAAAAAAAA 所以不是来 V 站问问现成的方案嘛,先有个大概我好去 battle (
    Chihaya0824
        19
    Chihaya0824  
       11 days ago   ❤️ 2
    别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
    正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
    如果电够多也可以选择 8 个 5090 的方案也行

    @vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
    yiranw09
        20
    yiranw09  
    OP
       11 days ago
    @evil0harry 似乎可以欸
    yiranw09
        21
    yiranw09  
    OP
       11 days ago
    @Chihaya0824 带宽还是太低了是吗?哎,不知道能不能买得到
    Chihaya0824
        22
    Chihaya0824  
       11 days ago
    还有别买 pro 6000D ,一买一个不吱声
    Hilalum
        23
    Hilalum  
       11 days ago
    https://omlx.ai/compare 这输入模型和芯片可以查到真实部署的 tok/s
    Chihaya0824
        24
    Chihaya0824  
       11 days ago
    @yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
    yiranw09
        25
    yiranw09  
    OP
       11 days ago
    @Chihaya0824 #24 嗷我好像知道咋回事,M3 那会还没有加速单元,M5 才加上的
    Vveeb
        26
    Vveeb  
       11 days ago
    > 而且因为数据敏感,还必须是纯本地运行
    我说个题外话, 大清都亡了, 现在中小公司真的有那种很敏感的数据么?
    人家顶尖的 Cyber 模型都已经能发现茫茫多的网络安全漏洞了 (至少人家模型厂商是这么吹的).
    真让人家模型厂商拿到公司的数据了, 这数据对模型厂商有价值么?
    Chihaya0824
        27
    Chihaya0824  
       11 days ago
    @yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
    AEDaydreamer
        28
    AEDaydreamer  
       11 days ago
    @Vveeb 道理懂技术的人都懂, 更多是制度和合规吧.
    foryou2023
        29
    foryou2023  
       11 days ago
    你搜索一下 b 站,我刷到过别人的部署个人使用,个人使用的话,好像 10 万就够了,每秒 Token 在 100 左右好像,不过这个金额记得不是很清楚。
    yiranw09
        30
    yiranw09  
    OP
       11 days ago
    @vandort 看了一下,感觉现在这个价格要更贵了...
    yiranw09
        31
    yiranw09  
    OP
       11 days ago
    @Vveeb 哎...问题是我们的数据不是那种 ai 会需要的数据,而是在生产行业中很敏感的数据,虽然 ai 不需要,但是会有数据泄露,这个很严重。
    wwhc
        32
    wwhc  
       11 days ago
    两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
    jimrok
        33
    jimrok  
       11 days ago
    建议你用生产的样本数据给 ai ,写出分析程序之后,去跑生产数据。这样敏感信息的处理还是自己控制,但分析工具让 ai 给你造。
    GeTLeFt
        34
    GeTLeFt  
       11 days ago
    @Vveeb 很多啊,比如金融法律这种涉及用户隐私的
    yiranw09
        35
    yiranw09  
    OP
       11 days ago
    @jimrok 问题在于样本数据我都很难发给 ai ,以及生产的数据很复杂,变量影响因素特别多,不给真实数据分析程序是写不明白的,除非我提示词工程能写的特别清晰...但是这个实在是太难了,我们之前偷摸摸用的时候就是这样做的,工程量巨大不说,调试测试也很麻烦,甚至数据还清洗不干净,可是几十万条数据你让我手动清理...哎
    suke119
        36
    suke119  
       11 days ago
    @yiranw09 要么 A100 H100 4 张起步 要么昇腾国产系列 8 张起步 优化完速度 30-40 左右 效果还可以 目前我们实践过的 vllm
    lrabbit
        37
    lrabbit  
       11 days ago   ❤️ 5
    我前天刚部署了一个,两台 dgx spark,昨天连续跑了一个 7w 多行的 rust 代码,跑了十几亿 token ,总体感觉速度比官方 api 慢 30%,本地大概 50token/s,官方 70-100 token/s 目前 dgx spark 是我觉得最适合部署 deepseek v4 flash 的设备,放在桌面上简直是个艺术品,一点声音也没有,等我多跑几天,后续发个测评
    KOMA1NIUJUNSHENG
        38
    KOMA1NIUJUNSHENG  
       11 days ago
    @yiranw09 #8 你可以跟老板报告你拿着 AI 能把信息部的活全揽了,让他把信息部全开了给你涨工资,过两年直接财富自由
    jimrok
        39
    jimrok  
       11 days ago
    @yiranw09 确实,你这样的需求非常多,dgx spark 这样的产品未来会是一个主要的形态。苹果,国内的瑞芯微应该都会类似的产品出来。每个办公室都需要一个这样的数字员工,看看打印机的规模,这个市场真是太大了。
    sparkssssssss
        40
    sparkssssssss  
       11 days ago
    实测,我们有一台 m3 256G/1T 的版本,ds 刚出圈的时候,买来想着内部跑着试试的,结果,实测,跑个 70b 都勉强,能跑,但是速度很慢,正常用,30b 左右的模型,使用问题不大,但是并发也不行
    我以为用的框架有问题,ollma/vllm/lmstudi 都测试了下,来去不大,不推荐 mac ,能跑,但是仅仅是能跑,
    sky009
        41
    sky009  
       11 days ago
    @lrabbit 大佬部署的哪个模型?我看有专门的 DeepSeek-V4-Flash-DSpark 的模型,是否部署的这个版本。
    qishua
        42
    qishua  
       11 days ago
    @vandort 哪来的 48G 型号的 4090 ?,我们之前部署用的是 8 卡的 4090 24G 的,部署的是 ds r1
    kakakakaka8889
        43
    kakakakaka8889  
       11 days ago
    现在昇腾的卡都不好买到
    Jesens
        44
    Jesens  
       11 days ago
    一般来讲 vllm 官网的应该是最准确的: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
    TomatoCLI
        45
    TomatoCLI  
       11 days ago
    当生产力的话你就 36 楼说的,当玩具的话你就按上面说的 Mac 部署。
    hafuhafu
        46
    hafuhafu  
       11 days ago   ❤️ 1
    首先排除 DGX Spark 这类东西,因为只适合简单实验性探索,没法当生产力。
    要生产力正儿八经弄点显卡跑,看你预算了。正经想要速度和并发,投资不小。
    我 DGX Spark 单台跑了个 Qwen3.6-35B-A3B-FP8 的模型,30-50 的 tok/s 吧。
    跑 Qwen3-VL-8B-Instruct ,10-20 。效果倒是还可以,但是龟速。等完整输出完都猴年马月了。
    下了个量化过的 DeepSeek v4 flash 还没测,看测评也是 10-20 左右。
    flyico
        47
    flyico  
       11 days ago   ❤️ 1
    至少需要 70w ,不要盯着最低需求看,能吐字和能流畅的吐字完全是两种产品。
    jlkm2010
        48
    jlkm2010  
       11 days ago
    2 张昇腾 950PR 起步,最好是 4 张,如果对吞吐量要求比较高,可以搞一个 8 卡昇腾 950PR 服务器
    yiranw09
        49
    yiranw09  
    OP
       11 days ago
    @suke119 是增加 dflash 之后吗?并发效果如何?
    yiranw09
        50
    yiranw09  
    OP
       11 days ago
    @flyico 70w 大概率是超我们部门的预算了(
    提到集团公司上说不定有戏,这傻逼公司是真的抠门
    Haku
        51
    Haku  
       11 days ago via Android
    按百万算。
    不止你买硬件,后面跑起来电费,散热,维护也是一大笔开销。
    yiranw09
        52
    yiranw09  
    OP
       11 days ago
    @Jesens 上面的要求也太高了...哈,8 张 H100 ,我从哪偷啊
    dododada
        53
    dododada  
       11 days ago
    @Vveeb 理论内容如果是开放的,那值钱的除了商业机密,就是技术实施流程中的各种验证数据和验证方案了,这东西对生产制造行业来讲,就是命脉
    dododada
        54
    dododada  
       11 days ago
    好像 V 站的朋友很少和供应商打交道,渠道商肯定是缺货的,但是制造商不一定缺货啊
    yiranw09
        55
    yiranw09  
    OP
       11 days ago
    @dododada #54 到时候再拉上神通广大的商务,hhhh
    han1988
        56
    han1988  
       11 days ago
    最便宜是搞 4 张 cmp 170hx ,解锁到 40G 的就行。
    north521
        57
    north521  
       11 days ago
    两个 dgx spark 就行了,我这部署了,没问题,60 多 token/s
    bunai
        58
    bunai  
       11 days ago
    @north521 烫的起飞吧
    ZZFM
        59
    ZZFM  
       11 days ago   ❤️ 1
    用 MI300 或者 MI325 ,生产级别的硬件和代码,速度还够快,可以看看这个 https://github.com/ryanzhou/deepseek-v4-flash-mi300x
    cat9life
        60
    cat9life  
       11 days ago
    @north521 #57 两台总共 256G 显存不够的吧
    lrabbit
        61
    lrabbit  
       11 days ago
    @sky009 https://github.com/eugr/spark-vllm-docker/tree/main 吗,这个版本不会出现问题,跟官方的智商一模一样,我测试过了,其他版本可能会有点问题
    north521
        62
    north521  
       11 days ago
    @bunai #58 推理的时候七八十度
    north521
        63
    north521  
       11 days ago
    @cat9life #60 占了大概 220G
    beefhotpot
        64
    beefhotpot  
       11 days ago
    beefhotpot
        65
    beefhotpot  
       11 days ago
    #64, 八卡 5090 也能勉强跑,但是超级慢
    beefhotpot
        66
    beefhotpot  
       11 days ago
    syh2
        68
    syh2  
       11 days ago
    这种 284B 量级的模型,自己买设备,如果只走内存不走显存,貌似输出 token 特别慢,可能不一定能达到好用的要求
    superkkk
        69
    superkkk  
       11 days ago
    8 卡或者 4 卡的 5090 能跑 fp8 或者 nvfp4 的,或者用 2 卡 pro6000
    niubee1
        70
    niubee1  
       11 days ago
    自己爽跑的话,两台 DGX Spark ,要便宜可以去买微星或者技嘉的版本, 技嘉 1T 存储的版本 双机并联差不多 6 万多的成本
    zsj1029
        71
    zsj1029  
       11 days ago via iPhone
    h20 196g 足够,141 也能跑,一到两块就行 pcie 的卡,改个水冷就行
    niubee1
        72
    niubee1  
       11 days ago
    @zsj1029 H20 只有 96G 没有 196G , 你怎么看瓢了的
    beginor
        73
    beginor  
       10 days ago via Android
    2 张 H20(140G 版本)就可以,不过一定要有 nvlink ,我们用 4 张 H20 了,512k 上下文 10 并发,简直不要太爽
    Gnnbb
        74
    Gnnbb  
       10 days ago
    @Chihaya0824 #22
    为什么大佬,我们公司也是准备配 4 块 pro 6000D
    pro6000 好像是受管制
    Chihaya0824
        75
    Chihaya0824  
       10 days ago
    @Gnnbb BF16 over TF32 accumulation 怀疑是有 5090 一样的游戏显卡的非解锁算力,总之就是很慢
    pro 卡一般是和同 die 的游戏显卡少 2 倍的 tensor core 性能的
    Chihaya0824
        76
    Chihaya0824  
       10 days ago
    @Chihaya0824 游戏显卡少 2 倍的 tensor core 性能的 “游戏显卡的 2 倍的 tensor core 性能的” 打错了不好意思
    vandort
        77
    vandort  
       10 days ago
    @qishua 华强北魔改的
    anyinuo0413
        78
    anyinuo0413  
       10 days ago
    我们现在单 4090 48g 跑 qwen 3.6 量化版本…写个小工具行,稍微复杂点的得转半天…
    买了俩 48 俩 24…四张都用上也跑不了什么模型…现在跑了俩量化…一个排序一个向量… 空了一块 24 在吃灰
    clemente
        79
    clemente  
       10 days ago
    单张 B100 (192GB VRAM) 可以跑 NVFP4 版本的 deepseek-ai/DeepSeek-V4-Flash-0731
    clemente
        80
    clemente  
       10 days ago
    @vandort 别买电子垃圾 还不如 rtx6000 呢
    clemente
        81
    clemente  
       10 days ago
    @wwhc 满血 bf16 dtype 应该是 160Gib * 4 以上的需求 还不考虑 kv cache 的话
    clemente
        82
    clemente  
       10 days ago
    @vandort NV 或者 AMD 的 sdk kernel 库都是根据卡 sm 标号来的 你老卡上显存 120gb 也只能解决能跑的问题 速度天花板很低,因为 kernel 是按照 general 或者那个标号来写的
    clemente
        83
    clemente  
       10 days ago
    @vandort 另外游戏显卡 没有 tensor core 或者少很多。 这才是 高性能计算需要的。
    wwhc
        84
    wwhc  
       10 days ago
    @clemente DeepSeek 开源的是 4B 版本,也就 167GB 左右,你可到 huggingface 计算具体大小
    clemente
        85
    clemente  
       10 days ago
    clemente
        86
    clemente  
       10 days ago
    DeepSeek-V4-Pro with 1.6T parameters (49B activated) and DeepSeek-V4-Flash with 284B parameters (13B activated) — both supporting a context length of one million tokens.
    clemente
        87
    clemente  
       10 days ago
    @wwhc 你不妨吧链接和 readme 扔给 ai 解答一下吧
    Lazymio
        88
    Lazymio  
       10 days ago
    单流跑 Agent 性价比最高的感觉就是 2 台 Dgx Spark ,6 万块
    wwhc
        89
    wwhc  
       10 days ago
    @clemente DeppSeek 开源的是 167GB 的版本,仓库里标明了大小
    DeepSeek-V4-Flash-0731
    167 GB
    https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/main
    clemente
        90
    clemente  
       10 days ago
    @wwhc 体积和运行时加载 vram 消耗是两回事啊
    clemente
        91
    clemente  
       10 days ago
    @wwhc


    对话中双方的具体错漏分析讨论角色观点/依据分析与评价 wwhc 看到 HF 文件列表总和为 167GB ,就认为只要 167GB 显存即可运行。
    概念混淆:混淆了“磁盘文件体积”与“运行时显存需求”。没有考虑到 KV Cache 、并发数( Batch Size )、上下文长度以及加载精度对显存的放大效应。



    clemente 提醒“满血 BF16 需求远超文件体积”、“运行显存还需考虑 KV Cache”。
    思路正确:深刻理解 LLM 推理的显存瓶颈不仅在 Weight ,更在于长上下文下的 KV Cache 和计算开销。
    namgking
        92
    namgking  
       10 days ago
    部署 0731 版本,使用的是 4 卡 H20 141GB 版本的 ,输出响应都很流畅。
    (APIServer pid=) INFO 08-07 13:33:52 [loggers.py:273] Engine 000: Avg prompt throughput: 2059.3 tokens/s, Avg generation throughput: 1343.5 tokens/s, Running: 102 reqs, Waiting: 1 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 94.4%
    fcten
        93
    fcten  
       10 days ago
    4 x 4090 48g 或者 2 x RTX PRO 6000

    上面是最低配置,如果需要 1M 上下文 + 一定数量的并发,比较建议 4 x RTX PRO 6000

    当然,预算够就推荐 4 x H20
    dbow
        94
    dbow  
       10 days ago
    https://v2ex.com/t/1232688 我专门开了一贴讲怎么在 dgx spark 双机上部署 deepseek v4 flash
    misakaleeasxy
        95
    misakaleeasxy  
       10 days ago
    很巧了刚好今天测完,起因是师兄公司到了 DGX Spark ,部署 V4flash 玩,给我截图,开着 Dspark 投机最高大概 50tokens/s 。然后我这边因为有 4xV100 SXM2 和 5090 分别测了一下,Q8 生成在 V100 上大概 8tokens/s ,Q3xxs 可以到 30 (完整放入显存),Q3 开 Ngram 四路并发最高 67.6 。8x5090 的话 baseline 是 55 左右,开 Dspark 到 87 ,重复输出 123 。开 Ngram 重复输出能到 600 (以上数据来自 sol5.6 自动测试)。从价格来看说句实话 DGXSpark 太香了。
    wwhc
        96
    wwhc  
       10 days ago
    @clemente 我建议你实际部署以体验真实的情况
    fanhed
        97
    fanhed  
       9 days ago
    两张 RTX PRO 6000, 数据自己看:
    Prefill tok/s Aggregate decode tok/s
    ╭──────┬─────────┬────────┬────────┬───╮╭────────────┬───────┬───────┬───────╮
    │ ctx │ tokens │ TTFT s │ tok/s │ N ││ ctx \ conc │ 1 │ 2 │ 4 │
    ├──────┼─────────┼────────┼────────┼───┤├────────────┼───────┼───────┼───────┤
    │ 8k │ 8,192 │ 0.82 │ 9,959 │ 1 ││ 0 │ 213.7 │ 331.0 │ 494.7 │
    │ 16k │ 16,250 │ 1.61 │ 10,094 │ 1 ││ 16k │ 214.3 │ 333.4 │ 585.7 │
    │ 32k │ 32,342 │ 3.10 │ 10,429 │ 1 ││ 32k │ 209.1 │ 335.3 │ 491.9 │
    │ 64k │ 64,559 │ 6.15 │ 10,501 │ 1 │╰────────────┴───────┴───────┴───────╯
    │ 128k │ 128,992 │ 14.53 │ 8,878 │ 1 │
    ╰──────┴─────────┴────────┴────────┴───╯
    charlie21
        98
    charlie21  
       13h 13m ago
    参考 google gemma-4-31b 部署
    https://zhuanlan.zhihu.com/p/2026969413518107721
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1435 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 178ms · UTC 16:53 · PVG 00:53 · LAX 09:53 · JFK 12:53
    ♥ Do have faith in what you're doing.