我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?后者比前者贵 5000 左右,要不要换呢?还是说等老黄的大饼(显存内存一体笔记本)还是加预算上 mac 呢?如果不本地部署,买订阅也够用 4 、5 年。但是未来不好说啊,自己能有一个推理和执行 skills 准确率 80%以上的大模型真的很香
我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?后者比前者贵 5000 左右,要不要换呢?还是说等老黄的大饼(显存内存一体笔记本)还是加预算上 mac 呢?如果不本地部署,买订阅也够用 4 、5 年。但是未来不好说啊,自己能有一个推理和执行 skills 准确率 80%以上的大模型真的很香
1
Nasdaq 11h 10m ago
我 4090 跑起来感觉就那样,都是营销号在吹牛皮。个人感觉都不如新出的 gemini3.7-flash
|
2
ethanpeng 10h 52m ago
你们单卡 24GB 怎么跑起来的?量化多少上下文多少?
我这边测试 4*24GB 刚刚跑起来,速度还特别慢 ``` docker run -itd --name Qwen3.8-27B-8bit --gpus all --ipc=host -v /data/models/btbtyler09_Qwen3.8-27B-GPTQ-8bit:/models -p 8000:8000 vllm/vllm-openai:v0.27.1-x86_64-ubuntu2404 --model /models --served-model-name Qwen3.8-27B --port 8000 --api-key 6f08cbed -tp 4 --gpu-memory-utilization 0.98 --kv-cache-dtype fp8 --max-model-len 262144 --max-num-seqs 6 --enable-chunked-prefill --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-prompt-tokens-details --enable-force-include-usage ``` ![]() |
3
Jacobson 10h 51m ago
850W 电源,270KP+Z890 ,拆分成双槽 PCIE5.0 x 8 ,插 2 块 5060TI 16G ,跑 27b q4 ,23token/s 。
估计是双槽通讯延迟损耗 + 5060TI 位宽太小导致的,图隐私,倒也是能用。 要体验更好,最好单卡 32G 以上吧,70ti 80ti 那种。 |
4
wwhc 10h 9m ago
建议 Linux + 32GB VRAM GPU + Qwen3.8-27B-UD-Q5_K_XL.gguf + llama.cpp ,可以上到 200k 的上下文。不建议用 vllm ,只能上到 4 位量化,推理质量显著劣于 llama.cpp 的 Q5 量化
|
5
loveshuyuan 10h 4m ago
我用 Mac Studio M4 Max 64G + MTPLX 能跑 60tps ,但是 prefill 很慢,特别是接入 claude code 这种 AI 工具,首字要等几分钟
|
6
BingoXuan 9h 52m ago
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
|
7
wwhc 9h 38m ago
单卡 24GB GPU + llama.cpp + Qwen3.8-27B-UD-Q4_K_XL.gguf 可以上到 100K 的上下文,推理质量优于同 4 位量化的 vLLM 配置
|
8
metalmax 9h 8m ago
AMD R9700 看看呗,全新的 1 万块 3 年质保比魔改卡靠谱多了,开 MTP 也有 25+的 tokens/s 了
|