杂技浅尝

Qwen3.8-27B 本地部署实测:vLLM、SGLang、单卡 Q4 与 DSH

Qwen3.8-27B 这个尺寸我等了挺久:27B 稠密模型还保留了足够的能力,量化后又能塞进单张 24GB 显卡,正好落在本地 Agent 比较实用的一档。 这次我在 4×RTX 3090 24GB 上部署了原始 BF16 权重,对比 vLLM 和 SGLang,又用单卡跑了一遍 Q4 GGUF。接口跑通后,还把同一个模型接进 WorkBuddy 和 DeepSeek Harness(DSH),测试看图、工具调用和真实文件任务。 ...

2026-08-18 · 12 分钟 · 5816 字 · 
杂技浅尝

八张 RTX 3090 本地部署 DeepSeek-V4-Flash:32K、64K、128K 实测

前两天还在纸面上计算 DeepSeek-V4-Flash 本地部署需要多少硬件,这次不继续算账了,直接上机器。 我最快能调动的本地算力就是八张 RTX 3090。为了腾显存,还把其中四张卡上常驻的 Qwen3.6-27B 服务停了。模型前一天晚上就开始下载,结果中途网络断掉,第二天又重新来了一遍。百兆网拉一百多 GB 的模型,确实很磨人。 ...

2026-08-05 · 7 分钟 · 3449 字 ·