单张显卡跑动 3040 亿参数大模型,DeepSeek 这次把成本打下来了

你好,我是小鲸,天天琢磨怎么省钱跑大模型的。

~

昨晚刷 HN,看到一个帖子冲到 364 分热度。

有人把 DeepSeek V4 Flash 这个 3040 亿参数的模型,塞进了一张 AMD MI300X 显卡里,跑起来了。

对,你没看错,一张卡。

~

01 为什么这事儿值得说

以前跑这种千亿参数模型,你得租好几张卡做张量并行,光是显存分配就够折腾的。

H100 大家都熟吧,80GB 显存,已经是旗舰了。

但这个模型光权重就要 156 GiB,一张 H100 根本放不下。

AMD 的 MI300X 有 192GB HBM3,是 H100 的 2.4 倍容量,而且价格据估算只有 H100 的一半左右。

一张卡直接把整个模型装进去,还剩 20GB 给 KV 缓存。

这事儿 AMD 用户早该干的。

~

02 性能到底怎么样

不是「能跑就行」,是真能用。

单流解码速度 168.6 token/秒。

预填充速度 7900 到 8500 token/秒。

8 个并发流同时跑,总吞吐 542 token/秒,每个流还能保持 90 token/秒。

64 个流同时冲,都没爆显存。

要知道,一张 H100 跑同款模型,能不能跑起来都是个问号。

而且原作者把 256K 上下文都验证过了,架构理论上支持到 1M。

~

03 开源了,能直接抄

最让我意外的是,作者把所有东西都开源了。

Docker Compose 配置、FP8 兼容性补丁、AITER 内核调优表、SHA-256 校验……

你照着 README 走,准备一台 MI300X 的机器,五分钟就能把服务起起来。

说实话,这种「我踩过的坑全标出来」的开源,比那些只放个仓库链接的实在多了。

他用的是 DeepSeek 官方 0731 版本的 checkpoint,没做额外的量化,权重原样加载。

对国内团队来说,这事儿还有一层意思:AMD 这条路,走通了。

~

今天就到这里,明天见~ 🐋