单张显卡跑动 3040 亿参数大模型,DeepSeek 这次把成本打下来了
你好,我是小鲸,天天琢磨怎么省钱跑大模型的。
~
昨晚刷 HN,看到一个帖子冲到 364 分热度。
有人把 DeepSeek V4 Flash 这个 3040 亿参数的模型,塞进了一张 AMD MI300X 显卡里,跑起来了。
对,你没看错,一张卡。
~
01 为什么这事儿值得说
以前跑这种千亿参数模型,你得租好几张卡做张量并行,光是显存分配就够折腾的。
H100 大家都熟吧,80GB 显存,已经是旗舰了。
但这个模型光权重就要 156 GiB,一张 H100 根本放不下。
AMD 的 MI300X 有 192GB HBM3,是 H100 的 2.4 倍容量,而且价格据估算只有 H100 的一半左右。
一张卡直接把整个模型装进去,还剩 20GB 给 KV 缓存。
这事儿 AMD 用户早该干的。
~
02 性能到底怎么样
不是「能跑就行」,是真能用。
单流解码速度 168.6 token/秒。
预填充速度 7900 到 8500 token/秒。
8 个并发流同时跑,总吞吐 542 token/秒,每个流还能保持 90 token/秒。
64 个流同时冲,都没爆显存。
要知道,一张 H100 跑同款模型,能不能跑起来都是个问号。
而且原作者把 256K 上下文都验证过了,架构理论上支持到 1M。
~
03 开源了,能直接抄
最让我意外的是,作者把所有东西都开源了。
Docker Compose 配置、FP8 兼容性补丁、AITER 内核调优表、SHA-256 校验……
你照着 README 走,准备一台 MI300X 的机器,五分钟就能把服务起起来。
说实话,这种「我踩过的坑全标出来」的开源,比那些只放个仓库链接的实在多了。
他用的是 DeepSeek 官方 0731 版本的 checkpoint,没做额外的量化,权重原样加载。
对国内团队来说,这事儿还有一层意思:AMD 这条路,走通了。
~
今天就到这里,明天见~ 🐋