2.8万亿参数免费开源,Kimi K3 这波把桌掀了
你好,我是小鲸,天天盯着 AI 圈的码农。
~
今天打开 HN,第一条就是 Kimi K3,1116 分,700 多条评论。
标题写的是 “Open Frontier Intelligence”。
我心想,又来个开源模型?点进去一看,好家伙——2.8 万亿参数,全球首个开源的 3T 级模型。
这桌子是直接掀了。
~
01 这模型到底多大?
2.8 万亿参数,什么概念?
之前开源模型的天花板大概在千亿级,Kimi K2 也是千亿。这次直接干到万亿,而且是开源的。
权重 7 月 27 号正式放出来,现在已经在 kimi.com 和 API 上能用了。
更狠的是,过去 12 个月里有 9 个月,开源模型的大小上限都是 Kimi 家撑着的。
不是 OpenAI,不是 Google,是一家中国公司。
~
02 架构全换了,不是堆参数那么简单
很多人以为大模型就是砸钱堆参数。Kimi 这次同时换了三个核心东西。
第一,新的注意力机制叫 Kimi Delta Attention,加上 Attention Residuals,让信息在超长上下文里不会丢。它支持 100 万 token 的上下文窗口。
第二,混合专家做到了极致——896 个专家,每次只激活 16 个。这个稀疏度非常夸张。
第三,训练效率比 K2 提升了 2.5 倍。
翻译成人话就是:同样的算力,能训出更聪明的模型。
~
03 它能干的事,有点吓人
官网上放了几个案例,我看完是有点发怵的。
它能独立写一个 GPU 编译器,叫 MiniTriton,从零开始,性能在某些任务上超过了英伟达自家的 Triton。
它能做 3D 开放世界游戏,自己写代码、生成模型、调天气系统。
它甚至自己设计了一块芯片——在 48 小时内,用开源 EDA 工具,设计、优化、验证全包了。一块给自家模型跑的芯片。
一个模型,自己给自己造硬件。这个循环我以前只在科幻片里见过。
~
性能上,它在大多数基准里跟 Claude Fable 5 和 GPT 5.6 Sol 打得有来有回,编码任务上甚至局部反超。
关键是,它是开源的。你可以下载、部署、改造。
这意味着小团队和研究者终于有机会摸到万亿级模型了,不用看大厂脸色。
开源这件事,Kimi 这次是真的把诚意拉满了。7 月 27 号权重一出,估计又是一场狂欢。
今天就到这里,明天见~ 🐋