• 最近访问:
发表于 2026-07-28 14:47:10 股吧网页版
Kimi K3正式开源,阿里、华为等厂商首日适配
来源:21世纪经济报道

  21世纪经济报道记者雷晨

  7月27日晚,月之暗面正式发布Kimi K3技术报告,并同步开放完整模型权重。

  作为总参数达2.8万亿、激活参数约1040亿的大模型,Kimi K3凭借在核心架构上的原始创新,在多项评测中展现出逼近全球顶尖闭源模型的性能。

  7月28日,K3模型即获海内外数十家AI基础设施厂商的首日(Day0)适配,引发了全球开发者社区的强烈反响。

  值得注意的是,Kimi K3采用了专门的许可证,为商业化应用设定了门槛。

  训练效率跃升

  Kimi K3的技术底座与上一代Kimi K2相比有明显变化。技术报告显示,该模型采用了三项核心架构设计:Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)以及Stable LatentMoE框架。

  KDA是一种线性注意力机制,它将传统Transformer中随序列长度增长的KV缓存替换为固定大小的循环状态,从而在1M上下文窗口下保持较低的计算开销。Attention Residuals则允许每一层网络选择性检索前面所有层的表征,改善了信息在深度网络中的流动效率。在MoE设计上,Kimi K3将路由专家数量扩展到896个,每个token激活其中16个,配合2个共享专家,实现了约56倍的稀疏比例。

  月之暗面企业业务负责人黄震昕此前在接受媒体群访时介绍,围绕token efficiency,团队自研了Moon Clip新型二阶优化器,Kimi团队在全球首次将其落地到大模型训练中。简单理解Moon Clip的效果:原本需要40T数据才能达到的训练效果,现在只用20T训练数据就能实现。目前全球可使用的优质训练数据基本已经挖掘殆尽,这项技术能带来两大价值:一是有限的数据可以激发出模型更高的智能水平;二是想要达到相同性能,模型训练成本、训练计算量(FLOPs)直接减半。

  从技术报告披露的缩放曲线来看,上述架构和工程改进共同带来了约2.5倍于Kimi K2的整体缩放效率提升。模型包含93层,其中69层为KDA注意力层,24层为Gated MLA层。

  在视觉能力方面,Kimi K3的视觉编码器MoonViT-V2是一个约4亿参数的视觉Transformer。与以往做法不同,该编码器从头开始通过下一token预测训练,而非从SigLIP等对比预训练模型初始化。月之暗面团队表示,这种方式在训练稳定性上表现更优,且最终视觉评测结果与SigLIP初始化的基线相当。

  在训练基础设施方面,月之暗面开源了支撑Kimi K3训练的三项关键Infra技术:MoonEP、FlashKDA和AgentEnv。MoonEP是为超大细粒度MoE设计的高性能通信库;FlashKDA是KDA的高性能算子;AgentEnv是与KVCache.ai合作开发的沙箱系统。

  在量化方面,Kimi K3从监督微调阶段起就采用了量化感知训练,专家权重使用MXFP4格式,激活值使用MXFP8格式,以降低部署时的显存占用。

  评测表现亮眼

  Kimi K3的评测结果显示,其在与主流闭源模型的竞争中具备一定竞争力。

  在研究生级科学问答GPQA Diamond上,Kimi K3得分93.5%,落后于GPT-5.6 Sol的94.1%,略高于Claude Fable 5的92.6%。在更具挑战性的HLE-Full评测中,无工具辅助下Kimi K3得分为43.5%,低于Claude Fable 5的53.3%和GPT-5.6 Sol的44.5%。

  在编程能力方面,Kimi K3在ProgramBench上以77.8%得分位居第一。在DeepSWE评测中得分为67.5%,落后于GPT-5.6 Sol的73.0%和Claude Fable 5的70.0%。在SWE-Marathon这一面向GPU内核优化的评测中,Kimi K3以42.0%领先于Claude Fable 5的35.0%和GPT-5.6 Sol的39.0%。

  值得关注的是Kimi K3的成本效率表现。据技术报告披露,在Kimi Code Bench 2.0上,Kimi K3得分比Claude Fable 5低约4个百分点,但推理成本仅为后者的38%。在BrowseComp上,Kimi K3以每任务约2.03美元的成本获得最高分。这一“高性价比”特质,证明了开源模型在保证顶尖性能的同时,能够以远低于闭源模型的成本运行,为开源商业路线提供了可行性样本。

  在第三方评测方面,Kimi K3在Artificial Analysis的智能指数v4.1中以57.1分位列第四;在Vals AI的行业基准中,以74.7%位列第二;在WebDev Arena中,Kimi K3以1678 Elo排名第一,是该榜单首个登顶的开源模型。

  关于开源与闭源路线之争,黄震昕曾在群访中表示,开源和闭源不存在相互竞争、非此即彼的对立关系,二者面向不同客户需求,在市场上都有存在价值。很多企业有私有化部署、基于开源模型微调的需求,这是开源路线的核心价值;闭源则主打顶级SOTA模型能力。他同时强调,Kimi依托自研底层技术,在Code等多项权威榜单中达到全球SOTA水平,同时没有陷入行业价格战,希望向全球市场证明中国自研、开源属性的大模型不需要靠低价内卷。

  多家厂商Day0适配

  Kimi K3开源后迅速引爆开发者社区。Hugging Face CEO发文称,模型在30分钟内获得超4000个赞,登顶平台趋势榜榜首。北美AI基础设施创企OsmanticAI创始人将其称为本地版Fable 5;美国AI创企Cognition宣布Kimi K3接入Devin桌面客户端与命令行工具,并表示在FrontierCode 1.1评测基准上,Kimi K3是其测试过的首款性能逼近前沿水准的开源模型。

  开源当天,海内外多家厂商宣布Day0适配。

  国内方面,阿里云真武M890超节点实例完成对Kimi K3的首日全面适配,成为国内首个跑通近3万亿参数模型的超节点。阿里云、平头哥与Kimi团队从软件栈、算子等层面进行了深度联合适配,优化后首token时延降低约35%,单卡解码吞吐提升1.8倍,可稳定支持1M长上下文。千问AI平台和阿里云百炼也将提供Kimi K3的模型API。

  华为昇腾同步实现Day0全链路适配,依托Atlas系列算力硬件、MindSpeed MM训练套件、vLLM Ascend与SGLang推理引擎,完整覆盖模型训练复现与线上推理部署。

  海外方面,Nebius、Baseten、Fireworks等AI基础设施厂商同步宣布支持。vLLM和SGLang两大开源推理框架均提供首日支持,开发者拿到权重即可直接部署。

  模型热度高涨的同时,Kimi K3的许可证设计引发了业内关注。协议允许免费使用、修改和分发,但设置了明确的商业化门槛:如果使用方的模型即服务业务连续12个月总收入超过2000万美元,需与月之暗面签署额外商业协议;如果基于Kimi K3的产品月活用户超过1亿或月收入超过2000万美元,需在界面中显著标识Kimi K3名称。内部使用和通过月之暗面官方产品访问不受此限。

  换言之,底层开发者免费使用;中型企业通过官方API按token付费;顶层超大客户签署单独协议。

  据行业测算,国内头部云厂商的单条大模型API产品线,年收入跨过2000万美元后,边际成本开始陡降,毛利率从负转正。云厂商部署开放权重后以API形式对外售卖,定价可比官方低20%至40%。

  多位业内人士对记者指出,单独协议涉及的内容可能包括收入分成比例、品牌露出要求、技术支持费用、优先更新权或排他性条款。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-34289898 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:021-54509966/952500