全球最大规模开源模型Kimi K3震动全球AI圈 17岁少年贡献Kimi K3核心架构技术(2)

2026-07-24 09:11  深圳特区报

Kimi官方明确表示,K3基于两项关键架构更新构建,分别是Kimi Delta Attention(KDA,混合线性注意力机制)和AttnRes。前者改善信息在更长序列中的流动,后者改善信息在更深模型中的流动,二者共同构成K3扩展至2.8万亿参数规模的架构基础。

Kimi K3在前端代码榜单中登顶。(据国际AI盲测平台)

降本增效

以2%成本换25%效率提升

AttnRes有多重要,可以用一组数字直观说明:Kimi官方披露,这项技术增加的额外成本不到2%,却带来约25%的训练效率提升。对于参数规模以万亿计的大模型而言,这意味着付出很小的额外计算代价,就能显著提高训练效率。

现有大模型常用的做法,是把前面各层的信息不断向后累积。模型越深,早期形成的有用信息越容易被层层叠加的内容淹没。AttnRes提出了一种新思路:让后面的网络层根据当前输入,从前面不同层中挑选并汇集更有用的信息。

据苏剑林回忆,在AttnRes研究中,陈广宇和张宇共同提出Block AttnRes(分块注意力残差)。它将逐层选择改为分块选择,在保留大部分效果的同时,降低显存占用和通信开销,使AttnRes更适合大规模模型训练,并被推进为项目主线。