原标题:
“北京、海淀的人才聚集效应无可比拟”
月之暗面:做像登月一样难而正确的事
“我们希望做的事是像登月一样,难而正确,但一旦成功,可能是对全人类都有非常大的贡献。”日前,在位于北京海淀的公司总部,月之暗面Kimi企业业务负责人黄震昕对北京日报记者说。
过去一周,月之暗面无疑是全球科技圈“顶流”。其7月16日发布了全球参数规模最大的开源模型Kimi K3。该模型总参数达到2.8万亿,具备100万词元上下文窗口,在长程编程、知识工作和复杂推理等场景中表现尤为突出。
据了解,参数规模决定模型“能装下多少知识”,注意力机制则决定模型“会不会抓重点”,能不能从海量信息中快速找到关键、建立联系并形成答案。此次,Kimi K3的突破,不仅在于“装得更多”,更在于处理信息的方式变得更高效。
业务人员介绍,Kimi K3的第一项创新,是团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时,计算量随文本长度接近平方级增长,模型读的内容增加一倍,计算量就增至约四倍,这正是超长文本难以落地的关键原因。而月之暗面的新技术,成功将这一效率实现了接近线性增长。这意味着,在同等算力条件下,模型能读得更长、处理更多信息、完成更复杂任务。
第二项创新,是注意力残差(Attention Residuals)技术。长期以来,模型越大、层数越多,信息传递的“路程”就越长,信号容易衰减、失真,训练也越容易“翻车”,成为全球头部实验室共同面对的工程难题。注意力残差技术改进了信息在不同网络层之间的传递和复用方式,相当于为巨型模型加装了一套“稳定器”,让2.8万亿参数不仅“训得出来”,还能稳定高效地用起来。
Kimi K3发布后迅速引发海外科技界关注。特斯拉首席执行官埃隆·马斯克在相关评测报道的评论区留言称“令人印象深刻”,并将Kimi K3列为其新模型Grok 4.5希望追赶的目标。
“最了解我们的不一定是投资人,可能是同行。来自同行的肯定对我们来说还是挺珍贵的。”黄震昕说。在社交媒体上,月之暗面官方对马斯克的回复是:“欢迎加入2万亿+俱乐部”。
“我们非常乐见于全球范围的技术交流与共享。”黄震昕说,Kimi的许多技术都已经开源,甚至在模型正式发布前就已将技术细节写入报告,向全世界公开。“我们中国AI企业有这样的胸襟和气度,希望马斯克他们也能做出2万亿级的模型,大家一起共同进步。”
在国际上收获广泛关注的同时,不少人对这家聚光灯下的明星公司的成长路径也颇为关心,一些人好奇:这样的成果和公司,为何能出现在北京,出现在海淀?
“北京海淀的人才聚集效应无可比拟。”黄震昕表示,包括创始人杨植麟在内,月之暗面的五位核心创始人,都来自清华大学。Kimi的投资人之一王慧文曾在社交媒体上感叹,自己所有投资收益最高的公司,都集中在一个清华以南、北大以东的“框”里。“在这个区域里,产生了智谱、Kimi、Seedance这些成果,我认为这并不是偶然现象,从人才、政策等方面,我们都得到了很多帮助。”黄震昕说。(记者 孙奇茹)
长按二维码关注精彩内容





