万年历 购物 网址 日历 小说 | 三峰软件 天天财富 小游戏 视频推荐 小游戏
TxT小说阅读器
↓小说语音阅读,小说下载↓
一键清除系统垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放,产品展示↓
首页  日历2025  日历2026  日历2027  日历知识  | 每日头条  视频推荐  数码知识 两性话题 情感天地 心理咨询 旅游天地 | 明星娱乐 电视剧  职场天地  体育  娱乐 
日历软件  煮酒论史  历史 中国历史 世界历史 春秋战国 三国 唐朝 宋朝 明朝 清朝 哲学 厚黑学 心理学 | 文库大全  文库分类 
电影票房 娱乐圈 娱乐 弱智 火研 中华城市 仙家 六爻 佛门 风水 钓鱼 双色球 戒色 航空母舰 网球 乒乓球 足球 nba 象棋 体操
商业财经知识 科技 汽车知识 工程技术知识 时尚与穿搭 家居与生活 设计艺术知识
    
  知识库 -> 科技 -> Kimi 员工震惊和 OpenAI 算力的差距,为什么在这么大差距下 Kimi 还能做出来 K3 ? -> 正文阅读

[科技]Kimi 员工震惊和 OpenAI 算力的差距,为什么在这么大差距下 Kimi 还能做出来 K3 ?

[收藏本文] 【下载本文】
[图片] [图片] https://www.interconnects.ai/p/kimi-k3-the-open-weights-escalatio…
OpenAI 和 Kimi 之间的算力差距还是很明显的,OpenAI 的研究员拥有的投入算力资源,对于 Kimi 来说完全超出想象,但是就在这种情况下,Kimi 可以跑出来 K3 :


类似这个问题,Nathan Lambert 在他的 《Kimi K3: The open-weights escalation》 报告里也谈到了:
中国实验室融资规模远小于美方对标(OpenAI、Anthropic、Google、Meta),但是却在公开指标上逼近甚至局部超越,主要原因还是:更聚焦“追赶”而不是开发“发明新范式”,因为算力有限,所有更注重优化创新。
所以 Lambert 把 K3 当做一个分水岭:开放权重模型真正进入前沿竞争,单极的美国闭源主导格局正在结束。
所以我觉得有今天看到一个人的说法挺对的:
为什么中国的人工智能实验室能不断获胜,靠的是扁平的组织架构和文化,同一批人在算法、数据和基础设施之间来回切换,而一些美国科技精英们认定,只有“研究员”才是高地位的头衔,做 infra 都是没人要的工作。


然后马斯评论补充:“一些营利性公司自称“实验室”,还人为地制造出一种等级森严的“研究人员”和工程师之间的隔阂,而实际上他们充其量也只是些工程师而已。”
感觉老马大概率点的就是 OpenAI 。
实际上这在 Lambert 的记录里也提到:核心就是团队文化的差异,在 GPU 受限的情况下,愿意和有能力做更多工程实践。
虽然模型构建很大程度取决于规模化,但是构建优秀模型的能力很大程度还是取决于个人的执行力和动力。


实际上国内很多模型厂好像都是这么跑出来的,都是算力有限,都是靠各种调优和降本,最典型的就是 DeepSeek ,但是随着国产算力节点的开始支棱起来,比如:
阿里的灵骏真武 M890 超节点实例华为的 Atlas 950超节点虽然不可能完全解决算力限制,但是算力问题也会逐步被国内解决,智谱都开始构建自己最大的算力中心了,并提到完全使用国产芯片,在算力慢慢得到补充的情况下,国产大模型的发展速度或者还会有进一步的突破?
另外我们在之前的内容也聊到过,有人计算了中美目前的差距:
Artificial Analysis 差距大概1.22 到 2.89个月ECI 差距大概为 4.37 到 6.08 个月
而如果分别观察单个中国实验室,Moonshot 和 Z AI 的上升趋势比中国整体趋势更快:
Moonshot 预计在 2026 年 12 月 23 日达到 ECI 161,追上 Fable 级别模型Z AI 预计在 2026 年 12 月 31 日达到 ECI 161,追上 Fable 级别模型


但是就像是评论区说的,中国在这样算力有限的情况下跑出来了 K3 和 GLM 5.2 ,那么在算力逐渐被国产补充的情况下,也许这个差距会被加速缩小。


所以很多时候不是不想饱和式火力覆盖,只是条件就这样,但是人的差距没被拉开,工程能力的差距没被拉开,反而通过工程能力进一步缩小的差距。
在我看来就是杨植麟nb,梁文峰nb,唐杰张鹏nb。这几个人如果拿到OPENAI那个级别的资源,不说把OA两家爆成渣,也是大概率超越这两家的水平。
我问过meta和微软的做AI的同学为什么你们算力比全中国加起来都多却没干出东西,基本回答都是主管AI的大领导纯废物。一将无能累死三军是绝对正确的。
美国大厂找AI带头人的思路是找上个时代最有名气和成绩的,比如yann lecan,DeepMind的创始人,openai创始元老之类的。而中国几家带头人是三十多岁的天才年轻人。LLM虽然脱胎于transformer,但是本质上个新东西。某种意义上,“没用过的脑子更好使”。
1.
有一个理论叫做资源的诅咒。
当你的算力很多时,那你研发的方向最省力的方式就是用比较省力的方法,用最笨的技术去硬砸参数,一力降十会吗嘛。
如果这个不好理解,你可以这么理解。
比如说你和富二代同样买一个东西,你去研究参数、去比价、去搞它的性价比,然后还要在各大平台去领券、国补,买下来确实便宜很多,也是和他差不多的东西,但是对方只用1秒就买完了。
资源匮乏有时候是好事。
比如你算力和内存不够,那你为了让这2.8T的参数跑得动,所以kimi就把传统的注意力机制换成了自研的KDA现象注意力,又把残存连接给改了。然后在专家模型调度上,他把896个专家模型压缩到单次只激活16个。
这样大大提高了效率。
2.
第二个,不管是OpenAI或者是Anthropic的算力池有多吓人,很大一部分程度上还是为系统冗余买单。
一方面,它要处理全球几亿甚至用户的实时需求,然后还要进行很多看不见的内部对比,真正摊到某一个具体模型上的训练的算力,其实我感觉也许跟中国的公司没有差那么多。
模型的能力,应该是算力乘以效率的乘积。
只对比算力是不行的,效率这一项,操作的空间很大,更好的数据清洗、更省的显存优化器、更聪明的强化路线,模型的能力其实有很大的提升空间。
3.
还是开源闭源之争的东西。
不管是OpenAI也好,还是Anthropic也好,它很难复制有两个东西,第一个就是开源的权重,第二个就是很深的人才池。
不管是K3也好,或者是DeepSeek V4也好,开源权重之后,意味着下游开发者、创业公司或者研究者都能拿去用、去改,这就形成了一个反馈闭环。
所以你会看到Kimi在迭代的时候也有很多Deepseek的技术的影子,而Deepseek这边,你也很难不说它没有用到Kimi的研究成果。
4.
还有一个就是策略,说白了就是田忌赛马。
比如OpenAI,它几乎在所有维度都铺开了,对话、编程、推理、多模态自主Agent以及前沿的探索,还有图片和视频,御三家的摊子铺得都比较大。
(目前国内在多模态或者在生图全面比较开花的,也就字节和阿里了,因为他们俩的算力相对多一点,但还是不够用)
Kimi这边你明显发现他会先选择在某一个领域去打,一开始是做长上下文,后来K1.5压推理,K2压工具调用。
你没有必要在每一项都比OpenAI强。
送礼物
还没有人送礼物,鼓励一下作者吧
戴着镣铐跳舞这就是我们技术人的常态。
就算是大厂,资源竞争也非常激烈,很少有团队能玩无限火力,大多数人都得尝试用更少的投入、撬动更高的产出。
近十年来当然也有不少企业是玩资本运作的,能够用烧钱的方式来干很多事情 —— 但就算如此,量入为出、账本精算也都是技术人的常态;所以,几乎所有技术团队,都会以极高的规格来激励那些能大幅度削减成本开销的团队或个人。
太卷了,没有成本优势的话,很难打赢别人。
在进出口贸易层面也同样如此,我们卖出去的东西,转手可能会被卖几十倍的差价。
但从另一个角度来看,这也恰恰是我们能卷死欧美厂商的原因。美国想要工业复兴,那就得来跟我们这边的工业产线真刀真枪地卷,至少卷到我们的两倍成本。
涨价当然也会涨,但暴利却很难 —— 一旦有某个行业能获取暴利,就会有新的玩家进来卷,把成本打下来。
有人说是人口红利,某种程度上的确是,但不是说人力便宜,而是受教育人群占比大,再叠加人口基数大,那就非常恐怖 —— 真的就是你不卷就会有别人进来卷。
而 AI 大模型研发,又再次复刻了此前我们的火力不足焦虑 —— 这个本来我们有所缓解,但感谢鹰酱在 90 年海湾战争的时候又给我们上了一课,让大家又重新拾起了这种焦虑情绪。所以,我们的火力焦虑是没有断代的,铺张浪费也一直不是我们的习惯。
而美国呢?美国在资本层面基本把 AI 拉升到了「国运级战争」的地位,云厂商与硬件厂商有天文数字的投入、叠加发债输血与大资本投资层面的跟进,还要叠加政府以及电力政策层面的跟进。这还要叠加他们本来就领先的芯片与算力积累,以及芯片层面对我们的封锁。
至少,在资本以及算力层面,他们的确在打非常富裕的仗,我们也的确是在芯片方面被卡住了脖子。
可以说,美国从 1945 年以来,就没有感受过火力焦虑。45 年到现在已经 80 年了,整整两代人没有感受到火力不足,已经完全断代了。
而就像前面说的,我们的火力焦虑没有断代。火力不足对我们来说不是什么新鲜事,「赶英超美」就更不是什么新鲜事。
把好钢用在刀刃上,自然就能出效果。
送礼物
还没有人送礼物,鼓励一下作者吧
算力差距最大的目前还在于 inference 推理,而对于训练来说,差距还没有那么巨大。
但是训练这东西有一个优势:对于闭源模型来说,它的绝大多数信息都是严格保密的,但模型大小这种东西其实没有那么容易彻底保密。其实很早的时候就有人爆出来,比如 GPT-5.5 达到几个 T 的参数量,然后 Claude 也是几个 T 的参数量,甚至可能都不是 MoE 的模型,所以它们的性能才那么好。
假如大概的训练范式以及教育背景非常相似的大模型研究员,如果 Fable 5(或 GPT-5.6)这样的模型要比其他模型好很多,那么唯一的可能性就是它有一项维度是非常突出的。在现阶段,这个维度就是模型的大小,因为现在模型大小已经从几百 B 转入到 T 级别的竞争了。
现如今,摸着“鹰酱”过河的定律依旧有效,像 Fable 5 这样的前沿大模型已经替大家验证过了,增加 parameter 上的 scaling law 依旧是生效的。那么其实就好办了,我们的优化目标就是直接从几百 B,scale 到 2T、3T 这个级别就行了。
在 scale 过程中:
1. 没有数据就去找数据
2. 缺卡就去筹、去租
3. 利用我们国内人工价格的优势,去做更多的数据标注和后训练
我觉得前排的回答非常好。我们如果处于追赶过程的话,那么对于“范式创新”的需求,其实没有对于“结构创新”或者“优化策略”来得更为实在。因为我们处于追赶地位,大家不会要求那么高的性能,只要能摸得着或者看得见最顶级模型的天花板,就已经非常好了。由于对范式创新的要求没那么高,所以追起来是比较快的。
但我觉得,当开源和闭源达到交叉那一天的时候,谁能引领下一波的范式创新,才是最重要的。
送礼物
还没有人送礼物,鼓励一下作者吧
[收藏本文] 【下载本文】
   科技 最新文章
现在豆包的水平到底如何?
如何看待 DeepSeek 未在 7 月中旬上线 V4 正
如何评价GPT5.6为了在跑分上作弊,自主挖掘
Kimi 新模型 K3 跑分力压 ClaudeFable5 登顶
如何看待 7 月 22 日 DeepSeek 客户端联网搜
OpenAI 负责人称 Kimi 开源是减速主义,他的
OpenClaw是噱头吗?
为什么有些用户宁愿看盗版,也不愿为正版视
如何看待DeepSeek-V4正式版发布跳票这件事?
如何看待美国一民众闯入openai扬言要杀死所
上一篇文章      下一篇文章      查看所有文章
加:2026-07-23 14:22:02  更:2026-07-23 14:30:30 
 
娱乐生活: 电影票房 娱乐圈 娱乐 弱智 火研 中华城市 印度 仙家 六爻 佛门 风水 古钱币交流专用 钓鱼 双色球 航空母舰 网球 乒乓球 中国女排 足球 nba 中超 跑步 象棋 体操 戒色 上海男科 80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联
  网站联系: qq:121756557 email:121756557@qq.com  知识库