| |
|
| 知识库 -> 科技 -> 如何看待月之暗面kimi在2026年7月19日宣布算力紧张,暂停会员开放? -> 正文阅读 |
|
|
[科技]如何看待月之暗面kimi在2026年7月19日宣布算力紧张,暂停会员开放? |
| [收藏本文] 【下载本文】 |
|
[图片] 致Kimi用户:关于算力紧缺与会员暂停开放的说明 尊敬的Kimi用户: 自KimiK3发布以来,我们收获了远超预期的支持,但也面临始料未及的… |
|
大家别许愿什么昇腾 950 了,??据我所知,不管是昇腾还是寒武纪/昆仑芯/平头哥,基本上到 2026 年底的产能都已经被订完了,现在的算力紧缺就是这么离谱。 |
|
补充说明: 1) 没有移除老套餐,当前用户能正常用,支持连续订阅,正在优化界面显示(更新:已上线)。 2) 很多用户订阅之后会选择手动关闭连续订阅,这部分用户也可以续费,Kimi 界面上在24小时内可以支持(更新:已上线)。 3) 老用户可以选择升级老套餐,Kimi 界面上在24小时内可以支持(更新:已上线)。 4) 新套餐目前因为算力原因还没有开放购买,开放时间待定。 |
|
一定会有这么一天的,曾经2块钱一份的外卖大家又不是没吃过,可能程序员自己吃得最多。 其实一个被大家忽略掉的问题是,进入agent范式以后,改变的不仅仅是用户调用LLM的方式,另外一个被完全颠覆掉的,是云厂的算力资源结构和成本结构。 而这种改变,加上云厂莫名其妙自己作死的动作,让这种几乎不可能成功的脆弱成本结构,进一步的走向脆弱。 有兴趣的可以读一下前情提要: Agent把云端AI的主要瓶颈,从计算资源逐渐转移到了驻留资源。——单一用户占用的内存无论是数量还是占用周期都是指数级别的提高,而GPU的利用率大幅度的下降。 在聊天机器人时代,决定峰值并行用户上限的资源往往是算力资源(GPU),你每秒吐出来的token数量够多,你就可以吐完这个用户的查询,卸载kv cache,加载下一个用户的请求,继续吐token。抛开decode阶段的内存带宽瓶颈,你可以认为GPU是在尽可能的贴近瓶颈满负荷的工作。有多少GPU资源,决定了你峰值能同时维护多少用户。显存少一点?问题不大,我算快一点下一个用户的请求就可以继续加载了。因为聊天机器人的kv cache是可以丢弃的,用户重复使用单一的会话概率相对较小,很多会话都是一次性的,「明天天气会好吗」「特朗普昨天吃了麦当劳的什么汉堡啊」,哪怕是长程的对话,用户也不见得能在一天里多次迭代对话内容,为了满足更多的用户使用,先抛弃kv cache,等这个用户哪天想起来继续对话了,大不了从SSD加载或者直接认倒霉再给他从头到尾带着聊天记录算一遍,也没多大问题。 所以在聊天机器人时代,GPU算力是绝对的核心,显存是为了提供GPU计算条件的附属品,而且如果供需关系合理,这套硬件的效率是非常之高的,这套生产线24小时无眠无休的满负荷运作。 但是在agent时代,驻留资源(Resident Memory)成了服务并行用户的关键瓶颈,因为agent跑的大多数任务都是同一个对话不停迭代的长程任务,这就意味着,几乎所有任务都会有一个巨大重复,反复高频次被利用的上下文,而因为这部分的权重相同可以不用重复计算,并且大概率迭代过几秒钟过几分钟就会来一次。所以,agent任务就会保留kv cache以节省算力,但是这里就出现了一个巨大的问题——单一用户会占据大量宝贵的内存,而且短期无法释放,并且很有可能一段时间里gpu的算力是空置的,因为占用内存的用户可能暂时没有服务器端的计算需求。 agent的很多任务是需要本地电脑返回结果的。让agent克隆一个git库,agent在cli里git clone,让他测试,agent写完py脚本,然后呢?然后agent去机房角落抽烟玩手机去了,等clone好了,等脚本报错了,他再扔掉香烟骂骂咧咧的回来干活。 但是在这个过程中,GPU一动不动,kv cache完整的加载在内存中不能卸载,为什么?因为git clone可能2秒就好了,接下来就要看目录读脚本了,因为测试脚本可能2小时以后done,可能1秒就瞬间报错。——你不可能在这个时间抛弃缓存,因为一旦2秒钟以后任务回来了,你就要重新计算1M上下文,并且重建kv cache。 当然有很多黑科技,比如ssd/内存/显存的分级kv cache,比如上下文总结,强制压缩等等 但是这都只是缓解问题,最根本的问题是底层的成本约束结构发生了变化。 单一用户消耗的不再是算力,而是内存。 原本GPU晕头转向,内存帮忙搬运状态的情景,现在变成了内存时时刻刻塞满,GPU懒懒散散坐在电动车上看手机等着接单。 |
|
|
GPU现状belike 这无疑提高了单位token生产的成本,因为调度策略没有质变的话,GPU闲置的概率会大幅度的提高,同样硬件满载的情况下,agent的token生产效率会大幅度的下降。 所以,我的问题是: 如此大幅度降效的token产出效率,定价该上浮多少? 注意啊,这里我们只讨论了模型和行为不变的情况下的token产出效率。这里实际上还有一个很重要的问题——模型究竟缺的是智力,还是行为稳定? 一个很明显的趋势是,模型参数和上下文窗口都是在无限膨胀的,主流上下文窗口干到1M,模型参数KIMI自己从古早的100b干到了如今的2.8T。 无论是1M上下文的缓存,还是2.8T的权重,非常明显的,这会大幅加重内存的负载,而moe模型却又在降低GPU的算力符合,对于同一套硬件来说,GPU产出更低,并行服务用户数更少 我在之前的文章里就批评过这种做法: 事实上在每个模型巨头的实验室里,都有一个像mythos或者比mythos更大的怪物在笼子里,但是商用模型讲的最终是成本,究竟多大的参数,才是企业可以接受的? 那么我们又要回到那个问题,现在agent缺的到底是什么? 不是智能,而是行为模式和注意力,这和大参数没有半毛钱的关系。 在GPT5.6出现以后,知乎讨论过一个问题codex+gpt5.6好像让大部分skill失效了,为什么? 因为skill是一种稀缺的语料,人类历史上最多的是原材料和成品,很少有语料教你,拿到一堆资料,看到一堆文件,该先看什么,注意力放在哪里,为什么要看这里,看完这里看哪里,然后组织什么信息就能得到初步结论…… 如果你下载一个巨大的软件项目仓库,或者拿着一整套上海中心完整的图纸,你一个人看完估计得好几年,但是为什么一个成熟的软件工程师,一个土木工程技术总工,只要几天就能把所有的内容看完,形成总结和摘要? 因为他们知道该看哪里,该把注意力放在哪里。 这不是智能,这是注意力引导规则。 所以,当人类意识到没有这种引导语料的时候,就有了skill,当skill积累到一定的数量,GPT5.6就可以快速的在SFT阶段吸收这种注意力引导准则,转化成行为,没有新的知识,有的只是行为指引,先看readme,先看bootstrap,先读建筑总说明,然后建立log ,建立git…… 这些新的训练语料,让gpt形成了新的注意力结构和条件反射行为。 就好比让一只狗学会蹲下,但是因为缺乏训练技术(skill),之前的狗一直不太听话。 你不去加强你的训练技术,反而你找了个爱因斯坦来替代狗,让爱因斯坦响应蹲下的动作,因为爱因斯坦的注意力结构和智力比狗高,好训。 然后你还言之凿凿,说通过把狗换成爱因斯坦,虽然成本上升了2000倍,但是爱因斯坦蹲下的动作响应更加可控和稳定,原来你对狗说20次,对爱因斯坦只需要说一次,所以token效率提升了。 提升你个冯了个福提升! 这活谁不会干啊,找泰森当保安,让雷军写代码,让刘翔送快递,让汉密尔顿跑滴滴。 然后社会运转效率就大幅提高了???? 你们不能因为现在成本结构还在黑箱里,就天天搞这种奇迹吧。 最终的结果会是什么样子? 所以我很早就说了,现在的前沿模型厂还在死抱这scaling law不放的核心原因,是在制造恐慌,因为现实世界完全不可能这么运作,如果现实世界遵循scaling law,那么人类最好的解决方案就是单一个体(碇源堂:加入光荣的进化吧),而不是60亿人口,蟑螂老鼠这种又小又脏又低等的东西就不可能有适合的生态位,真正让他们抱紧scaling law的唯一核心就是「贩卖恐慌」——万一符号系统再次突破了一个涌现瓶颈呢? 但是这帮搞自然语言处理的人实际早就很清楚,语言和文字,是脑内高维度空间关联性的1D投影,LLM的原理是借用这种1D投影反向重建关联性,来模拟大脑的高维思考空间,那么,就这部分都还有99%的思考细节被丢弃没有被文字还原,就这还有大量的信息可以复用可以研究可以开发,你拼命做一个更高维度结构的黑箱,有什么意义? 而一旦落到这个结论,一个恐怖的事实是,对于聊天机器人这种思考大于行动的LLM,反而需要1T2T甚至10T大参数,而coding agent,我说难听一点,只要行为可控,30b-70b足够了,甚至还有很大的富余。 现在最大的问题不是30b不聪明,而是模型厂在让30b蹲下的时候没有给足狗粮。 一个典型的例子就是Qwen3.6系列的35b a3b以及27b,为什么相比其他开源权重来说这俩可以「聪明」这么多?没别的,因为阿里给出的是一个充分工程化SFT,充分语义对齐的权重,而不是其他厂家给出来的RAW权重。 那么你再回头看GLM5.2看KIMI K3,你能看到什么? 泰森当保安,雷军写代码,刘翔送快递,汉密尔顿跑滴滴,这不是一个可以跑通的商业模式。 我不知道你们怎么看,我只觉得看着头疼。 别暂停会员开放了,实在不行先暂停一下公司的运营吧 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
从美国刚刚开始尝试限制向我国出口先进计算卡开始,我就写回答提过: 美帝禁售中高端计算卡的举动,本质上是试图通过卡住先进算力的方式打击中国在AI、流体力学、工程仿真等等领域的科技研发。 尤其是AI大模型爆发的头两年,知乎乃至全网一片悲观绝望的氛围,以至于当时我还需要顶着逆风写长文支持并看好国内的产业升级。 现在回头看,还是蛮感慨的。 应该说美国的制裁和限制的确发挥了一定作用,延缓了国内AI产业的发展速度。 直到今天,月之暗面的KIMI K3表现非常惊艳的同时,仍然因为海量需求涌入导致算力过载。 网上这张著名的梗图,感觉又可以增添新角色了: |
|
|
另外正如前排高赞所说,其实不只是昇腾,最近凡是性能堪用的国产推理卡全都处在供不应求的状态。 寒武纪的估值肯定是早就疯狂甚至泡沫化了,但至少这两年来看并不是毫无业绩纯粹瞎炒。 尤其还需要考虑到,昇腾950系列的产能都快被几个大厂抢光了,月之暗面目前为止应该是没拿到多少。 我有时候都想吐槽,DeepSeek多拿点倒也罢了,字节需要那么多算力么?总不至于Seedance消耗那么大吧? 这下短视频彻底成了“害群之马”,我看也是“早该图图了”。 (评论区针对这一点的比较多,其实我只是玩笑性质调侃一句,没有说AI短剧无用的意思,编辑修改时补充上引号) 而从长期来看,美国切断AI计算卡的所谓制裁更是愚蠢且短视。 美国丧心病狂的实体清单,短期内确实对国内相关产业造成了不小打击,但长期看却为国产替代提供了至关重要的市场空间,这句话我在知乎重复过无数次了。 更进一步说,2023年麒麟9000s横空出世,摆明了国内已经拥有自主先进制程产能,美国一度还要收紧算力出口,更是极其荒唐儿戏。 这一张“A4纸”,不仅严重打击了美国的算力出口和英伟达苦心孤诣构建的CUDA生态,更是白白把大块市场让给以昇腾为首的国产算力。 尤其是最近一段时间,不论DeepSeek V4对国产算力的高效适配,还是LongCat-2.0由国产算力跑通万亿模型训练推理全流程,都表明国内AI产业的上下游协同越发明显。 DeepSeek V4发布初期英伟达部署效率极低,H200实际发挥的效率甚至只有昇腾950的十分之一,更可以说是一个关键转折。 当初看到这个结果我也非常意外,没想到优化与否效率差距如此之大。 诚然大模型发布初期必然会有一定的部署和适配过程,昇腾等国产算力是提前适配了,英伟达后续应该也有大幅优化的空间。 但以前是大模型基于英伟达开发国产算力磕磕绊绊,现在是昇腾0day适配英伟达落后追赶,一来一回差距非常明显。 国内自主算力卡和AI大模型的生态联盟已经初现端倪,这是老黄最恐惧的事态。 所以美国佬如今也后知后觉,英伟达H100/H200都放开了,甚至连B100/B200也开始睁只眼闭只眼。 我不清楚月之暗面什么时候能拿到新卡,缓解算力紧张的问题,但如今国内算力饥渴的情况确实不容忽视。 之前海思搞出来Atlas 950 SuperPoD,在集群AI算力这个关键战略领域实现了弯道超车。 正如拿几万台消费级CPU堆不成超算一样,集群算力机柜需要的多卡通信互联也不是堆卡就能解决。 英伟达拿出的产品就是NVL系列,目前主打的是NVL72机柜,海思昇腾之前对应的是CloudMatrix384。 下一代旗舰算力阵列,英伟达NVL144预计今年下半年量产,华子这边对应的竞品就是Atlas 950: 以单柜64卡为基本单元,最大可支持8192张NPU卡高速互联,算力、内存、互联带宽等指标全面领先英伟达: Atlas 950 FP8算力8E FLOPS,FP4算力16E FLOPS,大致是NVL144的6.7倍; Atlas 950 内存容量1152TB,大致是NVL144的15.36倍; Atlas 950 互联带宽16.3PB/s,大致是NVL144的62.7倍; 可以看到这个性能参数是真的炸裂,不仅全面超越NVL144/144 CPX,甚至能跟预计2027年下半年量产的NVL576掰掰手腕。 就我个人观点,华为这波本质上是在错位竞争: 用规模和性能大致相当于英伟达下一代旗舰(NVL576)的产品,对英伟达本世代新品形成硬件碾压态势,弥补生态建设方面的不足。 在高性能算力集群的互联层面,目前看英伟达和菊花走了不同的技术路线。 英伟达主力机柜走的是铜,菊花这边我印象中也有铜方案,但从CloudMatrix 384开始就已经全面切换光纤。菊厂在光模块领域有很深的积累,国内光模块和光纤产业链又早就杀成了白菜价,连带着昇腾算力集群实现了“力大砖飞” 还记得Atlas 950发布之初,业内有部分人反馈不是非常积极。 主要是8192卡规模太夸张了,而且大家也都知道下一代昇腾960升级相当大,曾有人怀疑仅仅相隔一年时间有必要投入这么大吗? 所以一开始大家的预期是8192机柜可能只有少数几台,主力还是千卡左右的机柜。 但是现在看,搞不好真有不止一家要上8192。 明年海思更是要搞昇腾960和15488万卡阵列,国产算力爆发真的太夸张了。 所以我还是那个观点: 未来国内自主的半导体产业将以摧枯拉朽的态势在国内快速崛起,并且一步步席卷全球,占据半导体产业链绝大多数关键环节。 未来国内自主的半导体产业将像钢铁光伏那样爆出巨量产能,甚至超越所有海外国家的总和,我从未怀疑过这一点! |
|
kimi算力紧张是事实 |
|
|
现在的问题是,O家和A家在拥有几十倍乃至几百倍于kimi资源的情况下,为什么仍然会被kimi追着跑 |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 下一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |