In Kunming this Mid-Autumn season, black truffle has found its way into one of China's most traditional festive foods: the ...
将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享 ...
9月29日中午,Tiffany(蒂芙尼)月饼事件的当事人更新了最新进展。她收到了中国Tiffany零售管理团队发来的一长段调查说明,品牌承认了礼盒地址复制出错、员工沟通不当,也给出了员工处理、流程整改、当面致歉邀请等方案。
IT时代网9月29日消息,中科曙光分布式存储ParaStor近日成为业界首家接入Mooncake社区的商用分布式存储,首次完成商用分布式存储后端的生产环境落地,相关技术能力已全部合入Mooncake社区主干。大模型推理中,智能体、高并发对话、代码生成 ...
在大模型推理中,KV cache 是 Transformer 注意力机制的关键缓存,但其显存占用随上下文长度线性增长,成为长上下文与高并发场景的瓶颈。通过分层存储与高效传输,KV cache 可从 GPU 显存卸载至 CPU 内存或远端存储,并支持跨实例共享,从而提升显存利用率和推理吞吐。Mooncake 作为面向 vLLM 的 KV cache ...
原创 最新推荐文章于 2026-09-23 16:03:21 发布 · 334 阅读 第一次在生产环境里看到 Mooncake 这个名字,是在一个跑了 8 卡 A100 的推理集群上。当时的现象很典型:模型是 Qwen 系列的 72B 级别,并发一上来,GPU 显存就顶到 98%,然后 vLLM 的日志里开始频繁出现 preemption ...
快科技9月29日消息,中科曙光分布式存储ParaStor近日成为业界首家接入Mooncake社区的商用分布式存储,首次完成商用分布式存储后端的生产环境落地,相关技术能力已全部合入Mooncake社区主干。大模型推理中,Agent、高并发对话、代码生成 ...
在信息技术迅猛发展的今天,数据存储的效率与安全性已成为企业运营的重要命脉。9月29日,中科曙光宣布其分布式存储产品ParaStor成功成为首个接入Mooncake社区的商用分布式存储系统。这一里程碑式的进展标志着商用分布式存储在生产环境中的实际应用,开启了存储技术的新纪元。 ParaStor的接入不仅是技术上的一次创新,更是对大模型推理应用的有力支持。在AI应用日益普及的背景下,智能体、高并发对话 ...
交换衣服太太太太可爱了!! 而且超级合适。。小王马也很适合露肩装啊!
联想 集团面向高端制造推进AI创新,将全自研工业质检预训练模型和小样本终身学习用于轮胎全检,并在三家全球轮胎三十强企业规模应用:60至100条良品数据即可建模,单条检测25秒。在生产决策领域,联想自研排程技术已进入工厂,“鲁班智能体”在武汉制造基地全面上线。沐曦的几何模型算子优化、中科曙光的推理缓存共享,分别体现了AI计算与推理存储层面的创新。
开源大模型的竞争正从参数规模转向推理底座。Prime Intellect 开源了生产级推理平台 Prime Inference,靠 Prefill/Decode 物理分离与 NVFP4 显存压缩,让 GLM-5.3 在 GB200 上跑出每秒 100 Token。 平时大家聊开源大模型,注意力往往全放在模型参数有多大、榜单刷了多少分上,真到了实际把模型拉出来跑 Agent 的生产环境,很多人立刻傻 ...
一些您可能无法访问的结果已被隐去。
显示无法访问的结果