屠龙屠龙之术2026年9月22日· 41:08

AI进入生产阶段之后, 智能、算力、芯片 会走向哪里?

庄明浩在AICC2026人工智能计算大会现场听完全天分享后,用三章内容回答AI进入生产阶段后智能、算力与芯片的走向:需求侧从Chat到Agent的结构性跃迁、智能从概率拟合到可信生产的重新定义、以及算力与芯片在系统、器件、生态三层的突围。IDC与浪潮信息联合发布的《2026中国人工智能计算力发展评估报告》预测到2031年AI累计创造22.5T全球经济价值、2030年全球活跃Agent达22.16亿、Token消耗量复合增长率高达4822.6%,而算力供需缺口将扩至3809亿美金且持续放大,'Agent=Model+Harness'已成业界共识,Work与Coding是当前最成熟的Agent场景。同济大学郑庆华院士主张突破数据与算力依赖,借鉴人脑机制发展小样本强推理的'机器记忆智能';工信部电子五研究所联合智源、浪潮信息等20多家单位发布面向Agent时代的可靠AI全链路评测体系。浪潮信息首席AI战略官刘军提出'能力型+容量型'智算双轨进化,发布元脑SD200 Ultra超节点服务器(Token生成时延低至5.85毫秒、支持10万亿参数模型)与元脑HC2000多元算力基组(Token产能提升10倍);清华大学吴华强教授的存算一体芯片让计算走进存储,28纳米工艺即把算力从150 TOPS提升到600 TOPS,主张中国'换道超车';智源研究院林咏华则以开源FlagOS打破CUDA生态壁垒,实现国产模型一天内适配12款芯片的Day 0支持,生态已有100多家伙伴与800多个开源算子。

  1. 0:00开场
  2. 1:17AICC大会
  3. 2:33从Chat到Agent
  4. 9:47Token爆发
  5. 14:58智能再定义
  6. 19:22可靠评测
  7. 25:46算力突围
  8. 31:13存算一体
  9. 35:09开源生态
  10. 39:54回顾致谢

PodHood 提供支持

文字稿

开场0:00

庄明浩0:00

哈喽哈喽 , 大家好 , 欢迎收听 《 屠龙之术 》, 又是一期我个人的 solo 带 PPT 的播客节目 。 本期的主题叫 "AI 进入生产阶段之后, 智能 、 算力 、 芯片会走向哪里 "。

呃 , 我对今天的议题起了一个小标题 , 叫 《AICC2026 人工智能计算大会侧记 》。 看到这个小标题 , 你大概会猜到我为什么会有这期的内容 。

本周一的时候 , 我去北京参加了一场 "AICC2026 人工智能计算大会 ", 这是这次大会的第 7 届 。 也就是说 ,在过去 7 年的时间里面 , 关于人工智能计算 、 尤其是关于算力 、 芯片的探讨 , 就已经持续了非常多的时间 。

那因为进入到 2026 年之后, 随着 AI 这一轮模型能力的提升 , 关于算力 、 芯片 、 包括下一阶段智能怎么走的探讨特别的多 。

呃 , 如果大家有印象的话 , 我在今年 6 月份发过一期播客 ,是我跟高飞老师对谈的 , 那次的大会叫 "AIEC 人工智能生态大会 "。

那次的会议内容其实更多集中在我们平时在我的播客里聊得比较多的 , 比如应用啊 、 软件啊 、Agent 这个方向上 。

但是今天这次的 AICC 的大会 , 我觉得可能弥补了我很多此前行业不是特别了解的 , 尤其是偏 Infra 跟硬件层面的很多的探讨 。

AICC大会1:17

庄明浩1:19

我在大会上听了完整的一天的内容 , 包括上午的主会场所有嘉宾的 Keynote, 下午的几个分论坛 , 我串着听了一听 , 挑了一些我感兴趣的内容 。

基于这次大会的内容 , 我做了今天的这次的 PPT 的整理 。 跟以往的内容一样 ,PPT 会放在我的 Imma 里 , 然后 PPT 的所有的图像会放在我的 Shownotes 里 。

欢迎大家收听 , 我们正式开始今天的内容 。 就像前面标题提及的 , 呃 , 我所说的叫 " 智能 、 算力跟芯片到底会走向哪里 "。

所以今天的内容大概分了 3 个章节 。 我首先会讲 " 从 Chat 到 Agent",也就是需求侧的结构性跃迁 。 这部分内容主要来自于现场大会现场当天上午 ,IDC 的副总裁周总的一个非常长的报告分享 。

第二部分是关于智能本身的重新定义的 " 从概率拟合到可信生产 "。 它主要来自两位嘉宾 , 一位是同济大学的党委书记 , 一位是来自工信部的一位研究员 。

第三部分来自于三位嘉宾 ,他们分别从系统层面 、 元器件层面 、 以及整个生态层面探讨了算力与芯片的发展 。

所以一共 3 章 。 我们先进入第一章 : 从 Chat 到 Agent, 需求侧的结构性跃迁 。 首先 ,在 IDC 的这次分享当中, 我觉得它用了一个可能今天这个时间点成为业界共识的概念 ,也就是 "Agent=Model+Harness"。Model 决定了 Agent 的智能上限 , 今天的 Agent 里面的模型可能包括推理长度 、 上下文的长度 、 是否支持多模态 、 工具的调用 、 以及成本的差异 。

从Chat到Agent2:33

庄明浩3:05

同时又因为不同模型对于不同任务的擅长的能力 , 模型的路由层变得越来越重要 。 大家开始探讨模型的路由层要把不同的任务按类型 、 用户的意图 、 负载做动态的匹配 , 给予最优的选择 。

同时对于模型的评判上, 我们开始考虑准确率 、 推理能力 、 延时性 , 包括 Token 的成本 。 就是模型这一层 , 它在决定整个 Agent 智能的上限 。

那在进入今年之后, 大家讨论到比较多的 Harness, 它负责的是把模型输出转化为可执行的流程 。 那模型从真正意义上嵌入到 Agent, 到产出结果中间所有的所用到的东西 , 或者说所用到的功能模块 , 可能包括上下文的管理 、 模型的路由 、 工具的连接状态与记忆 、 执行控制 、 安全 , 甚至可观测与评测 。

就像我上一期播客讲的 ,Benchmark 变得特别重要 。 所以 Agent=Model+Harness: 模型提供智能能力 ,Harness 把能力组织成可运行 、 可治理 、 并能恢复 Agent 的执行系统 。在当下这个时间点 , 这个公式本身似乎已经成为了绝对的业界共识 。

IDC 在会上发布了一个报告 , 它是跟浪潮信息联合发布的 , 叫 《2026 年中国人工智能计算力发展评估报告 》。

我会把这份报告也放在 Shownotes 里 。 这份报告列了非常多的信息点 , 我抽取出了一些我比较关注的点 。

比如说 ,在过去一两年时间里面 , 我无数次地提及 " 人工智能的发展走到了人类极限里 , 我们开始用万亿美金就是 Trillion 这样一个数据标记 , 用我们去衡量 GDP 的一个数据标尺去衡量整个 AI 领域的无论是 CapEx 的投入 、AI 的产值等等 "。

那 IDC 的报告在这次报告当中给了一个截止到 2031 年, 就是未来 5 年左右时间 , 人工智能这个行业累积创造的全球经济的价值 。

它给了一个数字是 22.5T, 就是 22.5 Trillion。 它给了一个未来 5 年在这件事情上一个宽定义下的产值 。 这个数字可能已经基本上等于

中国还是美国 26 年的 GDP 了 , 对 , 如果我没记错的话 。 因为 26 年的预计的全世界生产国民生产总值应该是 126 个 T, 就是 22.5, 大概相当于六分之一左右的全世界的 GDP。

对 。 然后因为我们走到了 Agent 的年代 ,IDC 这份报告预计截止到 2030 年, 全球活跃的 Agent 的数量可以跑到 22.16 亿 。

更重要的是 ,Agent 从 —— 或者说 AI 的能力从此前的验证开始走到价值的兑现 , 那最直接的体现就是所谓的经济价值 。

因为无数的人提及这一轮的 AI 是所谓的什么技术革命 、 第四次工业革命之类的 , 那它既然被冠到这样的名词 , 当然要去跟能够提升多少 GDP 去做对比 , 能够提升所谓的多少的经济价值 。

那 IDC 给了这样一个预期 ,但同时在这份报告当中用了很大的篇幅去描述 " 算力层面供需的剪刀差在持续扩大 "。

根据 IDC 的预计 ,2030 年全球 AI 算力的供需缺口 —— 注意 ,是供需缺口 —— 将达到 3809 亿美金 ,并且从趋势上来看 , 这个缺口在持续的放大 。

很多人预期 28 年左右随着这一轮的基础建设的投入 , 这个缺口可能会出现缓解 ,但是 IDC 的统计 , 或者 IDC 的预期 , 似乎预示着这件事情的缺口将持续放大 。

为什么呢 ? 因为从 2026 年到 2030 年, 全球 Token 的消耗量的复合增长率 ,IDC 的统计是 4822.6%。 我再说一遍 ,2026 年到 2030 年, 全球 Token 消耗量的复合增长率

是 4822.6%。在这样一个巨大的涨幅前提下, 似乎物理世界的很多限制都很难追得上 。 呃 ,IDC 的定义 , 比如说 Agent 的发展 , 它定义了 5 个阶段 ,有点类似之前的 L1 到 L5 的划分 ,但是更集中在 Agent 这个板块 。

它会认为第一个阶段是功能型 AI, 主要做的是生成 、 识别跟预测 , 代码生成 、 视觉的试验 、 智能的回答 。

第二阶段是个人 Agent, 工具调用和任务执行 , 主要做邮件 、 日程 、 文档 。 那似乎我们在这个阶段 2。 阶段 3 它会认为叫单流程 Agent, 就是完成一个业务流程 , 代码 Agent, 工单的 、 全链路的 、 端到端的交付 。

那似乎我们正在从阶段 2 走到阶段 3。 阶段 4 它会认为叫多 Agent 协同 , 跨角色跟跨系统 , 营销 、 销售 、 交付协同 、 供应链协同 。

那当然今天这个时间点 , 如果大家熟悉 Agent 的发展 , 那似乎有一些前沿的 Agent 调研跟 Agent 的任务的协同 , 大家也在尝试 。

那阶段 5 叫监督下的闭环 , 持续运行 、 人工负责 、 工程资质 、 人审批权的变更 。 听到这个概念 , 你会发现 , 似乎最最最激进的当前这个时间点的模型厂商 、Agent 厂商也在尝试类似的事情 。

那在当下这个时间点 , 呃 , 挨靠我前一期播客所讲的 ,也是 HLZ 给的结论 :Work 场景加 Coding 场景是这个时间点的共识 。

所以从成熟度的角度来判断 , 专业服务的 Work Agent、 法律 、 咨询 、 会计等专业工作 ,以及软件与 IT 行业的 Coding Agent, 代码的开发 、 测试与工程交付 , 相对会比较成熟 。

其他领域 , 比如教育 、 科研 、 医疗 、 金融 、 能源 、 制造 、 零售 , 这些它的成熟度没有当前这个时间点的 Work 加 Coding 那么的成熟 。

我觉得在 26 年,Work 加 Agent 似乎 —— 啊 ,Work Agent 加 Coding Agent—— 是阶段性共识 。 当然最近一段时间出现了所谓 " 个人 Agent" 的一波浪潮 , 这个我在我上期播客也有提及 。

Token爆发9:47

庄明浩9:47

回顾刚才那个 4822%,4822% 的增 Token 增长 , 为什么会以这样的量级增长 ?IDC 给了一个公式 , 大家看得见的是 Agent 的应用 ,但看不见的是对底层算力基础设施的巨大的需求膨胀 。

这个 Token 的消耗来自于三个成数的相乘 。 首先是任务执行的次数 , 就是我们有多少任务 。IDC 统计 , 从 2026 年的 2800 亿次要涨到 2030 年的 415 万亿次 , 翻了多少翻 , 大家可以算一下 。

这是第一个成数 : 任务执行次数 。 第二个成数 : 单任务的 Token 消耗 。 也就是说 , 我们之前完成的更多的是偏简单的任务 ,但是今天大家越来越多去完成所谓的复杂任务 。

所以单任务的 Token 消耗可能从数十 Token 涨到了数十万 Token, 增长非常多倍数 。 这是第二个成数 : 单任务的 Token 消耗 。

第三个成数 : 多智能体的协同放大系数 。 一个用户任务变成多个智能体的子任务 , 推高任务的执行次数 , 尤其是并行的任务次数 。

智能体间的上下文传递与结果汇总 , 延长任务链路 ,也就是大家所谓的长程任务 , 推高了单任务的 Token 消耗 。

所以三个成数 : 任务执行次数 、 单任务 Token 消耗 、 多智能体协同的放大系数 。 这三个系数一乘 ,Token 的消耗你可想而知会膨胀到什么程度 。

所以算力需求角度来讲 , 从当前这个时间点 , 或者说此前一段时间的单次调用 , 推向了持续协同 。

这可能也跟我上一期播客讲到的 RSI 有一定的关联性 。 但是面对如此爆炸的 Token 算力需求 , 似乎就像我此前讲过无数次的一样 , 我们触碰到了人类太多的物理极限 。

物理世界的限制会成为常态 ,而不是很多人预期的 28 年会得到缓和 。 根据 IDC 的统计 , 它统计了两个数字 , 一个是算力供给 , 一个是算力需求 。

这两个数字一除 ,有一个叫算力满足度 。 两条曲线的缺口其实在持续的放大 。 刚才我们说过 ,2030 年要 3800 多亿美金 。

从满足度情况来说 , 今天 2026 年大概是 74%,2027 年会更紧缺 , 大概 71%。2028 年有所缓解到 75%,2029 年、30 年依然在缓解 , 可以达到 76% 甚至 77% 的满足度 。

但是因为 Token 的爆炸性的增长 ,以及算力的更大规模的投入 , 缺口是在持续放大的 。 也就是说 , 缺口的绝对值要从 2024 年的 389 亿美金涨到 2036 年的 3809 亿美金 , 将近 10 倍 。

企业投入的意愿 97.3% 扩大投入 ,37.7% 增加推理 。 价格的信号 , 调价加快至半年内 。 我觉得更极端来讲 , 我们看当前这个时间点 , 最紧缺的存储芯片的调价空间已经调到了可能季度到月 , 全年涨幅 30 到 50。

我觉得这是平均值 。 其他有几个核心的板块 , 涨幅远远不止于此 。 这个瓶颈除了产能的约束之外, 还有能源的约束 ,也就是电的约束 。

所以物理世界的限制会成为常态

。 所以 IDC 的核心观点我总结一下 : 首先 ,Agent 正在重写一切 。 当 AI 从内容生成走向任务执行 , 从单轮问答走向长链路协作 , 它不再是人类手中的工具 ,而开始成为能够独立承担生产任务的运行单元 。

我们在 26 年似乎看到了很多很多类似的场景的出现 。 首先 , 交付形态之变 : 从内容生产到任务执行 , 从单轮回答到长链路的并行协作 。

第二 , 竞争焦点的变化 : 从是否部署 AI, 尤其是企业层 , 转向是否具备规模化 、 安全化 。 安全这个话题在过去一两个月被提到了特别高的高度 : 可治理的运行 Agent 能力 。

我觉得某种程度上也挨靠了我上一期 《Own Your Intelligence》 所讲的内容 。 第三 , 中国的态势已平静 : 中国展现出独特的领先优势 ,Agent 规模化运行将算力推向国家关键基础设施的战略高度 。

这场由 Agent 驱动的变革 , 正沿着 5 个趋势加速展开 : 第一个 ,AI 价值的兑现提速 ; 第二 , 中国智能体部署渗透率领先全球 ; 三 , 算力需求结构性跃升 ; 四 , 算力成为国家战略基础设施 。

我觉得这也是共识 。 五 , 供需缺口长期存在 。 这是 IDC 的总结 。 我们第一章讲完了从 Chat 到 Agent 需求侧的结构性跃迁 , 我们再看第二章 : 智能本身的重新定义 , 从概率拟合到可信生产 。

智能再定义14:58

庄明浩15:07

智能本身 , 先看同济大学党委书记郑庆华院士的演讲 。他说机器智能的下一步突破 ,不能只依赖数据和算力规模的拓展 。

大家总说这轮 AI 三驾马车 : 数据 、 算力 、 算法 。在算法没有太多变化的前提下, 大家似乎今天这个时间点都在追求数据跟算力 。

但是郑院士会说 , 我们不能只依赖数据跟算力规模的拓展 , 还要具备在知识和资源有限 、 环境持续变化学习和推理的能力 。

为此需要将数据驱动与知识引导相结合 , 借鉴人脑记忆与联想机制 , 探索面向小样本强推理的机器记忆智能 。他的演讲标题类似 《 从大模型到机器记忆智能 》。

郑院士回顾了过去 70 年人工智能的发展 , 从最早的计算智能到感知智能 , 再到认知智能 , 再到类人的自主智能 , 到未来大家期待中的所谓的通用的人工智能 。

从工具式能力走向了理解 、 协同与自主 ,也就是我之前播客提及的 RSI。 那么为什么会需要再往前探索 ?

郑院士会提及当前这个时间点 , 大模型的这一代的结构存在一些局限 , 比如说算力与数据的需求极度的夸张 , 极度的夸张 。

算力消耗高 , 数据依赖强 。 第二 , 缺乏人类的抽象能力 , 人类的抽象能力 。 第三 , 黑箱不可解释 , 可解释性也是很多人去探索的方向 。

第四 , 灾难性遗忘 , 学习新任务时旧知识会被覆盖 , 所有的任务的上下文的记忆窗口的长度 , 很长时间没有突破了 。

第五 , 小样本复杂推理的缺失 , 难以在少样本的情境下做泛化 。 这些议题可能都是当前这个时间点大模型的局限 , 这些局限制约了在真实的 、 关键的 、 多变的场景中大模型的可靠的落地 。

那么如何解决这件问题呢 ? 说点玄学的 : 造物主或者上帝给了我们一个示范 ,也就是人脑 。 人脑给的什么是方案呢 ?

人脑有 860 亿个左右的神经元 ,但它的功耗只有 20 到 23 瓦 , 平均仅需要 4% 的神经元同步的激活就可以解决很多问题 。

它可以自动的纠偏 , 受噪声干扰仍可恢复正确的记忆 。 它可以做内容的联想 , 快速关联回忆 , 完成任务 , 实现类脑的检索 。

它可以做各种各样的状态切换 , 创造性的思维的关键来源也是来自于人脑 。 这是造物主在造人类的时候给的人脑的一种解决方案 。

那我们似乎可以借鉴人脑的解决方案 , 往前再去推演智能的演进 。 那推演到哪呢 ? 又回到那个标题 。

郑院士会觉得 , 我们要从大模型走到所谓的机器记忆智能 。

机器智能的模型核心 , 它可以做协同 , 它可以在资源最小化的情况下 ,在机制稀疏的情况下做强推理 , 对知识的表征 、 结构化的组织与压缩有理解 , 可以做联想 , 可以做内容的关联跟激活 。

它实现了某种程度上的不可能三角 。 这不可能的三角是有限性 ,也就是说有限的算力 、 存储 、 数据 、 时间 。

第二个 , 时效性 , 必须在限定时间内输出可行方案 。 第三 , 开放性 , 泛化性 , 动态的适配新场景 、 新知识 , 随时吸收新的知识 。

似乎如果我们沿这条路 , 所谓的机器记忆智能这条路往前走 , 我们可以实现某种程度上的不可能三角 。

这是郑院士的主张 。 那在另外一位嘉宾 , 就是工信部电子务所软件与系统研究院的高级副院长蒋沛航讲演讲的演讲当中 ,他提及的议题是 : 可靠的评测体系如何护航 AI 产业落地 。他说 AI 规模化落地推动测评体系从模型能力评价走向全链路可靠性评价 。

可靠评测19:22

庄明浩19:47

可靠 AI 测评体系从应用场景出发 , 覆盖芯片整机框架 、 模型 、 数据和应用的全链路 , 为产业选择 、 行业治理和技术演进提供统一 、 可验证的评估标准 。

听到这儿 , 如果熟悉我的播客 , 应该会想到我在上期播客里提到的一个观点 : 当前这个时间点 ,benchmark 本身都是问题 。

那蒋院长把这个事情提到了更高的高度 ,也就是可靠性的评测体系 。 比如说 , 我们要去探讨当前这个时间点 AI 系统的协同效应 。

单点的指标亮眼 , 可能不足以对整个系统跟适配协调上产生足够的影响 。 业务的可靠性 , 把 AI 落到政务 、 工业 、 民生各个领域 , 它对延时 、 能耗跟稳定性以及安全的要求都不一样 。

复杂任务的稳定性 , 今天 AI 在执行的是多步骤的高并发任务 。 尝试或者说试点好 ,但并不能代表真正的生产中就可以搞得定 。

还有 ,benchmark 本身的数据的有效性也在出现巨大的挑战 。 现有的评测在场景 、 数据集 、 方法上贴合度不足 。

这是当前在可靠性的评判上遇到的问题 。 那么怎么解决这些问题呢 ? 蒋院长的逻辑是说 , 我们要做一套可靠的 AI 评测体系 。

那何为可靠评测体系 ? 有 5 个维度 : 从测评对象 、 测评方式 、 测评边界 、 评估力度 、 跟评价的标尺上, 我们都要从传统的方式走到新的方式 。

比如说在测评对象上, 传统的方式更多是针对单一模型的测评 。 当前这个时间点 , 我们需要的是系统级的智能体的测评 。在测评方式上, 我们原来用的是静态测试 ,有一个表单或者是一套打分 ,但是未来我们需要一个动态的 、 持续的即时测试 。在测评的边界上, 原来我们更多是在测模型 ,但是今天我们似乎需要对整个技术栈进行评测 。

原来的评测力度 , 我们只看得分 , 更多时候我们只看结果 ,但是现在我们可能需要对全流程的轨迹做完整的判断 。在标尺上, 原来我们根据打分的高低评判能力 ,但是你会发现今天越来越多人去探讨所谓的 ROI, 所谓的成本 ,也就是说价值与成本的综合考量变得越来越重要 。

总结一下, 我们需要做的可靠评测是包括全流程轨迹覆盖 、 工序调用 、 权限使用 、 任务迭代等要素 。

评价 , 这个评价体系包含推理成本跟

TCO 的总拥有成本

。 也就是说 ,在整个的 AI 执行的全链路 ,在特定场景和运行条件下, 持续稳定地实现预期功能 ,并具备安全可靠 、 行为可预测 、 异常可处置与恢复能力 。

从芯片层 , 比如算力 、 带宽 、 能效 、 稳定度 , 到整机互联 、 算力集群 、 通信 、 故障恢复 , 到框架系统 、 算子兼容 、 调度 , 到模型本身准确率 、 幻觉鲁棒性 , 到数据层面 , 数据的质量 、 归属 、 溯源 , 到应用层面 , 闭环 、 成效 、 安全退出 , 这个全链路要可证明 、 可控制 、 可承受 、 可复核 。

听起来非常的难以实现 , 对吧 ? 但是这需要所有的产业方的所有人付出非常多的努力 。 综合来看 , 从我们简单来看 AI 这一轮的探讨 , 从基础的硬件层 —— 芯片 、 互联 、 框架与系统软件 —— 到模型层 , 到数据层 , 到应用层 , 整个四层架构似乎可靠性要一耳贯穿 , 才能形成一个可靠 AI。

它包括了安全可控 、 行为可预测 、 稳定的实现功能 , 出现异常可以察觉 , 这就是代表可靠 。 所以在当天会上, 工信部电子第五研究所联合北京智源研究院 、 浪潮信息 、 摩尔县城 、 木系股份 、 北京开源芯片研究院 、 百度智能云 、 阿里云等 20 多家产业链单位 , 正式发布了面向 Agent 时代的可靠 AI 评测体系 。

针对传统 AI 评测更多聚焦单一模型 、 芯片或局部性能等问题 , 该体系聚焦智能体应用带来的新能力 、 新场景和新要求 , 覆盖芯片 、 整机 、 互联 、 框架 、 系统 、 模型 、 数据 、 应用等诸多环节 。

从可靠性 、 安全性 、 稳定性等维度开展全链路评测 , 涵盖场景构建 、 风险评估和能力优化 , 为产业选型 、 技术演进和行业应用提供可验证的评价参考 。

我会觉得这套可靠 AI 的评测体系 , 对于当前这个时间点 AI 的落地尤为的重要 。

第二章我们聊的叫智能进化跟可信评估 。 这其实是一体两面 : 智能是否进化 , 它是否能在有限资源下工作 ,在限定时间内给出答案 , 能否吸收全新的知识做泛化 ; 系统是否真的可靠 , 它能否持续稳定实现的功能 , 能否处置异常的检测处置 , 它的每个 Token 是否对得起它的成本 。

所以让智能真正的可信 ,是下一步的共同命题 。 好 , 我们进入第三章 : 算力芯片 、 系统 、 器件 、 生态的突围 。

算力突围25:46

庄明浩25:52

我说过这章有三位嘉宾 , 所以它对应了系统 、 器件跟生态 。 我们一个个来看 。 系统层面 , 智算双轨来自浪潮信息的流动 。

它会认为能力型与容量型的智算要出现双轨 。 器件层 , 这位嘉宾来自于清华 ,他做的是存算一体的芯片 。他所讲述的内容是讲存算一体芯片如何打破当前这个时间点的瓶颈 。

最后一位嘉宾来自于智源研究院 ,他讲的是生态协同 , 就是开源生态如何让芯片可用 。 从算力系统到器件脱破 , 再到生态协同 , 构成了整个当前这个时间点的完整链路 。

我们一个一个来看 。 首先是浪潮信息的首席 AI 战略官刘军刘总的发言 。他说 Agent 让智能第一次可以像计算和电力一样被规模化生产 , 这就让 AI 计算既要支撑前沿智能突破人类的能力边界 ,也要推动智能充分供给 ,以贯穿式系统创新提升计算效率 ,以开放创新构建健康可持续的产业生态 。

所以总结一下刘总的演讲 ,他会认为智算系统需要双维进化 : 向上突破与向广普惠 。 双轨之向上的叫能力型算力 , 它做的事情是突破认知的边界 , 支撑前沿模型的研发 , 面向的可能是马上进入到 10 万亿参数规模的前沿模型的研发 , 极度追求的是连续稳定运行与低延迟 。

同时出现的另外一轨叫容量型算力 , 它面向的是商业推理跟普惠的共享 , 要解决的是海量高并发的终端需求 , 极度追求资源动态调度与防闲置 。

一轨一轨来看 , 我们先看能力型智算的极端需求 。 当前这个时间点的开源模型 , 比如大家所熟知的 Kimi 的 K3 已经达到 2.8T, 传闻中的 Claude 应该已经是一个 10T 的模型了 。26 年结束之后, 最最最的头部厂商应该都奔着 10T 模型去了 。

今天的语气大会上, 千问应该也做了类似的表态 。 沙亚文的窗口今天一个命令应该已经是常态了 , 对吧 ?

然后 Agent 的运行时长 , 已经从几个小时大家开始在尝试往几天去跑了 。 所以在漫长的推理与规划的周期中, 任何一次计算 、 通信或者软件故障 , 都会导致长周期任务的中断 。

所以不需将单节点视为一个整体 。 这种超级高端的能力需要落地 , 对于智算系统需要有三个巨大的前提 : 第一 , 紧跟最前沿模型的发展速度 ; 第二 , 极低的延迟 ; 第三 , 支持长周期的稳定运行 。

这是能力型智算的极端要求 。 也就是说 , 我们需要去解决的是 , 这种智能究竟可以跑到多强 。 就像当前这个时间点 , 最最最的红模型在做的事情 ,他们在做的是突破智能的上限 , 让 AI 帮助人类探索还不知道什么 。

对于智算系统要求变成了装得下 、 跑得快 、 跑得稳 。 关键概念变成了有效计算义 ,也就是说一个智能实例可以高效地使用计算的域要足够的大 。

它的技术路径就是超节点 , 从更多服务器到一个更大的计算机 。 我觉得当前这个时间点 ,NVIDIA 的老黄就在践行这样的事情 。

但在另外一面 ,也就是普惠的推理层的需求 , 它的核心议题变成了我们究竟能够拥有多少智能 。

它的目标是实现智能的充分供给 , 让每个人身边都有大量的智能 。 它的挑战是单个资源的智能产出的上限 。

核心理念变成了由负载定义算力 , 推理不是一种易算 ,是让每种芯片都做最擅长的事 。 关键概念 , 多元算力协同 。

高密度 、 负载结构 、 多元协同 。 它的技术路径就是多元算力协同的推理基组 , 从一个计算机到一个智能生产的工厂 ,也就是所谓大家谈讨的 Token 工厂 。

所以在这次的大会上, 刘总发布了两个浪潮信息的新的产品 , 分别针对刚才两个场景 : 一个是能力型的 , 一个是容量型的 。

能力型的 , 元脑 SD200 Ultra 超节点的 AI 服务器 , 它是解决能力型 ,也就是前沿模型研发的 。 它举的例子就是当时 Kimi K3 的联合发布过程中 ,他们可以做到 Token 的生成时延低至了 5.85 毫秒 , 支持了 10 万亿参数规模的超节点 AI 服务器 。

这是解决能力型的 , 元脑 SD200 Ultra。 解决容量型的是元脑 HC2000 多元算力基组 , 可以达到的效果是头等投资的情况下,Token 的产能可以提升 10 倍 。

这是针对双轨制情况下的智算体系浪潮信息所给出的答案 。 我们再看第二位嘉宾 ,也就是器件层面的这位嘉宾 , 来自清华大学的教授吴华强 。他做的是存算一体的芯片 。他说面对大模型算力需求的快速增长 ,以及传统芯片在面积 、 带宽等方面的约束 ,AI 芯片需要从新器件 、 新架构和新计算范式中寻找突破 。

存算一体31:13

庄明浩31:38

一组器在纳米尺度实现计算与存储融合 , 减少数据搬移 ,是发展算力芯片的新路径 。 它的核心逻辑是说 , 今天这个时间点的 AI 算力层的数据中心 , 数据在处理器与存储器之间的来回搬运 ,也就是数据的传输的问题 ,是性能与能效的主要瓶颈 。

那为了解决这件事情 ,他所做的研发的工作是做存算一体的芯片 ,也就是说让计算走进存储 。 存储阵列 , 计算与存储融为一体 , 单个单元内同时完成存储跟计算 , 实现的效果是数据在哪里 , 计算就在哪里 , 无需搬来搬去解决这样的瓶颈 。

那么为什么选择存算一体呢 ? 去跟传统的 GPU 跟 CPU 架构做对比 。 比如说传统架构在核心计算模式上是纯数字的逻辑 , 数据的搬运需要高频的搬运 , 所以功耗极高 。

所以反过来讲 , 为什么对大家对高速的内存要求这么的高 ,也是这个原因 。 同样的 , 又因为高速的内存跟不断的数据的传输 , 对功耗产生更高的要求 , 功耗上出现了瓶颈 。

然后极端的要求先进制程 , 尤其是 7 纳米以下的先进制程 。 但是如果是存算一体的方式 , 它是基于物理模拟的零搬运 , 它可以逼近硅基物理能效的极限 , 成熟制程也就是 28 纳米就可以实现性能的跃迁 。

所以存算一体实现了对传统架构的降维打击 。在吴教授的团队过去这些年的尝试过程中 ,他们已经最开始从 130 纳米做 28 纳米 、22 纳米 , 现在在往 7 纳米的方向去走 。

然后之前在同制程的传统结构上 ,他们的算力可以提升 4 倍左右 。 当时用的是 28 纳米的工艺 , 算力可以从 150 TOPS 涨到 600 TOPS。

这是他们已经在做的尝试 ,并且已经在很多的场景下做了实施 。 同样的 , 存算一体的芯片可以在算力之外进行更多的场景拓展 , 比如说在智能终端设备上实现极低功耗的常量唤醒跟永远的在线感知 , 打破移动设备的电池续航的痛点 。

比如在智能汽车上, 可以实现本地毫秒级的实时数据处理 , 彻底告别云端的传输延迟 , 全面保障智能驾驶的绝对安全 。

比如在 IoT,也就是物理网节点上, 突破极端环境的电池的极限 , 实现超长待机与高精度的本地边缘的智能推断 。

更高层级的意义 。 你会发现吴教授在讲的过程中 ,他会不断的提及说 , 今天这个时间点 , 我们可以通过这样的方式 ,也就是存算一体的方式 , 实现中国新换道超车 。

首先可以摆脱制程的依赖 ,在受限的成熟物理节点上, 我们就可以利用这种底层架构创新 , 实现跨代际的指数级的性能提升 。

第二 , 打破物理的极限 , 直接挑战硅基半导体的能效极限 。 第三 , 可以赋能全站的场景 , 从 4% 权重的边缘微调到千维百亿级的云端向量检索 , 完成从端到云的商业生态闭环 。

也就是说 ,不单纯存算一体的这种芯片结构 , 可以去解决一些我们当前遇到的现实的算力问题 ,也可以实现某种程度上的中国新的换道超车 。

开源生态35:09

庄明浩35:09

第三位嘉宾 , 北京智源人工智能研究院的副院长兼总工程师林永华女士 。 她所讲的是 AI 负载不会收敛 , 计算架构也不会只剩一种 , 让多元算力从能接入走向真正可用 , 需要构建更加开放共享的软件生态 , 降低不同芯片的重复适配成本 , 让硬件创新更快转化为产业能力 。

所以她的演讲讲的更多的是软硬协同的 AI 生态构建 ,以他们所在做的 FlagOS 这样一个开源生态 , 让芯片共享一套软件生态 。

她所讲 , 前面很多嘉宾讲到都是算力本身的瓶颈 , 那算力之外还有什么瓶颈 ? 从他们角度来说 , 软件生态也依然会成为所谓的壁垒 。

当前这个时间点 , 尤其以英伟达的 CUDA 为代表的软件生态 , 依赖协议 、 编译器与开发者习惯 , 它是一种多年积累的习惯 , 很难撼动 。

她会认为算力买到是相对容易的 ,但是生态的渗透是难的 。 这是国产 AI 芯片面临的核心问题 ,也是无数人会提及今天这个时间点 CUDA,是英伟达的核心护城河之一 。

她会举个例子是说 , 当前的国产的芯片非常像孤岛 , 这些孤岛虽然进行了非常激进的底层的创新 ,但是它在面临的是封闭的软件生态的战役 。

数百种新型的 AI 芯片结构 ,90% 被困于软件生态的高墙之外 。 我们只能无奈的妥协为兼容既有生态 , 创新架构被迫向旧标准妥协 。

所以他们做了一个开源的生态 , 叫 FlagOS。 三层协同 , 从框架与插件层 , 兼容主流的模型框架 , 接口对接开发者 。

算子层 , 开源算子库有 800 多个算子 。 底层编译层 , 支持多种 AI 芯片架构 , 通过全站的开源共享 , 让不同的芯片复用同一套软件能力 。

所以有一个比喻叫万能的插座 。 它做到什么程度呢 ? 当天林院长在演讲的过程中, 我拍了一张他演讲的 PPT。

那张 PPT 是一个时间轴 , 过去的几个月时间 , 国产大模型频繁的发布 。 林院长说 , 通过 FlagOS, 我们可以让一个模型在一天内适配并运行多达 12 款不同的 AI 芯片 , 使更多开发者能够在更广泛的硬件环境中体验跟使用该模型 。他列了 D0 适配支持芯片 , 包括平头哥 、 英伟达 、 昆仑星 、 海光 、 木犀 、 摩尔线程 、 天数之心 、 岁元 、 希望 、 青微智能 、 苹果 M4M5、

此心科技等等。 适配后的多芯片模型版本同步发到 Hugging Face、 摩尔大社区 、 腾讯云 、 焕新社区 、 国家超算互联网等重要平台 , 赋能更广泛的产业大模型应用 。

你听过刚才的模型的适配的过程 ,以及这些芯片的覆盖 , 大部分是国产芯片 。 所以架构层的创新 , 芯片 、 新芯片 、 新架构层出不穷 。FlagOS 通过所谓的开源生态共享软件站 , 破除了适配瓶颈 , 把这些国产芯片跟国产模型的适配做到了 D0,也就是当天可以实现 , 让规模化的算力可以被可用 。

而且当前这个时间点 ,FlagOS 已经从论文走到了可用 , 没有什么支撑的算力 , 只是闲置资源 。 生态是芯片真正发挥价值的最后一公里 。

当前 FlagOS 生态正在壮大中, 对芯片制造商而言 , 可以专注芯片上的微架构创新跟算力堆叠 ,不需要再耗费数年的生命重复造底层的软件车轮 。

对开发者而言 , 尤其是模型开发者而言 , 模型架构只需要一次编写 ,72 小时之内可以瞬间触达全球数十种最优算力 , 打造属于 AI 时代的共享土壤 。FlagOS 不是在制造另一个封闭的城墙 ,是在铺设一片生机勃勃的共享土壤 。

当前这个时间点 ,FlagOS 已经有 100 多家生态伙伴 、800 多家开源算子覆盖主流算子 、12 款单模型适配芯片 、50 多个国家的培训覆盖 。

一个壮大的 FlagOS 生态正在演进中 。 所以回顾一下我们三章 、 三层 。AI 进入生产阶段 , 比的是谁能让每一个任务跑完 。

回顾致谢39:54

庄明浩40:04

首先需求侧 , 从 Chat 到 Agent 的量级跃迁 ,是这一轮变化的起点 。 第二 , 智能侧 , 进入生产之后必须重新定义可靠性 , 从概率拟合到可信运行 。

第三 , 供给侧 , 系统级 、 器件级 、 生态级的三级同时推进 , 才算真能接住这个需求 。 写在最后, 用一个金字塔式的比喻 。

性能层面 , 我们要实现的叫可信运行 ; 效率层面 , 我们要做软件的生态与评测标准 ; 稳定性的在算力跟系统数据中心层面 ; 安全在底层跟芯片跟硬件层面 。

这几层一起构建了完整的 AI 生态的金字塔 。 好 , 感谢大家收听本期节目 。 以上就是我对 AICC2026 年大会的一次整理 。

再次感谢收听屠龙之术 。 老规矩 , 我的 PPT 会放在声档里 ,有需要可以下载 。 再次感谢 。