# 智能的下一幕，让人兴奋---73页PPT solo

屠龙之术 · 2026-09-15

<https://tulongzhishu.podhood.com/099ca75f-9174-4853-9890-a9ab5b1e1291>

庄明浩在本期《屠龙之术》单口带PPT节目中，以红杉美国研讨会标题《Own Your Intelligence——从模型竞争到智能生产》为框架，梳理过去一个季度AI行业。他指出模型发布已呈

## Questions this episode answers

### 为什么现在大家评测模型都用3D效果来衡量？

庄明浩引用兰西老师的观点：当所有Benchmark失效后，观察者、用户和厂商对模型传播与能力的界定需要"奇观"，而3D和Game是最直观的奇观。智谱5.3 Flash靠匿名登榜加价格斩杀线获得传播，MiniMax H3经FAL后训练在Twitch实现生成速度超过观看速度的"无限流"直播，都印证了Attention is all you'll need。

[14:33](https://tulongzhishu.podhood.com/099ca75f-9174-4853-9890-a9ab5b1e1291?t=873000)

### 开源模型和闭源模型在OpenRouter上的token量和花费占比是怎样的？

庄明浩引用OpenRouter统计：把Salpage、Google、OpenAI定义为一条曲线，其他Lab（多为开源）为另一条，token量的交集发生在去年8月。到今天token量上三分之二由其他模型贡献，头部三家只占三分之一；但花费角度相反，三分之二被那三家占据，开源模型因单价更低只拿走三分之一。

[26:20](https://tulongzhishu.podhood.com/099ca75f-9174-4853-9890-a9ab5b1e1291?t=1580000)

### Harvey是如何构建自己的智能体系的？

庄明浩介绍，刚融资155亿美金的AI法律公司Harvey在红杉美国会议上提出三步：先Build a Benchmark，再用Benchmark去后训练模型，并选择与提供训练Infra的厂商合作。它先建立法律领域Benchmark，基于此搭建RL环境，与LangChain及各类neolabs合作，形成环境搭建、后训练、Benchmark、评估不断反馈的Loop飞轮。

[30:56](https://tulongzhishu.podhood.com/099ca75f-9174-4853-9890-a9ab5b1e1291?t=1856000)

### neolabs公司融资和收入情况如何？

庄明浩引用美国一家机构的统计：119家neolab在过去一段时间融了94.3个B，即943亿美金，但其中只有16家公开过一点点收入。英伟达投了其中34家，将近三分之一。按分类，物理AI、世界模型、AI for Science与RSI关系较小，而新的结构推理及真正定义RSI的公司占近一半，赌的是广义的Loop和RSI。

[42:24](https://tulongzhishu.podhood.com/099ca75f-9174-4853-9890-a9ab5b1e1291?t=2544000)

## Key moments

- **[0:00] 开场**
- **[3:38] 节目主题**
  - [5:13] 庄明浩：这次内训是接过最难的一次，对方要求"只往高了讲"
  - [5:29] 庄明浩列出本期六大关键词：RSI、Auto-Research、Loop、Neolab、Router、Benchmark
- **[7:25] 模型狂奔**
  - [7:45] 一个多月内中美头部厂商发布超40到50个模型，观察者已经麻木
  - [8:50] OpenRouter数据：2026年4月和7月平均每天发布2个新模型
  - [11:02] 版本号加日期：DeepSeek V4 Flash 0731、Pro 0813，模型命名进入制造业逻辑
  - [12:31] 《大模型是残酷的制造业》：判断一个行业是不是制造业，硬指标是马斯克能不能玩明白
- **[13:35] 评测失效**
  - [14:34] Benchmark失效后，评测视频集体用3D效果当"奇观"衡量模型能力
  - [16:09] 智谱5.3 Flash匿名登榜与MiniMax H3的Twitch无限流直播间：Attention is all you need
  - [18:25] 梁文锋语录：把AI训练做好，并不需要世界模型，甚至不用多模态
- **[18:44] 开源与本地**
  - [19:20] 中美头部模型差距缩小到3到6个月，开源生态主要由中国厂商贡献
- **[20:21] 智能分化**
  - [20:56] GPT 3时代本地模型追平需33个月，如今千问3.8 27B只用9个月追平Opus 4.5
  - [21:21] 8月19日Swift 70亿美金收购OpenRouter，9月3日英伟达129亿美金收购Hugging Face
  - [22:20] 默认前提松动：Fable 5强得可怕，却没有给Anthropic带来超额利润
  - [23:40] Ramp统计：最烧AI的企业人均月花费达8000美金后，8月首次回落
  - [25:01] 开源模型成本只有闭源十几分之一、能力达80-90%，为什么不用开源？
  - [26:24] OpenRouter上开源模型已占三分之二token量，但花费大头仍是三大闭源厂商
- **[30:56] Harvey案例**
  - [30:57] Harvey的三步法：先建法律领域Benchmark，再用它做后训练形成飞轮
  - [32:16] LangChain主张：Agent就是模型加上下文加Harness，每个环节都有专门厂商服务
- **[34:08] 智能分工**
  - [34:50] Brex Top 25榜单中14家公司是帮别人构建AI模型的服务商，新Infra方向爆发
  - [36:33] YC 26夏季有8家公司瞄准Skill.ai，数据赛道才刚刚开始
  - [37:40] AftCurie从YC孵化到32亿美金估值只用了不到两年，五个月前仅3亿
- **[39:46] 循环自生**
  - [39:57] Claude文章《When AI builds itself》：模型不断参与训练，最后人类不见了
  - [41:18] 智谱唐杰：GLM 6.0定位全自训练技术路线，海外就是RSI
  - [42:15] 从奖励信号到环境搭建，模型训练各模块正被AI自己Take Over，只剩物理世界
  - [44:12] 119家Neolab融资943亿美金，只有16家公开过一点收入
- **[45:08] 人类价值**
  - [45:21] 英伟达投了119家Neolab中的34家，近一半公司赌的是Loop与RSI
  - [47:29] Jeff Dean公司Logo是倒8无限符号，田渊栋公司缩写就叫RSI
- **[47:51] 界面重构**
  - [49:17] 如果一切都Loop了，人类的价值变成定义新的高峰
- **[49:59] 总结**
  - [50:58] QuestMobile 7月数据：Work About It月活658万，国产办公Agent数据水分大
  - [51:10] ICLJ四象限：只有可验证且易编辑的领域（如Code、3D）适合Loop，Loop是结构不是魔法
  - [52:24] 侧边栏塞满技能、连接器、插件：复杂度应该产品自己消化，而不是转嫁给用户
  - [52:57] 苹果10年来首次App Store制造收入下降，我们真的进入新软件时代
  - [54:17] Codex周活达2500万，国产办公Agent界面与Codex几乎无区别
  - [54:39] 产品叙事从Code到OpenClaw到Grok Bot再到Meta Muse，个人Agent叙事已经开始

## Speakers

- **庄明浩** (host)

## Topics

模型与基础设施

## Mentioned

DeepSeek (company), Harvey (company), Hugging Face (company), LangChain (company), Mercor (company), MiniMax (company), OpenAI (company), OpenRouter (company), YC (company), 智谱 (company), Claude (product), CodeX (product), GPT (product), Kimi (product), 千问 (product)

## Transcript

### 开场

**庄明浩** [0:00]
Hello 大家好 ， 我是明昊 ， 欢迎收听我的播客 《 屠龙之术 》。 这是一期我的单口带 PPT， 针对过去 1 个季度左右 AI 行业的一次梳理 。

关注我播客的朋友应该知道 ， 我其实本来没有打算做这个季度的整理 ，因为大概率 10 月底的狂喜我应该会做一次整理 ， 所以这中间间隔的时间不是太长 。

但最近一段时间 ，因为一个朋友找去他们公司做一个演讲 ，有了这次的整理 ， 所以索性我就又做了一次 PPT 的内容 。

在今天的节目开始之前 ， 先跟大家聊一件我最近挺在意的事 ： 掉头发 。 对 ， 熟悉我的朋友应该知道我最近在打替尔伯泰 ， 这段时间也出现了掉头发的困扰 。

现在除了关注体重 ， 我还得关注一下头发 ， 所以最近我真的开始认真研究掉头发这件事情 。 到了自己在意这件事的时候 ， 就会很想弄明白一瓶强发洗发水里面的成分到底在做什么 。

也正好 ， 这期 《 屠龙之术 》 的赞助商就是欧倍青 DMG 洗发水 ， 这个合作算是碰上了我最近正在研究的一个生活课题 。

品牌给它的定位是 " 新一代头皮兴奋剂 ， 欧倍青旗下最强配方 "。 这里面我想重点跟大家讲的是它的主打成分 ：DMG。

DMG 中文叫二甲基甘氨酸 ， 它在这套配方里的作用是帮助促进头皮微循环 。 这个词听起来有点专业 ，其实说白了就是头皮的血液循环 ： 头发从毛囊里长出来 ， 毛囊需要的氧气和养分都靠血液送过去 。

如果头皮微循环不畅 ， 毛囊就相当于在饿肚子 ： 营养送不到 ， 发根自然就弱 ， 长出来的头发也容易细软脱落 。

欧倍青 DMG 关注的就是这个环节 ： 帮助改善微循环 ， 让发根获得更好的营养支持 。 跟它搭配的是欧倍青大家比较熟悉的咖啡因 ， 帮助激活发根 。

咖啡因和 DMG 组成专利协同配方 ， 一边支持发根活力 ， 一边改善供氧条件 。 这也是这次产品升级最值得了解的地方 。

当然 ， 掉头发还得结合个人情况看原因 。 对我来说 ， 研究洗发水是认真做日常头皮护理的一部分 。

这瓶洗发水的用法也很明确 ： 按产品说明 ， 洗发时让它接触头皮 ， 停留 2 分钟 ， 再冲洗干净 。

把 " 头皮护理 " 放进 " 原本就要做的洗头 " 这件事里 ， 对我来说是比较容易坚持的 。 我现在的想法也很简单 ： 既然已经开始在意这件事 ， 就把每天能做的护理认真做起来 。

如果你最近也开始关心掉头发 ， 可以了解一下欧倍青 DMG 洗发水 。 选的时候记得看清 "DMG" 三个字母 ， 它的核心就是咖啡因 ： 帮助激活发根 ；DMG： 帮助促进头皮微循环 。

两者形成专利协同配方 。 感谢欧倍青支持本期节目 。 好 ， 接下来进入今天的正题 。 我用了一个之前红杉美国的最近一次研讨会的标题 ， 叫 《Own Your Intelligence》。

我又配了一个中文的小标题 ： 从模型竞争到智能生产 。 看到这个标题 ， 你大概会知道我们今天会讲到什么 。

### 节目主题

**庄明浩** [3:38]
在讲述开始前 ， 先介绍一下这次准备内容的不同之处 。 我刚才讲我这次的 PPT 内容 ，是去一个朋友的公司做类似培训的事情 。

朋友公司是一家很有意思的公司 ，他在找我的时候给我发了这样一段话 ： 他说我们内部 Agent 的程度很高 ， 还有自己家的基模 —— 对 ，他们家有基础模型 —— 全员 Web Coding。

所以他说 ：" 你只要往高了讲就可以 。" 我听到这个诉求之后， 就觉得 ： 哇塞 ， 这可能是我接的所有类似的项目里面最难的一次 。

更麻烦的是什么呢 ？ 其实他们是一家金融机构 ，他特意强调了 。 因为我给他之前看了一些我过往做过的内容 ，他的建议是说 ， 最好就不要去讲二级跟一级的叙事 。

熟悉我的 PPT 的朋友应该知道 ， 我的大部分这种超长的季度总结应该分 4 章 ： 技术 、 产品 、 资本 、 跟一个叙事 。

而那个叙事往往也跟资本相关 。 所以根据他的要求 ， 过往我讲了很多的 CapEx、Mag 7 上市融资 ， 很多这种叙事都没有办法展开 。

所以今天的这期的内容 ， 更多集中在技术跟产品 。 可能是最难的一次 ，但我觉得也是好事 。 之前的习惯如果了解的话 ， 我一般会做 " 季度的更新 + 行业梳理 + 一次的叙事 "。

那这次可能更多的就是 " 季度的更新 + 一点点展开 "。 我们今天会涉及到哪些关键词 ？ 我在做这次 PPT 之前 ， 列了大概十几个关键词 ， 然后最后挑了五六个关键词留在了我的 PPT 的算是比较前面的位置 。

第一个关键词 ：RSI。 我觉得在过去可能 3 到 4 个月时间里面 ， 甚至再往前推 ， 过去大半年甚至一年左右时间 ， 最前沿的模型公司大部分公司在 bet 的应该就是 RSI。

第二个关键词 ：Auto-Research。 可能跟 RSI 有一定的概念上的重合 ，但它更聚焦在 Research 任务上， 那它的议题变成了 " 多大程度上的 Auto-"。

然后前面的 RSI， 我会有一个疑问是说 ： 到底 RSI 是一种目标 ， 还是今天大家把模型往前推进的手段 ， 亦或是两者都是 ？

第三个关键词 ：Loop。 这个关键词可能在我前两期的 PPT 节目里面应该也出现过无数次了 。 那看起来所有人都在 bet 的是 " 一切皆可 Loop"， 那真的如此吗 ？

再下一个关键词 ：Neolab。 这可能也是过去一年左右时间 ， 整个业界在意识上 、 投资的角度来看 ， 最宽泛的一个定义 。

所有人似乎都成为了 Neolab。 那问题变成了 ： 这个定义跟这个范围是不是太大了 ？ 再下一个关键词 ：Router， 路由 。

那路由到底是一个中间态 ， 还是它会成为所谓 AI 行业的一个入口 ？ 对于这件事情的来回来的掰扯 ，在过去可能很长一段时间也有很多的观点跟主张 。

最后一个关键词 ：Benchmark。 我的疑问变成了 ： 今天连 Benchmark 似乎也成为了一种瓶颈 ， 所以造成的结果是 ， 今天出现了一堆公司只做 Benchmark， 就可以成为一家独立的公司 。

就是在我演讲这个 PPT 的当天 ， 阿里跟腾讯投资了一家在中国做 Benchmark 的公司 。 对 ，Benchmark。 涉及的关键词大概是这些 。

然后今天的正式内容一共分 4 个章节 ， 分别是 ： 模型狂奔 、 智能分化 、 循环自生 、 界面重构 。

### 模型狂奔

**庄明浩** [7:37]
模型 、 智能 、 循环跟界面 ， 四章 。 我们一章来 ： 模型狂奔 。 我的这次 PPT 内容的制作时间应该是 9 月初到大概 9 月 10 号左右 ， 就是 9 月的上旬 。

我去截取了 8 月到 9 月的头部模型厂商的发布 ， 无论是中国厂商还是美国厂商 ， 都可以截出超过 20 个模型 。

也就是在过去的一个多月时间里面 ， 中美可能发了超过 40 到 50 个模型 ，而且这只是头部厂商 。 我还没有去统计那些非头部厂商 。

所以面临这种密集的 、 有些过于密的模型发布 ， 我觉得无论是像我们这样的观察者 、 个人用户 ， 甚至是从业者 ， 我觉得大家已经有点麻木了 。

那再看具体的数据统计 。 两张图 。 第一张图来自 OpenRouter， 这张图我在我的 AI Buy Number 里面用过 ， 就是 OpenRouter 那个数据分析师给出的数据 。24 年在 OpenRouter 上上线的模型 ， 平均一个月一般是十几个到二十个 ， 最多是 24 年 8 月份达到 28 个 。

那就是说平均每天就是 0.5 到 1 个 ，但不到 1 个 。 所以它用了白色的柱状 ， 表示 24 年的使用况是这样的 。

到了 25 年的时候 ， 你会发现有大概 6 个月的模型发布 ，也不到平均每天 1 个 ， 大概平均在 25、26、27 这样 。

但是有另外 6 个月的模型发布 ， 分别到了 45 个 、50 个 、35 个 、42 个 、42 个跟 35 个 。 那平均来算 ， 那 6 个月每一天的平均新的模型有超过了 1 个 ， 没有到 1.5。

所以它用紫色的柱子表示了 。 那这件事情到了 26 年呢 ？ 你会发现 ， 这个图制作的时间是截止到 26 年的 8 月 11 号 。

也就是说有 7 个完整月 ，7 个完整月当中， 有 3 个月的模型发布没有达到平均一天 1 个 。1 月 17 个 ，2 月 26 个 。

啊不对 ， 前面 7 个月里面有只有 2 个月平均没有达到 1 个 ， 就是 1 月跟 2 月 ， 分别发布了 17 个跟 26 个 。

超过 1 个的 ：3 月 、5 月 、6 月 ， 平均每一天超过了 1 个 。 更更更疯狂的是在 4 月跟 7 月 ， 分别是 80 个跟 70 个 。

也就是平均一天达到了 2 个 ， 它用了绿色柱状 。 然后这张图截止到 8 月 11 号 ，8 月份 11 天发了 22 个 。

所以如果 8 月整月来算 ， 应该也是超过 2 个的 。 从频率跟发布的量来看 ， 确实模型厂商在疯狂的发布 。

另外一张图来自 Hugging Face， 很有意思 。 一张 OpenRouter， 一张 Hugging Face， 两家公司都被收购了 ， 后面会展开 。 它统计的 ， 它 Hugging Face 上所覆盖的所有的 AI 的模型 ， 这就不单纯只是语言模型 ，有多模态 ，有语音 ，有 RL，有各种各样的模态的环境 。

你明显感知到 ， 从这个曲线的分布来看 ， 进入到 25 年下半年， 这个曲线瞬间变成了一个急速往上拉的状态 。

进入 26 年之后， 这个曲线硬生生地又被拉出来一个斜率增长的状态 ， 就基本上快跟笔直的往上增长一样 。

所以肉眼可见的 ， 从模型发布角度来讲 ， 总量跟频率都在增加 。 再一点 ， 版本号的变化 。 我列了三个版本号 ， 可能是最近国内比较有名的几个版本号 。

比如说 DeepSeek V4 Flash， 第一次发布叫 DeepSeek V4 Flash 0731。 然后没过多久 ，DeepSeek V4 发了 Pro， 叫 DeepSeek V4 Pro 0813。 然后又没过多久 ， 千问发了 3.8 Max 0902。

我们单纯只看这个版本号本身 ， 第一层我们看到了 ， 除了定义版本号之外， 出现了 Flash、Pro、Max 这样的分布 。

比如 GPT 有 Soul，有 Luna，有这样的划分 。Claude 模型也分这样的不同的参数量的大小 。 这是一层 。 同时这一层分布还不够 ， 还加了日期 。

为什么要加日期呢 ？ 因为版本模型之间的版本号发布的密集 ， 导致你可能仅仅过了一段时间 ， 没有很久之后， 前面的 V 级或者是那个版本号没有太大的变化 ， 甚至连 Flash 跟 Pro 也没有变化 ，但是这个模型其实已经有进化了 。

那我们只能用日期来去做区隔了 。 那好 ， 先有版本号 ， 然后模型的大小的对应的号 ， 然后又有了日期 ， 那再往后是不是还需要加别的 ？

版本号的变化 。 所以模型变成了什么 ？ 像 AI 来讲 ， 模型或者是大模型的生产跟训练 ， 变成了纯纯的 " 制造业 "。

之前有一篇文章叫 《 大模型是残酷的制造业 》，有几段话我觉得讲得非常好 ， 我截取了几段 。 经过了这两个月模型厂的狂轰滥炸 、 疯狂更新之后， 相信大伙都逐渐认清了一个事实 ： 这些模型厂之间没有本质区别 ， 水平都差不多 ， 无非是谁的新版本抢发几天 ， 谁晚发几天的差异 。

你回想过去这几个月的时间 ， 似乎确实如此 。 下一条 ， 判断一个行业是不是制造业有一个硬指标 ， 那就是马斯克能不能玩明白 。

你看最近这个这个 ， 这个 SpaceX 的模型 ， 就是 Grok，也还不错 ， 对吧 ？ 马上跨界进去玩不明白的 ， 那铁不是制造业 。

第三段话 ， 事实证明 ， 科学家带不好先进段的大模型团队 ，因为科学家不爱带人打标 ，不爱工程任务 。 而现阶段干大模型需要的就是包工头 ， 带大伙一起零零七 ， 主要工作就是做题 、 解题 。

说的没有任何错 。 所以大模型变成了残酷的制造业 。 至此出现了一个新的问题 。 我前面提到的关键词的最后一个 ：Benchmark。

### 评测失效

**庄明浩** [13:43]
面临这么密集的模型发布 ， 用户 、 厂商 、ToB 的公司 、 观察者 ， 如何去评判这个模型的能力 ？ 我们看到了各种各样的打分 ， 甚至那个最有名的用醍醐汽车的做案例 ， 看到各种各样的所谓帕雷特最优的衡量 ，也就是除了衡量模型能力 ，也衡量价格 。

你可以在所有模型发布的官方推送上看到各种各样的搒单推送 。 可是 ， 似乎看起来所有的这些搒单 、Benchmark， 都很难界定一个模型到底好不好 、 强不强 。

就像兰西老师说的 ， 似乎我们需要另外一种方式去衡量这个模型的价值 。 所以出现什么问题 ？ 你发现了吗 ？

最近一些新的模型 ， 比如说之前的 FEB 5.1， 比如说腾元的浑源 4 的 Preview 版本发布的时候 ， 包括这次 GPT 6 发布之后， 你发现大面积的评测视频都在用让模型去做 3D 的效果来去衡量模型的价值 。

那就出现一个问题 ： 为什么大家都开始和 3D 过不去了 ？ 也是兰西老师说的 ， 当所有的 Benchmark 失效之后， 我们这些观察者 、 用户 ， 甚至厂商 ， 对于模型的传播跟模型能力的界定是需要 " 奇观 " 的 。

那 3D 也好 ，Game 也好 ， 似乎就是最最最直观的奇观 。 这个又让我想起了前一段时间 DeepSeek 的梁文锋的那个语录里面提到一句话 ，他说 ：" 当前最重要的是把 AI 训练做好 。"

把 AI 训练做好 ，并不需要世界模型 ， 甚至不用多模态 。 梁圣 ， 诚不欺我 。

那对于当前的模型厂商而言 ， 当模型的制造跟训练变成所谓的制造业之后， 如何获取 Benchmark 之外的奇观的关注呢 ？

这又对应了这一轮 Transformer 最重要的核心那篇论文的标题 ：Attention is all you'll need。 举两个例子 ， 分别来自两家中国上市的大模型公司 。

先是智谱 ， 最近发的 5.3 Flash， 就是那个牛来的模型 ， 先在推特上引起了巨大的传播 ， 匿名登搒 ， 然后得到非常多的关注 ， 能力非常强 ， 然后价格非常便宜 ， 然后得到了更多的传播 ， 用户的关注 ， 公布自己是牛来 ， 就是所谓的 5.3 Flash 之后 ，他们在正式公布的推文里面 ，他们官方自己画了那个非常有名的斩杀线 ， 就是它的模型能力跟价格的那个

斩杀线 。 用这样的方式让 5.3 Flash 得到了更多的关注 。Attention is all you'll need。 下一个案例 ，MiniMax。MiniMax 的 H3 发布之后， 美国的一家做后训练的公司 FAL 做了一个事情 。

这个事情是什么呢 ？ 他们通过他们的后训练 ， 基于 H3，在 Twitch 上开了个直播间 。 这个直播间的内容是 24 小时不间断的 。

更重要的是 ，因为 H3 的能力加后训练的这个他们的调教 ， 双引号的 " 调教 "， 造成的结果是 ， 当用户在这个直播间的弹幕发出一个对视频模型要求的修改内容之后， 模型生成的速度超过了观看的速度 。

我再说一遍 ， 模型生成的速度超过了观看的速度 。 也就是说 ， 它生成一段一分钟的视频 ，是不需要一分钟的 。

这就造成一个什么结果 ？ 那个直播间就变成了双引号的 " 无限流 "， 就这个视频可以无限滚下去 。

当传说中的无限流出现了 ， 大家会惊呼 ， 视频模型似乎到了一个节点 。 因为这样的传播 ，MiniMax 的 H3 得到了巨大的关注 。Attention is all you'll need。

这个事情再延展 ， 提到无限流 ， 如果关注行业的话 ， 你应该会想到 ， 今年的上半年， 有几家做所谓的视频模型的公司 ， 号称他们在做世界模型 ，他们所的主张就是无限流 ， 对吧 ？

这个问题再延展 ， 老生常谈的中国跟美国的模型对抗 ， 似乎我们的头部的模型厂商跟美国最头部的模型厂商之间的差距不是特别大 。

有些观点会认为已经缩小到比如说 3 到 6 个月 ，有些观点可能会认为还在 6 个月 、9 个月之间 ， 反正这个距离不是特别大 ，并且又因为我们的模型的性价比的能力的提升 ， 引发了后面所有的问题 。

所以这个问题自然而然引入到了另外一个对比的角度 ， 就是开源跟闭源的竞争 。 美国最头部的三家模型厂商 OpenAI、Salpage、Google， 依然延续着闭源的策略 。

### 开源与本地

**庄明浩** [18:57]
美国当然也出现了一些做开源模型的厂商 ，但似乎开源的生态更多是由中国厂商贡献的 。Kimi、 智谱 、 千问 ， 对吧 ？

开源跟闭源的竞争 。 再下一张图 ，也是我之前 AI by the number 提到的那张非常重要的图 ， 就是从云端跟本地模型的对比 。

这张图呢 ， 比较的就是当一个最新的 Scalable 模型出现之后， 我们看需要多久可以出现一个可以在本地部署的参数量比较小的模型的能力 ， 达到当前这个时间点的头部的 Scalable 模型的能力 。在 GPT 3 那个年代 ， 这件事情需要 33 个月 ， 快 3 年 。

等到了最近千问 3.8 的 27B 那个非常非常强的可以本地部署的模型的能力 ， 已经到了 Opus 4.5 的能力 。 也就是说 ，Opus 4.5 发布之后的 9 个月 ， 就有一个可以部署在本地的小模型达到了 Opus 4.5 的能力 。

那大家在想 ， 今天我们世界上最优秀的跟最强的模型是 GPT 6， 那似乎不需要等太久 ， 就可能有一个 30B 左右的小参数量的可以本地部署的模型 ， 达到 GPT 6 的能力 。

那这个事情可延展的空间似乎就会被无限放大 ， 甚至可能我们都不需要等到 GPT 6。 现在的千问 3.8 的 27B 的模型就可以干很多的事情了 。

### 智能分化

**庄明浩** [20:22]
所有的议题到这 ， 自然而然引发的问题 ， 中美对抗的问题 ， 开源模型 、 闭源模型的问题 ， 本地模型 、 云端模型的问题 。

你会发现 ， 纯大模型这件事情出现了分化 。 所以我们进入第二章 ， 智能分化 。 两条新闻 ， 前面提到了两家公司 ：8 月 19 号 Swift 70 亿美金收购 OpenRouter，9 月 3 号英伟达 129 亿美金收购 Hugging Face。Hugging Face、OpenRouter， 这两家被定义成这一轮 AI 爆发过程中最最最核心的所谓中间层的代表公司 ，在差不多的时间点 ， 都以超级高的价格被 AI 行业的基础设施 、 广义的基础设施公司收掉 。

我觉得大的并购往往会代表着行业的重要的节点出现 。Code 这章的标题 ， 智能分化 。 再一张图 ，是 Ramp 统计的 ， 金融时报重新绘制一张图 。

我在上次 AI by the number 也用过 ， 就是 Claude 系列所有模型的企业端的付费占比 。 你会发现 ， 之前发布的 Fable 5 模型发布之后 ，并没有得到所有超级多人的认可 。

它增长到可能百分之十几之后就不涨了 ， 大部分人依然在延续用 Opus 4.8。 那在过去几年， 似乎在应用跟 ToB 场景里 ， 大家有一个默认的前提 ， 就是所有最新的跟最强的模型出来 ， 我就是要用那个最新跟最强 ， 甚至最贵的模型 。

但在今天 ， 这个前提本身 ，也就是说所有人都要用最新跟最强的模型的这个前提出现了松动 ， 造成的结果是说 ， 确实 Fable 5 出来的时候 ， 强得可怕 ， 这么强的技术领先 ，但没有给 Salpage 带来超额利润 。

也就是说 ， 所谓的 Scalable 模型的保质期急剧的变短 。 更更更麻烦的是什么呢 ？ 同样是来自 Ramp 的统计 ， 它在刚刚发布的 8 月的 AI Index， 就是 AI 指数的 ， 就是它统计的是它所覆盖的美国几万家公司在 AI 上的花费 。Top 1，也就是花费最最最多的公司 ， 平均每一个员工在 AI 上的花费 ， 这个月度的额度达到了 8000 美金 。

我讲过 ， 这个数字大概是美国软件公司工资的一半 。 这个数字在 7 月份达到顶点 8000 美金 ， 可是在 8 月份 ， 这个速度往下掉了一点点 。

为什么 ？ 不是才到软件公司一半吗 ？ 怎么就往下掉了呢 ？ 虽然它统计的 Top 10 跟平均数的中中位数的企业的 AI 的支出还是在往上涨 ，但是最最最核心 ，也就是说原来用 AI token 最狠的那些企业 ，在 8 月平均那个数字往下掉 。

当然这里面可能有一些季节或者是单月的异常数据的变化 ，但似乎我们会可以推断一个比较怎么讲 ， 比较主观的结论是说 ， 哪怕是那些最基的厂商都意识到了这个成本需要调一调 ， 那个前提松动了 。

这里面最最最核心的原因 ， 当然是价格 ， 对吧 ？ 过去这么多年， 我们已经看到过无数次 Scalable 模型的单价会在过去过了一段时间之后不断的下降 ， 可能降一个 0 的降 ，而且这个保鲜期在急剧的缩短 。

如果有印象 ， 大家上一次最大的调价应该就是 GPT 5.6 的调价 ，Luna 直接调了特别多 ， 所以造成 OpenAI 的 Luna 的 5.6 的模型的访问量暴涨 。

价格 ， 价格还是价格 。 同样来自 Ramp 的统计 ， 它也 Echo 了这个趋势 。 它统计的三家最头部的模型厂商 ，OpenAI、Salpage 跟所有闭源模型公司 ， 最大的模型 ， 标准模型跟 Lite 模型 ， 就是按尺寸来算 。

当然当然这个尺寸本身也代表着价格 。 你会发现 ，在 8 月 2 号那个统计里面 ， 用最最最便宜 ，也就是我用最贵的这件事情 ， 还有 53%。

可是到 9 月 6 号的时候 ， 这个数字已经跌到 45% 了 。 而 Lite 版本 ， 就是轻度版本的这个额度并没有太大的变化 ， 大概从 16% 降到 14%。

大部分模型回到了所谓的 standard 的版本 ， 就是标准版 。 从价格曲线上来看 ， 这个曲线就在往下拉 。

我们回想过去的这段时间发生了什么 ， 用一个替代角度来看 ， 很现实的 ， 如果今天有一个模型能力达到头部模型 80% 甚至 90% 的开源模型 ， 它的成本只有对方的十几甚至几十分之一 ， 那我为什么不去用那个开源模型 ， 对吧 ？

那我们就看过去三年半开源模型领域发生了什么 。2023 年最代表的开源模型 Llama 2， 哇天呐 ， 感觉上古时代的模型了 ， 还不太行 ， 非常多的幻觉 ， 大家也做过很多的后训练的调试 ， 发现不太 OK。

所以在 22 年很多公司就选择回到了 GPT 4，24 年出现 Llama 3， 还可以 ，有些公司开始做了尝试 。 真正意义上，Llama 3 可以说是大家认为开源模型可以跟闭源模型是吧是吧 ， 那是 24 年的事情 。25 年 DeepSeek 2.1 出现了 ， 引发了后面所有无数的事情 。

真正意义上， 开源模型可以跟头部模型有竞争 ， 大家可以开始尝试做更多的部署 ，因为低成本 ，因为经济性特别明显 。

到了 26 年， 我们不需要练任何一个开源模型能力 。26 年今天开源模型跟闭源模型能力你知道什么 ， 我也不需要去解释 。

那自然而然造成结果就是大面积的商业铺开成为现实 。 过去三年半经历的事情 ， 趋势已经非常非常明显 。

同样是 OpenRouter 的统计

，在 token 的这个这个 share of tokens 的这个曲线上， 我们把 Salpage、Google、OpenAI 定义成一条曲线 ， 把其他 Lab 其实绝大部分就都是开源的 Lab 定义成另外一条曲线的话 ，他们之间的交集 ， 就是从 token 量的交集在 OpenRouter 上的量的交集的发生 。

发生在去年 8 月份 ， 然后到今天

， 从 token 量角度 ，在 OpenRouter 的 token 量角有三分之二是由其他模型贡献的 ， 最头部的三家模型只占了三分之一 。

但在 spend 就是钱的花费角度来讲 ，是反过来的 ， 三分之二是那三家占据的 ， 三分之一是被开源模型拿走的 。

我觉得这非常 make sense， 对吧 ？ 就是确实 token 的消耗变得更大了 ，但是因为单价更低 ， 成本更低 ， 所以从花费角度来讲 ， 还是大头在那三家 。

同样是一张我之前 AI by the number 用过的图 ， 就是那个一个第三方机构做的 token 的 ETF， 你明显感知到闭源模型的价格在过去的一两个月时间被急速的往下拉 ， 原因就是因为开源模型的崛起 ， 甚至开源模型的价格其实还在往上提 ，但是因为之前开源模型的价格足够的低 ， 所以它会把那个闭源模型的价格往下拉的非常强烈 ， 造成的这个平均价格

的曲线也是往下的 。 那么就出现了一个问题 ， 如果最强的模型在今天似乎已经不太能够等于最好用的智能了 ， 那么会出现什么样的状态 ？Echo 我今天的标题也是红杉美国那次的标题 ，Own Your Intelligence， 企业开始想能不能拥有自己的智能 ， 成本就有点考虑的 ， 速度也要考虑 ， 好的智能的好的标准 ， 这个表现是什么也要考虑 。

当然更重要的是对数据的把控 。 所以这几方因素造成了在过去的可能两个季度左右时间 ， 无数的企业开始认真的构想建立自己的智能 。

但在建立的过程中需要直面一些问题 ， 比如说到底是选择租用还是本地的建立 ， 这个边界跟权重怎么分 ， 如果要建立 ， 团队怎么构建 ， 如果建立了自己的这一套能力之后， 如何去说服你的客户接受的这种能力 ， 具体的执行过程应该是什么样 ， 这些就全部都是问题迎面而来 ， 那自然而然会有很多的厂商去解决这些问题

。在所有的问题里面 ， 我觉得成本只是第一个因素 ， 或者只是因素之一 ， 对吧 ？ 租用就是云端的还是本地部署 ，在成本上肯定有区别 ，在速度上也会有区别 ， 那最核心的区别在数据的掌控上， 当然可能还有天花板的问题 ， 成本只是因素之一 。

然后是刚才说的所谓的组织问题 ， 到底是一个自上而下的还是自下而上的 ，是全员的还是一个小规模集团军的 ，是以点代面的还是全部铺开的 ， 没有标准答案 ， 每家公司有自己的情况 ，team 具体的执行路径 ， 红杉定义 ， 红杉美国定义 ， 你可能首先需要一个战略 ， 所谓的战略就是你要做这样的一个决定 ， 然后去评估 ， 你要设定评估的标准 ， 然后做 Harness 跟路由 ，

做提示词 ， 做数据准备 ， 做后训练 ， 做中性链 ， 做 online learning， 做所有的事情 。 还是那个观点 ， 既然你要做这么多事情 ， 就一定会有一些厂商提供各种各样能力 ， 帮助你把这些环节做了 。

所以无论是开源领域还是闭源领域 ， 今天你会发现出现了一堆 ， 把刚才我们说的无论是做战略 、 做评估 、 做 Harness、 做 routing、 做数据 、 做 RL 环境搭建 、 做后训练 ， 甚至做预训练的所有这些东西 ， 变成商品化提供给别人的厂商 。

也就是说 ， 模型训练的这件事情的各个流程成为了商品 。

最后没有评估就没有真正的进步 。 你希望达到效果 ， 就是说一种是用闭源的云端的 API 达到一个效果 ，但是你今天希望通过一个开源模型 ， 加后训练 ， 加提示词 ， 加你自己的数据 ， 加 online learning， 加各种各样的事情 ， 达到的结果比单纯用 API 的方式能力得到提升 ， 这是最后的目标 。

### Harvey案例

**庄明浩** [30:57]
我们看一些具体的实施 ， 典型的比如说 Harvey 那家做最有名的 ， 最近刚刚融资 155 亿美金的 AI 法律的代表公司 ， 它当时在红杉美国那次的会议上的标题叫 Build a Building a Research Lab， 逻辑特别简单 ， 三步 ，Build a Benchmark， 然后用这个 Benchmark 去后训练模型 ， 谁来帮你 ， 或者说你选择跟谁合作 ， 就选择那些帮模型提供训练的 Infra 的厂商 。

它列了非常多的厂商 ， 先从模型厂商就有 ， 包括 OpenAI、Salpage、DeepMind、SpaceX、Meta， 开源模型厂商又包括 Kimi、 智谱 、DeepSeek、 千问 ，有做数据的公司 ，有做 training 的公司 ，有做评估跟搒单的公司 ， 甚至有各种各样的 neolab， 把这些公司合作一起做起来 。

那具体的做事方式就是 ， 它先建立了一个在法律领域的 Benchmark， 然后基于这个 Benchmark 去搭建一套 RL 的环境 ， 它跟合作是 LangChain， 然后跟那些各种各样服务的 neolabs 合作 ， 建立一个 Loop， 或者说一个飞轮 ， 环境搭建 ， 后训练 ，Benchmark， 评估 ，不断的反馈 ，不断的 Loop，不断的不断的 Loop， 这就是 Harvey 的执行策略 。

我们在这个过程中看到一个很重要的提供商 ， 比如 LangChain， 它所定义的当前这个时间点 ， 所谓的把 。 它甚至把概念扩大到了 Agent 角度 ， 它会认为 Agent 就是 Model， 就是模型加上下文 ， 加外围的 Harness， 针对这几个事情会 ， 你会针对模型做训练 ， 针对数据做记忆 ， 针对 Harness 做 Harness 的 Engineer， 所有这些事情都有专门的厂商给你提供服务 。

我们同样看到了 ， 我之前 PPT 也有无数次提及的所谓 RL 环境的搭建 ， 这里面在红杉的会议上，Mercer 出来讲了如何在现在这个时间点搭建 RL 的环境 ，他说在此前都是重包的 ， 后来变成了 Agentic Data， 然后你要构建 World，World 就是那个广义的环境 ， 然后你要构建 Apps， 让它跑的东西 ， 还要构建 Task， 你要让它完成什么样的任务 ， 这个任务要是可以评估的 ， 可以实现 Loop 的

。 我们在过程中也无数次见到了 Agent 和 Harness， 同样是 LangChain 的主张 ， 它会认为今天的 Agent 需要

跑在一个我们可以行动的环境里 ， 连接你的数据 ， 管理长程任务 ， 并行执行各种各样的任务 ， 同样要允许 Human in the Loop， 人的情况要加进去 ， 然后不断的去持续的改进 ， 这就是整个的这个 Agent 跟 Harness 框架要去做的事情 。

那 LangChain 的主张其实特别的简单 ， 建立一个 V1 版本的 Agent， 跑起来 ， 收集它执行的所有的过程 ， 跟踪这些数据 ， 然后基于你的 Benchmark， 让它不断的去做实验 ， 我们去评估实验的结果 ， 好坏强化学习 ， 然后形成 Loop， 这就是一个非常听起来非常非常简单的一种主张 。

### 智能分工

**庄明浩** [34:08]
所以智能本身 ， 或者说模型训练加 Agent 加 Harness， 所有这套服务出现了产业分工 ， 所以出现了一堆公司做广义上的 Infra，不单纯是做云的芯片的基础设施的数据中心 ，也做广义的软的这一层面的 Infra， 帮你做数据的训练 ，RL 环境的搭建 ， 预训练 ，Harness， 甚至帮你做搒单 ， 做评估 ， 做构建 ， 所有这些事情都出现了一堆公司 ， 帮你做协议 ， 支付 ， 身份认证 ， 权限搭建

，Sandbox 都是 。

所以在美国过去两个季度 ，有一个比较热门的方向 ， 就是做 AI Training Data 跟 RL 环境搭建的公司 。 我同样用了上一次 AI by the number 的一张图表 ， 前段时间广密的还有多少时候发过一篇文章 ， 我觉得它的标题写得更明显 ， 无法蒸馏的美国市场 ， 谁在分食 Frontier Labs 百亿美金的数据预算 ， 特别简单 ， 对吧 ？

这些最最最头部的 ， 无论是模型厂商还是所谓 neolab，他们融了那么多钱 ， 要搭建他们自己的模型训练的整个的流程架构跟平台 ，他们的预算就是另一批人的收入 ， 那这一批人自然而然要给他们提供服务了 ， 对吧 ？

同样的 ，在另外一家跟 Rep 做差不多的企业支付的公司 Brex， 发的 26 年 Summer 的 Top 25 最快增长的 Software Vendors 搒单 ，以及 Ramp 的刚刚发布的 8 月份 Top Software Vendors 的搒单 ，是出现了一模一样的趋势 ，有超过一半的厂商都是干刚才我说的这种服务的 。

比如 Brex 的 Top 25 里面 ，有 14 家公司是帮助别的厂商构建 AI 模型的公司 ， 无论是做数据的 ， 做训练的 ， 还是做平台的 ， 都是这样的 。

那 Ramp 的 8 月搒单里面 ，也有大概一半的公司是做相关的事情 ， 很多搒单都展现了同样的趋势 。 我在今天上午看 YC 这一届的 26 年夏季的所有项目的统计 ， 一模一样的趋势 ，其中有一个统计非常有意思 ， 统计了所有这些公司在对外宣讲的时候 ，他们是瞄着谁去的 ， 就是他们的假想敌是谁 。

有 200 多家公司里面 ，其中有 8 家公司是最多的 ，8 家公司瞄着 Skill.ai 去的

，8 家 。 而且看起来一切才刚刚开始 ， 同样是 YC 的公司 AftCurie， 你听这个名字 ，AftCurie 做数据的公司 ，9 月 1 号 32 亿美金了 ， 这一家公司是 YCW25 的公司 ， 就是 YC25 年冬季的公司 。

我再次说一下，YC25 年冬季的公司 ， 到今天不过才十几个月的时间 ，不到两年， 这家公司从 YC 孵化的公司涨到了 32 亿美金 ， 五个月之前这家公司只有 3 亿美金 。

我刚才说过 ， 这一届还有 8 家瞄着 Skill.ai 去的 ， 单纯只是做数据这一件事情 ， 才刚刚开始 。

截止到这 ， 似乎出现了一个新的可能性 ， 还是刚才 LangChain 那张照片的主张 ， 建立一个 V1 版本的 Agent， 收集数据 ， 跟踪 ， 然后评估 ， 打分 ， 改进 。

那么这套流程能够自动化吗 ？

好 ， 刚才我们聊到 ， 围绕模型已经长出了一整套的产业分工 ， 接下来还会再往前走一步 ， 能不能让 AI 参与改进 AI，也就是所谓的自动化处理 。

不过在进入下一部分之前 ， 我们先中场休息一下， 回到我开头所说的头发的问题 ，也再次感谢本期赞助商欧倍青 DMG 洗发水 。

开头解释了 DMG 是做什么的 ， 这里再多聊一点 ， 它为什么要跟咖啡因放在一起 。 头发生长需要发根保持活力 ，也需要周围的供氧条件跟得上 。

欧倍青这套配方里 ， 咖啡因帮助激活发根 ， 专利成分 DMG 则帮助促进头皮微循环 ， 供支持 ， 两种成分从不同环节配合 ，不只是追求一次性的刺激 ，而是通过快速激活加持续支持 ， 让毛囊保持更好的状态 。

如果用科技行业的语言来讲 ， 我觉得可以理解成 ，不只是看峰值性能 ，而更要看的是能不能持续在线 ， 这也是它 1+1 大于 2 专利协同比较有意思的地方 。

但头发保养这个事情 ， 具体到每个人效果会有差异 ， 对我来说 ， 看这类资料的时候 ， 除了看结果 ，也会留意它多久才会出现效果 。

头发护理这件事 ， 确实需要给它时间 ， 使用上记住一个很具体的动作就行 ， 让洗发水在头皮上停留两分钟 ， 再冲洗 ， 按产品说明持续使用 ， 把护理放进平时的生活里 。

如果你也在研究防脱洗护 ， 这篇可以重点了解一下， 咖啡因帮助激活发根 ，DMG 帮助改善头皮微循环 ， 两者组成专利协同配方 ， 再次感谢欧倍青 DMG 洗发水对屠龙之术的支持 。

### 循环自生

**庄明浩** [39:47]
好 ， 我们回到刚才的那个问题 ， 如果连改进 AI 这件事都能让 AI 参与进来 ， 那么会发生什么呢 ？

自然而然我们进入今天的第三章 ， 循环自生 。 还是今年上半年， 我认为 Claude 发布的最最最重要那篇文章 《Done AI builds itself》， 它画了一个非常非常直观的示意图 ， 人类跟电脑训练出来第一代模型 ， 模型加入到训练过程 ，不断的加 ，不断的加 ，不断的加 ， 模型越来越参与整个模型训练 ， 到最后人类不见了 ，AI for AI。

我们到底走到哪了 ？ 回头去想 ， 当年 Sam 定义的 L1 到 L5，L1 Chatbot，L2 推理 ，L3 Agent，L4 研究者 ，L5 组织者 ， 当时所谓定义的研究者或者创新者 ， 就是能够做 OpenAI 内部研究员在做的事情 。

那似乎我们从一些新闻看出来 ，OpenAI 内部的最最最先进的模型 ， 似乎就在做他们研究员自己在做的事情 。

同样的 ，8 月 31 号智谱发新的财报 ，在财报发布之后的分析师电话会议上， 智谱的创始人唐杰老师说 ， 未来要发的 GLM 6.0 的定位 ， 全自训练技术路线 ， 海外就是 RSI。

同样的 ， 最近新刚刚发布的 GPT 6，也有一些论文在讲述 ，他们在用所谓的 Loop 的方式 ， 字节的 Seed 模型最新的论文的标题也出现了 Loop 的公式 ，Loop。

再放一张图 ， 我觉得这张图画得非常非常好 ， 我们把模型训练分成奖励信号 、 训练数据 、 教室模型 、 数据集 、 人类行为的归纳 、 研究者 、 环境搭建 ， 到物理世界的这一个个的模块 。

你会发现从 22 年到 23 年到 24 年到今天 ， 这些模块越来越多的部分被 AI 自己 Take Over， 似乎看起来今天完全没有任何 ， 或者说没有办法百分之百拿走的 ， 只剩最后的物理世界了 。

所以为什么今天上半年世界模型那么热 ，也是这个原因 。 而其他的这些事情 ， 看起来似乎都被模型自己 Take Over 了 ， 这就造成一个结果 ， 从 25 年下半年的一堆所谓 neolab 疯狂融资 ， 这些 neolab 当中， 很多公司截止到今天 ， 依然没有公布任何的营收数据 。

美国一家机构做了统计 ， 它统计了 119 家 neolab 在过去一段时间融了 94.3 个 B， 就 943 亿美金 ，但这 100 将近 120 家公司里面 ， 只有 16 家公开过有一点点收入 。

所有的孵化器 、VC、 巨头 、 大佬 ， 疯狂对这些 neolab 下注

， 疯狂 。 有个统计 ， 英伟达 119 家里面投了 34 家 ， 将近 1/3。 那么这些 neolab 到底在 bet 什么 ？ 我们把这 119 家的 neolab 按分类 ， 物理 AI 跟机器人 、 世界模型 、AI for Science， 这几块看起来可能跟 RSI 关系没有那么大 ，但剩下的三块 ， 新的结构推理 ，以及真正意义上定义 RSI 的公司 ， 占了另外三个板块 ，也就是将近一半的公司 ，是赌着广义的 Loop 跟 RSI 去的 。

同样的 ， 看一些比较有名的大佬 ， 比如说刚刚离职 Google 的 Jeff Dean， 原来 OpenAI 的 Ilya，OpenAI 的 Mira，Meta 的田元栋老师 ，

我们看 Jeff Dean 那家公司的 Logo， 就是一个倒着的 8，也就是那个无限大的那个 Logo。 那这个东西代表的不就是循环的意思吗 ？

田元栋老师的公司的缩写就叫 RSI。

比如说 Jeff Dean 刚刚离职的时候 ， 那张 BP 讲他业务的 BP， 就是说 Loop，他说在其他很多科研领域 ， 实验改进再促进实验的循环已经都形成了 。

那 AI 领域我就想做这件事情 ，Loop。 最近 Ilya 在推他们的新的主张 ，TTT，Test-time Training，Mira 他们最近之前新发的模型 ， 主张的是要做 Human in the Loop。

然后田元栋老师他们发了第一篇论文 ， 标题里有 Automated，

大家看到的公式是一样的 。

再往后， 那人类呢 ？ 人类的目的是 ， 或者说人类的价值变成什么 ？ 如果一切都 Loop 了 ， 人类相当于在定义新的高峰 。

### 人类价值

**庄明浩** [45:08]
用了一张 ICLJ 最近的 PPT， 人类跟 AI 的并行研发的过程 ， 变成了人类寻找到一个高峰 ， 一个目标 ， 然后通过 AI 跟 Loop 的方式达到目标 ， 达到之后人类再去寻找下一个 ，不断的往下跌 。

第一步 Human inside， 第二步 Agent Loop。 那如果一切都 Loop 了之后， 从投资的角度来讲 ， 怎么给这些公司定义里程碑来给新的估值呢 ？

比如传统 SaaS 公司 ， 你可以从产品阶段 、 产生收入阶段 、 增长阶段来去定义 。 生物医药公司 ， 你可以从试验实验室到什么什么临床几期 ， 到正式上线 ， 到通关允许 ， 对吧 ？

那这些 neolab 呢 ？ 怎么办呢 ？ 拉一批人，

组建一个团队

， 公布一个搒单 ， 都能算吗 ？

还有再往下 ，是所有的事情都能 Loop 吗 ？ICLJ 给了一个划分方式 ， 画横轴坐标 ， 画四个象限 ，是能够验证的还是不太能够验证的 ，是好编辑的还是不好编辑的 ， 这样四个象限 。

那似乎看起来只有第一象限 ， 现在被证明是比较好 ， 就是既强可以被认证的 ， 又容易编辑的 ， 典型的 code，以及比如说我们前面提到的 3D。

为什么大家用 Blender 去做奇观 ？ 那你发现如果是第四象限的 ， 就是那些物理 AI 的 ， 似乎就比较难了 ， 对吧 ？

然后内容板块基本都在强 ， 哦 sorry， 弱验证但强编辑 。 所以并不是所有的事情 ， 听起来都可以通过强化学习跟 Loop 的方式 ， 非常完美的解决 。

所以 Loop 其实是一种结构 ，但不是魔法 。 这个问题再扩大 ， 我们刚才聊的很多的 Loop， 都是定义在模型训练跟 Agent 训练上

，但你细想 ， 今天 code 的 Loop 已经形成了 。 那一家公司 ， 比如说它的报价体系 ，其实也是个 Loop， 你根据用户的反馈 ，不断调整价格结构 ， 用户接受 ， 然后你就确定这个架构 ，不接受再调 ， 再扩展 。

一家商业公司的运转不也是 Loop 吗 ？ 对吧 ？Loop 又的 Loop 的又其实只是技术和产品 ， 它其实就是一套思维跟运行方式 。

那我们自然而然进入所谓的第四章 ， 界面重构 。

### 界面重构

**庄明浩** [47:57]
刚刚公布的这季财报 ， 苹果财报 ， 苹果在过去 10 年历史上， 第一次它的 APU 制造的收入出现了下降 。

过去 10 年， 无论这个世界发生任何事情 ， 无论这个 iPhone 成不成功 ， 卖的多还是卖的少 ，iPad 成不成功 ， 卖的多还是卖的少 ，APU 制造的收入从来没有降过 ， 可能增长变缓变慢 ，但是从来没有降过 。

过去的这个季度 ，APU 制造的收入第一次下降 ， 我们似乎真的进入到了一个新的软件时代 。 传统的软件到今天 ，AI 因为 Web Coding 崛起 ， 我们真的可以为每一个人做一个他自己的单独需求的 ， 甚至是一次性的软件 。

那些科幻电影里演的一个所谓的个人助理 ， 一个 AI， 它知道我所有的事情 ， 它可以帮我的生活 、 娱乐 、 工作 、 投资 、 健康都搞得定 。

似乎原来这种在电影里演的东西 ， 今天听起来好像马上就 OK 了 ， 对吗 ？ 科幻吗 ？ 似乎一点都不 。

所以阶段性的共识出现了 ，在 Agent 板块 ，Coding 跟所谓的 Personal Agent 成为了共识 。Coding 已经不用讲了 ， 对吧 ？ 那 Personal Agent 可以一会儿后面稍微展开一点点 。Coding Agent 最大的共识 ，Codex， 那 Claude Code 可能是 25 年 Q3 开始 ，Codex 今年接棒 。其实只做这次 PPT，Codex 最新一次公布 ， 已经达到了 2,500 万周活 。在 GPT 改名 5.6 之后， 把 ChatGPT 调整成 Codex 之后，Codex 的活跃用户一直在爆发式的增长 。

带来的共识有多么的共呢 ？ 今天打开任何一个国产的所谓的办公 Agent， 或者是原来的 Chatbot 产品转的 Agent， 跟你打开 Codex 界面上， 几乎没有任何区别 。

### 总结

**庄明浩** [50:15]
回头再去想过去几个月 ， 这场由这些中国大厂兴起的办公 Agent 的战役 ， 两个季度 ， 一个多季度了吧 ， 算蛮大的 ， 算两个季度 。

大家会觉得这场仗能够持续多久 ？ 年底春节再打一波 ， 打到明年 。 阶段性的有一些数据 ， 比如说 Quest Mobile 公布了 7 月的数据 ，Work About It 是 658 万月活 ， 我觉得这个数字基本是可信的 。QCloud 225 万 ，TreeWork 190 万 ，CoderWork 23 万 ，AutoCloud 14 万月活 。

反过来想 ， 阶段性的这些数据 ， 尤其是月活数据 ，是否有意义 ？ 那提及数据 ， 就不得不再一次吐槽上次所说的什么 ， 一关的 Work About It 2,000 万的月活 ， 然后千万办公 ， 最近公测 30 天 ， 公布了一个用户数突破 3,000 万的数字 。

前一段时间百度的大字说 ，MAO 环比增长 1,063.79%， 酷酷 AI 的 MAO 2,500 万 。 数据这个东西吧 ， 嗯 ，不展开了 ， 懂的都懂 。

又回到那个老生常谈的问题

， 这些产品的护城河到底是什么呢 ？

我截了一下 Work About It 过去一个多月的版本更新 ， 基本上每两天三天更新一次 。 豆包自从跟这个飞书合并之后， 恨不得一天更新两个版本 。

这些执行的功能跟快速的迭代 ， 能够构成护城河吗 ？ 这背后其实更重要的是组织架构的调整 。 我们已经看到了字节的调整 ， 腾讯的调整 ， 阿里的调整 ， 甚至是百度的调整 ，其实都是组织 ， 都是组织 。

还有一点 ， 从界面角度来看 ， 你在今天的所有这种产品上看到了 ， 比如在侧边栏上， 我们可以看到专家套件 、 技能连接器 、 伙伴 、 定时任务 、API 插件 。

当然了 ， 你说这些产品向来如此 ， 可是我反问 ， 对于一个普通用户而言 ， 这似乎是不是它的复杂度过高了 ？

向来如此变对吗 ？ 这种复杂度不应该产品自己消化吗 ？ 而不应该交给用户 ，不是吗 ？

然后提到界面这个事 ， 比如最近我们看到了 OK8 点跟和平精英合作了 ， 对 ， 你可以领一个和平精英的桌面宠物 ， 然后你的 OK8 点的界面会放上和平精英的样子 。

你甚至可以做张亮颖的

界面 ， 你可以做传统 QQ 的界面 。 对界面这个事

， 我们的创新性还是很强的 。 对 ， 同样的 ， 我们看到一些界面上变化 ， 比如说马斯克的 Grok Bot， 最近讨论很多 ， 我觉得它符合刚才我前面我说的前面的逻辑 。

那些复杂的东西应该内化到产品本身 ，而不应该交给用户 。 同样的 ， 我们看到了 Meta 发的 Muse， 我觉得依然符合这个逻辑 。

之前 Minus 定义的给用户一台虚拟机 ，Meta 的 Muse 做的更极致 ，但这就对吗 ？ 我们也不知道 ，但至少在刚才我们前面提到叫 Personal Agent 这个板块上， 一些厂商开始做了一些新的尝试 ， 中国也有些创业团队 ， 今天也在尝试类似的事情 。

那么来问题来了 ， 那几家在打的非常热烈的办公 Agent， 要尝试这个方向吗 ？ 不知道 。

新的界面叙事 ， 这个个人 Agent 的叙事似乎已经开始了 。 我前我之前发过一条几颗 ， 我说模型之外 ，在产品端的叙事 ，在过去一年左右时间 ， 已经经历了从 Code 到 OpenClaw 龙虾 ， 到 Work， 到 Cloud Tag， 到 Grok Bot。

最新的叙事像 Meta 的 Muse 的这个个人 AI assistant， 那么国内要跟吗 ？ 或者说会跟吗 ？ 办公 Agent 回头看是不是一段弯路呢 ？

以及我又想起来前几天那个问题 ， 你说微信的张小龙龙哥 ， 怎么看现在正在打的这一波所谓办公 Agent 的战役 ？

如果再考虑到这几天小微灰度测试的功能 ， 想不清楚啊 。 回头来看今天的四章 ， 模型智能循环界面 ， 似乎连在了一起 。

最后，Own Your Intelligence。 好 ， 感谢收听 ， 老规矩 ， 我的 PPT 会在 show note 里 ， 再次感谢 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
