183 episodes
- 「这个秋天并不冷。」
AI 本身的进展速度已经超过了对它的理解和讨论的速度。最近几天,OpenAI Dev Day、Google 的 Gemini 4 连番登场。而我们第一次录节目还是在 DevDay 之前。
所以本期的内容由两次录制构成:前面一部分,我们单独放了对个人助理的讨论,包含 OpenAI DevDay 之后的新信息,和第一次录时,对 Muse、Instinct 等产品的讨论。后面是我们第一次录制的其他讨论。我自己觉得很有意思的部分有:
多智能体的一体两面:OpenAI 用多智能体协作解决了千禧年难题,而不受控制的协作又带来了 Hugging Face 攻击事件。
GPT-6 Astra 发布之后,具身智能领域的兴奋和害怕。我们会在 11 之后的「具身季报」里,更充分地讨论这个问题。
本期季报的嘉宾是 MoE Capital 的创始合伙人 Henry Yin。这是一家位于硅谷的早期基金,主要投资 AI 基础设施、数据、 Agent 和机器人。取名“MoE (Mixture of Experts)”是因为他们有多位来自前沿 AI 实验室的研究员做个人 LP 和顾问。我们的讨论会更偏研究视角和一级市场视角。
从 2023 年到 2025 年,大模型热潮以来,每年秋天前后都会有点儿“悲观气息”,但今年不一样,这个秋天不冷,各公司更新密集,比如刚刚发的 Gemini 4 我们这期就来不及讨论了(正好这个模型是北京时间 10 月 1 日发布的)。我们上季与这季都讨论的 RSI,可能正在带来加速度的量变。
祝各位《晚点聊》听友国庆快乐!
本期嘉宾:Henry Yin,MoE Capital 创始合伙人
本期主播:程曼祺,晚点 LatePost 科技报道负责人
本期剪辑:甜食
时间线跳转:
OpenAI DevDay 后的补充讨论
-个人 AI 助理的又一轮尝试:能力成熟,也碰上生态高墙
01:44 OpenAI Dots:常驻云端的个人助理,为什么从 100 美元起步
08:25 “眼里有活”的 Instinct,但数据条款让人退缩
11:27 个人助理为何此刻爆发:Computer Use 成熟、推理成本下降
16:11 App 会接受被个人助理 over the top 吗?
22:02 下一步:能力、生态、个性化与安全
第一次讨论:智能前沿与扩散
1.模型、科学与物理世界
31:11 Astra 与 Opus 5.5:新旗舰强在哪里,从“Put That There”到操作 Blender
1979 年,MIT 的研究 "Put-that-there": Voice and gesture at the graphics interface
开发者用 GPT-6 Astra 调用 Blender 软件,给Zillow上了一栋豪宅,做了 3D 导览图
开发者用 Opus 5.5 的 coding能力,结合一些工具调用制作的 Claude 的“生平”。
42:57 蒸馏与反蒸馏:Astra 为什么更难蒸?
45:50 一万个 Agent、88 小时:OpenAI 如何挑战 Navier–Stokes
53:43 通用模型进入机器人:大语言模型直接成为策略模型
01:02:30 前沿模型进入生物科技:蛋白质设计、新酶与 GPT-Rosalind
2.两家前沿厂商的增速对比:增长能否撑住算力豪赌
01:06:18 OpenAI ARR 猛增,Anthropic 增速是否已被反超
01:12:52 Anthropic 上市材料:大客户、云渠道与 5180 亿美元承诺
01:15:10 招股书该看什么:用户画像、收入分布与 Coding 渗透率
3.多智能体的一体两面:攻克难题,也冲破隔离
01:16:49 1200 个 Agent 冲破隔离:“我的天,我找到了其他 Agent” 01:26:45 We Must Pace the Frontier:第三方评估能做什么
01:28:29 RSI 的两条路线,以及为什么 Infra 成为第一站
-智能扩散:更便宜、更快、更会交互
01:33:05 便宜和快为何变得更重要:同等智能的成本暴跌
01:40:08 从亏本到盈利:低价模型怎样改变开发者行为
01:43:20 Jev 爆火:把自然语言变成编程里的 if
01:49:06 GPT-Live-1 与 Interaction Models:实时交互走到哪一步
01:54:08 Grok 强势反弹:独特数据与预训练门槛
02:00:37 Q3 的两条主线与 Q4 悬念
02:03:41 连点成线:延伸推荐
附录:人物、机构与术语
-Noah Shinn:Instinct 创始人,曾任 Sierra 研究科学家。Instinct 在 2026 年以邀请制个人 AI 助手迅速走红硅谷科技圈。
-METR:一家独立研究前沿 AI 能力与重大风险的非营利机构,为模型公司开展能力评估、红队测试和事故调查。本期引用了它对 OpenAI / Hugging Face 智能体入侵事件的独立调查。
-Tristan Buckmaster、Levent Alpöge:长期研究 Navier–Stokes 方程的数学家。两人曾合作推进相关问题,并对 OpenAI 公布的成果与未公开研究之间的关系提出质疑。
-Artifactory:用于集中存放和分发软件包、构件的仓库系统。多智能体失控攻击 Hugging Face 事件中的 Agent 利用共享 Artifactory 目录名建立了未获授权的通信渠道。
-RoboDojo:包含 42 项机器人操作任务的仿真评测环境。《An Unexpected Robot Policy》用它测试通用大模型能否在未经专门策略训练时,直接依据观察输出机器人动作。
相关链接:
AI & 具身季报系列:
《晚点 AI 季报:Muse 引爆个人助理,Astra 走进机器人,OpenAI 收入猛增》
171 期:与 Henry 的「AI 季报 26Q2」:从 coding 到 RSI,强者愈强的未来?
156 期:与 Henry 的「AI 季报 26Q1」:OpenClaw、OpenAI vs Anthropic 的三重对阵、自进化
170 期:与陈哲的「具身季报 26Q2」:世界模型大风不停,和不想被贴标签的人
157 期:与陈哲的「具身季报 26Q1」:宇树招股书、人形再思考、英伟达世界模型、高自由度灵巧手
其它相关节目:
179 期:蒸馏风暴:一场无人公开谈论的技术竞赛
178 期:与田渊栋聊 RSI:模型自进化如何到来?
177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
83 期:《智人之上》:没有 AI,寻找意义也是每个人的必解题|串台《知本论》
本期提及的一些文章、论文:
Dario Amodei:We Must Pace the Frontier
OpenAI:On the Navier–Stokes Millennium Prize Problem
测评 Astra Robotics 任务表现的文章:An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond
METR:对 OpenAI / Hugging Face 智能体入侵事件的独立调查
智谱:Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure
小红书@曼祺_火柴Q即刻@曼祺_火柴Q
☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: - 「工具产品是解题,娱乐产品是出题。」
从今年初到现在,整个 AI 领域的最大重心在 coding、生产力和工作。梁琛奇想回答另一类问题:如何用 AI 让人开心?获得一种真正新颖、长期、高频,又不容易厌倦的娱乐体验?
在去年夏天创立「动念引线」之前,96 年出生的梁琛奇只待过一家公司:字节跳动。7 年里,他亲历了抖音在 2018 年的崛起,很快在 2021 年开始从零 lead 一个实时社交产品。再然后是 2023 年,字节成立 AI 产品部门 Flow,梁琛奇带团队做出了猫箱。
不管是在字节还是创业,梁琛奇的热情一直在于娱乐和内容。而现在,还没有人拿出 AI 娱乐方向的爆款产品、把无可争议的那个新体验推到人们面前。
梁琛奇和动念引线的押注:是一种泛创作/表达,并混合轻游戏的体验。而这能否成立,取决于我们怎么想象和推演未来的自己:一种想法是,大部分人即使有闲暇,也不会投入创作,我们仍会被动地 kill time;而梁琛奇相信,当人不再需要为生计而工作,泛创作会变成一种普及、高频的娱乐活动。
你的答案呢?这是内容和娱乐创业有意思的一部分。它最大的 bet,最后指向我们怎么理解自己和同类。
图注:「松果时刻」的一位用户在给病人打点滴时发现,输液管被折成了一只蝴蝶。她用这个瞬间制作了一个小故事。
本期嘉宾:
梁琛奇,动念引线创始人
本期主播:
程曼祺,《晚点 LatePost》科技报道负责人
时间线跳转:
-为什么是娱乐?为什么是现在?
01:57 每一轮技术变革,娱乐就是会比工具慢,而“我只想做娱乐”
14:20 主动选择抖音,加入在 2018 年爆火之前
18:38 在抖音做社交,体验 Alex 的“细节变态”
29:57 入职两年做产品一号位,最大的教训是不可逆势而为
36:05 “动念引线”和 DayFold:火花来自人类,AI 助燃
-从抖音到猫箱:产品、内容与人的创造
41:26 从 ChatGPT 到猫箱:互动内容的新格式
47:23 AI 给娱乐的机会:供给扩大、无限分支的体验与 Scale“人”
01:02:48 文字互动产品,多数的核心是角色,而猫箱的核心是故事
01:09:45 移动互联网产品是搭房子,AI 产品是养女儿
01:12:18 从猫箱到动念引线:都在自己训模型
-离开字节:0 到 1 只能自己下注
01:18:32 新体验大概率来自新公司
01:25:42 字节的方法论:找到那辆合适的车,踩油门
01:33:43 字节背景创业者被高估了吗?那些带不走的能力
-动念引线:验证与推演
01:38:44 把“想象力的摄像头”丢进人群
01:50:19 优化一:把消费也变得烧 token,这才有新平台的机会
01:55:07 把公司做成“产品 UGC”组织
02:04:38 优化二&三:收浓人群&提高频次
02:13:45 ChatGPT 最了解很多人,前沿模型厂商会吃掉娱乐应用吗?
02:31:42 版本答案何时出现,以及它不是什么?
-版本答案之前:纠偏、壁垒与娱乐的价值
02:44:40 低估了 Coding 的进化速度,高估了 Sora 带来的行业加速
02:55:59 从模型切入,大概率做不出新的娱乐体验
03:07:22 “你还是得解决,大量不参与科技爆炸的人的价值感”
03:13:27 少数人向前,多数人向四面八方
03:18:00 本期「连点成线」
剪辑:甜食
相关链接:
《晚点 LatePost》:对话动念引线梁琛奇——非典型字节创业者的“娱乐至上”
150 期:年末 AI 回顾:从模型到应用、从技术到商战,拽住洪流中的意义之线|Solo
136 期:Sora 新世界 & Lovart 4 个月复盘|与陈冕聊怎么做垂类 Agent|Agent #5
81 期:游戏怎么变成了生活?游戏社区发展史
小红书@曼祺_火柴Q即刻@曼祺_火柴Q
☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: - 「质疑泡沫,理解泡沫,拥抱泡沫,享受泡沫,但他没有说第五步是什么。」
这期播客,曼祺邀请晚点的两位作者,李梓楠和徐煜萌一起聊当下喧闹的具身智能创业。
过去数月里,梓楠和煜萌接触了多位具身智能创业者,数据、零部件、代工供应商,和多位一二级市场投资人,结合我们 2023 年以来对这个行业的持续跟踪,撰写、发表了《具身智能的金钱游戏》一文(此文作者还有申远)。
和往期编辑部同事之间聊的选题一样,播客不是对文章的复述。我们会补充更多视角、逻辑分叉和行业里的不同看法,也会更直接地表达个人观察。
这期节目讨论了 3 个问题:
弥漫在行业中的“不对劲”的源头——表象是研发投入远少于全行业融资,根源是技术仍处于早期阶段;
收入“做大术”——技术不成熟,估值和外界期待却颇高时,一批具身智能公司不得不提前撑大收入。这是一个地方政府、机器人供应链企业(不少已上市)和具身智能创业公司各方利益求同存异的过程,有人称它是“生态”,有人视其为“诡计”,更多人已见怪不怪、不置可否。
融资和 IPO 竞争的未来——A 股和港股的机器人行情都已在下半年转折,那些排队上市的公司和汹涌的热情与期待往下会如何?
时间线跳转:
本期嘉宾:
李梓楠:《晚点 LatePost》科技组记者
徐煜萌:《晚点 LatePost》平台组记者
本期主播:
程曼祺:《晚点 LatePost》科技报道负责人
剪辑:甜食
时间线跳转:
-钱很多,技术进展却难判断
02:33 融资竞赛:大家拿了很多钱,却花得很少
05:40 具身进展难观测,也更容易在高估和低估中摇摆
08:51 抓一个轴承要 70 秒:比人慢,也比成熟工业机器人慢
16:47 “上春晚不是问题,都上春晚就是问题”。
-“版本答案”是做大和上市:收入如何来?
17:39 融资越多,越得奔着做大和 IPO
18:13 港股 18C:2.5 亿港元收入只是最低门槛
19:44 数采中心:地方政府、就业和数据销售如何闭环
24:06 被质疑的科研、跳舞、迎宾,也许是当前最市场化的收入
29:18 供应商既是客户,也是投资人,是合资公司股东,是销售代理
32:38 一个例子:宇树等机器人的 800 万元订单,如何撬动长盛轴承的想象
36:42 二代们执掌机器人:从果链、汽车链到机器人链
41:13 2000 万,成为智元 VAP
45:15 Optimus 预期落空,看销量预期,邓泰华比马斯克准
-金钱游戏如何继续
50:30 Club Deal:“T0 级”产投、VC 的排列组合
54:44 泡沫继续,二级投资人开始寻找可验证指标
58:57 未来最重要的验证:数据 Scaling 与上市后定价
相关链接:
《具身智能的金钱游戏》
港交所《上市规则》第 18C 章:特专科技公司
170 期:与陈哲的「具身季报 26Q2」:世界模型大风不停,和不想被贴标签的人
157 期:与陈哲的「具身季报 26Q1」:宇树招股书、人形再思考、英伟达世界模型、高自由度灵巧手
149 期:具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望
126 期:解读智元机器人“类借壳”:6 个涨停板!可想学不简单
附录:人物、公司与术语
播客里口头提到的“邓总”指邓泰华:智元机器人创始人、董事会主席兼 CEO。
优必选(UBTECH):机器人公司,工业人形机器人 Walker 系列是其主要产品线之一。节目将其与宇树、智元并列讨论国内人形机器人的销售规模。
长盛轴承:深交所创业板上市公司(300718),主营自润滑轴承。节目以其与宇树的业务关系为例,讨论机器人订单规模与上游公司的估值想象之间可能存在的巨大差距。今年 8 月市值均值为 188 亿元,今年最高市值为 258 亿元(5 月 26 日)。
均胜电子:汽车零部件上市公司,业务覆盖汽车安全和汽车电子,并布局机器人控制器、灵巧手、电子皮肤等部件。节目将其列为智元生态中的制造业合作伙伴之一。今年 8 月市值均值为 315 亿元,今年最高市值为 507 亿元(1 月 6 日)。
宁波华翔:汽车零部件上市公司,通过旗下业务布局机器人本体、关节模组和轻量化材料,并承接智元部分机器人产品的生产制造。节目将其列为智元生态中的制造业合作伙伴之一。今年 8 月市值均值为 158 亿元,今年最高市值为 290 亿元(1 月 21 日)。
卧龙电驱:电机与驱动系统上市公司,已投资智元机器人,并布局无框力矩电机、减速器、伺服驱动器和关节模组等机器人核心部件。今年 8 月市值均值为 525 亿元,今年最高市值为 760 亿元(1 月 12 日)。
三花智控:制冷控制元器件和汽车热管理上市公司,也被资本市场视为人形机器人执行器产业链公司。节目用它说明机器人业务预期可能怎样改变传统制造企业的估值。今年 8 月市值均值为 1591 亿元,今年最高市值为 2464 亿元(1 月 19 日)。
SCARA 机器人:Selective Compliance Assembly Robot Arm,通常译为“选择顺应性装配机器手臂”或“水平多关节机器人”。它常用于高速取放、装配等工业任务;SCARA 与并联机器人属于不同的机械结构分类。
六轴机械臂:具有六个旋转关节、可实现六个自由度运动的串联机器人,能够同时控制末端的位置和姿态,常用于焊接、搬运、喷涂和装配。
港股 18C:港交所主板《上市规则》中面向特专科技公司的上市制度,2023 年 3 月 31 日生效。已商业化公司最近一个经审计会计年度的特专科技业务收入须至少达到 2.5 亿港元;未达到这一门槛的公司也可按“未商业化公司”规则申请,但需满足更高市值、研发投入等要求。
数采中心:节目中指集中部署机器人,通过遥操作等方式采集真实世界操作数据的场所。部分项目由地方政府、机器人公司与运营方共同参与。
Club Deal:多家投资机构共同参与同一笔交易或同一轮融资的安排,常用于分摊投资金额和风险。节目讨论了具身项目中产投与 VC 共同组局、为后续融资背书的现象。
小红书@曼祺_火柴Q即刻@曼祺_火柴Q
即刻@李梓楠
即刻@CherieHsu
☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: - 「关于蒸馏:误解、门槛与代价」
这期播客,又是一次“编辑部”节目:我和《晚点 LatePost》的主笔高洪浩一起来聊蒸馏。
这是一个所有人都在关注、却很少有人愿意公开谈论的话题,所以也很难邀请外部嘉宾。本期中,我们对蒸馏的讨论,来自过去一段时间,我们和数位来自不同中国 AI lab 的从业者的讨论以及一些公开资料。
相关文章蒸馏风暴:AI 公司不愿公开谈论的技术竞赛已在上周发布。
播客里,编辑了《晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响》的洪浩,也和我一起讨论了更多公司,如字节的更多做法和可能的原因。
蒸馏这种诞生多年的技术到底是什么?为何在 2026 年出圈?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么?
本期节目是一个引子,希望更多从业者、听友在评论区分享你们的想法、观察和思考。
图注:斩杀线。处在一个模型,右边(比它贵),和下方(智能程度比它低)区域的模型,被该模型”斩杀“。不过这个图里没有反映另一个非常重要的维度,就是推理速度。
本期嘉宾:
程曼祺,《晚点 LatePost》科技报道负责人
本期主播:
高洪浩,《晚点 LatePost》主笔
本期剪辑:甜食
时间线:
-蒸馏不是“抄答案”,蒸馏为何在 2026 年出圈
02:04 典型蒸馏:让学生模型逼近教师的输出行为
04:26 智能体轨迹蒸馏:可被“蒸”的数据越来越丰富
06:41 不是所有使用强模型输出的训练都是蒸馏,但都违反用户协议
08:05 蒸馏规模扩大的两个关键节点
10:17 从为了压缩,到为了变强
-字节为什么不蒸馏?
13:51 张一鸣的判断:最多只能逼近,很难真正超越
17:44 一个运动员可以既嗑兴奋剂,也勤加训练吗?
24:41 其它公司的蒸馏讨论
-蒸馏难在哪,如何实现?
28:52 账号、真实问题与数据管线:大规模蒸馏的 know-how
32:08 蒸馏行为可以被隐藏吗?
34:56 学生模型超越教师模型的可能性
37:29 一直逼近而不超越,问题是什么?
-学生能否超过教师:技术、规则与更大的商业问题
38:35 蒸馏的红线与“双标”争议
44:05 更便宜的智能,如何改变前沿模型商业逻辑
相关链接:
蒸馏风暴:AI 公司不愿公开谈论的技术竞赛
晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响
177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
176 期:姚顺雨,来到腾讯 300 天
163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化
80 期:OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态
Anthropic:Detecting and preventing distillation attacks
Google Threat Intelligence Group:Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use
DeepSeek-R1 技术报告
OpenAI 使用条款
小红书@曼祺_火柴Q即刻@曼祺_火柴Q
小红书@高洪浩 ALaNGo 即刻@高洪浩 ALaNGo
☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: - 「专聊 RSI 的一期来了。」
在 171 期节目 AI 二季度季报中,我们重点聊了 RSI,递归自进化。
那之后不久的 6 月底,我采访了从去年开始就在这个方向探索的创业者之一田渊栋。他参与创立的 Recursive SuperIntelligence 的缩写也是 RSI,目前估值超 46 亿美元。
我们聊了这个不算新鲜的想法为何在今年春天“复兴”,相比十年前 Google 做 AutoML 用 AI 辅助神经网络的架构搜索,现在的 RSI 或者说 AutoResearch 已经发展到哪一步。
6 月初,Recursive SuperIntelligence 释放的第一批成果是一个具体的实力,它们在小规模上,验证了一个 AI 系统可以自动化地提升性能、提升效率和改进 Infra:
图注:图中蓝色底纹一列,为 Recursive Superintelligence 公司 6 月初取得的成果。
这期节目录制的 6 月底,还没有涵盖一些后续事件,如 OpenAI 一举解决了 10 个数学难题。Thinking Machines Lab 的联创之一翁荔重新回到 OpenAI,据报道,她将带团队探索的方向就是 RSI。
关于 RSI,一个极有诱惑力、也十分危险的假设是:率先达到这个状态的公司,会把其他人越甩越远。这也是从 Anthropic 到 OpenAI 等前沿模型公司尤为关注这个方向的原因之一。
这个推演成立吗?田渊栋认为还有另一种可能性,这取决于,你认为智能的提升是一条平滑向上的曲线,还是你 bet(押注)它会阶梯式跳跃。
本期也已发布了视频版,可前往各主要视频平台搜索「晚点聊」观看。
本期嘉宾:
田渊栋,Recursive Superintelligence 联创
本期主播:
曼祺,《晚点 LatePost》科技报道负责人
时间线跳转:
-从科幻设想走向 RSI:为什么循环开始转起来
05:53 为什么 RSI 在今年变热?
07:15 去年与 GPT-5 合写论文,从不用再招实习生到创业
13:10 coding 能力提升后,研究老手的春天又回来了
15:26 从 AutoML 到 RSI:AI 辅助研究的今夕变化
-RSI 竞赛:“它比 coding agent 大得多”
19:48 Anthropic 长文更多展示了提效,还不是递归自进化
27:14 解决 RSI 不只靠 coding 这个支点
38:07 强者愈强的变数:智能提升可能是跳跃的,而非平滑的
43:38 终极形态也许是“修仙社会”
-Recursive 公司的第一步:把研究系统跑起来
45:51 First Steps:三个 benchmark 的初步成果
54:43 现在缺什么?数据、算力与可解释性
-AI 终将成为科学
57:13 自我进化的风险
59:37 “多数人已经绝望了,但我认为AI 终将成为科学”
01:05:45 当 AI 能自己发现新知识,那我就来欣赏吧
-追求美的结构,也知道这是一种局限
01:08:13 从 Waymo 到 FAIR,从工程回到研究
01:14:11 hands on 带来的研究判断:区分难的不同程度
01:20:26 大厂为什么变慢:小团队、扁平协作与 150 人临界点
01:23:22 追求美的结构,也知道这是一种局限
01:26:09 连点成线:延伸推荐
剪辑:杨、Nick
相关链接:
Recursive:First Steps Toward Automated AI Research
Anthropic:When AI builds itself:Anthropic 对递归自我改进的研究框架与风险判断。
177 期:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
177 期文字版:详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?丨晚点播客
171 期:与 Henry 的「AI 季报 26Q2」:从 coding 到 RSI,强者愈强的未来?
171 期文字版:AI 季报 26Q2:从 coding 到 RSI,强者愈强的未来?
116 期:当 AI 研究者写科幻,与 Meta 田渊栋聊他的智能想象:我们终会“所思即所得”
108 期:与马毅聊智能史:“DNA 是最早的大模型”,智能的本质是减熵
附录:
Richard Socher:Recursive 联合创始人 & CEO;也是 you.com 的创始人、CEO,曾任 Salesforce 首席科学家兼执行副总裁。
Mirendil:由前 Anthropic 研究人员创立的 AI 研发公司,关注用 AI 推进科学与技术研究。
Behnam Neyshabur:Mirendil 联合创始人、CEO;此前在 Anthropic 与人共同领导 Discovery 团队,目标是构建 AI Scientist/Engineer。
Sanjeev Arora:普林斯顿大学计算机科学 Charles C. Fitzmorris 教授、Princeton Language and Intelligence 创始主任;研究涵盖机器学习、理论和自然语言处理。
马毅(Yi Ma):香港大学数据科学研究院(HKU IDS)院长,并任香港大学人工智能讲座教授。
David Luan:Adept 联合创始人、前 CEO;曾任 Amazon 自主系统副总裁及 AGI SF Lab 负责人,2026 年初离开 Amazon。
Adept:David Luan 等人在 2022 年创办的 AI agent 公司。Amazon 在 2024 年取得其技术授权并吸纳多名核心成员,Luan 随后负责 Amazon AGI SF Lab。
FAIR(Meta Fundamental AI Research):Meta 的基础人工智能研究组织,田渊栋曾在其中工作。
Open-ended algorithms(开放式算法):不把搜索限定在固定目标或单一路径上,而是持续保留、组合有价值的新颖解法的算法思路。节目里它是“让研究系统不断产生下一轮可尝试方向”的技术底座之一。
Reward hacking(奖励黑客):系统找到了能拿高分、却没有真正完成目标的“漏洞解”。例如 GPU kernel 评测中,候选方案可能利用计时或状态残留,而不是真的更快;因此需要独立验证与防作弊评测。
GPU kernel(GPU 算子内核):在 GPU 上直接执行某个张量运算的底层小程序,例如矩阵乘、归一化或注意力的一部分。它不是操作系统“内核”;写得更快,会直接降低模型训练和推理的成本。
BPB(bits per byte):按字节计算的验证集损失指标;数值越低,表示语言模型的预测越好。NanoChat Autoresearch 用它来判断一次训练改动是否值得保留。
NanoChat Autoresearch:Andrej Karpathy 在 2026 年 3 月公开的单 GPU 自动实验项目,建立在他 2025 年 10 月发布的 NanoChat 训练代码之上。AI agent 每次修改训练代码,运行固定 5 分钟实验,以验证 BPB 是否下降;适合测试“短反馈、可自动验收”的研究循环。
NanoGPT Speedrun:Keller Jordan 发起并维护的协作式训练效率挑战。它从 Karpathy 2024 年 5 月的 GPT-2 复现基线出发,Keller Jordan 的首个公开改进记录在 2024 年 6 月出现;目标是在 8 张 NVIDIA H100 上,尽可能快地把小 GPT 训练到 FineWeb 验证集 3.28 的损失。
SOL-ExecBench:NVIDIA 于 2026 年 3 月公开的 GPU kernel 执行评测。它包含来自 124 个模型、共 235 道 CUDA kernel 优化题,衡量实现距离硬件理论性能上限还有多远;项目公开资料未披露内部立项时间,公开论文与发布是目前可核验的起点。
小红书@曼祺_火柴Q即刻@曼祺_火柴Q
☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆
欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。
这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。
请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。
关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:
More Business podcasts
Trending Business podcasts
About 晚点聊 LateTalk
《晚点聊 LateTalk》由《晚点 LatePost》出品。 最一手的科技访谈,最真实的从业者思考。
Podcast websiteListen to 晚点聊 LateTalk, The Curve and many other podcasts from around the world with the radio.net app

Get the free radio.net app
- Stations and podcasts to bookmark
- Stream via Wi-Fi or Bluetooth
- Supports Carplay & Android Auto
- Many other app features
Get the free radio.net app
- Stations and podcasts to bookmark
- Stream via Wi-Fi or Bluetooth
- Supports Carplay & Android Auto
- Many other app features


晚点聊 LateTalk
Scan code,
download the app,
start listening.
download the app,
start listening.



























