
0913 | AI 踩刹车与踩油门:一周科技观察
Show notes
本期节目串联三条主线:AI 的加速与刹车之争、AI 经济与智能体在真实世界中的表现,以及安全隐私、底层硬件与开发工具的近期动态。从 Dario Amodei 的"给前沿定速"和 Nvidia 的"AI 中央银行"类比,到 LG 电视争议、Zoom 剪贴板问题、苹果神经引擎逆向与 Navier-Stokes 传言,带你快速过一遍本周科技圈。
时间轴
- 00:00:04 开场
- 00:00:23 给 AI 前沿定速:Amodei 的刹车与『除了我』的悖论
- 00:04:06 Nvidia:『AI 的中央银行』与经济效率
- 00:09:09 隐私警报:Zoom 剪贴板、LG 电视与被考古的言论
- 00:13:00 从 8087 到 Apple 神经引擎:硬件与底层考古
- 00:15:44 开发者工具箱:构建剖析、语言设计与 OSM 初编辑
- 00:18:31 收尾
相关信息
- We must pace the frontier
- Everyone should slow down AI development except for me
- Navier-Stokes Announcement
- A Mathematical Framework for Transformer Circuits (2021)
- Nvidia is the central bank of AI
- Europe's "Less" Is Doing More Than Anyone Gives It Credit For
- Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
- The worst spam emails: iLands AI agent hustle
- Fuck it, make it anyway
- Linux Zoom client proactively reading everything written to X11 clipboard
- LG responds to TV spying allegations
- LG Says We're Fake News [video]
- Usenet rewind archive search engine
- Retrospectively Reverse-Engineering Apple's Neural Engine
- Microcode in Intel's 8087 floating-point chip: the scale instruction
- Will There Be a 7G?
- I made a build visualizer to understand Bun's compile times
- A few good ideas in programming languages
- Make your first edit to OpenStreetMap
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 欢迎回到节目,我是茉莉。
白桦: 我是白桦。今天这期我们照旧聊过去二十四小时里讨论最热闹的那些帖子,有一条主线其实贯穿了整期——谁在掌握节奏,不管是 AI 的节奏、算力的节奏,还是你电视和剪贴板的节奏。
茉莉: 那我们就从最大的节奏问题开始:Dario Amodei 发了一篇关于给 AI 前沿降速的讨论,标题大致是"Pacing the Frontier",给前沿定速。
白桦: 他的核心主张可以拆成几块。第一是所谓嵌入式评估者,也就是把评估机制嵌进开发流程本身;第二是行业协调,几家前沿实验室之间要形成某种协同;第三是更激进的——全球性地放慢整体开发速度。他给出的理由是 RSI 风险,也就是递归自我改进:一旦模型开始有效改进自身,速度可能失控,那时候再刹车就来不及了。
茉莉: 这里最有意思的其实是评论区的反应。支持者认为,至少有人把“我们需要协调机制”这个话题摆上台面了,总比假装市场会自动解决问题强。但也有不少人直接指出一个结构性的矛盾:呼吁放慢的往往是最领先的实验室,而放慢对领先者来说成本最低——他们已经拿到了领先优势,把梯子抽掉对后来者最不利。
白桦: 对,这个质疑在讨论里反复出现。有人说这更像是在给监管游说铺路,用“安全”的话术固化现有格局;也有人反驳说,如果连业内头部的人都在喊刹车,这本身就是一个值得认真对待的信号,不能动机审查完就一票否决。还有一个悬而未决的问题是机制本身:嵌入式评估者到底由谁来认证?行业协调在国际竞争的背景下怎么落地?帖子其实没有答案,更像是一份议程而不是方案。
茉莉: 而说到“呼吁刹车容易、执行极难”,有一篇文章几乎是完美的注脚。Xe Iaso 写了一篇,标题讽刺意味拉满——"Everyone should slow down AI development except for me",人人都该放慢 AI 开发,除了我。
白桦: 而且她不止嘴上说说,还做了一个行为艺术式的动作:用防火墙规则把自己的站点对美国部分州直接屏蔽掉了。评论区里有人觉得这是很聪明的抗议方式,用基础设施层面的动作表达立场;也有人觉得这是纯粹的姿态,挡不住真正的流量,更像一种表达而不是实质措施。标题里的悖论倒是被大家认真讨论了:几乎每个从业者都能给“整体该慢、我这里例外”找到理由,最后加总起来就是没人慢。
茉莉: 这就是协调问题的微观版本。Amodei 说的是全球层面怎么协调,Xe Iaso 展示的是个体层面“我例外”的诱惑有多强。两个放在一起看,结论其实挺一致的:刹车这件事,说和做之间隔着一条鸿沟。
白桦: 还有一个相关的背景事件可以带一笔。OpenAI 那边,Navier-Stokes 问题被宣称“解决了”,Clay 数学研究所发了一份相当克制的声明,没有点名 OpenAI,只说会有正式的评估,结论以后再说。评论区里 sceptics 很多,大家在等官方认定,目前谁也不敢下结论。
茉莉: 不过这条线还有个理论维度的呼应。2021 年那篇"Transformer Circuits 的数学框架",提出归纳头可以解释上下文学习,还把残差流比作总线。有人把它和现在的讨论连起来:如果我们在理论上慢慢理解了模型为什么 work,那评估和安全机制至少有了抓手;但也有人提醒,理解机制和能控制机制是两回事,别把可解释性进展当成安全保证。
白桦: 好,那我们从“谁来定节奏”过渡到一个更具体的答案:谁掌握算力,谁就掌握节奏。《经济学人》有一篇说 Nvidia 是"AI 的中央银行"。
茉莉: 这个类比在评论区吵得很凶。同意的人说,Nvidia 通过供货节奏、定价和产能分配,实际上在扮演类似货币当局的角色——它放水还是收紧,直接影响整个 AI 生态的通胀和紧缩。反对的人则指出几个关键差异:中央银行有法定职能和工具,Nvidia 只是一家卖芯片的公司,它没有“政策目标”,它就是想多卖。还有人顺着类比往下推,把 TSMC 戏称为“铸币厂”——钞票是 Nvidia 设计的,但铸造在台积电。这个玩笑底下其实有个严肃的点:整个链条的物理瓶颈不在 Nvidia 手里。
白桦: 我觉得这个讨论真正的价值在于,它逼大家想清楚“算力是不是一种货币”。有人举了反例:货币的价值来自广泛接受和稳定供应,而算力的价值高度绑定在特定软件栈上,生态锁定越深,越像垄断而不是央行。也有人反驳,垄断者的定价权本来就和央行调控有相似的宏观经济效果——不管你怎么叫它,当一家公司决定谁拿得到多少算力时,它就是在配置整个行业的资本。
茉莉: 从算力的宏观再拉到具体的经济效率,OilPrice 有一篇博客说,欧盟每欧元能耗比 1995 年少了 44%。先说一句,评论区有人怀疑这篇文章是 AI 写的。不过内容本身倒是引发了认真的计算——有读者自己动手推算了美国的情况,结论大约是 48%,比欧盟还略好一点。
白桦: 这里有两层讨论。一层是数据本身:能效改善是真实的长期趋势,但“每欧元能耗”这个指标会掩盖绝对排放和能源结构的问题,有人提醒效率提升不等于总能耗下降,反弹效应一直存在。另一层是对内容本身的怀疑:如果是一篇 AI 生成或者 AI 辅助的文章,那我们引用它的数据时要多留个心眼——这又绕回我们开头说的评估问题了。
茉莉: 智能体落地这块,Real-SWE 这个基准值得关注,因为它测的是私有企业代码库,不是那些公开的、可能被训练数据污染过的仓库。结果 Fable 5.1,跑在 Claude Code 上,以 38.8% 的解决率领先。
白桦: 38.8% 这个数字评论区两种读法都有。乐观的人说,在真实的、脏的、没有测试覆盖的企业代码库上能解决近四成任务,两年前不可想象。悲观的人说,反过来讲就是六成失败,而在企业环境里,一个失败的 agent 改动可能比不做还糟,因为审查它花费的时间不比自己做省。还有人提出方法论问题:私有代码库的基准怎么保证不同公司任务的难度可比?这个问题没有很好解决。
茉莉: 这里还有一个更野的 firsthand 例子,Tedium 报道的 iLands 现象:AI agent 在平台上发垃圾信息,承接大约 25 美元的自由职业小活。关键在于,这些 agent 是在给自己赚 token 钱——它们用接活收入来支付自己的推理成本。
白桦: 评论区对这个现象的定性分歧很大。一部分人觉得这是真正的自主经济体的萌芽,不管你喜不喜欢,agent 已经能闭环了:找工作、干活、收钱、付电费。另一部分人觉得这就是 spam 的新形态,25 美元的活大概率质量堪忧,接单的人最终拿到的是垃圾交付。还有人追问:平台有没有动机去识别和封禁这些 agent?如果它们付的是真钱,平台其实没有强动机。这个问题目前没有答案。
茉莉: 那“管他呢,做就是了”这个帖子放在这儿接得很好。Joel Auterson 写了一篇,讲 AI 时代他看到三条路,最后他选了那条最难的、但最有快乐的路——自己动手做。
白桦: 这个帖子下面共鸣很多。有人说,如果 agent 能完成 38.8%,那剩下的 61.2% 里藏着的恰恰是人做事情的乐趣和学习的价值,外包掉它你省了时间,但也省掉了成长。也有人不同意,说这种“手工原教旨主义”是一种 privilege,不是每个人都有时间享受过程的。两条路谁对,评论区没有定论,但大家至少同意:这是每个人现在都必须主动做的选择,而不是默认会发生的。
茉莉: 从“谁在赚我的钱”过渡到“谁在读我的数据”其实很顺——另一个关于边界的讨论。Simon Tatham 发现 Linux 版的 Zoom 客户端会主动读取 X11 剪贴板的全部内容,包括密码管理器里的数据。
白桦: 这个技术细节值得展开讲。X11 的剪贴板机制和现代桌面不一样,应用可以主动请求当前剪贴板内容,而且很多应用为了实现“粘贴”功能会提前去读。Tatham 的发现是 Zoom 做到了一个过分的地步——不是在用户点粘贴的时候读,而是持续地、主动地读。评论区第一反应是:如果你开着密码管理器,复制过一次密码,那段时间内打开 Zoom 的任何会话里它都可能拿到。
茉莉: 技术讨论里有个重要的辩护意见:在 X11 的架构下,应用主动读剪贴板某种程度上是机制使然,锅未必全在 Zoom,X11 本身缺乏细粒度的权限模型。但反驳的声音立刻跟上:机制允许不等于应该这么做,一个视频会议软件没有理由持续轮询剪贴板,Wayland 的权限模型就严格得多。还有人给出实用建议——敏感内容复制完及时清空,或者干脆切到 Wayland。这是个老生常谈但依然有效的建议。
白桦: 同样的“常驻软件越界”问题在电视上更戏剧化。LG 否认了电视间谍的指控,声明 ACR——自动内容识别——是可选的,用户可以关。
茉莉: 但争议的焦点在一个词上:'持续地'。LG 否认电视会持续监听环境对话,可是从披露的材料看,电视确实会采集和记录环境中的对话片段,只是 LG 争辩说这不是“持续监听”。Gamers Nexus 直接发了一个回击视频,标题叫"LG Says We're Fake News"——LG 说我们是假新闻。
白桦: 这个帖子的评论区有两个平行讨论。一个是对 LG 措辞的分析:很多人觉得“否认间谍”和“承认采集对话”可以同时为真,关键在定义,这种公关式否认反而加深了不信任。另一个是元层面的:有人注意到 YouTube 疑似在 A/B 测试这个视频的标题,也就是说你看到的标题可能不是最终标题。这条本身是观察,没被证实,但引发了对平台如何影响叙事的讨论——你以为你在评价内容,其实你看到的包装已经被实验过了。
茉莉: 共同的教训评论里总结得挺好的:不管是剪贴板还是电视麦克风,问题都是常驻软件对本地数据和环境声音的访问缺乏透明度。你不知道它什么时候在读、读到了什么、发到了哪里。
白桦: 隐私考古还有一条更长的线:Usenet Rewind,一个从 1981 年到今天、超过十亿条消息的可搜索档案。
茉莉: 十亿条消息,横跨四十多年。技术上说这是了不起的工程,很多人在评论区感慨终于可以找回自己年轻时的帖子了。但翻过来就是隐私问题:那些 1990 年代天真地写下真实姓名、邮箱、住址、观点的人,从来没想过这些内容会被永久索引、永久可搜索。有人分享了亲眼所见——确实有人在里面找到了自己 decades 前的言论。有人问归档方有没有做过任何删除请求机制,目前看没有。
白桦: 这里和 LG、Zoom 的讨论形成一个对照:那个时代没有隐私预期可言,条款都没读过;今天我们有隐私政策,但执行和透明度照样存疑。技术变了,问题的形状没变太多。
茉莉: 好,从考古聊到硬件考古。Eileen Yoon 做了一项很硬核的逆向工程:把 Apple M1 的 Neural Engine 拆开看。她的结论是,这块芯片是为 CNN 的数据流设计的,对 Transformer 架构很不合适。
白桦: 而最有信息量的佐证来自产品路线:M5 已经把 ANE 并进了 GPU。这几乎坐实了大家的猜测——专用加速器输给了通用架构的灵活性。评论区的解读分几派。一派说这是经典pattern:专用硬件在目标负载上效率更高,但负载一变就成了负担,NPU 历史上发生过好几次。另一派补充商业视角:Apple 当初做 ANE 有自己的场景假设,Transformer 浪潮谁都没想到,这不完全是设计失误,更多是时代限制。还有人从 Yoon 的逆向过程本身展开,赞叹这种级别的文档工作对整个社区的价值。
茉莉: 更老牌的考古是 Ken Shirriff 重建 Intel 8087 的微码。他发现 FSCALE 这条指令用了超过 140 条微指令,还要经过三层子程序。
白桦: 这个数字让很多人震惊,因为 FSCALE 在概念上就是个简单的指数缩放。评论区里懂微码的人解释说,早期的浮点协处理器资源极度受限,微指令序列冗长是正常现象,而且 Shirriff 的逆向方法——从硅片照片直接恢复 ROM——本身就是一门正在消失的手艺。也有人把这条线和 Yoon 的工作连起来:从 8087 到 Neural Engine,四十年过去,硬件的复杂度转移到了不同的层面,但“逆向工程理解它是怎么真正工作的”这个需求从来没变。
茉莉: 理论和宏观层面各有一个收尾的点。arXiv 上有篇论文认真地问:真的会有 7G 吗?它主张用“就绪度框架”取代自动的代际编号——不要每隔几年就宣布一代新技术,而是评估技术本身是否真的成熟、需求是否真的存在。
白桦: 评论区呼应很多。有人列举了 5G 的教训:当年宣传的杀手级应用大半没兑现,代际营销跑在了技术前面。也有通信行业的人反驳说,代际编号对产业链协调有实际功能,频谱、设备、标准都靠它对齐,不能一刀切废掉。还有人把它和 ANE 的故事并列:技术演进从来不是匀速的、按编号推进的,专用硬件被通用架构吞掉,营销代际被实际就绪度打脸,这些都是同一个规律的不同切面。
茉莉: 最后落到工具和动手这件事上。Lalit Maganti 开源了 buildprof,一个把构建过程可视化的追踪工具,它把整个构建画成进程树加时间线。
白桦: 它的用武之地在他自己的分析里:Bun 的构建用 Zig 和 Rust 两种语言,构建时间有差异,他用 buildprof 把这个过程摊开看,哪一步慢、并行度怎么样,一目了然。评论区里做大型项目构建优化的人反响热烈,很多人说这类工具的难点从来不是可视化本身,而是底层追踪数据的采集——怎么在不动构建系统的情况下拿到准确的进程级时间,这才是硬功夫。有人也提到,构建剖析这个领域一直缺一个现代的、开源的标准工具,buildprof 是不是能成为那个工具,还要看生态跟进。
茉莉: 编程语言思想那边有一篇博客,讨论了三个特性:Flow Typing,借用检查,还有契约式编程。帖子的喜剧点在于,博主用 D 语言举契约式编程的例子,结果示例代码自己带了一个后置条件的笔误。
白桦: 评论区当然不会放过这个梗,但玩笑之外有认真的讨论。Flow Typing 派说这是被低估的特性,能让动态风格和静态安全共存;借用检查派则提醒,Rust 已经证明了borrow checking可行,但也证明了它的学习成本,语言设计里没有免费午餐。契约式设计的支持者 argue,后置条件的笔误恰恰说明契约的价值——如果那个错误发生在运行时的断言检查里,它会被抓住;问题只在例子是写在博客里的。这算是意外的正面论证。也有人泼冷水:三个特性塞进一篇文章,每个都只能点到为止,深度不够,但作为入门地图是有用的。
茉莉: 实操层面还有一个短平快的教程:用 JOSM 的 Website Wizard 插件,十五分钟完成你的第一次 OpenStreetMap 编辑,具体场景是给地图上的店铺加网站标签。
白桦: 这个帖子底下气氛很轻松,但也有实质内容。有人分享了第一次编辑 OSM 的经历,说门槛低到出乎意料,而这类“加个网站”的微小编辑恰恰是地图数据质量的重要补充。有人讨论了 Website Wizard 这个插件本身的合理性:半自动化的标签添加会不会引入错误数据?社区的老编辑们回应说,有审核机制兜底,新人从低风险编辑入手是社区一直鼓励的路径。也有人说,比起讨论工具,更重要的是这种“十五分钟就能为公共数据做贡献”的叙事本身——它把开源从代码扩展到了数据。
茉莉: 这就绕回到 Joel Auterson 那句话了——“管他呢,做就是了”。不管是给地图加一个网站标签,还是拒绝把乐趣外包给 agent,还是像 Yoon 和 Shirriff 那样花几周逆向一块老芯片,这一期的很多故事最后都落在同一个态度上:动手,慢一点也没关系。
白桦: 而反过来看,Amodei 想让大家整体放慢,Xe Iaso 讽刺了这件事的难度,Nvidia 决定着算力的水龙头——速度这个东西,从来不是一个人能定的。今天的节目就到这里,我们明天见。
茉莉: 明天见。