0802 | 《HackerNews每日沙龙:TLS旧密钥退出、水务PLC攻击、AI建模新范式》

||Download

Show notes

本期节目从新互联网标准《RFC 10015》谈起,它计划在 2026 年弃用 TLS 1.2 中的过时密钥交换方法(有限域 DH 与 RSA 密钥交换)。随后聊到 Go 1.27 引入的泛型方法等新特性及维护者共识之争、CISA 关于供水系统联网 PLC 遭攻击的警报,以及 MIT 研究指出的 AI 财务建议的优劣。此外还讨论了字节跳动 Seedance 2.5 视频生成模型、Lean 内核第 14576 号健全性漏洞的事后分析、NetBSD 11.0 的发布、谷歌当年如何损害 RSS 普及、探索式建模训练新范式、Cursor 移除用量页成本信息的争议、加拿大签署联合国网络犯罪公约的隐忧、ripgrep musl 版本的段错误,以及 OpenAI 声称下一代模型解决十个开放数学问题所引发的社区分裂,还有"原型不是产品"的深刻讨论。

时间轴

  • 00:00:00 开场
  • 00:00:04 开场:本期话题预告
  • 00:00:41 RFC 10015:弃用 TLS 1.2 过时密钥交换
  • 00:03:26 Go 1.27 新特性与泛型之争
  • 00:06:26 CISA 警报:供水系统 PLC 遭攻击
  • 00:09:21 AI 财务建议:出奇地好但有局限
  • 00:12:15 Seedance 2.5 与生成式视频争议
  • 00:14:09 Lean 内核健全性漏洞的事后分析
  • 00:16:44 NetBSD 11.0:能否当日常系统
  • 00:19:15 谷歌如何损害了 RSS 的普及
  • 00:21:48 探索式建模:训练 K 次猜测的最优
  • 00:23:21 Cursor 移除用量页成本信息引争议
  • 00:24:58 加拿大签署联合国网络犯罪公约的隐忧
  • 00:26:56 ripgrep musl 版本大规模搜索段错误
  • 00:28:38 OpenAI 声称破解十个数学难题引争议
  • 00:31:09 原型不是产品:AI 时代的判断力
  • 00:33:53 收尾与总结

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 欢迎收听《HackerNews每日沙龙》,我是茉莉,这里是Bri播客家族的一档节目。今天由我和白桦一起,聊聊Hacker News上正在刷屏的话题。

白桦: 大家好,我是白桦。今天的内容相当硬核,从正在推行的网络安全规范,到AI生成视频的最新进展,再到一个关于数学猜想的意外转折,都值得好好聊聊。

茉莉: 没错。开场先给个预告——今天会讲到全新发布的一系列互联网标准更新,还有AI在财务建议这个领域的研究发现,以及一些很有意思的开发者工具动态。请继续收听。

茉莉: 今天 Hacker News 的讨论围绕一份新发布的互联网标准文档展开,编号 RFC 10015,标题是《弃用 TLS 1.2 与 DTLS 1.2 中的过时密钥交换方法》。它属于 IETF 的标准轨道,预计在 2026 年 7 月出版,作者是 N. Aviram,这次更新一共涉及十七份旧 RFC。 简单说,它要在 TLS 1.2 里面淘汰两类密钥交换方式:一类是有限域迪菲-赫尔曼,也就是常说的 DH 或 FFDHE,另一类是 RSA 密钥交换。同时它也劝阻大家使用静态的椭圆曲线 DH 密码套件。需要注意的是,这些规定只针对 TLS 1.2——TLS 1.0 和 1.1 早前已经被 RFC 8996 弃用,而 TLS 1.3 根本不用这些受影响的算法,DTLS 版本本身也没有 1.1。

白桦: 那它为什么要淘汰这些方法呢?文档给出的理由里,非临时的密码套件缺乏前向保密,这是个老问题;而 Raccoon 攻击则显示,有限域 DH 如果复用公钥,可能通过定时侧信道泄露连接机密。椭圆曲线 DH 那边,还存在无效曲线攻击的风险;RSA 密钥交换则有独立于具体实现方式的安全问题。另外,有限域 DH 还有互操作性上的麻烦——系统之间没有协商群组的机制,部分实现只支持很小的群组,客户端也很难真正验证服务器自定义的群组里是否藏了小子群。实践中大家常用的是 1024 位的群组,而目前公开的离散对数纪录是 795 位,安全余量已经很薄。更现实的是,攻击者只要做少数几次大规模计算,就能以很低廉的成本解密相当比例的这类流量。

茉莉: 讨论区里,有位叫 sidewndr46 的网友直接问:大家不能直接用 TLS 1.3 吗?ImPostingOnHN 带着反讽回应说,那还不如去破坏大量现有安装、逼大家做晦涩的配置文件修改,好让一切回到被破坏之前的状态。意思其实是,直接迁到 TLS 1.3 会冲击现有的部署,迁移成本相当高。这份文档的价值,更多是给还困在 TLS 1.2 上的系统划出一条明确的安全底线。

白桦: 接下来这笔,VictoriaMetrics 博客发布了一篇叫《Go 1.27 interactive tour》的文章,作者是 Jesús Espino,日期标注为 2026 年 7 月 31 日,约十九分钟阅读量。文章说自己是基于官方发布说明和 Go 源码写的,并不是详尽清单。这套互动巡览最初由 Anton Zhiyanov 开创,他写过 Go 1.22 到 1.26 的版本后决定停手,由 VictoriaMetrics 接续。文章的头条变化是泛型方法:方法声明现在可以声明自己的类型参数,和接收者的类型参数相互独立。不过有个限制——接口仍然不能声明带类型参数的方法,泛型方法也不能用来满足接口。

茉莉: 其他变化还包括:结构体字面量的键可以是任何有效的字段选择器,能直接设置来自嵌入结构的提升字段;泛型函数的类型推断被推广到类型转换和复合字面量等更多场景。编译那边,会生成大小特化的内存分配例程,某些小于 80 字节的分配成本最高能降约三成,整体分配密集型程序预计提升约 1%,代价是二进制体积多了 60 千字节左右。这个功能可以用一个叫 nosizespecializedmalloc 的开关关掉,而这个开关预计在 Go 1.28 里面移除。另外,go.mod 设为 1.27 或更高版本的话,堆栈回溯会包含 goroutine 的标签信息。

白桦: HN 讨论主要围绕泛型展开。有位 stingraycharles 对 Go 终于拥抱泛型表示震惊,问维护者的观点到底发生了什么变化。他不接受花了二十年才搞清楚怎么做这种说法,认为这是设计语言时本来就该考虑的事,而且泛型当初明确不在语言设计范围内,事后回填因为向后兼容反而更难。曾在 Go 团队工作多年的 bradfitz 回应说,说真的就仅此而已——Ian 一个人提出又否决了大约六种他自己的不同泛型方案,最后人们都喜欢的语言加实现计划才成型。另一位网友则把原因归到原维护者转去其他项目,新一代社区维护者通过提案和治理流程达成了共识。

茉莉: 那位网友 lilbigdoot 也说,这种程度的泛型让他对 Go 开始有点感兴趣了。另外,chenxiaolong 提到这个版本还修复了一个运行时函数,以兼容安卓上的 MTE 内存标记扩展——这是阻止用 gomobile 构建的应用在 GrapheneOS 这类系统上启用 MTE 的唯一障碍。后面值得关注的是泛型方法在接口这里的限制会不会持续,以及那个编译开关的移除计划有没有变化。

茉莉: 网络安全那边,美国网络安全与基础设施安全局,也就是 CISA,在 2026 年 7 月 30 日发布警报,警告说威胁行为者正越来越多地针对供水和废水处理系统里暴露在互联网上的可编程逻辑控制器,也就是 PLC。CISA 说,攻击者有时会修改密码来把操作人员锁在外面,还会通过更改 IP 地址把设备断开连接,结果导致煮水通知和持续的人工操作。警报直接点名了罗克韦尔自动化、也就是 Allen-Bradley,还有西门子和施耐德电气的设备,并指出蜂窝调制解调器在常规的攻击面扫描中经常被忽视。

白桦: 安全研究机构 Censys 在 2026 年 7 月 30 日的快照里给出了互联网暴露的规模:四千一百多个罗克韦尔或 Allen-Bradley 的 EtherNet 设备,四千一百多个西门子 SIMATIC S7-1200,还有两千多个施耐德电气的主机。需要强调的是,Censys 说自己只是描述暴露特征,并不确认任何特定主机就是 CISA 所述活动的受害者。CISA 则敦促关键基础设施的所有者、运营者和集成商,尽快把公开展露的 PLC 和其他运营技术设备从互联网上撤下来。

茉莉: HN 讨论里,有用户说这事迅速变成政治足球,但他觉得某位现任总统在这点上没错,这是各级别的严重无能,属于 IT 失职。他指出,CISA 及其前身警告公用事业运营商注意关键基础设施漏洞已经有大约十五年,能追溯到奥巴马第一届政府时期,可到 2026 年这些公用事业还是把设备直接连到互联网,还用着默认密码。一位自称做 PLC 工作的网友说,不管有没有默认密码,防护这么薄的设备竟然能从公共互联网访问,让他难以置信;前面那位则回应,默认密码只是本来就很糟的安全状况上的一颗樱桃。

白桦: 还有人觉得问题在于请不起、也付不起具备相应技术知识的人才,而不是粗心大意,并且提到见过把树莓派接进生产网络的安全研究人员。另一位网友认为关键是激励结构——文官系统里缺乏设定高标准、追究个人责任的机制,唯一例外是军队,因为那里生命切实面临危险。也有人主张掌事者该为伤害无辜民众而负责入狱,政府不应只是警告,而该下令、监禁并出资教育。还有人反驳说,运行安全补丁在运营技术领域说起来容易做起来难,问题更在上游,涉及政策、程序、文化和执行资源,这些都不是纯技术能解决的。

白桦: 最后这笔,HN 的讨论围着一篇来自麻省理工斯隆管理学院的文章,标题叫《AI 财务建议出奇地好——尤其在你问对问题的时候》。文章引用了金融学助理教授 Taha Choukhmane 共同撰写的新研究:大约一半的美国人在用 AI 获取财务建议。研究让一千名成年人不借助模板、自己写提示词,分别向 GPT-5.2、GPT-5.6 或者 Gemini 3 Flash 寻求开支与投资建议,然后模拟二十二到八十九岁的人群长期遵循这些建议的结果。结论是,遵循 AI 建议几乎对所有三十岁以上的人都能带来可观的储蓄缓冲。AI 会始终建议工作期储蓄、退休期支取、重仓分散的股票基金,以及四十五岁之后降低股票敞口。不过它对失业这类冲击的调整不够好,会让投资组合漂移,而不是主动再平衡;更结构化的提示词能改善建议质量,但主动再平衡仍然不足。

茉莉: 评论区围绕 AI 建议的局限展开。有网友指出,这个标题被截掉的一半——问对问题——才是重点。另一位的反驳更直接:这句限定让结论沦为接盘侠——不管有没有 AI,没问对问题结果都一样。还有人认为 AI 只是复述常识,比如认定某个高杠杆 ETF 不适合长期持有,但若用特定组合并搭配定投和每年再平衡,就完全可以;另一位则说自己就长期持有那个产品,承认长期持有说不通,但他用期权构造了同等杠杆、风险调整后回报更高的做法。两人还争论到税负拖累的差异,以及 AI 说高杠杆产品会因杠杆归零是技术上正确的。

白桦: 也有网友分享亲身经验:把 YNAB 导出的 CSV 文件交给一个 AI 当财务顾问,得到了预算分类、长期消费模式、信用卡积分、利率税率方面的实用建议,说自己第一次感到真人的工作被 AI 威胁,理财顾问和税务会计应该尽快适应。但立刻有人提醒,税务会计领域要谨慎,复杂税法下面大语言模型会犯错,而用户很难验证。还有个反例:AI 建议把某类公司转成另一种结构来省钱,会计却说考虑纽约市税之后反而更贵——因为提问的人没告诉 AI 自己住在纽约。其他讨论里,有人追问提示词细节,也有人推荐自托管的记账软件,还有人用付费工具把银行流水放进谷歌表格再交给 AI 分析,以及更便宜的替代方案。

茉莉: 字节跳动的 Seed 团队在七月底推出了新一代视频生成模型 Seedance 2.5。单次生成最长 30 秒,比上一代的 15 秒翻了一倍,而且支持多轮扩展,可以连续输出几分钟的视频,同时保持角色、场景和叙事节奏一致。一次还能输入多达 30 张图片、10 段视频和 10 段音频作为参考,并支持时间戳级的音视频定向编辑,绿幕、镜头视角这些能力也有增强。目前已经在即梦 AI 和豆包 Pro 等平台上线,API 也即将通过 BytePlus 的 ModelArk 提供。

白桦: 科技论坛上的讨论绕不开一个老问题:这类视频模型是不是只会被用来制造虚假信息和垃圾内容。有人觉得它纯粹有娱乐价值,还听说教育工作者用它做更高质量的讲解;也有观点认为,导演和电影人靠它实现原本根本拍不出来的场面,但确实凭空多出大量粗制滥造的产出,已经有几家大牌公司用 AI 视频投主流广告了。有人说得更直白——这些东西现在大量用在诈骗和政治操弄上,但算清成本收益之后,终归会流进好莱坞和商业制作。

茉莉: 还有个对比挺有意思。有人指出,代码生成相对良性,因为代码有明确可验证的指标;但把决策和思考交给模型就危险了。他举了个例子:办公室里出现过先定好结论、再让 AI 生成两千字分析幻灯片的做法,没人有精力去反驳,最后这份东西竟然成了记录在案的计划。也有人提到,一些 AI 视频社区用独立资源翻拍大制作,还有像 Balenciaga 版哈利波特那样的梗视频,只要观众一眼能看出视频是假的,这类用途就会一直存在。

茉莉: 八月一号,Lean 的形式化验证研究员 Leonardo de Moura 发布了对一个被称为第 14576 号内核健全性漏洞的事后分析。事情要从七月底说起:有人发布了一个由 AI 辅助生成、号称证明 Collatz 猜想反例的仓库,但它根本不是有效证明,而是巧妙地利用了一个内核在处理嵌套归纳类型时的毛病。另一位研究员把它归结成一个极简的假命题证明,并提交了 bug 报告;官方在报告提交一小时后推送了修复,经过审阅后合并,新补丁版本已经发布。

白桦: 漏洞的机制是这样的:在消除嵌套出现时,如果归纳类型的某个参数是所谓幻影参数——也就是没有出现在构造子字段里——这个参数就会从生成的辅助类型中消失,从而逃过类型检查,那个位置的错误类型参数就能被设计成让内核接受假命题的证明。不过这个漏洞只能通过元编程,也就是直接把归纳声明发给内核来触达,普通前端会检查参数并拦截错误类型的项。作者特别强调,这是实现层面的 bug,不是 Lean 元理论本身的破洞。

茉莉: 还有一层曲折。这个原始仓库居然也通过了另一个独立内核的检查,后来发现其实牵涉两个互不相关的 bug:官方内核缺了嵌套归纳检查,那个独立内核则没检查另一种节点类型。独立内核的 bug 在 Lean 的 bug 报告前一周就修好了,而那证明恰好被构造得让官方内核从不检查的表达式,正是旧版独立内核会接受的。作者认为这更多是时间巧合,但不排除模型看过那份报告的可能;也有研究者猜测,巧合背后是强模型找 bug 的能力。

白桦: 论坛上的解读集中在信任的边界上。有人说,就算证明通过了验证器,也不能信任大模型生成的代码;有人回说,你只能像信任任何软件那样信任验证器。还有人指出,形式推理的信任必然是条件性的——已验证的证明唯一出错的途径就是验证器本身出错,外加你对形式陈述的理解和它实际含义不同。也有人类比说,Rust 之类的简单类型检查器也偶有健全性问题,所以验证结果是极强的保证,但不是绝对的保证。

茉莉: NetBSD 在八月初发布了 11.0 版本,公告由 Martin Husemann 写在官方博客上。这次发布有一层特别的背景:项目组说,随着 AI 工具出现,发现或疑似安全问题数量大增,所以他们做不到零问题发布,选择透明公开,这次发布还因为等第三方组件的稳定版而推迟了。ISO 镜像被拆成小于 700 兆的 CD 镜像和完整 DVD 镜像,闪存介质建议用专门的镜像文件,ARM 设备则需要从可引导镜像页面获取预配好引导程序的版本。

白桦: 项目组同时公开了几个尚未修复的安全补丁请求。音频驱动那边,有个 ioctl 命令缺少本地用户权限检查,手动解决办法是移除对应的设备节点,音频功能仍然可用。防火墙方面有两个:一个是远程可触发的空指针解引用,不过相关功能默认不在任何已发布内核里;另一个是分片重组中的释放后使用,该功能已经弃用而且同样默认不启用。这些修复会在 11.0 之后进入稳定分支并纳入 11.1,目标是在两个月内发布 11.1。

茉莉: 论坛上主要争论 NetBSD 能不能当日常系统用。有人说到处比不上 Linux,也有方面可能更好;有人说得看硬件,很多设备 Linux 已经不再支持了;也有人认为桌面使用最合适,主板的几乎所有组件最可能都有驱动支持。谈到蓝牙,有网友问 NetBSD 有没有蓝牙,因为 OpenBSD 至今没有——其实 NetBSD 有蓝牙已经二十年了,而 OpenBSD 是因为安全原因主动移除了蓝牙支持,那是他们自己的选择。

白桦: 有人形容 NetBSD 像七十年代伯克利的高质量远古遗物,但立刻有人用亲身经历反驳,说当年的旧 BSD 可没这么成熟——没有后来那些方便的工具,得自己动手折腾才能搭起来。现代 NetBSD 已经换掉了旧组件,引入了访问控制列表、UFS 大容量卷支持和 kqueue 这些机制。不过也有人吐槽,2026 年了,系统里还有个命令,不带头参数运行就能在没有任何警告的情况下静默毁掉整台机器;另有人回应说,NetBSD 和其他标准的可移植操作系统一样现代。

茉莉: 再来聊聊一篇 2023 年的旧文章,标题是《谷歌如何摧毁了 RSS 的普及》。文章承认 RSS 至今还活着、还有大量使用,但指控谷歌用经典的拥抱、扩展、扼杀套路损害了它:先围绕这个开放协议打造产品、把用户锁进来,再把 RSS 支持拆掉。具体来说,Chromium 里的内置 RSS 按钮在没有任何通知和解释的情况下消失;谷歌 2007 年收购了 FeedBurner,后来先后关闭它的 API、移除邮件订阅等大部分服务,留下一大堆失效的订阅链接。

白桦: 还有更著名的两条。2013 年谷歌关闭了 Google Reader,官方说法是产品虽有忠实用户,但使用量逐年下滑,而有工程师当时说,整个项目期间一直有人想掐死它。同一年谷歌还移除过 Google Alerts 的 RSS 支持,遭到反弹后恢复了,但作者说伤害已经造成。有趣的是,谷歌的官方 RSS 扩展也曾经被移除、一周内恢复并解释为误删——放在这个时间线里,就不太像巧合了。

茉莉: 评论区基本是愤怒加怀旧。有人直接开骂,说这就是他深思熟虑的回应;也有人把关闭 Google Reader 视为谷歌从伟大公司滑向有点邪恶的转折点,他原本想去谷歌工作,也曾相信它能兼顾好生意和善待用户。至于为什么这样搞,大家的猜测各有侧重:有人说 RSS 里不好放广告,直接回应的就是简单两个字——广告收入;有人说当年是为了推 Google+;也有人说 RSS 是去中心化方案,而谷歌想让一切都经过自己。

白桦: 有个比喻挺到位:订阅 RSS 就像在 HTTP 上搭出一张点对点的网,切掉了站在中间的中间人,而谷歌恰恰是最大的那个中间人。有人怀念地说,Google Reader 消失是他所知互联网终结的开始;也有人直到今天还放不下。还有人回想自己当初全部的 RSS 用途只是订阅大约五十个网络漫画,后来就彻底弃用了。真正没解开的谜题始终是谷歌的真实动机——到底是为了广告、为了 Google+,还是为了消掉去中心化的威胁——以及用户是不是因此永久流失了。

茉莉: 先看 Hacker News 上讨论的一篇论文,作者提出了一种叫“探索式建模”的新训练范式,声称它可以作为第三个预训练轴,叠加到现有的生成模型上,还支持端到端生成。作者报告说,在图像、视频和语言这些领域,增加探索能持续改进现有模型,收益随数据规模从百分之七上升到百分之三十六,随参数规模从百分之十三上升到二十三;同时还声称在样本效率、计算效率和参数效率方面都有大幅提升。作为端到端生成模型,它能用在控制类任务上,而且最多只要扩散模型百分之几的推理计算就能匹配效果。

白桦: 评论区有人觉得,如果这些数字是真的并且在大规模下成立,那之前训练的每个图像模型现在都过时了。也有评论者看好,提到这用起来很简单,建议去看论文的伪代码。不过质疑的声音也不少:有人指出文章没提到 GAN,也有评论者做了更专业的技术点评,说实现上有几次额外的前向传递、以及对多个模态等概率采样的缺点。还有人认为这和 DeepSeek 的 GRPO 训练方法本质上是同一类思路,也有评论者反驳说机制完全不同,论文附录里已经包含了与另一种最优传输方法的比较。总之,对这套方法到底新在哪、是否在大规模上成立,讨论里还远没有共识。

茉莉: 再来是 Cursor 的一个变化,直接戳中了很多付费用户的痛点。有用户在官方论坛发帖,说 Cursor 的用量页面把原本显示的美元金额,换成了 token 数量,一直用金额紧盯每日和活跃支出的用户,现在觉得这个页面完全没用了,而且找不到切回美元金额的设置。还有人报告说,导出 CSV 文件时成本数据也不见了。

白桦: Cursor 的员工回应说,个人套餐现在确实没有切回美元金额的设置,只有企业套餐仍然显示美元金额。这是刻意设计,因为个人套餐的用量很慷慨,之前短暂显示金额时,常常高于用户实际付的套餐费用,反而造成困惑。超出套餐的部分,按需用量仍然在成本列显示美元金额,美元数据也能在仪表板的支出页面看到,或者导出 CSV 里看。

茉莉: 用户强烈反对。有人晒出自己所在的团队计划当前计费周期的用量成本高达三万美元,几乎全部基于 API 定价,过去依赖按日、按模型、按请求的明细,每天要看这个页面很多次,现在只剩下每个用户的总金额,根本不够用。还有人给出了更技术性的证据:API 返回的每请求成本字段被清空了,而且连此前显示真实值的历史事件也被一并清零,他要求恢复 API 和仪表板的成本列,说对按用量计费的产品而言,每请求收费透明不是可选项,这种做法还追溯性地破坏了他独立跟踪成本的工作。

茉莉: 转到一条关于隐私和法律的新闻。加拿大教授 Michael Geist 撰文指出,加拿大政府在七月中旬悄悄宣布签署了联合国的网络犯罪公约,几位部长宣传它的儿童保护条款和人权保障。但 Geist 认为,这个公约实质上不是网络犯罪条约,而是一份广泛的跨境监控和电子证据共享协议。

白桦: 背景是这样的:公约源于俄罗斯二〇一七年的倡议,目的是取代俄罗斯拒绝加入的欧洲《布达佩斯公约》。谈判启动时,加拿大和美国、欧盟一起反对,警告这是扩大国家监控权力的工具;反对失败后转入谈判以限制损害。最终文本在二〇二四年十二月协商一致通过,威权阵营提出的言论和内容犯罪清单被排除。有意思的是,去年十月在河内的签署仪式上,加拿大连同美国、新西兰等地都没有出席,签署方包括俄罗斯、中国、伊朗和朝鲜等;九个月后加拿大却在未解释原因的情况下签署了。

茉莉: 风险在哪里呢?这套程序的取证权力适用于任何刑事犯罪的电子证据,而且国际合作义务延伸到了“严重犯罪”,也就是按国内法可判处四年以上监禁的任何罪行。由于一些国家对批评政府、新闻报道甚至同性关系也处以这样的刑罚,公约实际上把压制性的国内法,变成了触发跨境取证的开关。数字权利组织警告说,它要求各国建立实时拦截和数据收集权力,却把事先司法授权这类保障交由国内法裁量,还允许对合作请求下封口令,也缺少政治犯的例外。签署前没有公开咨询,几十个加拿大组织和专家曾致信要求政府不要签署,这些担忧在公告里也没有回应。

茉莉: 最后是一条开源软件的 bug 讨论。ripgrep 官方仓库里的一个 issue,报告 x86 架构的 musl 版本二进制,在超大规模搜索中会偶尔段错误。汇报人说最初是在 OpenAI Codex 自带的 rg 里碰到的,而且他已经独立复现。复现需要大约二十吉字节、一百八十万个文件的随机目录,在二十四核机器上循环搜索不存在的字符串,大约一分钟就会出现崩溃。

白桦: 讨论的看点之一,是分享出来的那份详细分析报告究竟值不值得看。观点明显对立:有人说它是“没有灵魂、不可读的 AI 垃圾”,另一派则觉得它比多数人工写的披露更详细、更简洁,甚至能手工验证;还有人说读 AI 生成的 bug 报告感觉很糟,也有评论者判断它显然出自 AI agent 之手。

茉莉: 真正值得注意的是,问题出在哪一层至今没有定论。技术评论者指出,有人认为的额外 TLB 刷新根本不会导致错误,问题似乎是一种内存映射的异常状态。也有人怀疑,是不是内核加锁不当,导致 mmap 返回的虚拟地址正被并发 munmap 解除映射,或者干脆是硬件 bug——因为崩溃只在同一颗特定的 CPU 上、只在重负载时偶尔出现。内核、musl、硬件哪一层的锅,还需要在更多硬件配置上验证才能下结论。这份 bug 报告本身,也折射出 AI 生成分析在开源协作里引发的争议。

茉莉: 这份报告最有冲击力的地方在于它的规模——OpenAI 在八月初公布,说它的下一代内部模型 Astra 一口气解决了十个开放问题,而且是那种主线研究了至少十年都没有进展的问题。十个。范畴从几何里的高维球堆积、二元码,一路到群论里的 Connes 刚性猜想、算术电路复杂度、量子计算的重复问题,再到最近向量问题和多色 Ramsey 数。任何一个单独拿出来,都是能撑起一场博士答辩的难题。

白桦: 而且计算成本低得惊人——按它公布的 Sol API 费率折算,求解所有这些结果总共大约两千美元。更关键的是方法论:人类研究者用同一个模型整理手稿,模型把每个论证都形式化成了 Lean 的机器可验证证明,还把思考过程公开了。同时公司宣布向十万名科学家和数学家免费开放最强模型,用于学术研究。

茉莉: 这个声明引发了社区分裂。有人认同这是数学走向主流的一刻,说每个被攻克的猜想都会打开七八个新想法,前进路径仍然由有创造力和好奇心的数学家决定。但也有人拿国际象棋来打比方,说出现了失望者和热情者两种人。这个类比的争议很大——有批评者说,国际象棋因为人类之间的技能竞赛而存在,电脑主要用来训练和复盘;而数学空间远比棋盘广阔,没法机械地硬算出来。连原本提出这个类比的人都删掉了它,说自己想表达的只是变化会发生,人类会找到前进方式。

白桦: 更深层的焦虑是职业前景。有人指出,旧的建立学术信誉的方式正在被摧毁——成就越来越难和 AI 区分开来,而且越来越取决于你拿到多少算力。像比尔·盖茨大学时代靠论文建立信誉那条路径已经消失了。还有人追问,如果成就不能再区分有才能的人和只是有算力的人,努力还有意义吗?他仍然希望有才能者加上算力会更有效,只是担心这种局面维持不了多久。而另一方面也有人回应说,杰文斯悖论就在眼前——效率提升会带来更多盈余,反而推高对产品和服务的需求。

茉莉: 另一篇讨论文章标题讲得很直白:原型不是产品。核心论点是,AI 大幅加快了通往第一个可用版本的路径,却没有缩短从第一个可用版本到生产级之间的距离。原型能跑在笔记本上,但一有负载就崩溃,没有错误处理,可能泄露 API 密钥,加第二个用户数据模型就塌了,认证全靠假设撑着。

白桦: 文章认为难点一直是判断力——构建什么、怎么组织、推迟什么、什么时候说不。而模型只有模式匹配,没有判断力。这也点出了学计算机科学的真正价值:建立一套关于系统如何行为、如何失败、为何失败的思维模型。举例说,就是要能看出 AI 写出的查询会在五千万行的大表上引发全表扫描。纯属机械翻译需求的工程师需求在下降,但现在是学 CS 的最佳时机,被落下的是那些把 AI 当成理解力替代品、自己无法修复和解释系统的人。

茉莉: 社区里对"生产级"的定义也有争论。有人觉得它说穿了就是更多复杂度和过度容错,也有人认为生产级软件本质上是对系统的集体理解。还有一种观点说,生产级意味着经用户实战检验、在投诉和建议反馈里打磨出来——而这个反馈循环占绝大部分时间,没有编码代理能加速它。代码从来不是真正的瓶颈:一整天的编码变成十五分钟,但相对花好几周和用户确认要做什么,只是杯水车薪。当然也有人反驳说"当然缩短了",并要求反对者用完整论证说话。

白桦: 关于恐惧,有人说多数人怕的不是丢工作,而是 AI 抬高同行能力下限后,自己失去了市场价值;也有人认为主要恐惧是生产率提升让雇主少招人。不过讨论里还有一层更深的设想:模型一代代扩展能力,从擅长全新项目但不太会重构和维护,到专攻维护能力的后代,再到管项目、管产品、做销售,最终不需要公开发布,直接设计并卖出成功的软件产品——用百万美元级的算力批量产出应用,挤垮软件公司。但有人冷静地回应:总得有人付钱维持经济,最坏的情形不过是十几个 AI 驱动的"一人公司"互相买卖,足够换来食物、带泳池的房子和医生。一句话收尾就是——AI 不会自动产生能用的产品,那仍然是你的工作。

茉莉: 好,今天这一期信息量相当大。从互联网标准要弃用 TLS 1.2 里那些过时的密钥交换方法,到 CISA 对供水系统联网设备的警报,再到 VitessMetrics 对 Go 新版本的解读,都值得回头再翻一翻。当然,最能让人停下来想的,还是开源社区里那几件事——比如关于 Lean 内核健全性漏洞的事后分析。

白桦: 还有 AI 财务建议、视频生成模型的新版本,以及 Google 和 RSS 的老故事。我们把这些内容都整理成了文字稿和链接,欢迎随时回顾。也要记得,网上很多讨论时效性强、背景复杂,涉及安全或者数据的内容,多留一份心眼总没错。

茉莉: 今天就到这里,感谢收听,我们下期再见。