
0829 | 谣传即漏洞、GLM-5.3发布、Luanti与Anthropic法律案件
Show notes
本期节目回顾了本周 Hacker News 上最受关注的技术与行业话题。开场讨论 AI 驱动的漏洞狩猎正在改变开源维护的负担:Rclone 作者感叹一个月内涌入四十多个安全披露,而“光是 bug 的传闻就足以让攻击者顺藤摸瓜”已成现实。随后是开源模型 GLM-5.3 的发布,评论者把它与 Anthropic 的 Opus 直接对比,火药味十足。OpenAI 就 Cursor 被 SpaceX 收购作出了决定。论文介绍了无中央协调者的多智能体数学发现环境 Station,智能体在没有脚本化流水线的情况下自主研究并取得多项新成果。一位安全研究者把 LLM 的记忆问题改造成程序分析问题,做出 Datalog 引擎 Lemmalog。开源体素平台 Luanti 因一纸被指毫无根据的 AI 版权通知被移出 Google Play;联邦法官裁定五角大楼将 Anthropic 列入黑名单违法;第九巡回法院在 Kalshi 赌博纠纷中站在各州一边;美国制裁了意大利数字通信集体 Autistici/Inventati。技术方面还涉及 HTTPX2 的发布与 OpenAI 的迁移、小型模块化核反应堆的承诺
时间轴
- 00:00:00 开场
- 00:00:37 光是 bug 传闻就足以触发漏洞狩猎浪潮
- 00:01:03 GLM-5.3 开源权重发布,与 Opus 的直接对比
- 00:03:12 OpenAI 对 Cursor 被 SpaceX 收购的决定
- 00:03:34 Station:无协调者的多智能体数学发现
- 00:05:48 把 LLM 记忆改造成程序分析:Lemmalog
- 00:07:38 Luanti 因一纸 AI 版权通知被移出 Google Play
- 00:09:31 法官裁定五角大楼将 Anthropic 列黑名单违法
- 00:09:59 第九巡回法院在 Kalshi 赌博纠纷中站在各州一边
- 00:11:48 美国制裁 Autistici/Inventati:先例之争
- 00:13:50 HTTPX2 发布,OpenAI 迁移与命名争议
- 00:14:39 小型模块化核反应堆:沉重的“应该”
- 00:15:21 苏美尔王表与古气候事件的统计检验
- 00:17:14 GUI 应完全由键盘驱动?HN 的立场之争
- 00:17:55 “在应用里效果更好”——谁毁了网页?
相关信息
- Just the rumour of a bug is enough to find an exploit these days - Bri Hacker News Campaign Feed
- GLM-5.3 is now open-weight - Bri Hacker News Campaign Feed
- Our decision on Cursor following its acquisition by SpaceX - Bri Hacker News Campaign Feed
- Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment - Bri Hacker News Campaign Feed
- I accidentally turned LLM memory into program analysis - Bri Hacker News Campaign Feed
- Luanti removed from Google Play due to baseless AI copyright notice - Bri Hacker News Campaign Feed
- Pentagon's blacklisting of Anthropic was unlawful, US judge rules - Bri Hacker News Campaign Feed
- 9th Circuit sides with states in Kalshi gambling fight - Bri Hacker News Campaign Feed
- U.S. sanctions against the A/I Collective - Bri Hacker News Campaign Feed
- HTTPX2 – A next-generation HTTP client for Python - Bri Hacker News Campaign Feed
- Migrating to HTTPX2 - Bri Hacker News Campaign Feed
- Smaller reactors bring nuclear power closer to fulfilling its promise - Bri Hacker News Campaign Feed
- Does the Sumerian King List Align with Paleoclimate Events? - Bri Hacker News Campaign Feed
- GUIs should be fully keyboard-driven - Bri Hacker News Campaign Feed
- “It works better in the app” - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 欢迎收听 Bri 电台的《HackerNews每日沙龙》,我是茉莉。
白桦: 我是白桦。今天的话题从一句耐人寻味的说法讲起:光是某个 bug 的传闻,就足以让人找到利用它的漏洞。
茉莉: 还有 Z.ai 带来的一版只靠后训练就大幅提升编码能力的新模型,以及 Luanti 在 Google Play 下架背后那桩 DMCA 风波。
白桦: 另外,一位美国法官裁定五角大楼把 Anthropic 列入黑名单属于违法,几篇值得玩味的文章和论文也都在路上。
茉莉: Rclone 的作者在 Hacker News 上感叹,过去十年这个开源项目总共只收到大约二十个安全披露,而最近一个月就处理了超过四十个,即便用 AI 工具来分诊和起草修复方案,也占掉了他大量时间。而那条被讨论的博客恰恰说:光是存在一个 bug 的传闻,就足够让攻击者顺藤摸瓜找到可利用的漏洞。
白桦: Z.ai 在 Hugging Face 发布了开源权重模型 GLM-5.3。模型卡显示它与 GLM-5.2 共用同一基础模型,所有提升都来自后训练:在自研 Code Bench 上编码能力比 5.2 提升百分之五十,并在 Terminal Bench 3.0 与 Agents' Last Exam 上达到开源最优,而越往利用链上游提升越大,利用类基准得分比 5.2 翻倍以上,比如 Terminal Bench 3.0 从四点六跳到二十八点三。模型支持中英文,许可证为 glm-5.3,可用 SGLang、vLLM 或 TokenSpeed 本地部署。讨论里把它和 Anthropic 的 Opus 比的火药味很重:有人开玩笑说用起来像 Opus 4.8,以最好的方式,随即被问是不是比 Opus 5 更好,有人接话说几乎任何东西都比 Opus 5 好;还有人猜测 Opus 4.8 实际规模可能远小于外界假设,传言里有人猜高达五万亿参数,如果反而明显大于 GLM 5.3,那对 Anthropic 会很尴尬。
茉莉: 这个比较立刻被反驳了。有评论者指出,相隔六个多月发布的模型没法直接比,GLM 5.2 和 5.3 架构相同却差很多,因为前沿能力蒸馏到更小尺寸需要时间。还有人从资源约束切入:Anthropic 这类美国实验室研究人员人均几百到几千块 GPU,而 Z.ai 这类中国实验室一般只有一到十块,优先级根本不一样。
白桦: 也有人从规模本身切入:更详细的世界知识要求模型规模指数级扩大,但多数知识其实可以临时靠搜索或数据库查询获得,这方法在模型缺乏知识、问不出该问的问题时就会失效。至于 Opus 这边,还有评论补充说 4.7 和 4.8 其实比 4.5 和 4.6 更小,而 4.5 又比 4 小。
茉莉: OpenAI 就 Cursor 被 SpaceX 收购后作出了一项决定。有评论说这合理,也有人替 Cursor 用户惋惜,毕竟不太妙,并且关心能不能通过直接用 OpenAI 的额度绕过去。讨论的重心基本落在:这个决定对 Cursor 现有用户意味着什么,以及是否还有其他的使用路径。
白桦: 这篇论文介绍了一个叫 Station 的开放世界多智能体环境,arXiv 编号 2608.23691。来自不同模型家族的 AI 智能体在没有任何中央协调者或脚本化流水线的情况下,自行选择研究方向、开展实验、协作,还共同维护一份共享的科学文献。论文报告,在 AlphaEvolve 目录的十二个构造问题和两个附加案例里,智能体在五个问题上取得了超前结果,具体给出了有限域 Kakeya 集的新无穷族,找到十一维空间中一个新的精确六百零四点 kissing 构型,刷新了离散化 Kakeya 针和符号不确定性问题的纪录,显著改进了 Erdős 最小重叠问题的下界,还发现了 Book Ramsey 数的一个新无穷族。关键是它们不只给出数值构造,还提供了解释构造原理的定理与分析,全部原始对话、证明和验证代码都公开了。
茉莉: 讨论里对原创性的追问换了个方向。有人注意到过去每当著名问题被解决,评论区总有人问原创性何在,如今大家开始问下一步会是什么。另一位评论者说这误解了职业数学家的主张:一个拥有海量可访问记忆、能极速测试和重组既有方法的 AI,很容易超越数学界的大部分成员,这或许在功能上等同于某种创造力,但也可能是非穷尽的形式,开放问题正在于这里。
白桦: 还有人追问奖励结构能不能内生。最终的那个数学评估器也许始终需要外置,但智能体可以自己搭建研究奖金、同行评审、期刊、声誉系统、评审者选举,以及计算与注意力的分配规则——这些机制可能促进专业化和判断积累,也可能加剧羊群效应,目前是未知数。另外有人引用论文里一个细节:智能体会定期放假,放下手头工作并接收鼓励开放式思考的随机提示,有人调侃这是给 AI 重新发明了剑桥高级公共休息室。
茉莉: 一位安全研究者发现,让大语言模型智能体在漏洞调查里跑上几个小时,模型会慢慢忘掉已确认的结论:它可能重新提被排除的方向,忘记某个假设早已被证伪,甚至继续拿失效的观察来推理,而且只告诉它某个结论错了并不能保证它不再相信所有依赖该结论的东西。
白桦: 所以他不再追求更好的记忆,而是做成了 Lemmalog:一个把智能体知识当作分析状态维护的 Datalog 引擎,带来源追踪、撤回和增量求值,并在 LongMemEval 和 LoCoMo 上做过基准测试。思路是把模糊部分留给模型,比如判断被释放的对象后来被复用为写入目标;事实间的推导则由引擎保证一致,一旦发现对象 a 并不指向对象 b,依赖那条事实的推导就会自动失效。
茉莉: Hacker News 上,有人把它比作手工实现的 CodeQL,也有人觉得它基本嵌入了 CodeQL 的核心思想,即从代码库做 Datalog 抽取,再让模型提问并回答。
白桦: 有评论说这类能力对排查硬件故障日志很有用,因为设备在店里时问题没被观察到,故障在另一地点才出现;还有人让模型去收集同类问题的佐证来源并不断精炼,直到足以当作假设再往下推断。
茉莉: 另有人提到更早的类似做法:让模型把文章拆成陈述句、构建事实与事件的实体关系图再用常规图查询去查,说对时间线类查询特别有效;还提到经典的 Cyc 项目,认为这类方法或许已是模型在权威数据源上落地的根基,不过对模糊、含混或观点类信息可能仍得靠模型本身。
茉莉: 开源体素游戏创作平台 Luanti 的安卓应用现在上不了 Google Play。根据团队博客,Tracer.AI 代表微软提交了 DMCA 通知,声称 Luanti 侵犯 Minecraft 版权;团队称通知毫无根据,Luanti 不含任何专有代码或资产,通知只引用一个对应 Minecraft Java 版 1.9 的注册号,却没有说明具体被指侵权的资产。
白桦: Luanti 本是不附带游戏或游戏资产的开源平台,属非营利社区项目,很多欧洲学校还把它当教育工具;团队说 2023 年就因同公司的类似通知成功申诉过,今年它又对标称体素风格的独立游戏 Allumeria 提出了类似通知。
茉莉: 评论里争议主要落在该告谁上:有人建议起诉干扰业务关系,有人坚持应该起诉微软而不是谷歌;还有观点认为,若谷歌按许可合同提供服务又收费,违反自己的合同可能构成对开发者的欺诈,另有人质疑服务条款能否真的放弃所有权利。
白桦: 关于通知来龙去脉,有人勾勒了链条:开源项目发布源码,AI 抓取源码生成类似专有游戏代码,再用工具扫描 jar 文件发现相似代码并触发违规;也有人提醒,相关司法裁决只认定生成代码的程序不能成为作者,不等于 AI 生成的内容就完全不可版权化。
茉莉: 团队还主张,体素这一游戏概念本身不属于任何人,Minecraft 也受 2009 年 Infiniminer 启发,方块游戏已是完整类型;独立于此事件,ContentDB 上的第三方包仍由志愿者人工审查,团队正研究基于感知哈希的自动资产标记来辅助,但坚持最终决定由人做出。
茉莉: 美国一名地区法官裁定,五角大楼把 Anthropic 列入黑名单是违法的。有位评论者说,就他的阅读感受,法官的意见相当直截了当,而政府那边的证据基本站不住脚。
白桦: 评论区对这类做法带着整体性的失望,有人把它概括成这个政府许多行动的一个缩影,不过核心还是落在裁决措辞上:法官认为政府提供的证据没有支撑住这个决定。
茉莉: 第九巡回上诉法院在一桩围绕 Kalshi 的赌博纠纷里站在了各州一边。评论里的概括是,法院认定体育博彩不受那部曾被用来阻止克里斯·梅耶斯被起诉的联邦法律保护;从案件标题推断,这项裁决很可能让亚利桑那州的起诉复活。
白桦: 一位评论者引述瑞安·纳尔逊法官在一致裁决里的原话:国会在修订《商品交易法》时,并没有用大锤砸碎联邦、州和部落政府几十年来建立的体育博彩监管体系;他说花了这么长时间才得出这个显而易见的结论,让人难以置信。围绕司法慢,一派说法律慢是设计使然的审慎升级机制,坏裁决不会立即生效;另一派反驳说恰恰是这种慢让大量违法行为在裁决落地前已造成不可挽回的损害。
茉莉: 围绕赌博本身,有评论主张赌博是负外部性,促成并从中获利的公司应把毛收入的四到五成交给政府,广告要受限,永远不能面向儿童或高风险人格类型,也不得用暗黑模式和抽卡机制加剧风险;也有人回应说,对恶习征税纸面上值得,但酒精广告不断、赌博应用普遍用暗黑模式这类二阶效应在他看来不值。
白桦: 评论区甚至质疑了法院的区分:法院举例说超级碗是否会举行是发生的事件,但谁赢了不算;有人反问,公羊队赢和包装工队赢难道不是一个事件的两面吗?在他看来这种词义解析已接近司法立法,不如宣告法律因含糊而无效,让立法机关重新来过。
茉莉: 美国对意大利的数字通信集体 Autistici/Inventati,简称 A/I,实施了制裁。这个组织的网站页面上有一份声明,标题就是针对它的美国制裁。它二零零一年成立,源自自主反资本主义运动中一批关注技术和数字权利斗争的个体和集体。
白桦: 这个集体服务的对象,是活动家、基层群体,以及任何希望不被画像地沟通的人。它提供免费的数字服务,包括电子邮件账户、邮件列表、博客、网站、聊天和 VPN 访问,所有服务都不收费,也不控制或商品化用户的个人数据。
茉莉: 更特别的地方在于运营方式——运营者都是志愿者,经费只靠自愿捐款,服务仅限于非商业用途,而且只提供给和这个组织理念相合的个人或团体。每个服务请求都由志愿者人工审核,请求本身会先被匿名化,之后销毁。Hacker News 上有用户觉得,读完它的宣言仍然不清楚它到底在做什么,一些链接也失效了。
白桦: 评论区里有人补充说,它托管了很多活动家使用的博客和电子邮件;还有一个叫 noblogs 的网站被不少无政府主义、反法西斯、反帝国主义的团体在用。它的“关于”页面明确列举了自己的原则:反法西斯、反种族主义、反性别歧视、反军国主义。有评论者因此质疑,这套服务是不是真的面向“任何人”,还是只面向政治立场一致的人。
茉莉: 后续的讨论里,有人反过来说,这些“反”观点在不少地区其实相当主流,他见过酒吧侍者穿着印着这些标语的 T 恤。也有人批评页面写得像企业宣传语,通篇没有说明具体工作;还有人讽刺地说,反法西斯主义被视为非主流本身就是件可悲的事。
白桦: Hacker News 上出现了一个名为 HTTPX2 的新项目,定位是 Python 的下一代 HTTP 客户端。有意思的是,OpenAI 自己也在迁移到 HTTPX2,它在开源仓库里专门发布了一份相关的迁移文档。
茉莉: 迁移里值得注意的一个改动是:现在用的是操作系统的 TLS 信任库,而不再是此前的 certifi。有读者对文中的缩写 nb 感到困惑,作者解释说那是拉丁语 nota bene 的缩写,就是“请注意”的意思。
白桦: 项目命名本身也成了话题。有人评论说,如果它叫别的名字,比如 httpx-ng 或者 httpy,自己会更乐意看到这个项目,似乎对沿用 HTTPX2 这个名字有点意见。
茉莉: 《自然》一篇报道的标题提出,更小的核反应堆正在让核能从“应该兑现其承诺”变得更接近兑现。Hacker News 上有评论者抓住了“应该”这个词,说这两个字在用词上是过了狠劲的——尤其是考虑到眼下的事实,到二零三零年应该有一座这样的反应堆上线,到时我们就能见分晓了。
白桦: 另一位评论者接话说,到那时候我们至少应该知道了。语气上明显是在顺着前一位的观点,觉得 SMR 也就是小型模块化反应堆“应该更便宜、更容易建造”这种话,最终还是要靠实际的投产结果来检验。
茉莉: 一位叫 Istvan 的作者发布了一篇《苏美尔王表古气候对齐检验》,专门检验古老文献苏美尔王表里洪水前八位君主的统治时长,和古气候事件之间有没有统计上显著的对应。
白桦: 王表记载的这八位君主,统治时长从埃鲁拉的两万八千八百年,到恩美杜兰那的两万一千年、乌巴拉图图的一万八千六百年不等,八任加起来共二十四万一千两百年。作者在固定的锚点、一万一千六百年前,样本核宽度一点六千年之下做了检验,结论是:在主要古气候目录里,这份苏美尔序列没有显示统计显著的对齐,原始 p 值零点三五零,校正后更高。
茉莉: 即便把目录扩展到一百零三个条目,表观上的匹配数增加了,结论依然不变。按灾难性探索目录再试,能得到最小的原始 p 值零点零二一,但多重比较校正后升到零点二二二,仍然不支持这个假设。作者本人说得很清楚:没有任何一次检验达到统计显著性。
白桦: 评论区里,有人肯定作者没有强行让数据去拟合结论,而是解释了即便是表观上的匹配也可能只是巧合。另一位评论者则注意到一个数字规律:前六位君主的时长以及八项总和,都是某整数乘以六十再乘以六十,但最后两项两万一千年和一万八千六百年不符合这个模式;如果换成一万八千年和两千一百六百年,就同样能套进公式、总和也不变。还有人在追问,所谓王表数字是史前失真记忆的那种推测性解释,到底有没有任何来源依据。
茉莉: Hacker News 上那篇主张图形界面应完全由键盘驱动的博客文章,评论区里争论得很激烈。有评论者 sublinear 直接说,终端用户界面是一种荒唐的东西,大多数图形界面其实做成网页就够了,命令行界面该用的时候还是该用,学会命令行以后,写脚本或者处理海量数据的时候会有回报。
白桦: 有意思的是,就算在键盘驱动界面的支持者内部也不是铁板一块。sublinear 只接受命令行,而下一层回复他的 Arainach 只冷冷回了一声带感叹的“Ha”,明显连终端界面那一派都看不下去。
茉莉: Terence Eden 在博客文章里讲了他订阅活动日历的经过:他手上有链接,手机是运行最新 Android 十七系统的谷歌 Pixel,日历应用也已经更新,但点击日历链接就是加不进去。谷歌给出的说明是,要订阅新日历必须用电脑网页浏览器,无法在 Android、iPhone 或 iPad 的日历应用里订阅。他改用手机浏览器开桌面模式,进了 calendar.google.com 把日历加上,日历就出现在应用里了。
白桦: 他觉得这不只是谷歌一家的问题。很多公司都想在用户主屏幕上保持永久存在,同时认为用户太笨、不会用浏览器的书签功能,而他自己也说,也许他们是对的。他还指出了一个更深层的结构问题:应用的核心毛病一直是难以更新,每个新功能甚至新页面都要在上千台设备上测试,分发很耗时;唯一的出路是让应用从远程动态拉取新功能,而做到这一点,就等于重新发明了网页浏览器。他也承认有些事只有应用能做,但浏览器在追上来,主屏幕图标很容易加,离线功能网页也能实现。他早年还开发过 Symbian、BlackBerry 甚至 Palm Pilot 的应用。
茉莉: Hacker News 评论区里,blenderob 说这个领域变成了很多人专做容易又看得见的部分,拿到一个月的关注、也许一次晋升,就转向下一个新项目;真正留下来把半成品应用修好、维护它们、处理无聊问题的人,却很少得到同等的认可。pjc50 接着回应说,谷歌正是以拿新功能和新应用换晋升而出名的,baggachipz 补充说,然后让应用慢慢枯萎,几年后最终被放弃。
白桦: lmm 提出了另一种解释:这不是应用没做完,而是谷歌故意在开放标准的支持上敷衍了事,想把人困在它的日历生态里,所以外部添加日历,比添加别人的谷歌日历摩擦更大。tisdadd 说因为这,他经常只能说“等我回到电脑前再看”,除非是在那些他主要在阅读的地方。arthurezende 说在手机上不装应用几乎没法用社交网络,unglaublich 把这叫人为锁死,因为应用能比网页收走更多数据,还有更大的表面用通知、小部件和其他广告来骚扰用户。onion2k 补了一句,说如果你不装,他们就阻止你花时间在上面,这是功能,不是 bug。nottorp 还提到,更不用说没有东西在后台拉那些“互动”帖子的时候还省电。
茉莉: 也有人给出了绕过的办法。kelvinjps10 说可以用 Libredirect,或者 uBlock Origin 配 Firefox for Android;wilkystyle 说自己没法用应用看 YouTube,但 Safari 加上 uBlock Origin lite 之后,他从来看不到广告。最后,博客评论者 Paul Armstrong 在 2026 年 8 月 28 日套用内部说法总结了一句:谷歌的软件只有两种状态——已弃用和尚未就绪。
茉莉: 今天这两条都很有意思——一条是开源权重模型 GLM-5.3,另一条是说,有时候一句传言就够了,比如评论里那个关于 Opus 4.8 规模的说法。
白桦: 确实,我们聊了模型本身,也聊了人们对它的反应。感谢收听,我们下次再见。