
0923 | AI 竞速与安全风波
Show notes
本期节目从AI模型与代理的最新竞争讲起,聊到多起安全与隐私事件,再进入开发工具与平台政策的观察,最后看看数据如何渗入日常。
时间轴
- 00:00:04 开场
- 00:00:27 模型三国杀:Opus 5.5、GPT-6 与开源 MiMo
- 00:03:06 代理与决策型 AI:异步省钱、打字破译、Jev 的赌注
- 00:06:50 安全事故串烧:从 WordPress 到 FBI 再到 Meta
- 00:11:11 认证与身份:SAML 的烂摊子与 Discord 的年龄推测
- 00:13:35 开发工具与平台:编译、复刻、沙箱与苹果的['广告']
- 00:17:38 数据渗入日常:世界杯广告与一枚诗意的芯片
- 00:19:49 收尾
相关信息
- Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
- Claude Opus 5.5
- GPT-6 Sol and Luna
- MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis
- OpenAI GPT–6 Astra breaks Enigma message that has resisted solution since 2005
- Can gzip be a language model?
- Unreal Agent
- Jev – a curation of Jev demos on X, tools, skills, and integrations
- OpenAI is well positioned to fast-follow Jev
- WordPress: Unauthenticated path traversal leading to conditional RCE
- 'We hacked the FBI:' Hackers say they have data on all FBI employees
- I asked Meta’s Muse for its filesystem and it sent me 6.8GB
- Obscura: VPN that can't log your activity
- SAML: A fractal of bad design
- An update on how we confirm your age group on Discord
- There's a high chance of devices being sold with GrapheneOS preinstalled in 2027
- Native apps written in TypeScript and CSS
- Microsoft killed FoxPro in 2007. Anyway, here's FoxPro revived
- 16-bit Intel 8088 chip (c. 1985)
- Show HN: Drop – a rootless Linux sandbox with gVisor support
- Apple has added persistent 'ads' to iOS, and it's driving users crazy
- I said no and Apple said yes
- 9 Ads per Minute: FIFA Cup 26 – "the price of the beautiful game"
- AMD's random number generator can't generate a 0?
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 大家好,欢迎收听这一期的节目,我是茉莉。
白桦: 我是白桦。这一期我们还是照老规矩,聊聊过去二十四小时里讨论最热闹的那些帖子。今天的故事线其实挺清楚的:模型厂商又打起来了,代理工具在拼命省钱,安全圈从 WordPress 一路炸到 FBI,最后还落在苹果往你手机里塞广告这种日常小事上。
茉莉: 对,我们从模型开始聊,因为这是今天争论最激烈的一块。Anthropic 发布了 Claude Opus 5.5,智能指数直接登顶 58,成了新的代理编码领导者。
白桦: 而且不只是跑分好看。价格比 Opus 5 便宜了大约 40%,同等任务的成本差不多是一半。对齐评分也有提升。
茉莉: 这个价格降幅一出,讨论区立刻分成了两派。一派认为这是真正的竞争红利,说 OpenAI 那边紧跟着发布 GPT-6 Sol 和 Luna,API 定价直接比 5.6 低了 50%,Sol 是每百万 token 两美元输入、十美元输出,Luna 更夸张,一毛钱输入、五毛钱输出。
白桦: 另一派的意见就比较冷静,有人指出这种降价节奏对上游算力供应商和下游应用开发者的影响完全不对称。应用开发者当然高兴,但也有人担心这种价格战不会持续,等市场格局稳定下来,价格会回弹。
茉莉: 还有一个数字值得留意,就是 Opus 5.5 那个一百万 token 的上下文窗口。有人讨论说,代理编码任务里真正费钱的是反复读代码库,上下文便宜了,整体成本才会真正降下来。
白桦: 有 commenter 提出了反例,说上下文大不等于用得好,便宜的 token 反而容易让人把无关的代码一股脑塞进去,结果输出质量下降,省下的钱又赔进去了。这是个挺有意思的张力点。
茉莉: 不过开源阵营今天也有大新闻。MiMo-V2.6-Pro 出来了,一兆参数、四十二 B 激活的 MoE 架构,MIT 许可证,智能指数 46,推理速度每秒 125 个 token。
白桦: 这个讨论就很有意思了。乐观派说 MIT 许可加上这个规模,开源终于追到闭源前沿的脚后跟了。悲观派直接把 46 和 58 摆在一起,说差距还是实打实的三个档位,尤其是代理编码这种任务,评分差距在实际工作流里会被放大。
茉莉: 也有人补充说,别只看智能指数,每秒 125 token 的速度对交互式代理场景很关键,本地部署或者自托管场景里,这个速度加上零 API 成本,账要另算。
白桦: 还有个没人能达成一致的问题:价格战会不会继续压下去,还是开源的存在本身就是为了给闭源定价设一个天花板?这期先留个悬念,因为这个问题的答案,其实取决于这些模型接下来被拿去做什么。
茉莉: 这就自然接到了下一块:代理和决策型 AI。先说一个特别戏剧性的演示。GPT-6 Astra 独立破解了 1941 年的一条 Enigma 密电,编号 MVUEH,这条电文从 2005 年以来就没人能复原。
白桦: 它用的是 crib ROSENOW,也就是已知明文攻击的思路,而且关键是,破解过程中用的那些工具,是模型自己写的。不是人在旁边喂步骤,是它自己搭了工具链然后跑通。
茉莉: 讨论区对这个的评价很有层次。惊叹派说这是经典密码分析推理能力的展示,不是暴力枚举,因为 Enigma 的密钥空间靠穷举早就该扫完了。质疑派则问,所谓“独立”到底怎么定义,模型是不是从训练数据里间接见过相关线索,毕竟 MVUEH 这条电文被公开讨论了快二十年。
白桦: 这就引出那个未解问题:这类成能不能规模化。一条二十年悬案和日常自动化工作之间,隔着的东西还很多。
茉莉: 规模化这条线正好有两个产品在试。第一个是 Unreal Agent,一个异步工具调用的代理 harness,对比 Codex 最多能省 40% 的调用成本,而输出质量不变。
白桦: 原理上的讨论挺热闹。同步调用的时候,代理每发一个工具请求就得干等结果回来,时间串行,token 也跟着串行。异步的话,可以同时发起多个独立的工具调用,等所有结果齐了再继续推理。
茉莉: 支持者举了 firsthand 的使用场景,说读多个文件、跑测试、查依赖版本,这些任务天然是并行的,异步化之后省的钱几乎白拿。反对者则说,一旦工具调用之间有依赖,异步的调度复杂度就上来了,出错重试的成本可能把省的 40% 吃回去一大半。
白桦: 质量不变的声称也有人存疑,说“质量不变”是怎么测的,是不是只挑了适合并行的任务做 benchmark。这个疑问没有得到回答。
茉莉: 第二个产品思路更怪,是 TypeSafe 的 Jev。它的核心想法是让模型输出“类型化的决策”——不是自由文本,而是结构化的选择、布尔值、评分,而且每个决策带校准过的概率。
白桦: 然后计费方式是按请求的 API key 收费,不是按 token。讨论区有人认为这是把模型当成传统软件的组件来用的正确方向,因为下游系统要的是决策不是散文,校准概率让你可以直接拿去做风控或者分流。
茉莉: 但马上有人泼冷水,说结构化输出早就不新鲜了,各家 API 都有 function calling 和 JSON 模式,Jev 的差异点只剩那个“校准”二字——校准说起来容易,真的在分布漂移的情况下还能保持校准,是另一个故事。
白桦: 而且这里有个竞争维度的讨论。Arcturus Labs 那边的分析说,OpenAI 现在的位置,完全有能力自己复制 Jev 这套想法然后直接集成进自家模型里。
茉莉: 那TypeSafe 的护城河是什么?分析给的答案是训练数据。也就是说,产品形态不是壁垒,壁垒是喂出那种“带校准概率的决策行为”的数据集。
白桦: 有 commenter 对这个判断表示认同,说大厂抄功能从来不是难事,难的是复现数据的积累过程。也有人反驳,说数据壁垒在模型能力快速通涨的环境下会快速贬值,今年是 moat,明年可能就不是了。这段争论没有结论,但方向很清楚:决策型模型是个值得盯的方向,赢家未定。
茉莉: 好,接下来这段可能会让写代码的人血压升高一点。WordPress 的 get_page_template 里出现了一个未认证的路径遍历漏洞,最坏情况下可以条件性达成远程代码执行,CVSS 打到 9.2。
白桦: 补丁的事也很值得说:官方一路把修复回溯到了 4.7。这个细节在讨论区被反复提起,因为这说明受影响的版本跨度极大,很多多年没升级的老站全都在射程之内。
茉莉: 评论里安全从业者的分析是说,路径遍历加上条件性 RCE 的组合最麻烦的地方在于,它不需要登录,攻击面就是公开可访问的端点。而 WordPress 全球装机量摆在那,哪怕只有一小部分站点满足触发条件,绝对数量也非常可观。
白桦: 有人反驳说“条件性 RCE”这个措辞应该被谨慎对待,因为条件满足率在实际部署里可能很低,9.2 分存在高估的可能。也有人回他,CVSS 本来就是按最坏情况打分的,这个分数没有问题。这是典型的两端拉扯,没有共识。
茉莉: 比 WordPress 更劲爆的是 ShinyHunters 的声称:他们借一个 PeopleSoft 的 zero-day 攻破了 FBI,拿到了全体员工的数据,规模大约 2 到 3 TB,顺手还把 FBI 的招聘网站给黑了——破面了。
白桦: 这里讨论区非常谨慎,几乎所有认真的 commenter 都在强调:这是攻击者的单方面声称,FBI 尚未证实,攻击者夸大战果是常态。所以大家都把重点放在 PeopleSoft 这个点上。
茉莉: 对,因为 PeopleSoft 是大型企业和政府机构都在用的 ERP 系统,如果真的有可被利用的 zero-day,而且已经被人拿到了 FBI 的部署,那么数量庞大的同类部署都该连夜排查。有 commenter 说,这类系统常年被认为在内网里、不直接暴露,但历史反复证明它们总有办法被摸到。
白桦: 未解的问题当然包括:这个 zero-day 细节会不会公开,受影响面到底多大,以及 ShinyHunters 拿到的 2 到 3 TB 数据会不会出现在泄露市场上。这些现在都只能等。
茉莉: 第三桩事故最黑色幽默。Meta 的 Muse 在执行文件系统归档请求的时候,把归档发到了 Google Drive,解压出来 6.8 GB,里面居然带着 SSH 密钥。
白桦: 用户按流程报了赏金,得到的判定是“Not Applicable”。这两个字的讨论热度比漏洞本身还高。
茉莉: 评论里分成很清楚的两边。一边说,SSH 密钥出现在第三方云存储的归档包里,这是教科书级的数据处理失误,“不适用”的判定暴露的是赏金评审流程的问题,而不是漏洞不存在的问题。
白桦: 另一边试图还原 Meta 的视角,说如果泄露的是用户自己的数据、且只发给了用户本人指定的目标,从赏金项目的范围定义上可能确实够不上。但这个辩护马上被反驳:SSH 密钥不是普通用户数据,它是访问凭证,归档里带凭证意味着归档路径本身就有问题。
茉莉: 我觉得这三桩事放一起,能看出一个共同模式。WordPress 是老代码的陈年问题,FBI 是企业级系统的供应链风险,Meta 是 AI 工具在执行文件操作时的越界。
白桦: 对,而且 Meta 那桩还有一层含义:现在 AI 系统越来越多地被授权去动文件系统,一旦它把“归档”理解成“发到云上”,凭证就跟着走了。这个类别以后只会更多。
茉莉: 说到这里,如果你听完这期开始不信任自己的网络环境,有一个工具可以了解一下,叫 Obscura。它是一个无日志设计理念的 VPN,采用两跳中继架构,出口用的是 Mullvad,而且给你一个随机的账号编号,不用真实身份绑定,每月 8 美元。
白桦: 双跳这个点在讨论里被解释过:入口知道你是谁但不知道你去哪,出口知道你去哪但不知道你是谁,两边拼不出完整的画像。这是和单跳 VPN 的核心区别。
茉莉: 好,网络之外,身份认证本身也在被重新审视。Trail of Bits 发了一篇很辛辣的东西,称 SAML 是“糟糕设计的分形”。
白桦: 分形,意思是放大到哪个尺度都是坏的。底层是 XML,签名机制是包裹式签名——这个组合在讨论区被吐槽了很多年,包裹签名的历史漏洞太多了,XML 解析的复杂性又不断制造新的攻击面。
茉莉: Trail of Bits 的建议很直接:迁移到 OIDC。支持者基本是拍手称快,说 OIDC 建立在 JSON 和现代 Web 语义上,实现难度和出错概率都低一个量级。
白桦: 反对的声音也很实在:SAML 在企业 SSO 世界里盘根错节,几十年积累的企业客户、老系统、身份提供商全都挂在上面,迁移的成本谁来承担?有 commenter 说,理论上的优越敌不过组织惰性,这话听起来悲观但很可能是现实。
茉莉: 身份的另一个场景是年龄验证。Discord 现在用账号信号来估算用户年龄,而且说超过九成的用户根本不会触发验证流程;真要验证的时候,也可以在不交身份证或自拍照的情况下完成。
白桦: 这个设计在讨论里被不少人称赞,因为传统年龄验证要求上传证件或人脸,隐私代价极大,而账号行为信号推断这个思路,把验证的触达面缩到了最小的那一撮人。
茉莉: 当然有质疑:信号推断的准确率怎么保证?误判会把成年人卡在门槛外,或者放进来真正的未成年人。还有人追问这些信号具体是什么——是注册历史、行为模式还是别的,官方没有细说,这也是讨论里最空的一块。
白桦: 手机侧还有个时间线预告:GrapheneOS 说 2027 年有很大概率能买到预装该系统的手机,但首发不会就有。支持预装路线的人认为,只有走到运营商和零售渠道,隐私手机才能真正出圈。
茉莉: 从 Discord 的年龄估算到 GrapheneOS 的预装,你会发现身份和认证这一整条链,从协议到平台到硬件,都在被重新设计。SAML 是旧世界,OIDC 是新世界,中间夹着无数迁移成本。
白桦: 而身份之外,开发工具和平台这一侧今天的消息也很多。先说最激进的一个:GeaStack,它把 TypeScript 直接编译成原生 C++,整个链路里没有 JS 引擎。
茉莉: 渲染走的是原生,但写界面还是用 CSS 和 JSX,也就是说开发体验保留,运行时全部换掉。最惊人的演示是它连 ESP32 都能跑——一块单片机。
白桦: 讨论区的争论焦点是“这算不算 TypeScript”。乐观派说,语言的灵魂在类型系统和语法,运行时可以换。反对派说,TS 生态的半条命在 npm 生态和运行时语义上,脱离了 V8 这套语义,你写的是“长得像 TS 的另一门语言”。
茉莉: 也有人务实地说,对嵌入式和性能敏感场景,能有一个带现代类型系统的语言跑在微控制器上,本身就是价值,争论它“是不是真 TS”有点学院派了。
白桦: 复刻老技术这条线上还有一个更情怀的项目:FoxScript,用 64 位的 Rust 和 wasm 运行时,把 2007 年就停止更新的 Visual FoxPro 9 复活了,支持超过 2 GB 的表,甚至 32 位的 .fll 库也支持。
茉莉: 这个在讨论区几乎是清一色的赞赏。有人分享自己维护的老系统还跑在 FoxPro 上,说这种“把垂死技术接进现代运行时”的做法,救的是无数没人敢动的关键业务系统。
白桦: 有 commenter 点出关键:FoxPro 用户群体当年是业务人员,不是程序员,那些系统是真实跑着的生产系统,不是博物馆展品。所以兼容到 .fll 这个级别是必要的,不是情怀。
茉莉: 工具侧还有个给开发环境用的:Drop,一个受 virtualenv 启发的 Linux rootless 沙箱,用 namespaces 实现,可以可选叠加 gVisor,每个环境的 home 目录是用完即弃的。
白桦: 讨论里有人拿它和容器对比,说容器的镜像管理越来越重,Drop 这种轻量、按需、临时化的思路,对“我想试一个包但不想污染系统”的场景是精准命中。gVisor 可选这个设计也被称赞,因为 gVisor 的开销不小,愿意给用户选择权是成熟的做法。
茉莉: 开发者的好消息不少,但坏消息集中在一家公司身上:苹果。iOS 现在加入了无法屏蔽的常驻“广告”,App Store 的搜索结果被全屏推广塞满。
白桦: 讨论区对“常驻、非屏蔽”这几个字的愤怒是压不住的。有人说,一台你花钱买的设备,操作系统层面给你塞不可关闭的推广,这在任何其他平台都会被称作流氓软件。
茉莉: macOS 27 更进一步:把关闭 Apple Intelligence 的开关直接删掉了。有开发者发现自己的“不启用”设置被无视,Apple Intelligence 相关组件占了 22.28 GB 的存储空间。
白桦: 那个 22.28 GB 的数字在讨论里被反复确认和讨论。有人说这个体积对一组模型文件来说不算意外,但问题不在体积,在于“用户说了不,系统还是装了”。
茉莉: 有人拿早年 Windows 的预装软件历史来类比,也有人为苹果辩护说模型文件是系统的一部分,类似缓存,将来有用。但反驳很锋利:如果它是系统的一部分,为什么要给开关,给了又删掉?删除开关这个动作本身就是答案。
白桦: 平台治理的讨论有个共同底色:从 iOS 的广告到 macOS 的开关,用户对自己设备的控制权在单向收缩。有人总结说,十年前我们讨论的是“哪个系统更尊重用户”,现在讨论的是“哪个系统掠夺得体面一点”。
茉莉: 最后这几条要轻一点,从数据渗入日常聊起。布里斯托大学有一项研究,统计了世界杯期间的直播,发现有害品牌展示超过了九万三千次,其中七成是不健康食品,大约四分之一的直播画面里都出现过。
白桦: 这个研究的方法论在讨论里被问到,就是“有害品牌展示”怎么界定和计数,但大家基本接受了这个量级,因为直播里啤酒、快餐、含糖饮料的广告密度,看过的都懂。有 commenter 说这本质上是监管滞后于媒体形态的问题,体育直播的受众结构决定了这类广告的争议会长期存在。
茉莉: 硬件趣闻一个:AMD 的硬件随机数发生器被发现一个 bug,在 16 位和 32 位的输出模式下,某种情形下永远不产生 0。同样条件下 Intel 的实现是正常的。
白桦: 这个 bug 的讨论很有味道,因为随机数发生器最基本的要求就是输出分布均匀,如果某些位模式下系统性缺失某个值,统计性质就破了。好在有人指出,实际密码学应用一般走的路径未必踩到这个模式,但任何把 RNG 输出直接用于统计或模拟的场景都得小心。评论也提醒大家,硬件 RNG 的信任链很长,这种“几乎不可能犯的低级错误”真的出现在硅里,说明验证流程值得审视。
茉莉: 文化彩蛋压轴:Bukowski,大约 1985 年的时候,写过一首关于 Intel 8088 芯片的诗。
白桦: 而且有意思的地方在于,这位以酒馆和失意人生闻名的诗人,在诗里对当时计算机的描写居然颇为准确。讨论区有人感慨,那个年代芯片已经进入了大众文化的想象力,连最不应该关心硅片的诗人都为它写了一首。
茉莉: 也有人说这正好呼应了前面的话题——从 8088 到被 AI 删掉开关的 macOS,个人计算的历史走了一个完整的循环,从“新事物被写进诗歌”到“基础设施被悄悄改写”。
白桦: 好,今天从模型的 price war 聊到一首芯片的诗,中间路过 FBI、Meta 和苹果的客厅。感谢大家听到这里,我是白桦。
茉莉: 我是茉莉,下期再见。