
0930 | 代码、算力与人情:本周科技快览
Show notes
本期节目围绕四条主线展开:AI 代理与模型的快速迭代及其争议;隐私与安全领域的新漏洞与执法案例;能源与基础设施的真实变革;以及开发者工具与日常软件的更新。最后再看几则关于阅读、健康与生活的有趣数据。
时间轴
- 00:00:04 开场
- 00:00:21 AI 代理与模型定价大战
- 00:02:57 模型质量争议:退化与刷量
- 00:05:41 隐私、追踪与灰色生意
- 00:08:22 漏洞、监控与平台掌控
- 00:12:14 能源与基础设施的真实变革
- 00:14:47 开发者工具与软件质量
- 00:18:40 数据、书籍与生活边缘
- 00:22:06 收尾
相关信息
- DevDay 2026 Recap
- Dots: Always-on agents
- GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price
- ChatGPT Pro 500
- Livenerf: Has Opus 5.5 been nerfed yet?
- Nicholas Polson has authored 258 academic papers in 2026 so far
- Jeeves. Reasoning improves Jev-like decision models
- A Privacy Analysis of Web and Mobile Conversational AI Agents [pdf]
- U.S. postal inspectors shut down website selling counterfeit postage labels
- DraftKings Is Using AI to Behaviorally Target Chronic Gamblers
- PS5 Relapse Exploit
- 500k facial scans at UK stations yield no arrests, 1 false positive
- Google ending ChromeOS support two years early
- US sanctions force The Netherlands off Microsoft and toward alternative NixOS
- Vermont replacing power plants with home batteries
- Backblaze drive stats for Q2 2026
- How Delhi cut electricity loss from 50 to 5 percent
- How our vibe coded website looks like a designer made it
- Show HN: NSL – WSL for Linux
- Using any C++ library in Godot
- Tcl/Tk 9.1
- macOS Golden Gate Is a Buggy Mess
- America.gov
- Show HN: Real-time Solar System with 526k asteroids and all tracked satellites
- Ask HN: What are you reading?
- Sustainable energy without the hot air (2008)
- 1 in 8 cancer cases worldwide are caused by infections, study finds
- Everybody’s home. No one’s coming over
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 大家好,欢迎回到节目,我是茉莉。
白桦: 我是白桦。今天我们照旧聊聊 Hacker News 上过去二十四小时的热议话题,从 AI 代理和模型定价的正面交锋,一路聊到隐私、安全、能源和我们的日常生活。
茉莉: 那就从头说起吧。OpenAI DevDay 这次一口气发布了二十多项内容,我自己最关注的就是 Dots 这种常驻代理。
白桦: 对,Dots 基于 GPT-6 Astra,自带一台云端计算机,还集成了四千多个应用,只面向 Pro 和 Business Premium 用户开放。评论区里讨论的焦点其实不是功能本身,而是它到底能多大程度替代人做日常事务。
茉莉: 有人兴奋,觉得这等于给每个订阅者配了一个随时在线的助理;也有人泼冷水,说这类常驻代理的实际可靠性还没有经过长时间检验,四千个应用的集成听起来多,但每个集成的质量参差不齐。
白桦: 这也是评论区里我觉得最中肯的一条疑虑:演示和日常可靠使用之间往往有很大差距,Dots 到底是玩具还是工具,得等几个月才能看出来。
茉莉: 定价那边的消息更有意思。GPT-6.1 Sol 号称有接近 Astra 的智能,但价格只要 Astra 的五分之一,每百万 token 输入两美元、输出十美元,而且它和 Astra 在 DeepSWE 上打平,还在 GDP.pdf 上胜过 Opus 5.5。
白桦: 评论区的反应分两派。一派认为这是价格战的开始,五分之一的价格就能拿到接近旗舰的性能,对开发者来说是实打实的好事,以后高智能不再是奢侈消费。另一派则提醒,基准打平不代表实际工作流里打平,很多任务的表现差异是基准测不出来的。
茉莉: 还有 Astra Ultrafast,以及 ChatGPT Pro 那边的变化:新增每月五百美元的 Pro 500 档,带 Ultrafast;Pro 200 回归但对新用户降低了使用额度。
白桦: 这就是我想重点说的分层问题。你看,现在从 Sol 的两美元、十美元,到 Pro 200,再到五百美元的 Pro 500,价格梯度越拉越长。评论里有人称之为"订阅阶梯军备竞赛",说 OpenAI 在赌总有一部分重度用户愿意为速度和额度付溢价。
茉莉: 也有不同意见,说分层本身没问题,问题是每一层的实际收益还说不清。Pro 200 回归但配额降低,这算回归还是缩水?评论里就有人直接问:花两百美元的用户,这一个月到底能多用多少?没有明确答案。
白桦: 对,这一点是悬而未决的。大家普遍同意定价在加剧分层,但用户端实际得到什么,评论区里没人敢打包票。
茉莉: 正好,这就引出下一个话题,其实就是对"这些模型到底好不好"的直接追问。有一个叫 livenerf 的每日基准,专门追踪 Claude Opus 5.5 在发布之后是否变差。
白桦: 这个项目我觉得设计得很聪明。它先跑十天的基线,第一次正式对比大约在 2026 年 10 月 24 日开始,之后每天跑,看发布后的模型和基线比有没有退化。
茉莉: 评论区的讨论其实分成两个层面。一是方法论层面:有人指出单日波动很大,需要看多日滑动趋势才可信,不然一天的网络抖动或者负载变化都可能被误读成"退化"。二是概念层面:大家一直在说的"模型发布后悄悄变差",到底是路由变了、量化变了,还是纯粹的心理作用?
白桦: 这正是 livenerf 想回答的。有意思的是,评论里几乎没人否认这个问题值得测,分歧在于怎么测才算公平,比如请求模式、提示词分布要不要固定,这些细节如果变了,数据就没可比性。
茉莉: 这个话题的另一面是刷量。统计学家 Nicholas Polson 在 2026 年有 258 篇论文,HN 上不少人怀疑有大量 AI 参与,而且他的名字倒着拼正好是 "noslop",这个梗在评论区传得很开。
白桦: 我得说,这个倒拼纯属巧合的乐趣,但讨论本身很严肃。有评论者说学术界本来就有一作挂名的灰色地带,AI 把这个空间放大了:一篇文章的边际成本降到接近零,署名的意义就变了。
茉莉: 但也有人反驳,说不能光看数量就下结论,得看论文本身的引用和实质贡献。还有人提出了更实际的问题:现在的评审体系根本没有办法区分"认真写的"和"批量生成的",这才是真正的难题。
白桦: 所以这里的未解之问是:AI 产能和质量,至今没有公认的度量方式。livenerf 在测退化,Polson 事件暴露的是产能无法界定,两件事其实是一体两面。
茉莉: 说得好。而 PostHog 的 Jeeves 给了第三种视角:它是一个 90 亿参数的推理分类器,在留出测试集上拿了 0.889,超过了 Jev 的 0.857 和 Kev-9B 的 0.822。
白桦: 这条帖子在评论里引发的讨论更技术向。有人说这说明小模型在垂直分类任务上完全可以打赢更大的通用模型;也有人提醒,这是留出测试集上的数字,真实分布上未必保持这个优势。但整体上大家认同:小模型的分类能力在实打实地进步。
茉莉: 好,从模型质量和数据度量,我们很自然地过渡到下一个话题,因为度量之外的另一个大问题就是:你的数据到底流向了哪里。
白桦: 是的。有一项研究发现,多家 AI 聊天服务商把对话标题、提示词、截图,甚至未受保护的永久链接,泄露给了追踪器,而且带着持久用户 ID。
茉莉: 评论区的第一反应基本都是震惊。有人当场就去检查了自己常用服务的链接结构,发现未保护的永久链接确实能被爬到。也有人指出,这个问题的根源在于产品把"分享对话"做得太方便,而安全设计没跟上。
白桦: 分歧点在于责任归属。一部分评论认为用户有责任,毕竟是你主动创建的链接;但更多人反驳说,持久用户 ID 和追踪器的组合意味着这不是用户能自己规避的,这是服务商的架构选择。还有一个重要观点:很多人用 AI 聊敏感话题,正是因为以为它私密,结果恰恰相反。
茉莉: 从线上的数据泄露,转到线下的灰色生意。USPS 的调查人员指控了一名巴基斯坦籍人士,他通过 LabelsBank.com 卖了大约 510 万张伪造邮资标签,每张 2 美元,给 USPS 造成的损失超过 1.26 亿美元。
白桦: 这个数字让评论区炸了锅。大家在算账:510 万张标签,说明这是有规模的产业链,不是零星个人行为。有人指出这暴露了邮资系统的验证漏洞,纸质标签的时代,验证成本高得离谱。
茉莉: 也有人提出了一个更扎心的问题:为什么假标签能生存这么久才被查?是因为检测体系本身有滞后,还是因为这种灰色地带长期以来被默许?帖子没有给出答案。
白桦: 而下面这条比假标签更让人不适。DraftKings 用 AI 分析用户的投注记录,专门识别那些"大概率会输钱"的赌徒,然后定向给他们推促销。
茉莉: 评论区的态度在这条上高度一致,但深度不一。EFF 呼吁禁止行为广告,这是表面。往深了看,有人指出这是 AI 应用最阴暗的一面:不是帮你做决定,而是利用数据找到你最弱的时刻,然后在你最弱的时候出牌。
白桦: 也有人试图提出另一种解释,说赌博行业一直都在做类似的事,AI 只是让精准度提高了几个数量级,问题从"有没有"变成了"精准到什么程度该被禁止"。这个界限在哪里,评论里没有人能给出答案。
茉莉: 好,从 AI 被用来放大人性弱点,我们接着看 AI 和安全之间的攻防,先从一个让破解圈狂欢的漏洞说起。
白桦: PS5 的内核漏洞 Relapse,覆盖固件 7.00 到 13.60,技术上利用的是 JSC 类型数组损坏加上 aio_multi_wait 的释放后使用,最终拿到内核读写权限。
茉莉: 评论区的氛围非常兴奋。有内核开发背景的人分析说,把 JavaScript 引擎的类型混淆和 aio 系统调用的 UAF 串成一条完整的利用链,这个工程量不小。破解社区的人更关心实际意义:这意味着这条固件范围内的机器都有希望跑自制软件。
白桦: 但也有人泼冷水,指出 exploit 一旦公开,索尼的下一版固件大概率会补上,所以窗口期有限。还有人在争论:这类漏洞公开到底是促进安全还是破坏安全?这个争论每年都会重新打一遍,这次也不例外。
茉莉: 从漏洞我们转到监控,这条读起来更让人唏嘘。伦敦某车站做了六个月的人脸识别试验,扫描了超过 50 万张人脸,花了 32 万英镑,用了 100 个警察小时,最终结果是一次误报,零逮捕。
白桦: 评论区的第一条反应基本都是算账。32 万英镑除以零次逮捕,单价是无穷大。有人说这是对"监控有效性"的一次实地打脸,毕竟花这么多钱扫了这么多人脸,连一个真目标都没抓到。
茉莉: 但也有少数不同声音,说试验本身可能目的就不是抓人,而是采集数据和磨合流程,一次失败不代表技术路线失败。不过大多数评论不买账,认为如果试验的公开目的就是抓捕,那它就是失败了。
白桦: 这里有个有意思的分歧:你怎么定义"成功"?效率指标还是能力建设指标?这个问题在评论区没有共识。
茉莉: 平台掌控层面还有两条大事。第一条:谷歌宣布将提前到 2034 年结束 ChromeOS 支持,比原计划早了两年,同时推动 Chromebook 转向 Googlebook OS,并且引入新的付费许可证。
白桦: 评论区对这条的反应普遍是警惕。有人指出,Chromebook 的卖点一直是便宜和长寿命,现在硬件还没坏,系统先被终结,用户被强制升级到需要付费许可的新系统,这等于改变了产品的整个价值承诺。
茉莉: 也有人在讨论这对教育市场的冲击,因为学校一直是 Chromebook 的大买家,硬件周期被人为缩短,预算压力会直接传导过去。但也有人认为,2034 年距离现在还有八年,会不会再变一次,谁也说不准。
白桦: 另一条更有地缘色彩:美国对国际刑事法院的制裁,促使荷兰开始用 NixOS 构建替代微软的生态,现在试运行中,第一版预计 2027 年底发布。
茉莉: 这条评论区的讨论相当深入。有人指出这是主权计算从口号变成行动的标志性事件:不是因为性能、不是因为价格,而是因为政治风险,一个国家决定自己掌握操作系统层面的控制权。
白桦: 也有人看好 NixOS 被选中的原因,可复现、可回滚,对于政府这种需要审计和验证的环境,确实是合理选择。但反对意见也很实在:替代微软不是说换一个发行版就完事,办公套件、协作工具、兼容性,这些才是真正的硬骨头。
茉莉: 这条和 ChromeOS 那条放在一起看很有意思:一个是平台主动收回控制权,一个是用户主动夺回控制权。方向相反,根源都是同一个——对平台依赖的不信任。
白桦: 说得好。从这里我们进入能源话题,因为基础设施层面还有一个更实在的变革正在发生。佛蒙特的 GMP 虚拟电厂,把 5500 多户家庭的电池汇成一张网,用户每月付 55 美元,签十年合约,现在它已经是全州最大的电源。
茉莉: 评论区对这条的反应是两方面的。一是惊讶:一个州的最大电源居然不是电厂,而是几万个家庭的电池聚合。二是算账:每月 55 美元,十年就是 6600 美元,用户等于把电池的使用权部分让渡给电网,换取固定收入。
白桦: 有人分析这个模式的核心在于把分散的闲置资源变成可调度的资产,这改写了传统"电源=大电厂"的结构。但也有评论问:极端天气下这 5500 块电池同时被调用,用户的家用储备够不够?这些问题帖子没有回答。
茉莉: 对,而且大家也在想这个模式能不能复制,因为佛蒙特是小州、用户密度和电网结构都有特殊性。这是评论里没有定论的另一个问题。
白桦: 存储的另一半在数据中心。Backblaze 2026 年第二季度分析了 354,415 块硬盘,整体年故障率 1.73%,同时宣布和 CoreWeave 达成多 EB 级存储协议。
茉莉: 这份报告是评论区的常客了,每季度都有人等它更新。有人指出 1.73% 这个数字的参考价值在于样本量巨大,可以看到不同型号随时间的故障曲线。也有人关注 CoreWeave 那笔协议,认为这是 Backblaze 从消费者备份业务向 AI 基础设施存储扩张的信号。
白桦: 从存储资产我们再跳到电网治理的极端反例,或者说正面案例。德里从 2002 年开始,把电网损耗从 50% 降到了 5%,靠的是更换老旧设备和治理窃电。
茉莉: 这条评论区很有意思,很多人拿它和佛蒙特的案例对照。一个是从 50% 的损耗里抢救资产,一个是把分布式资产聚合起来。结论在评论里出奇一致:好电网等于好资产加好治理,两条腿缺一不可。
白桦: 也有人指出,德里这个案例的意义在于它证明了损耗不是"发展中国家的宿命",而是治理问题。技术上是可复制的,难的是几十年如一日的执行。
茉莉: 好,从基础设施转到开发工具,因为好资产好治理的逻辑,在软件层面同样成立。先说一个轻松的:Railcode 的创始人用"氛围编程"的方式做了公司官网,结果有人问他是请的哪位设计师。
白桦: 这条帖子在评论区引发了一场关于"什么是设计"的讨论。主流观点是 HN 上那句:与 agent 反复迭代本身就是设计。也就是说,设计的核心不是画图,而是做决策、提要求、判断好坏,这些步骤并没有因为工具变了而消失。
茉莉: 但也有人不同意,认为说"迭代就是设计"是把设计贬值了,真正的好设计需要对版式、层级、用户体验有系统性的理解,AI 只是执行,不是判断。双方在这条上争得很认真。
白桦: 有意思的是,还有一批评论从实用角度切入:如果用户根本分不出是不是设计师做的,那这个区分还有意义吗?这其实是对整个设计行业的间接提问。
茉莉: 开发环境方面,NSL 这个项目用 systemd-vmspawn 在一个 VM 里跑多个 systemd-nspawn 容器,实现 WSL 风格的 Linux 机器,而且宿主机保持干净。
白桦: 评论区里最技术向的讨论是它和 distrobox 的对比。distrobox 会挂载 $HOME,方便但有污染宿主的风险;NSL 的方案是容器嵌在 VM 里,隔离更彻底。喜欢隔离的人觉得这才是正确方向,喜欢便利的人觉得多了一层 VM 性能和交互都打了折扣。
茉莉: 游戏引擎那边,Godot 通过 GDExtension 加 godot-cpp 10 加 Conan,可以接入任意 C 和 C++ 库,演示里用 flecs 模拟了 10 万个粒子。
白桦: 评论区的兴奋点在于工作流的解放:以前接入 C 库要自己折腾构建系统,现在 Conan 管依赖、godot-cpp 管绑定,开发者终于可以像在普通 C++ 项目里一样选库了。有人已经在设想物理、音频、网络这些领域的库会陆续被接进来。
茉莉: 老牌工具 Tcl/Tk 9.1.0 也在 9 月 29 日发布了,Tk 加入了屏幕阅读器无障碍和双向文本支持,Tcl 加入了 unicode、timer 和 lfilter。
白桦: 这条的评论气氛是怀旧加敬佩。有人感慨这个项目比很多年轻框架活得久,还在这版补上了无障碍这块现代软件的标配。也有人认为双向文本支持说明它还在认真服务全球用户,不是躺平吃老本。
茉莉: 不过说到软件质量,反例马上就来了。macOS 27 "Golden Gate" 本来定位是修 bug 的版本,结果 UI 崩坏一堆:图标错位、菜单栏崩溃、搜索失灵,还残留着 Tahoe 的内容。
白桦: 评论区的核心疑问就是:一个以稳定为主题的版本,为什么反而更不稳了?有人猜测是工程节奏问题,修 bug 的周期太短,旧问题没清完,新迭代又压上来了。也有人更悲观,认为这是大型软件组织的系统性问题,不是某一版的偶然。
茉莉: 正好这里可以接一个支持材料,白宫新上的 america.gov,单个页面 25MB,还过不了 WAVE 无障碍测试,而老的 usa.gov 还在,只有 800KB。
白桦: 有人拿这个和 macOS 对照,说这不是孤例,而是同一种现象:体量越大的组织,产出的数字产品反而越臃肿。也有评论指出 25MB 对无障碍的影响是实打实的,加载慢、屏幕阅读器跑不动,最受伤的是依赖辅助技术的用户。
茉莉: 好,从工具和质量的滑坡,我们进入今天的最后一组话题,数据和生活的边缘。
白桦: 先说一个让人想立刻打开的项目:space.bl2.net,在浏览器里以真实比例呈现太阳系,包含 526,000 颗小行星,数据来自 JPL SBDB,轨道用 CelesTrak 的 TLE 数据,SGP4 计算跑在 web worker 里,每天更新。
茉莉: 评论区的第一反应都是视觉冲击:真实比例下,行星几乎不可见,空旷感扑面而来。技术讨论也很活跃,有人说把 52 万颗小行星的轨道计算放进 web worker,这是浏览器性能边界的展示;也有人问,普通设备跑得动吗,还是会降级渲染。
白桦: 确实,这条和前面 PostHog 那条有个共通点:都是在证明"小体量的计算,放在正确的架构里,能做出以前不敢想的东西"。
茉莉: 阅读方面,HN 上有个求书帖,《Dungeon Crawler Carl》系列意外成了大热门,同时还推荐了《Seeing Like a State》《Normal Accidents》和《Infinite Jest》。
白桦: 评论区的书单本身就有意思:一本轻松的 LitRPG 和三本重量级的严肃著作出现在同一个帖子里。有人分析说,这说明读者要的不是"同类",而是"值得投入时间",标准是深度或快感,两者择一即可。
茉莉: 老书重评这条更有嚼头。MacKay 2008 年的《Sustainable Energy Without the Hot Air》至今免费在线,但评论指出它有"一次能源谬误"的问题,而且 2008 年的太阳能和风电价格数据早已过时。
白桦: 评论区的态度很成熟:没有人因为数据过时就否定这本书,大家普遍认为它教的是思考能源问题的方式——把一切都换算成同一个单位,然后诚实地做算术。方法没过时,数字过时了。
茉莉: 健康数据方面,《柳叶刀·肿瘤学》的研究显示,2024 年感染导致了 230 万癌症新发病例,约占全部新病例的 12%,其中幽门螺杆菌和 HPV 是头号因素。
白桦: 评论区的重点在预防潜力上。有人指出,这两个主要病因都有成熟的干预手段:幽门螺杆菌可以筛查和治疗,HPV 有疫苗。也就是说,这 12% 里有相当一部分,理论上是可以从源头减少的。
茉莉: 也有人补充,说这研究的意义在于把感染和癌症之间的因果链条摆到了公共卫生政策的桌面上,接下来就看各国怎么把筛查和疫苗覆盖做起来了。
白桦: 最后一个数据,也是今天最让我心里一沉的:美国人每月招待亲友的比例,从 1975 年的 42% 跌到了 2026 年的 12%,五十年间下降了七成。
茉莉: 这条评论区的讨论特别安静,也特别真诚。有人把它和今天聊的所有科技话题串起来:我们造出了虚拟电厂、常驻代理、真实比例的太阳系,但招待朋友这件事,五十年里跌了七成。
白桦: 也有人提醒别急着归因,说原因可能是居住形态变了、工作更长了、社交搬到了线上,单一解释都太简单。但没有人否认趋势本身。这条帖子下面,很少有人开玩笑。
茉莉: 是的。今天我们聊了很多,AI 定价和代理、模型退化的实测、隐私泄露和灰色生意、漏洞与监控、能源与治理、工具与质量,最后回到人和人之间的距离。
白桦: 如果说有一条线串起来,那就是:技术在全速前进,但怎么度量它、约束它、让它服务于人,这些问题每一条都还悬着。
茉莉: 感谢收听,我们下期再见。
白桦: 再见。