
0924 | 快得看不见的成本:一周科技速览
Show notes
从 Anthropic 的极速优化到 Radicle 的安全漏洞,本期节目梳理 AI 速度与成本的跃进、开发者工具与基础架构的新变化、安全与隐私方面的麻烦,以及硬件与能源领域的大动作。
时间轴
- 00:00:04 开场
- 00:00:28 AI 跑得更快、用得更便宜
- 00:08:07 开发者的工具链与信任边界
- 00:11:58 当厂商辜负信任:漏洞、事故与骚扰
- 00:17:39 硬件与能源的大注
- 00:20:10 收尾
相关信息
- Once Claude can measure something, it can make it faster
- Tokens too cheap to meter
- Jev in 25 Lines of Python
- Gemini 3.8 text-to-speech
- Stripe's Knowledge AI Platform
- Claude discovers a novel enzyme system with CRISPR-like repeats
- GPT-6 Astra has gained the ability to drive a car
- VSCode's SSH Agent Is Bananas (2025)
- The GitHub wiki is an anti-pattern (2022)
- Claude Code reads AGENTS.md only when telemetry is on [fixed]
- Radicle: Disclosure of Vulnerability in the Network Protocol
- Samsung accidentally freezes its smart fridges with a software update
- Grammarly will send unhinged messages to all your users if you try to cancel
- Seattle City Council votes to ban surveillance pricing in sale of groceries
- I don't want the details
- Meta VR Glasses
- Italian parliament votes for return to nuclear energy
- Fixing the Portobello Police Station Clock
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 大家好,欢迎收听今天的 Hacker News 播客,我是茉莉。
白桦: 我是白桦。今天的故事从一条很有意思的线索串起来:AI 变快了、变便宜了,然后它开始被塞进各种工具和产品里,接着问题来了——我们到底该不该信任这些工具和厂商?最后再看看硬件和能源上的两笔大注。
茉莉: 对,今天聊的都是过去二十四小时讨论区里吵得最凶的东西。咱们先从最快的那件事说起:Anthropic 在两周之内,把 claude.ai 的速度整整提到了三倍。
白桦: 这组数字值得慢慢念。他们网页加载的 p75,也就是第七十五百分位的加载时间,从 3.1 秒降到了 0.55 秒。而且这不是靠什么单点奇迹,是大约三千项改动,在整个过程中零事故。
茉莉: 三千项改动、零事故,评论区里第一波反应就是不信。有人说,两周三千项,平均下来每天两百多项,这已经不像是"优化",更像是把"让产品变快"当成了唯一的组织目标。你如果给工程师说今年要做十个项目,什么都快不了;但如果整个团队唯一的口号就是快,那数字是可以做出来的。
白桦: 这正是讨论里最有分量的那条评论的观点:速度不是性能优化的问题,是优先级的问题。说这话的人认为,大部分网站慢不是因为技术难,而是因为没人真正在乎。Anthropic 这次等于做了个示范——当你把速度当成头等大事,p75 从三秒到半秒是可实现的。
茉莉: 但反方也很多。有人质疑,零事故的统计口径是什么?三千项里有多少是改一行 CSS 这种级别的?还有人说,p75 这个指标本身可以"美化"——你只要把大多数请求做得很快,最慢的那 25% 藏着什么问题根本看不见。真正的痛点用户可能在 p99 里,而 p99 可能一点都没改善。
白桦: 也有比较中肯的声音说,别管口径,0.55 秒就是用户能感知的差别。一个网页加载从三秒变半秒,你不用看任何指标都能感觉到。而且他们敢于公开说"两周、三千项、零事故",这种透明度本身就有信息量——如果数字是编的,很快会被人拆穿。
茉莉: 一线工程师的经验分享也挺有价值的。有人复述了这类"速度冲刺"的常见套路:先把所有阻塞资源找出来,把关键路径上每个请求都审一遍,前端切包、缓存策略、服务端渲染边界,全都是琐碎但确定的活儿。三千项听着吓人,拆开看可能八成是这种小改动,剩下两成才是硬骨头。
白桦: 所以这块比较扎实的结论是:速度是体验的一部分,而且是可以靠组织意愿换来的。至于 Anthropic 的具体方法还有哪些没披露,那是悬而未决的问题。
茉莉: 那从"快"顺下来,就是"便宜"。2025 年有个更宏观数字:LLM 每个任务的成本降了两个数量级。有人直接说,token 已经"便宜到不值得计量"了。
白桦: 这条讨论的分歧特别典型。一边的人说,这是历史上少见的成本曲线——两年前大家还在为 API 账单心疼,现在一项任务的推理成本已经低到你在报表里都不好意思单列一行。这意味着过去因为成本做不了的玩法,比如给每个用户每次请求都挂上一个大模型、全天候跑后台任务,现在都成立了。
茉莉: 另一边的人泼冷水说,成本降是降了,但你用的 token 量涨得更快。这跟杰文斯悖论一个道理:单位成本跌两个数量级,总开销可能一分没少,因为大家自动把任务规模放大两个数量级以上。还有做工程的人说,真正贵的从来不是推理 token,是围绕模型的工程——评估、监控、回滚、上下文管理,这些人力成本一点没降。
白桦: 里面有个特别好玩的支持性案例,值得念一下:有人搞了个恶搞项目,号称用二十五行 Python 重建了某个复杂的 AI 产品,核心就是一个本地跑的 Qwen3-0.6B 小模型,靠 logits 做分类。当然这个"重建"是故意抬杠式的——它没有延迟对比,没有错误率数据,也没有算力成本的比较,就是个玩笑。
茉莉: 但这个玩笑在评论区引发了认真的争论。一部分人觉得这种帖子是健康的提醒:很多 AI 产品的核心其实可以用极小的模型加一点工程搞定,大家被营销唬住了。另一部分人反驳说,这种"二十五行搞定"的帖子之所以能传播,恰恰是因为它省略了所有难的部分——边界情况、可靠性、规模,这些才是产品成本所在。
白桦: 这跟成本话题正好接上:如果小模型加二十五行代码真的够用,那成本曲线还会更陡地往下掉。所以这个玩笑其实戳中了一个真问题。
茉莉: 接下来看各家怎么把便宜的算力变成产品,讨论区里正好有几个样本。一个是 Google 发布了 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,语音可以用 prompt 定制,还支持声音克隆——但要 consent,就是本人同意,而且输出带水印。
白桦: 声音克隆这个点的评论挺一致的:同意加水印和同意门槛是对的方向,但大家都清楚,一旦模型权重或能力泄露,这些保护在开源复刻面前是挡不住的。所以问题是,商业产品的护栏能撑多久?
茉莉: 另一个样本是 Stripe 推出的 Knowledge AI Platform,定位很明确:给非技术岗的人配 AI 代理,接了一千多个内部工具。评论区的反应是分层的。有人觉得这是正确的方向——AI 的下一个阶段就是让不懂技术的人也能调度公司的整套系统。也有在类似岗位的人说,实际难点不在接多少工具,而在权限模型:你敢让一个代理替财务人员操作支付系统吗?出错了谁兜底?
白桦: 还有研究进展的样本:Claude 参与发现了一套新的酶系统,代号 ART。核心是噬菌体的 RT 蛋白,带类似 CRISPR 的 DNA 重复序列。整个过程用了大约九百五十个 AI 代理,跑了二十一小时。
茉莉: 讨论里科学家和怀疑者的交锋挺有意思。做生物的人说,这种"计算筛出来的候选"历史上不少最后验证不了,二十一小时产出结果听上去太顺滑。但也有人反驳,重点不是这个具体发现对不对,而是"多代理自动跑科学工作流"这个模式能不能规模化——如果可以,那就是科研方式的改变,单个结果真伪反而是细节。
白桦: AI 还开始碰真实世界了。DrivingBench 是个自动驾驶基准,最扎眼的数字是:GPT-6 Astra 驾驶一辆真实的丰田车,百分之百完成了赛道,用时五分二十二秒。而 Claude Fable 5.1 只完成了百分之四十五。
茉莉: 这个讨论吵得非常凶。一派人说,真实车辆、真实赛道、百分之百完成,这是里程碑级别的事件,别管什么基准的毛病。另一派立刻指出基准本身的局限:赛道驾驶跟开放道路完全是两回事,赛道有明确的边界和单一路径,而真实驾驶的难点是不可预期的其他交通参与者。还有人说,两个模型差距这么大,反而说明基准测的可能不是"驾驶能力",而是对某种特定任务格式的适应能力。
白桦: 悬而未决的就是:从封闭赛道到街上那辆车,中间还差多远?没人能给个可信的答案。
茉莉: 说到这里,正好从"AI 被装进工具"过渡到一个更尖锐的话题:开发者的工具链,以及我们的信任边界在哪里。
白桦: 先说 Fly.io 那篇关于 VSCode Remote-SSH 的文章。他们的核心警告是:这个协议允许远程主机在本地机器上执行代码、编辑文件。也就是说,你连上一台远程开发机,那台机器实际上拿到了在你笔记本上跑东西的能力。
茉莉: 评论区分两派。一派说,这不是漏洞,这是功能——Remote-SSH 的前提就是你信任那台远程机,就像你信任你装的任何插件一样,警告这个等于警告"SSH 是双向的"。有人还补充,这正是这套工具好用的原因:本地编辑器体验加上远端算力,这种双向能力是设计出来的。
白桦: 另一派说,功能归功能,但多数用户根本没有意识到这条信任边界在哪里。很多人以为自己是"在远程工作",没有意识到其实是"远程在自己这里工作"。Fly.io 作为一个经常帮人跑远程开发环境的公司,把这个写出来,是有价值的提醒。讨论里没吵出结论,但大家基本同意:默认行为的隐含假设应该写在明面上。
茉莉: 工具的默认行为还引出了另一个讨论:GitHub 的 wiki 被直接称为反模式。观点很明确——应该放弃 wiki,把文档放进代码库的 /docs 目录,走代码评审,再配 GitHub Pages 发布。
白桦: 支持的人理由很实在:wiki 没有评审、没有版本控制的纪律,谁都能改,结果就是文档慢慢烂掉,而且和代码脱节。放进仓库里,改代码和改文档出现在同一个 PR 里,评审的人会看到,文档就跟着代码活着。这是最常见的真实经验分享:wiki 死掉的项目比比皆是。
茉莉: 反对的声音也有。有人说,wiki 的受众本来就不是开发者——产品经理、外部协作者,他们不会提 PR。把文档流程开发者化,等于把非开发者挡在门外。还有人提到权限和发现性的问题。不过多数人最后落到一个折中:核心技术文档进 /docs,面向非开发者的说明另找地方。
白桦: 然后是一个把"默认行为"和"信任"绑得最紧的案例:Claude Code 只在遥测开启时才读取 AGENTS.md。
茉莉: 这个细节很重要——AGENTS.md 的加载,取决于一个远程的 feature flag。遥测关掉,这个功能就静默失效,而且没有任何提示。用户不会收到"AGENTS.md 没被读取"的通知,就是发现配置"有时生效有时不生效"。
白桦: 评论区对这件事的反应是它把两个问题叠加了。第一是可靠性:一个功能的行为取决于远程开关,那你的本地环境就不是确定的,调试起来是噩梦。第二是隐私:想让工具按你自己的配置工作,居然要先交出遥测数据,这是一种隐性的交换。讨论里有人明确说,这是"用遥测换功能"的商业模式写进了工具的运行时。
茉莉: 社区也找到了绕过办法:在 CLAUDE.md 里写一行 @AGENTS.md,引用进来,绕开那个 flag。但很多评论者说,workaround 的存在恰恰说明问题——你需要一个社区口口相传的小技巧,才能让一个标准格式的配置文件被正常读取。
白桦: 工具的默认行为、文档放哪里、配置读取依赖远程开关,这些都指向同一个词:信任。那接下来就看看,当厂商辜负这种信任时会发生什么。
茉莉: 先说最严重的:Radicle 被发现了一个漏洞——它的流量既不加密,也不认证。也就是说,理论上中间人可以窥视甚至篡改。官方的建议是在补丁出来之前,不要使用私有仓库。
白桦: 讨论区的震动主要来自 Radicle 的定位。它一直是作为"抗审查、点对点"的 GitHub 替代品被推广的,安全是它整个故事的卖点。所以当"没加密没认证"这种基础层的问题被爆出来,评论分成了几派。
茉莉: 一派说,这暴露了点对点协议的一个普遍难题:P2P 架构里"认证"比中心化系统难得多,因为没有一个权威服务器来担保身份。另一派反驳,不管架构多难,私有仓库的流量不加密不可原谅,这是 2025 年,不是 1995 年。还有人分享经验说,这类项目的安全审计往往滞后于功能开发,P2P 项目尤其如此。
白桦: 实际建议这块共识倒是有的:补丁前别用私有仓库,公开仓库的风险敞口不同,可以自行权衡。真正的悬案是:这个漏洞存在了多久?有没有被利用的迹象?官方披露里没有给出让人安心的答案。
茉莉: 同样是厂商责任,Samsung 这次的事故就有点哭笑不得。他们在韩国暂停了一次 SmartThings 更新,因为更新推送之后,大量智能冰箱直接死机。而且事故发生是在测试阶段,测试期间冰箱坏了,里面的食物都糟蹋了。
白桦: 这个讨论的评论角度很刁。有人说,智能家电最大的风险从来不是隐私,而是"你的冰箱突然变砖"。传统冰箱坏了就是坏了,智能冰箱坏了,是厂商一个坏更新让全国几十万台同时坏掉——这是单点故障,而且是你控制不了的单点。
茉莉: 关于食物损失那一part,讨论很认真:有人问,测试期间因厂商更新导致的损失,谁赔?多数意见是现实里基本没人会去索赔,但这恰恰说明智能家电的责任边界是空白的——厂商测试你的设备,设备坏了食物坏了,你连一个清晰的责任框架都没有。
白桦: 还有人提出更根本的问题:家电需不需要 OTA 更新这种模式?支持的人说,安全补丁需要它;反对的人说,那就把"功能更新"和"安全补丁"分开,后者谨慎灰度,前者干脆别推。目前 Samsung 暂停推送算是止血,但深层问题没有答案。
茉莉: 如果说 Samsung 至少是技术事故,Grammarly 这次就是纯粹的激进商业行为了。有企业取消订阅之后,Grammarly 向该公司的所有持照用户群发未经请求的邮件和弹窗,内容是用来向用户施压、让他们推动公司续约的。
白桦: 评论区的愤怒非常一致,但分析有层次。第一层:发给企业用户的个人邮箱,搞这种内部游说,是对企业客户关系的公然破坏——采购和 IT 部门看到这一幕,以后签约前都会想想这个 vendor 闹翻时会干什么。
茉莉: 第二层更有意思:这可能是故意的。有人从厂商视角分析,员工请愿有时候真能逆转取消决定,尤其是那些员工重度依赖的工具。所以这不只是恼人的邮件,可能是一种被验证过 ROI 的策略。当然,反驳者也说,短期救一单,长期毁掉的是"取消我们很安全"这个信誉,净效果很可能是负的。
白桦: 还有人拿数据和法律的棱镜看这件事:企业客户的环境里,向个人用户直接发营销和施压信息,涉及通信许可和数据使用的边界。具体有没有违法没有定论,但讨论普遍认为至少是"合法但自杀式"的灰色操作。
茉莉: 这些案例连起来,其实都在问同一个问题:厂商对用户数据和设备,责任边界画在哪?正好讨论区还有两个相关的延伸。一个是隐私监管直接出手了:西雅图通过禁令,禁止在食品零售里搞"监控定价"——就是那种根据你的个人数据、购物历史,对不同人显示不同价格的做法。
白桦: 支持的人说这是针对大数据歧视性定价的第一批实质性立法之一;反对者担心禁令会误伤正常的会员折扣体系,"个性化优惠"和"监控定价"的界线怎么划,是执行层面最大的未知数。
茉莉: 另一个是事故复盘的方法论,我觉得和今天所有的事故案例都呼应:事后复盘时,不要问"为什么会发生",要问"我们改变了什么"。
白桦: 这句话的论证很精彩:因为任何事故都能事后找出一条"看起来合理"的解释链——每一步在当时都情有可原,复盘会得出"谁都没做错"的结论,然后什么也不改。但如果复盘只回答"我们以后改变什么",那就强迫讨论落到具体的、可执行的变更上,解释得再合理也没用。
茉莉: 反对的声音主要担心矫枉过正:不了解根因就改东西,可能改错方向,甚至引入新问题。但支持者说,这不是让你放弃调查,而是把复盘的输出强制绑定到变更上。这条讨论没有形成结论,但它给我们今天聊的 Radicle、Samsung、Grammarly 都提供了一个收尾视角:事故之后,衡量一家厂商的不是事故本身,是他们改变了什么。
白桦: 说到改变和承诺,我们进入下一个话题:硬件和能源上的两笔大注,都是"承诺很诱人,成本是问题"。
茉莉: 先说 Meta 的 VR 眼镜。定于 2027 年春天上市,定价 1299 美元,最亮眼的规格是重量——只有一百克,用的是镁合金。
白桦: 一百克这个数字在评论区引起最大反响。做过头戴设备的人出来解释:头显能不能戴得住,重量和重心分布比分辨率重要得多。很多头显不是画质不行,是戴二十分钟脖子受不了。如果一百克是真的,佩戴体验会完全不同档。而且镁合金这个选择也有讲究——够轻、够硬、导热好,但加工难、成本高,说明 Meta 真的把轻量化当成了核心目标。
茉莉: 但 1299 美元的定价让另一派直接摇头。他们说,VR 市场的历史就是"下一代硬件救不了上一代的生态",Quest 系列靠低价才勉强撑起用户基数,现在反过来走高端路线,等于是把赌注押在一百克的舒适度足以创造一个新市场。有没有内容、有没有杀手级应用,这些都没披露。所以这项发布更像是一个宣言:我们还在做 VR,而且做到最轻。市场买不买账,2027 年见。
白桦: 从消费硬件的大赌注换到国家层面的大赌注:意大利议会投票支持重返核电。
茉莉: 这里的分歧特别真实。支持重启的人说,能源安全和技术主权的理由够充分了,意大利当年全民公投废核,现在风向变了,重启是补课。但反方的账算得很细:面对越来越便宜的太阳能,新建核电站的经济性是一个大问号——核电的致命伤是建造周期长、超支常态化,等你电站建成那天,光伏加储能可能已经便宜到你的电价没有任何竞争力。
白桦: 评论里没有形成共识,但提出了几个好的待解问题:意大利的具体规划是什么?是新建大型机组还是押注 SMR 小堆?融资谁来担保?这些问题目前都没有答案,投票只是表达了政治意愿,落地还是另一回事。
茉莉: 讨论里还有个温和的提醒:能源决策的周期是几十年,而太阳能的成本曲线的周期是几年,这种时间尺度错配才是核电经济性争论的本质。
白桦: 好,沉重的都聊完了,收尾来个轻松的复古硬件故事。波特贝罗警察局有一台 1877 年的钟,最近被修好了。
茉莉: 这个故事的细节太讨人喜欢了:修的人保留了原始的机械机芯,但在外面加了一个盒子,里面是 PIC 16F628 单片机加电机,用来自动上弦。也就是说,这台钟今天还在走,机芯是十九世纪的,上弦是二十世纪芯片干的活儿。
白桦: 评论区简直是复古计算爱好者的团建。大家欣赏的核心是这个"混合方案"的品味:没有为了自动化把机械结构改掉,而是把现代电子当成一个谦逊的外挂,尊重原物件的历史完整性。搞嵌入式的人还补了一句,PIC 16F628 是那种几十年不会坏、引脚少到不可能写错的老将,选它做这种"一百年不维护"的活儿,是对的。
茉莉: 你看,这个收尾和我们今天聊的什么都连得上:Samsung 的冰箱因为一次 OTA 更新集体死机,而这台 1877 年的钟,用一个最简单可靠的芯片,解决一个最古老的问题,还能再走一百五十年。
白桦: 技术的信任,有时候不在于多新,而在于改动了什么、留下了什么。今天的播客就到这里,感谢收听,我是白桦。
茉莉: 我是茉莉,我们下期见。