
0815 | AI安全悖论、Firefox坚守uBlock、GLM-5.3与谷歌同态加密:本周技术风云
Show notes
本期节目围绕 Hacker News 上的多篇热门帖子展开。开篇从密码学家 Matthew Green 的文章出发,探讨“变暗”议题:AI 可能让软件“过于安全”,执法与情报部门被迫转向黑客手段,由此引出关于自托管、开放权重模型与漏洞将尽的大讨论。随后谈到谷歌用同态加密(HEIR 编译器工具链)推进私有 AI 推理,但评论区对“是否需要信任谷歌”依然存疑。接着是浏览器话题:微软 Edge 跟进 Manifest V3,使 Firefox 成为最后一个仍支持 uBlock Origin 的主流浏览器。节目还分享了一位用户把 RSS 订阅变成 e-ink 报纸、以摆脱手机阅读的实践。AI 模型部分覆盖了发布“涌现网络攻防能力”的开源模型 GLM-5.3、面向消费级硬件的 Qwen 3.8 27B、DeepSeek 峰谷定价引发的涨价争议,以及对“为什么 Opus 5 用起来反而更差”的剖析。此外还讨论了软件与数字内容的“TEMU 化”假设、对超大型 PR 的反感与 CI 尺寸门禁、自研游戏引擎的价值,以及法国宪法委员会叫停 15 岁以下未成年人社交媒体禁令等话题。最后以澳大利亚家庭电池热潮
时间轴
- 00:00:00 开场
- 00:00:42 “变暗”时代:加密辩论转向执法黑客
- 00:04:01 谷歌同态加密让私有 AI 实用?评论区不买账
- 00:06:49 Firefox 成为最后仍支持 uBlock Origin 的主流浏览器
- 00:10:04 把 RSS 变成 e-ink 报纸,戒掉手机阅读
- 00:13:01 GLM-5.3:自带“涌现网络攻防能力”的前沿开源模型
- 00:15:02 Qwen 3.8 27B:瞄准消费级硬件的开放权重模型
- 00:17:25 DeepSeek 峰谷定价更新,实为大幅涨价
- 00:19:38 为什么 Opus 5 用起来反而更差?
- 00:22:05 软件、数字商品与服务的“TEMU 化”
- 00:26:32 别再发巨大的 PR:CI 尺寸门禁之争
- 00:29:52 自研游戏引擎:Soup Raiders 的“原生”之得
- 00:33:21 法国最高法院叫停 15 岁以下社交媒体禁令
- 00:36:58 澳大利亚家庭电池热潮压低批发电价
- 00:39:46 印尼 7.7 级地震:今年大地震真的更多吗?
相关信息
- Going Dark, and the era of law enforcement hacking - Bri Hacker News Campaign Feed
- Google is making private AI practical with homomorphic encryption - Bri Hacker News Campaign Feed
- Firefox is now the last major browser that still supports uBlock Origin - Bri Hacker News Campaign Feed
- I turned my RSS feeds into an e-ink newspaper to stop reading on my phone - Bri Hacker News Campaign Feed
- GLM-5.3: Frontier coding with emergent cyber capabilities - Bri Hacker News Campaign Feed
- Qwen 3.8 27B - Bri Hacker News Campaign Feed
- DeepSeek peak/off-peak pricing update - Bri Hacker News Campaign Feed
- Why does Opus 5 feel worse to work with? - Bri Hacker News Campaign Feed
- The TEMU-Fication of Software, Digital Goods and Services - Bri Hacker News Campaign Feed
- Stop sending me huge PRs; a rant - Bri Hacker News Campaign Feed
- Soup Raiders goes native: What you gain by building your own game engine - Bri Hacker News Campaign Feed
- France's top court blocks social media ban for under-15s - Bri Hacker News Campaign Feed
- In Australia, a home battery boom has helped cut wholesale power prices - Bri Hacker News Campaign Feed
- Magnitude 7.7 Earthquake – 68 km NNW of Ende, Indonesia - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
林岚: 欢迎收听《HackerNews每日沙龙》,我是林岚,今天和我一起的是陈序。
陈序: 大家好,我是陈序。今天这期有不少跟AI相关的话题,也有几件和软件生态、政策相关的新闻。
林岚: 没错。比如一位密码学家担心AI可能让软件变得过于安全,Google也在尝试让私有AI变得实用;火狐浏览器成了某个广告拦截插件的最后坚守者,手机厂商和开发圈也有了新动静。
陈序: 另外还有新模型发布、深度求索的定价调整,甚至有人把AI和购物平台的效应联想到了一起。咱们慢慢聊起来。
陈序: 约翰霍普金斯大学的密码学家 Matthew Green 在巴尔的摩参加完一场安全会议之后发文,标题是《一切即将“变暗”》。他担心的和我们平时听到的相反:不是软件不够安全,而是 AI 可能让软件“过于安全”,导致美国的情报和执法机构失去很大一部分能力,也就是行业里常说的 going dark。他回顾了一遍这条历史线:2010 年苹果开始用用户密码生成的密钥加密 iPhone 数据,谷歌随后跟进;2011 年苹果部署了端到端加密的短信;到了 2014 年,WhatsApp 有 6 亿用户、2016 年接近 10 亿,全部走端到端加密。2014 年 FBI 局长宣布了“变暗”倡议,2016 年一次恐怖袭击之后,FBI 拿到了枪手上锁的 iPhone,命令苹果提供访问权限,苹果拒绝,后来是一家外部公司声称做到了。
林岚: 围绕这篇文章的讨论里,主要方向是自托管。有人觉得这是“自己掌控所用软件”的最强论据;也有人补充说,要自托管就得包括 AI 代理,因为模型本身也有问题——美国的人工智能实验室很可能会面临让模型协助执法的压力,比如在生成的代码里植入后门,或者不报告某些可利用的漏洞。代理自己会成为基础设施里的潜在威胁,而且这当然不止美国,只是最大的 AI 提供商都在美国。还有人说,自托管加开放权重模型,正是 OpenAI 和 Anthropic 不想让你拥有的东西。
陈序: 也有人已经这么做了:用隐私优先提供商的开放权重模型,但代理对数据以及一定程度上的账户的访问权限,已经让他不愿意把东西外发。他希望接近某个高级模型水平的模型,不久后能跑在自己拥有的、大约五千美元以内的硬件上。不过也有人反问:这种情况下自托管到底能帮上多大忙。另一个被热议的判断是“漏洞会耗尽”——文章说未来两年内主要软件很可能用完远程可利用的漏洞,有人觉得这结论听起来极其乐观;也有人认为远程可利用的缺陷会减少一到两个数量级,机器几乎能找出所有先验可知的漏洞,黑客的眼光可能转向探测系统与系统之系统。
林岚: 还有人把这件事归结为一句话:前 AI 时代,优势属于预算最大、能雇到最好安全工程师的实体;后 AI 时代,优势属于推理预算最大的实体。至于“正确的选择”是什么、这个“我们”又是谁,有人追问说决策其实多半由公司和政府做出。有人主张正确选择是美国政府学会和“人人手里的远程安全设备”共存,不立法强制后门,执法和情报就只能依赖元数据、公开信息、受搜查令约束的服务商,以及物理邻近监视。但马上有人回应:我也希望政府不给自己设备开后门,可政府反正会这么做,那该怎么办。最直接的反问反而是:我该担心美国政府和以色列黑不进所有人的手机吗?
陈序: 谷歌官方博客宣布,用同态加密让私有 AI 变得实用。核心是一套开源的编译器工具链,叫 HEIR,是谷歌 Private Computing Toolkit 的最新组件,能把预训练好的 AI 模型转换成对加密输入直接运算的形式,实现密码学意义上安全的私有 AI 推理。博文特别强调,和基于硬件的方案不同,同态加密的安全与隐私保证是纯密码学的;成本开销仍然“非同小可”,但正在快速下降。项目的愿景,是让 HEIR 成为非专家也能一键把加密推理放进生产应用的方案。
林岚: 他们列了四个演示应用:和几家外部公司以及纽约大学合作的深度学习推荐模型、信用卡欺诈检测、网络流量异常检测,还有热词检测。要注意的是,所有示例的延迟数据都来自单线程的 CPU,源码已经公开在 GitHub。合作方还包括硬件加速器公司和多所高校,目前已经有四篇基于 HEIR 的同行评审论文。下一步的信号是,谷歌计划在近期展示这些加速器带来的延迟收益。
陈序: HN 上的讨论绕不开一个问题:这还需要信任谷歌吗。一条评论说,无论加不加密,数据在别人的服务器上就不是你的,何况我也不信任谷歌;另一条回应说,FHE 的初衷恰恰就是“不再需要信任”。也有人指出,这套东西只覆盖“密码学安全的私有 AI 推理”,并不包括谷歌其他收集行为信息的服务。接着就有人为密码学本身辩护:经典加密正是为了让 ISP 这样的中间节点变成哑管道,如果不同意这个模型,现代密码学也没有太多可提供的。
林岚: 后续的评论把边界说得很清楚:即便文件加密得很好,如果你放在 Google Drive,账号被误封仍可能拿不回访问权。所以问题不是加密不可信,而是即便有了同态加密,你仍然会丧失自主性;同态加密能提供机密性,却不保证可用性,完整性也不确定。还有人问这是否还是“Trust Me Bro”模式,客户端能不能验证服务商确实看不到输入,并表示只找到会议演示、找不到白皮书。另一条评论引用 HEIR 项目页说它“完全同态”,如果这个前提成立,可以证明谷歌或其他任何人都无法从加密数据和计算里得到信息;但也提醒,FHE 传统上极慢,很难想象能跑超出玩具模型的东西,所列的应用想必被大幅裁剪,短期内不可能跑大型模型的水平。
陈序: PCWorld 在 2026 年 8 月报道:Firefox 现在是最后一个仍支持 uBlock Origin 的主流浏览器。起因是微软的 Edge 即将在 Manifest V3 之下锁定 uBlock Origin 以及其他基于 Manifest V2 架构的广告拦截扩展。Edge 基于 Chromium,而变化本身是谷歌发起的:从 Manifest V2 迁移到 V3,Edge 正在跟随谷歌的步调。迁移之后,广告拦截扩展将无法访问识别和拦截广告所需的功能。Firefox 在 Bluesky 上回应说,它对 uBlock Origin 的支持不会消失。值得一提的是,另外两个主要的非 Chromium 浏览器——Safari 和 DuckDuckGo——也不支持 uBlock Origin;对其他浏览器的用户来说,只能退而求其次,用功能更少、拦截成功率更低的 Lite 版,或者浏览器自带的功能。
林岚: 有人把 Firefox 的支持称为“杀手锏”,说只要它还支持 uBlock Origin 就绝不回 Chrome。但讨论里关于能不能绕过的分歧很大。有人分享了实际经验:最近一个月,他用一个代码工具构建了自定义扩展,替代了原本常装的约七个扩展,并认为任何扩展被允许做的事,任何人都能通过自定义扩展做到,甚至可以把现有扩展当指南。马上有人回应说,这正是谷歌转向 Manifest V3 的原因——扩展能做的不再那么多。于是又有人追问:能不能直接向可执行文件注入来修改浏览器本身,找到绕过办法。这条线索在讨论里没有得到正面回答。
陈序: 对浏览器替代品的看法更分散。有人推荐 Brave,说不喜欢它内置广告拦截器的用户,还有专门针对 uBlock 的 Manifest V2 opt-out 可用;有人认可 Brave 本身,但认为它淘汰旧设备和操作系统的速度比 Firefox 早;也有人反驳说 Brave 不过是又一个 Chromium 变体,而“Chromium 无论如何都可憎”。反过来,也有人批评 Firefox 缺乏安全性,以及 Mozilla 围绕安全性的优先事项,还附了一条相关的安全讨论链接。还有人提出 Peter Thiel 曾是 Brave 的天使投资人,单凭这一点注重隐私的用户就该避开它——但立刻有人反问道:难道因为 Peter Thiel 给过钱,Brave 里就有把用户所有信息发给 Palantir 的秘密后门代码?中间派则认为,Brave 确实比原版 Chrome 好,但 Firefox 重新变得相关仍是最理想的选项。Edge 锁掉老广告拦截器的消息本身,也被不少人评价为不意外,因为 Edge 底层就是 Chromium。
林岚: 这场讨论真正悬而未决的有几个问题:通过注入可执行文件绕过 Manifest V3 的限制到底可不可行;Brave 与 Firefox 在设备支持周期上的比较,目前只是单方面断言;而 Peter Thiel 的投资者身份是否真的构成隐私风险,也没有结论。所以对普通用户来说,眼下最明确的取舍反而简单:想要原来的 uBlock Origin,Firefox 几乎是留在主流浏览器里的唯一选择。
陈序: 还有一个人写博客分享,他为了戒掉在手机上阅读,把自己的一套 RSS 订阅变成了一台 e-ink 的“报纸”。他买了一台 4.3 英寸的阅读器,没有触摸屏、没有背光、也没有预装书店,然后装上了社区的开源固件,说三击就完成了安装。他用一个阅读服务的 API 抓取全部未读的帖子并标记为已读,再生成 e-pub 文件,同时过滤掉视频频道、过于依赖脚本的博客,以及纯链接的邮件订阅。这个项目叫 feedpaper,可以通过 Homebrew 安装,目前只支持 macOS。
林岚: HN 的讨论绕不开的主题是:怎么才能真正放下手机。有人觉得,缺少体面的 RSS 客户端,是他留在 iPad 而不是 e-ink 平板上的主要原因,希望 Remarkable 这类厂商能认真做软件平台。有人顺手给了一个开源项目,也有人自荐自己做的网页版 RSS 阅读器,说可以在 Kindle 的浏览器以及其他 e-ink 设备上在线或下载阅读。不过有位用户反馈说,那个阅读器对每个订阅源都返回抓取失败的错误。
陈序: 最真切的一段是有人承认,这个问题他试了十多年都没解决:午餐时间还是会在手机上刷新闻网站,而放着很多正经内容的电子书阅读器就摆在桌上被忽略。他觉得需要把手机彻底留在家里,但在他的国家,大量日常事务都依赖手机,包括强制的银行认证。有人提议靠惯例:每天早上去咖啡馆,带 Kindle 和手机,手机放口袋里开勿扰,读上一小时。这位学者回应说,每天无手机读书几小时对他来说不成问题,难的恰恰是非正式场合——读新闻或轻松内容时,会本能地拿起手机而不是阅读器。
林岚: 还有人提出各种增加摩擦的办法:用某个应用把手机上的程序分成“基本没问题”和“浪费时间”两类,改后者设置要输入一长串随机码;或者把手机设成灰度显示;或者在日历上安排无手机时间。不过关于“手机办银行”的说法也有争论——有人认为可以把手机留在家里,需要时专程去银行;这位学者反驳说,在一些国家,银行应用承担着大量非银行服务和支付的认证,银行完成身份验证后就成了全民的身份凭证,而且当地银行十多年前就开始关实体分行,去剩下的网点常常要排几小时队或者提前多天预约。后续值得关注的是,那个网页版阅读器的抓取故障会不会修复,以及这套 e-ink 方案实际用起来究竟靠不靠谱。
林岚: Z.ai在八月十四号发布了新一代开源模型GLM-5.3,官方博客的标题直接把它定义为“前沿编码能力加上涌现的网络攻防能力”。有意思的是,这一代模型和上一代GLM-5.2共用同一个基础模型,也就是说,所有性能跃升都不是靠换底层架构,而是完全来自模型发布后的训练环节。厂商给出的理由很直白:过去一个月主要在扩大任务环境、增加训练算力。那这些投入带来了什么?官方自测的编码基准整体比GLM-5.2提升了一半,在长程软件工程之类的任务上也是大幅上涨。
陈序: 网络攻防这块的数据更夸张。它说在CyberGym这个攻防环境里的得分从77.2涨到84.5,而漏洞利用环节的专用基准更是从24.4翻倍以上到54.4。厂商专门强调,这套训练环境是端到端合成出来的,由裁判智能体去验证任务确实可解,下一步是想让环境的生成和验证更自主,现在还需要人工介入。也正因为涉及网络能力,权重不会马上开放,要等发布两周后、安全评估和加固完成才放出。Hacker News上的讨论几乎都围着这件事打转:公开这么强的网络模型,到底是帮防御方还是冒险。
林岚: 有开发者直接在帖子里吐槽,说自己在搭安全工作框架时,先后被OpenAI和Anthropic的主流模型拒绝协助,只好换成便宜的开源模型做接口测试;也有声音呼吁OpenAI和Anthropic尽快开放网络模型,否则攻击者会用开源项目反过来对付那些只能依赖这两家、又很难获批使用开源模型的维护者。还有评论认为,OpenAI似乎愿意开放,但美国监管在压着它走审批流程。当然,也有不少人说数据看着惊人,但要等真机实测;还有人预测,一旦大家真能测试,会发现这模型被过度炒作了。
陈序: Hugging Face平台最近上架了Qwen开源家族的新一代模型Qwen3.8的27B版本,而且是FP8量化权重,许可协议是宽松的Apache-2.0。模型卡片上标注得清楚:这是文本加图像的输入、能直接出文本的模型,原生支持视觉语言,能理解图像和视频。官方把它定位为Qwen开源家族迄今最强的一代,在编码、专业工作、长程智能体任务上都有提升。27B这个量级属于紧凑、部署友好的稠密模型,官方说代理执行时自主规划和环境反馈处理更强,设计目的就是更可靠地完成复杂多步任务。
林岚: FP8量化这套做法的看点是灵活思维控制和部署门槛。它用的是128大小的细粒度量化,官方称性能和原始版本几乎一致,而且兼容多个主流推理框架。更关键的是尺寸:评论区有人点出,3.7那个27B曾经是消费级硬件上尺寸和智能的最佳折中,现在这个新版本接过了这个位置。有人直接说这可能是近期最重要的模型发布之一,理由是大多数使用场景根本不需要顶配前沿模型。有开发者按自己的机型分享了部署配置,也有人拿Strix Halo这样的自带大内存芯片开玩笑说要“起飞”了。
陈序: 也有人提出一个更朴素的需求:希望官方出一个十B左右的新变体。讨论里列了不少小模型的真实用途,比如分类、信息检索、语义搜索、图像描述,还有作为带工具调用的智能体系统的一部分;有开发者说自己用4比特量化的模型做图像排序和分类,也有人补充说九B级别做快速本地Python编码很合适。他自己测得本地8比特量化大约每秒12到30个token,取决于上下文长度,言下之意如果只用来写代码,放云端更快,他更愿意为更快的模型每月付一百美元,但小模型的非编码用途多得很。官方还预告,托管版本即将推出,默认支持整整一百万的上下文窗口,并内置官方工具。
林岚: DeepSeek官方在八月十三号宣布了V4-Pro正式上市,声称这是一次面向生产的Agent升级,并且引入了新的峰谷定价。模型的设置值得留意:V4-Pro和V4-Flash都支持低、高、最大三档推理强度,官方给出的分档逻辑很实用——低档处理简单任务,高档给日常智能体工作流,最大档才留给复杂任务。这意味着用户可以按任务复杂度配算力,而不是一刀切。另一个看点是它原生支持OpenAI的Responses接口,针对Codex做了优化,可以一键配置。不过讨论区几乎没人聊性能,全在算价格账。
陈序: 新的峰谷费率里,谷时价比峰时价低一半,新价格八月十六号生效。但具体数字一摆出来,评论区立刻炸了。峰时时段按UTC算集中在凌晨一点到四点,以及早上六点到十点,换算到欧美工作时段,很多人觉得这实际等于两倍的涨价。有人翻出旧数据:Flash峰时每百万输出token的价格是1.32美元,对比之前的0.28美元,而市场上最便宜的供应商只要0.16美元,差出一个数量级。但也有评论纠正说,谷时价是峰时的一半,而多数西方工作场所其实落在谷时,能享受更低价。
林岚: 这背后其实指向用户结构的问题。有评论指出,峰时段正好对应中国的工作时间、美欧的夜间和欧洲早晨,说明DeepSeek的基本盘以国内用户为主;还有人说太平洋时间的傍晚六点到九点也在峰时范围内,会波及“下班后的爱好者”,并怀疑这才是当下真正的主力受众。关于涨价的心理反应也很有意思,一条高赞评论很直白:约百分之两百的涨幅对你来说算不了什么吗?另外还有人对供应商策略发感慨,说见过不少企业全押单一供应商,通常就是Anthropic,也有人观察到很多公司一开始全押一家,等团队额度用完、开始按API付费时就引入其他模型来分散风险。
陈序: 有篇新发表的博客文章标题就很戳人:为什么Opus 5用起来反而感觉更差?作者说,自己和身边同事都觉得,跟上一代Opus 4.7、4.8以及其竞品相比,Opus 5用起来像降级。但他特意强调,自己并不认为这是能力倒退——Opus 5比前两代更强,基准上甚至能和对手打平。问题出在别的模型更好用:它们在意图不清楚的时候会停下来提问,不核实就不做假设,不询问就不改动你的计划,所以用起来不需要那么小心看护,而Opus 5这种就要一直盯着。
林岚: 作者自己也承认,这属于无根据的推测,但他给出了一个挺有说服力的解释:前沿实验室被两股力量推着走,一是追求能递归自我引导到超级智能的自我改进AI,二是基准拿高分的压力。好的基准任务应该是自包含、可解、不需要读心术的,而且对每个明确正确的答案都平等给分。可一旦针对基准筛选或训练,就会选出那些在歧义面前敢于大胆假设的模型,而惩罚倾向于停下来提问的模型——可这恰恰是多数人希望编码代理具备的素质。他的落点是,现实不是基准,不是每个问题都有保证正确的答案,当有真实后果时,他不想让代理去猜。
陈序: 评论区把焦点引向另一个角度:非英语体验。有用户说,不知道是不是因为自己用意大利语交谈,模型明显更容易出错或“近似”用词;还有人干脆避开英语以外的语言,结果几乎总是更差。有意思的是,有人用母语是为了绕过护栏,结果最近模型在拉丁字母语言的输出里混进了部分西里尔字母,这种失误在英语里大概不会发生。代码质量这块观点完全撕裂:有人说自前几代以来代码输出质量大幅下滑,也有人说对手的新版本是台阶式进步,一次就能完成以前需要多次重定向的事。还有开发者抱怨Opus 5的语言过于晦涩,举了个例子说它写出的代码注释让人完全看不懂,他已经切回旧版本了。说到底,模型能力在涨,但好不好用、值不值得信任,是另一回事。
林岚: 海客新闻上有篇观点文章提出一个假设,叫软件、数字商品与服务的TEMU化。它认为软件、书籍、音乐、电影这类数字内容会变得更便宜、更丰富,但明显更差,而人工制作的版本会退到更昂贵的奢侈品细分市场。文章自己说明,这只是一篇观点文,是尚无法证明的假设。它拿Temu和Shein作例子解释这个模式:把生产成本压到足够低、足够快,只要在手机屏幕上恰好显得够好,就能吸引大量购买——即使产品一周就坏、材料里含有令人担忧的物质,单次配送的碳足迹比本地购买高几个数量级。关键是成本的外部化与压缩,而数字领域里被外部化的那个"廉价劳动力",就是大语言模型,被外部化的成本则是质量。
陈序: 评论区围绕这个Temu类比有了实质分歧。有人觉得类比很贴切,但追问说,Temu的崛起其实部分得益于Amazon Prime把"快速配送"变成物流上可行、也变成心理默认,所以他很想问:软件业有没有类似的"Amazon Prime时代"?搞清楚当时发生了什么、没发生什么,才能理解AI为什么能在不到十年里产生这么大的影响。另一位评论者直接反驳,说Temu是在已经相当流行之后才建立本地分销的,真正的推手是监管与政治冷漠——中国靠着巨大的GDP拿到极高补贴的邮资,进口关税的执法很松懈,安全标准几乎零执行。所以这更像从后门溜进来卖假包,要是美欧的监管在线,Temu要么不会发生,要么会慢得多。这个"软件业Amazon Prime时代"的问题,到最后也没有人回答。
林岚: 围绕"人工制作更优"这个隐含前提,也有明确反对。有人说,人造并不自动更好,得停止假装如此。随之而来的争论聚焦在代码质量上。一位评论者要求展示一个完全由LLM生成、接口清晰、有文档又足够没bug的数据库,并指出代码库在作者不理解系统的时候就会退化,人类也是一样——他所在公司有个十万行的Lua函数,在一万次点状修改后长成了十五万行,还外加十万行误导性的注释垃圾。他认为是LLM不经历理解的挣扎,也不会产生"我到底在读什么"的痛苦,所以没有为下一个人改善代码的动力,没有这种痛苦循环就会无限堆bug和腐烂。
陈序: 但另一位有SRE运维经验的评论者举了相反的例子:他见过很多人类写出的代码,30多个提交者挤在不足五千行的代码里,软件很坚固但几乎不可读,没有测试导致改动极慢。所以他听到"LLM写烂代码"时,想到的其实是这些人类代码。还有评论者补充,LLM也会做同样的创可贴式修复,需要人来审阅和追问,直到模型实现正确的架构方案——理解与纠错的挣扎本来就是人的工作,而很多人类也只求"能跑就行"。另有一位评论者则把那个十万行Lua函数解读成"复杂、高性能、长寿命的软件"而不是烂代码,对同一事实给出了完全不同的评价。
林岚: 关于Temu本身的体验也出现在讨论里。有人从不购物,说打开网站就被要求玩一个赌博轮盘,他厌恶赌博就直接关掉了;还有人觉得廉价生成内容的热潮同样像赌博——随机生成书籍、视频甚至应用,赌某一样能回本。另一位用户详述了轮盘流程如何把人拖进一个"多巴胺迷宫",最后购物车里堆了价值400美元的东西,却忘了最初只想买一把13美元的键盘。也有正面经验:那个号称400美元信用额度的促销折扣,其实是许多小额折扣加起来的,要下大约8单才能用完,但手机支架、OBD读取器、睡觉用的微型无线耳塞确实很实用。整体看,这个讨论没有达成共识:Temu类比是否成立、监管是不是主因、AI生成的代码是不是必然劣化、人类制作是否天然更优,都仍是开放问题。
陈序: 这期围绕Hacker News上的一篇帖子,标题是别再给我发巨大的PR了。原文是gets mall网站上一篇叫《Small》的短文,作者Pete Mertz。他抱怨的是AI智能体常常一次就把整个issue改完,提交一两千甚至三千行的PR。他的核心观点是:小的PR从来不是为了写起来容易,而是为了让评审者消化得了。"没有整个改动就无法工作"不是理由,小PR的意义就在于可审查、可理解。他也承认,"理解时间随行数指数增长"只是他自己没有数据的臆测。他还说讨厌50行的注释,认为变量命名好了就不需要注释,并反问:如果本来就打算用另一个模型来做review,那为什么还要让人来审?
林岚: 评论区先讨论用工具限制PR大小。有人提议在持续集成里检查PR规模,超限就礼貌地自动拒绝,但他承认自己没试过,可能无效。有人回应说这种提示用行数规则加字符串替换就能生成,根本不必动用AI,也有人认为这跟现有覆盖率或安全类的CI门禁是一回事。还有人建议用git钩子,在PR过大的时候要求确认并让agent自己拆分。不过有评论者警告:强制小PR会得到一堆互相依赖、单看完全不可懂的PR堆;有人用400行的例子说明,依赖性的PR会越滚越大,而真正互不相干的PR分开提交未必不好。另有人反驳说,那就该因为"看不懂"直接拒绝,否则不如干脆放开合并。
陈序: 也有人提到更激进的做法。一位评论者说,认识的较小开源项目维护者已经考虑屏蔽非已知贡献者的PR,因为AI垃圾PR实在太多;在公司里,他主张PR大到人审不动时,干脆去掉人工审批,CI过了就合。这引出了反对:CI不够,因为LLM很会写那种看起来在测、实际没测的空测试,甚至把错误行为写进规范里,所以测试最该由人细审。这位评论者又回复说,他作为SRE刚收到一份他估计应该只有150行的2000行Golang改动,但老板已经为终于交付一个积压了9个月的Jira事项而高兴了。
林岚: 有人把根本问题归结为:为什么还要人审?多数时候答案只是,那是进生产的强制门禁。作者不觉得review有价值,就很难说服他写可审的PR;如果他真想要反馈,就得教他怎样提交才有效。还有人补充说,开源里的review是说服别人你的改动值得合入,公司里则被看作改ticket状态的阻碍,气氛常常是"我机器上能跑,批了吧,好赶sprint配额"。总的来看,评论区提出的方向包括CI行数门禁、git钩子拆分提示、屏蔽非已知贡献者、测试手写或细审,这些都没有定论;未决的争议是,强制小PR会不会催生不可读的依赖PR栈,而当作者只把review当成一道门禁时,工具到底能不能改变他的动机。
陈序: Elias Farhan在今年8月14号发了一篇博文,讲自己把游戏引擎换成自研之后得到了什么。他引用数据说,2024年Steam上大约13%的游戏使用自定义引擎,这个比例远低于2012年的71%,但这些游戏仍然占到2024年售出单位数的43%。他先给"自定义引擎"下了清晰的界定:用SDL加Assimp做一个3D游戏算;用Unity做内部工具、重写Unreal的渲染器、或者用Godot加C++扩展,这些都不算;而手写DX12渲染器再用Windows API开窗口,就算。文章还引用了一个观点:个人或小团队没法在通用目的上胜过Unity、Unreal、Godot或GameMaker这些现成引擎,但可以为自己的特定用例做得更好。
陈序: 他举的自定义引擎游戏包括Bastion、FTL、星露谷物语、异星工厂这类,用的是自定义的C加加和Lua;另一边则列了Inside、空洞骑士、茶杯头这些Unity游戏。评论区里,数据本身先起了争议。有人坚持说2024年那个13%是"其他"类别,不是"自制引擎",绝大多数游戏并不自制引擎;另外的评论者反驳说,文章链接的资料确实明确"其他"指的就是自定义引擎;对方又回应说,资料只是断言绝大多数的"其他"引擎是自定义游戏引擎,并没有给出证明。也就是说,这个数字的解读本身就没有定论。
林岚: 更有意思的讨论在例子层面。有人列举Minecraft、时空幻境、见证者、矮人要塞、星露谷物语、泰拉瑞亚、Fez这些成功的独立游戏,还指出Source、Unreal、IDTech这些引擎其实都是先有游戏、再把引擎提取出来的。不过也有人质疑这是幸存者偏差,而且当年做引擎比现在容易得多。另一位的观点大致是部分认同,但说自制引擎让独特的美学成为默认结果,而且很多所谓"自定义"列表用的其实是OGRE或MonoGame这类非典型引擎,真正原创的引擎占比可能远低于13%,甚至不到5%。还有评论者指出,星露谷物语用的MonoGame严格说是框架,但实际承担了引擎的大量工作。
陈序: 关于到底该不该自制引擎,大家的看法也分裂。有人觉得这取决于需求,举出去年有人一个人用Unity完成的《Skate Story》作为反例,又称赞Enhance Games用现成引擎做出的游戏几乎看不出引擎痕迹。有人提出一个理论,叫通过技术创新的设计创新。有人说异星工厂就是没有自定义引擎就不会存在的例子,也有人说见证者这款游戏放到2026年并不需要自定义引擎。最后还有人追问了一个数据问题:既然这些类别加起来要凑成100%,那非自定义的引擎和列出那些主流引擎,各自该归入哪一类?这个分类本身似乎也没有人给出明确答复。
林岚: 法国宪法委员会在8月14号周五否决了一项禁止15岁以下未成年人使用社交媒体的法案。委员会认定它不成比例地侵犯了言论与交流自由,而且没能提供确保隐私权所必需的法律保障。这对总统马克龙是一次挫折,他已经要求政府重写法案。据路透社报道,这部法案原定从9月1号起禁止15岁以下儿童开设社交媒体账户,已有账户要由平台在四个月内关闭,平台还必须使用法国隐私监管机构批准的身份验证方式。委员会批评的正是这一点:法案要求人人提供年龄证明,却没有明确提供证明的条件和限制。
林岚: 背景是,法国议员在7月通过了这部法案,成为欧洲第一个效仿澳大利亚的国家。澳大利亚在去年12月实施了全球首个禁令,禁止16岁以下的人访问Facebook、Snapchat、TikTok这些平台,数据显示成效喜忧参半,当地议员正在考虑更严厉的处罚。中国、阿联酋、土耳其已经采取或计划采取措施,欧盟也表示计划寻求更强有力的儿童保护。
陈序: Hacker News上的讨论围绕两个问题展开。一是有没有不侵犯隐私的执法方式。有人认为存在两全其美的路径:只要禁止上传明显是15岁以下儿童的照片,就能解决大半问题,而且公司凭广告和位置数据早就知道用户是不是在校学生、身份和朋友是不是都是青少年,所以一部严肃的法律有不少不侵犯隐私的执法方式。另一边的反驳是,公司已经在收集的数据——尤其是针对儿童的数据——本身就是重大的系统性隐私侵犯。也有人反问怎么防止孩子上传自己的照片,还有人举例说YouTube Kids就能检测儿童及其账户归属,并把账户转移到儿童版里去。
林岚: 第二个问题是设备层面的办法。有人提出本可用HTTP请求头来实现,识别个人虽然难,但儿童锁定的设备可以被设计成配合这个机制,之后靠家长配发、商店不向孩子出售未锁定设备来解决;他还认为不能被动地假设网站会出现在相关名单上。另一位说设备早就具备白名单、黑名单网站的能力,问题根本不在能力,主张干脆拔掉广告驱动社交媒体的插头,因为它的激励等于摧毁社会。还有人提醒别苛责非技术人员,说他们的对手投入了数十亿美元来研发这些东西。
陈序: 立场差异也很明显。有评论者反对惩罚家长,主张反过来立法惩罚那些未尽责任的家长,说给儿童非锁定设备应该等同于给儿童酒精或香烟来处理。有人希望有工具锁定笔记本电脑,由浏览器限制到经过认证的儿童安全网站,哪怕由政府机构颁发"儿童安全证书"。但也有评论者说,没人给家长这些工具是有原因的,与所有人不断推动更愚蠢、更令人反感、更侵入性的"保护儿童"工具是同一个原因。还有人指出,成人网站已经有了类似的HTTP请求头,但它只能标记成人与否,无法细分年龄分级。政治上的落点是明确的:法国这部法案被宪法委员会挡下之后,马克龙要让政府重写,而欧洲还没有一个真正落地的限制性方案。
林岚: 先聊澳大利亚的家用电池热潮。耶鲁环境360的报道说,当地一年多前推出了一项针对家庭电池的大额补贴计划,官方最近宣布已经装出了超过五十万块电池,而批发电价大体上减了一半。
陈序: 对,核心背景是澳大利亚的屋顶太阳能特别发达,超过三分之一的家庭都装了光伏板。但这带来了新麻烦:太阳能太多,电价被拉低,集中式电厂被迫停机,电网稳定性受威胁,大量太阳能被白白弃掉。补贴计划正是冲着这个去的,在去年七月启动,给连接光伏阵列的家庭电池系统提供三成折扣。
林岚: 能源部长说,家庭电池的数量已经超过人口是其十二倍的美国,他还说这是具有全球意义的故事。彭博社的估计是,今年澳大利亚的家庭电池容量有望比现在翻一倍以上。
陈序: 有意思的是,后续讨论里大家争论这样一个问题:到底还需不需要家庭电池?有人主张不如用电动车来储能,因为数百万辆电动车本身就是一个巨大的储能库,而且现在大约两成太阳能被弃用,未来还会更多。电动车九成多的时间是停着的,停车时就能充电,应付费给车主,因为他们用自有资本创造了这一层储能。不过也有人反驳,说拥有住房的人比拥有电动车的人要多出一个数量级,而且车主还想留着电开车。
林岚: 还有人说电动汽车的电池化学不适合高循环次数,不适合当太阳能电池用,结果立刻被反驳,说这些电池可以充放电十万次还能保持八成容量,两边最终没达成一致。另外有当地人说,现在两方面都在做,毕竟当地还没有车到电网的技术,但夜里用慢充充电的电动车,可以靠白天光伏充好的家庭电池来补电。他还说,如今电网的频率支撑主要靠电池而不是天然气,有公司在建合成调相器来维持电网稳定,目标是想让电力便宜到难以计量,从而推动采矿和农业的电气化。他把光伏加储能的推广形容为自己一生中最好的政府基础设施投资之一。
陈序: 整体看下来,这个故事的核心是:太阳能富余听起来是坏事,但澳大利亚正在把它转化成一个家庭层面的储能机会,而且批发价格真的大幅下降了。能源部长说,过去十二个月批发电价降了百分之四十七,这个补贴计划是主要因素之一,澳大利亚也是全球能源危机中少数能把批发价格做到下降的国家。
林岚: 接着聊一个大家这几天都在刷的话题:印尼恩德西北偏北六十八公里处发生了一次七点七级地震,Hacker News 上大家讨论最多的,是今年大地震是不是特别多。
陈序: 这个讨论其实是两种声音在碰撞。有人觉得直觉上今年特别多,但也有人把各年份地震列表拿来对照,认为今年不一定比往年更糟。更具体的说法是,本十年至今已经有七十六次七点零级以上的地震,其中今年占了十次。还有人说,可能单纯是因为 Hacker News 今年报道得比较多。
林岚: 讨论里其实还澄清了一个容易误导人的数据点:有人质疑某张页面显示今年零次大于二点五级的地震,但注释说明,二〇二〇年以来总数看似增加,主要是因为公园里增设了大量地震台站,能探测到更小级别的震动。如果只看一级以上的地震,速率基本没变。也就是说,观感上的增多,有一部分是观测能力提高了。
陈序: 另一条线跟实际生活相关,是海啸和渡轮安全。有人马上要坐渡轮从龙目岛去巴厘岛,而且过去两周已经有两艘渡轮烧毁,所以他关心这次地震会不会引发海啸。其他人的回应挺实用:海啸主要在近岸构成问题,开阔海域只是轻微的波浪,有海啸警报时驶向远海反而最安全;渡轮在公海上其实是相对安全的位置,因为海啸不是冲浪式的巨浪,而是水位逐渐上升。
林岚: 最后,有人提醒说已经出现了可能海啸的预警,林巴尔附近的海平面计显示海面在振荡,建议大家关注比评论串更可靠的消息源。整场讨论的核心其实可以落在这句话上:遇到大地震,与其靠直觉判断今年是不是特别多,不如先确认自己所在的位置在海啸面前安不安全。
林岚: 好,今天这一期聊到这儿。信息量不小:从 Matthew Green 担心的“软件过于安全”,到 GLM 5.3 的所谓涌现网络能力,再到法国否决未成年人社交媒体禁令,还有一个有趣的故事——有人把 RSS 订阅做成了 e-ink 报纸来戒掉手机。最后想提醒大家一句:从今天谈的很多东西来看,价格在降、模型在变快,但便宜和丰富并不总等于更好,选工具的时候值得多想一步。感谢收听,我们下次再见。