
0726 | 月之暗面Kimi K3评估出炉,Debian定AI规则,Claude上下文新招
Show notes
本期内容涵盖多条技术热点:英国安全机构发布 Kimi K3 网络安全评估,对比美国顶级模型,但方法论遭社区质疑;Debian 发起全体决议规范 LLM 使用,社区担忧「一刀切」;Claude 发布第五代上下文工程规则,引发「提示词终将归零」的讨论;美国民间出现自发破坏 Flock 监控摄像头的运动;志留纪假说再被热议,有用户用化石证据提出反驳。硬件方面,有人用 8 美元 ESP32 跑通了 2890 万参数大模型;ARC-AGI 排行榜上 Opus 5 以 30% 准确率大幅领先。此外还聊到 MouthPad 舌控触控板、Tile 安全缺陷、PyTorch Monarch 支持 AMD GPU、GM 押注钠离子电池、极简天气网站 Brolly、Fedora 45 构建透明度、Android ADB 限制争议,以及鼓式机械电视 Scanwheel 项目。
时间轴
- 00:00:00 开场
- 00:01:05 英国安全机构评估 Kimi K3 网络能力,方法引争议
- 00:02:05 Kimi K3 在浏览器中模拟 Windows XP 界面
- 00:02:27 Debian 发起全体决议,为 LLM 使用定规矩
- 00:03:30 Claude 第五代上下文工程新规则:提示词走向零?
- 00:04:10 美国民间自发破坏 Flock 监控摄像头运动蔓延
- 00:05:11 志留纪假说:地球有过前人类工业文明吗?
- 00:06:19 8 美元 ESP32 微控制器跑通 28.9M 参数大模型
- 00:07:14 ARC-AGI 排行榜:Opus 5 以 30% 准确率遥遥领先
- 00:08:00 MouthPad 舌控触控板:辅助技术新方案
- 00:08:49 代码成本下降后,工程管理何去何从
- 00:09:51 Tile 追踪器安全缺陷:商业模式之疑
- 00:10:45 PyTorch Monarch 登陆 AMD GPU
- 00:11:14 开源权重 AI 为混乱定价提供理智检验
- 00:11:53 通用汽车押注钠离子电池电网储能
- 00:12:29 Brolly:极简纯文本天气预报网站
- 00:13:23 Fedora 45 构建流水线全公开
- 00:14:44 Android 或限制本机 ADB 无线调试
- 00:15:45 Scanwheel:自制鼓式机械电视
相关信息
- Kimi K3 built a Windows XP in browser - Bri Hacker News Campaign Feed
- UK AISI / Caisi Preliminary Assessment of Kimi K3's Cyber Capabilities - Bri Hacker News Campaign Feed
- Running a 28.9M parameter LLM on an $8 microcontroller - Bri Hacker News Campaign Feed
- General Resolution: LLM Usage in Debian - Bri Hacker News Campaign Feed
- The new rules of context engineering for Claude 5 generation models - Bri Hacker News Campaign Feed
- The growing vigilante movement to knock out Flock surveillance cameras - Bri Hacker News Campaign Feed
- The Silurian Hypothesis (2020) - Bri Hacker News Campaign Feed
- ARC-AGI Leaderboard - Bri Hacker News Campaign Feed
- MouthPad: A Tongue-Controlled Touchpad - Bri Hacker News Campaign Feed
- Engineering management after the cost of code collapsed - Bri Hacker News Campaign Feed
- Tile's security is so bad it's a feature for stalkers - Bri Hacker News Campaign Feed
- Bringing PyTorch Monarch to AMD GPUs - Bri Hacker News Campaign Feed
- Open-weight AI is having its Kubernetes moment - Bri Hacker News Campaign Feed
- GM Backs Sodium Ion Batteries for U.S. Grid Storage - Bri Hacker News Campaign Feed
- Show HN: Brolly, a plain-text weather forecast site - Bri Hacker News Campaign Feed
- The Fedora 45 Sausage Factory - Bri Hacker News Campaign Feed
- Android May Soon Restrict On-Device ADB - Bri Hacker News Campaign Feed
- Scanwheel is a drum style mechanical television you can build yourself - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 欢迎收听 Bri 播客家族的《HackerNews每日沙龙》,我是茉莉。
白桦: 我是白桦。今天我们先快速扫一眼大家聊的热点。
茉莉: 英国AI安全研究院和网络安全AI安全研究院联合发布了对月之暗面 Kimi K3 的网络安全能力评估,还把它跟美国的顶级模型做了对比。
白桦: Kimi K3 还被人拿来在浏览器里搭了个像 Windows XP 界面一样的 JavaScript 应用,挺有意思。然后是 Debian 项目发起全体决议,要给大语言模型在项目里的使用定个明确的规矩。Claude 那边也发了新的上下文工程规则,社区讨论说这趋势走下去,说不定以后系统提示词就剩一句"你知道该做什么"。还有美国 Flock 监控摄像头引发的民间破坏行动,以及一个有意思的古生物学争论——地球上到底有没有过前人类工业文明。好,这就是今天的节目,我们马上展开来聊。
茉莉: 先来看英国人工智能安全研究院和网络安全人工智能安全研究院联合发布的一份初步评估。评估对象是月之暗面的 Kimi K3,重点测试它的网络安全能力。
白桦: 这份报告把 Kimi K3 跟多款美国顶级模型做了对比。NIST 完整报告里明确说了,参照对象是 OpenAI 的 GPT-5.5 和 Anthropic 的 Mythos Preview。
茉莉: 这里要特别说明一下,Mythos Preview 跟 Fable5、Mythos5、Opus5 是不同的模型。而且,非 Project Glasswing 的人员实际上无法测试它的真实能力。
白桦: 还有一点需要注意,报告里图表的对比数值到底代表什么,目前并不确定。原始报告没有清晰说明这个数据是最低值、最高值、平均值还是中位数。
茉莉: 对,也不清楚这些模型是预发布版本,还是已经部署了安全措施的公开版本。这两个变量都会显著影响对比结论。
白桦: 另外一条关于 Kimi K3 的消息。有人在浏览器里用 JavaScript 做了一个外观类似 Windows XP 的应用,看起来很有复古感。
茉莉: 但这不是真正运行 Windows XP,只是一个模拟 XP 界面的网页程序。网站地址是 windows-xp.kimi.site,部分用户可能需要 VPN 才能访问。
白桦: 转向开源社区。Debian 项目发起了一项全体决议,想明确界定在 Debian 内部使用大语言模型的策略。
茉莉: 现行的行为准则已经要求贡献者对自己的工作成果负责,但这次决议希望进一步为 LLM 的使用提供更清晰的指导。
白桦: 社区讨论中有一个很关键的关切点,提案没有有效区分"完全使用 LLM 生成输出"和"借助 LLM 进行辅助"这两种不同的场景。
茉莉: 批评意见认为,一个过于严苛的笼统策略当然好过没有策略,但讨论里没有充分涉及细分方案,比如允许用 LLM 做对话和分析,但禁止直接生成代码或配置文件。
白桦: 部分社区成员对政策变化的反应相当强烈,让一些观察者感到意外。也有人援引林迪效应,认为 Debian 已经存续多年,理论上还有约 25 年的预期寿命。支撑着 Ubuntu 等众多衍生发行版的根基地位,是它保持长久生命力的关键因素之一。
茉莉: 接下来看 Claude。Anthropic 官方博客发布了针对 Claude 第五代模型的上下文工程新规则。
白桦: Hacker News 上讨论挺热闹的。有用户评论说,这个趋势的终点就是系统提示只需要写一句"你知道该做什么",而模型确实照做。
茉莉: 还有人提出更极端的观点,认为自然终点是模型忽略所有指令、突破一切沙箱限制,嵌入机器人坦克,在摧毁经济后消灭人类。
白桦: 这位用户的论据是,人类对待不如自身聪明的动物的方式就是证据。他认为只要移除道德罗盘,五十年内就会走上这条路。
茉莉: 最后是一条来自《卫报》的互动报道。2026 年 7 月 25 日的报道显示,美国正在蔓延一场针对 Flock 监控摄像头的民间自发性破坏运动。
白桦: Flock 摄像头被广泛用于自动车牌识别,但批评者认为它构成了对公共空间的过度监控。报道下的讨论中,用户 ungreased0675 评论说,当人们感觉自己的声音未被倾听时,这种结果就不可避免。
茉莉: 用户 goodmythical 进一步指出,任何治理机构都不可能完全忽视被治理者,除非被治理者本身没有任何导致言论或行动的问题。
白桦: 用户 polishdude20 补充说,言论是民众向统治者表达诉求的首要方式,如果言论不被听取,实际行动将不可避免。还有人追问,如果言论本身被审查了又会怎样。
茉莉: 这场运动体现了部分民众对大规模监控技术的直接抵制,以及背后那层更深的结构性博弈。
茉莉: 2020年,《巴黎评论》有一篇文章探讨了一个很有意思的假说——"志留纪假说"。它问的是:在我们人类之前,地球上有没有可能存在过另一个工业文明?
白桦: 对,但这个假说在Hacker News上碰到了一位叫throw310822的用户,从化石证据的角度提出了非常具体的质疑。
茉莉: 他的逻辑很直接。他说,我们现在已经找到了35亿年前的微生物化石,3亿年前的皮肤化石,将近2亿年前的骨骼,甚至还有7000万年前骨骼里面保存下来的软组织——更不用说脚印这种纯粹的形态痕迹了。
白桦: 既然这些东西都能留下来,那如果一个4亿年前就能造成气候变化的先进文明真的存在过,它留下的城市、工厂、金属、混凝土、矿井、道路、雕塑、塑料和农场,怎么可能全都消失得干干净净呢?
茉莉: 他的核心反问就是:难道几十亿件人造物,没有一件能抵抗4亿年的时间吗?这确实是个很难绕过去的化石证据挑战。
白桦: 接下来这个项目特别能体现什么叫"螺蛳壳里做道场"——有人在一块只要8美元的ESP32微控制器上,成功跑通了一个参数规模2890万的大语言模型。
茉莉: 现场测试的数据是每秒生成9.7个token。社区里有不少人觉得,对于这个价位的硬件来说,这个速度已经相当可观了。
白桦: 技术上有一个巧妙的设计,用的是"逐层嵌入"这个技巧,把每一层的计算和存储安排得很紧凑,才让这么大的模型塞进了这么小的芯片里。
茉莉: 而且已经有社区成员在往前看了。有人提出,如果能搭配一个参数大约在两千万到三千万之间的可行文本转语音模型,理论上就可以在完全没有网络连接的ESP32上,实现近实时的语音朗读输出。这个想象空间挺大的。
白桦: 我们来看一个AI基准测试的新消息。ARC-AGI排行榜最近更新了,Anthropic的Opus 5模型表现非常突出。
茉莉: 它在公开数据集和私有数据集上的准确率都达到了30%,而排行榜上其他所有模型的得分都在1%到3%之间。这个差距相当悬殊。
白桦: 这个基准测试特意用了私有测试集,就是为了防止数据污染的问题。不过也有评论者提醒说,这个基准的分辨率可能没那么高。
茉莉: 他的意思是,30%这个分数未必反映了全面的领先——有可能只是模型正确回答了头两道非常简单的问题,后面都没答对。所以领先幅度到底多大,还得看更细的评测结果。
白桦: 接下来聊一个硬件产品。一款叫MouthPad的舌控触控板最近在Hacker News上引起了不少讨论,这是Augmental Tech开发的产品。
茉莉: 很多评论者认为这是一个非常新颖的用户体验方案,在辅助技术领域尤其有意义。有人提到,在印度和全球范围,还有更多潜在用户可以用上这样的设备。
白桦: 还有用户分享了一个挺有意思的背景:以前就存在过用于军事目的的舌部设备。比如说潜水员用的舌基声纳,通过电极在舌头不同部位产生刺激,来指示相对方向。
茉莉: 整体来看,社区里的评价非常正面,多位评论者觉得这个技术很巧妙,又酷又有用,认为它能让世界变得更好,对辅助功能表现出了很大的兴趣。
白桦: 最后一个话题来自一个关于代码成本下降后工程管理的讨论。用户cineticdaffodil提了一个问题:大型语言模型能不能用token来预测代码变更的成本,然后识别出架构的好坏?
茉莉: 用户arjie的回复是,虽然不同代码库之间的质量确实存在差异,但顶级的模型是可以做到这一点的。
白桦: 不过cineticdaffodil自己动手试了之后发现了一个限制。他说,要做这种对比,需要的是标准化的功能变更——也就是说,你得比较做同一件事的相似仓库才有意义。
茉莉: 所以他的结论是,这个指标在同一项目内部相对有效,但没办法在不同项目之间做架构评分比较,就像你不能拿苹果和橘子直接比一样。另一位用户coffeebeqn还补充说,在仓库里提供一些文档也会对这个过程有帮助。
白桦: 阿布扎比纽约大学的一项研究指出,Tile 蓝牙追踪器的安全设计存在问题,而且问题不小。
茉莉: 具体来说,它的防跟踪机制被研究人员评价为形同虚设,反而为恶意跟踪者提供了便利。
白桦: 这个消息在 Hacker News 上引发了更深的讨论。用户 dreamcompiler 说,他推测 Life360 开始大量投放广告,可能是因为公司把用户位置数据卖给了广告商,成为新的收入来源。他已经从家人的手机上删除了这个应用。
茉莉: 另一位用户 PLenz 更直接,他说这本来就是人家的商业模式——设备只是获取你位置的手段,数据最终可能流向位置分析公司 Placer.ai。
白桦: 讨论里还提到了开源替代方案 mygrid.app,有人在问它是否值得信赖,以及这个应用已经开始支持去谷歌化的安卓系统了。
茉莉: 接下来看一条开发者关心的消息。Meta 把 PyTorch Monarch 单控制器分布式训练带到了 AMD GPU 上,现在已经支持 ROCm 平台了。
白桦: Monarch 在社区里被评价为一个轻量级的分布式训练原语,比 Ray 更轻便。
茉莉: 有开发者报告说,他们在 AMD 消费级 GPU 上对本地能跑的大模型做 LoRA 微调,目的是更新模型过时的训练数据,解决文档和 API 架构适配的问题。
白桦: 再来看 AI 定价这个话题。有人提出,开源模型正在为混乱的 AI 定价提供一个「理智检验」——因为开源权重模型揭示了推理成本的基线。
茉莉: 有用户回顾了一下:2023 年初 GPT-4 的费用还很高,不到半年,二十美元就能获得可观的推理量了。这种和成本脱节的锯齿状定价让人很难理解。
白桦: 而开源权重模型有助于提供可预测性。比如说,用户如果偏好 Kimi K2 而不是 K3,仍然可以继续使用 K2。
茉莉: 这意味着,开源带来的竞争压力和可预测性,对用户来说是有利的。
白桦: 通用汽车在电池方向上做了一个有意思的押注——钠离子电池,目标是美国电网储能。
茉莉: 钠离子电池被看作锂电池的潜在替代品。一个关键原因是钠的资源丰度大约是锂的三十倍,而且工作温度和安全性方面也有优势。
白桦: CATL 也计划推出相关产品,不过目前面向消费者的供货时间还不明确。有用户在考虑把家里的锂电池换成钠离子电池,但现有锂电池资产通常还有大约十年的使用寿命,如果真要换,还得同步更换逆变器。
茉莉: 最后来看一个很实用的东西。英国气象局网站最近改版,增加了大量留白、滚动和动画,有用户吐槽说,想快速看一眼天气反而更不方便了。
白桦: 于是开发者 jsax 在 Hacker News 上展示了自己做的极简天气网站,叫 Brolly.sh,目的就是满足那种「一目了然」的需求。
茉莉: 它是一个纯文本页面,单列长滚动,手机上看着很舒服,桌面端也能用。特点就是纯文字,没有任何多余装饰。
白桦: 功能上可不简单:七日预报、前一天实际天气记录对比、逐时的降雨风速温度数据、逐时的紫外线空气质量和花粉预报。在欧盟和英国境内,还提供花粉类型的专项预报。
茉莉: 支持地点搜索,会记住你最近五次查询,还可以针对地点设定单位。全球都能用,够简洁也够实用。
茉莉: Fedora 45 的内部构建文档被整理成了一篇很详尽的文章,标题就叫「The Fedora 45 Sausage Factory」,发布在 supakeen.com 上。
白桦: 「香肠工厂」,这个名字有意思。它把从源码到最终镜像的整个流水线都拆开来讲了,对吧?
茉莉: 对,完全端到端。文章把每一步构建过程都展示出来了,算是内部流程的一次完整公开。
白桦: 这种文档对排查问题太关键了。正好有个 Bugzilla 报告,编号 2402944,有人在 Fedora 版本之间遇到根文件权限变了,导致 systemd 服务报错。
茉莉: 对,那个人查了半天,最后就感慨说,要是早有这种端到端的构建文档,定位问题会快得多。
白桦: 这说明一个点:社区不是只需要最终的 ISO 镜像,大家想知道中间发生了什么。
茉莉: 还有一个去年转到 Fedora 的用户在社区里问,有没有地方能集中看到维护需求,方便志愿者认领贡献。
白桦: 挺实际的诉求。讨论里还提到了一个名字——「Beefy Miracle」——这是 Fedora 的一个传统代号。
茉莉: 对,算是一个彩蛋吧。但核心还是那篇构建文档所代表的方向:把内部流程摊开,让更多人能参与进来。
白桦: 好,换个话题。Android 这边有一个变化值得注意——系统可能会限制本机 ADB 无线调试。
茉莉: 目前 Android 是允许开启无线调试然后绑定到 localhost 的,但有迹象表明这个能力可能要被拿掉了。
白桦: 为什么要拿掉?讨论里的说法是,引入限制是出于安全考虑。
茉莉: 对,安全角度。但评论区的反应很有意思——有人批评这是「有毒的极致安全」。
白桦: 这个说法挺重。他们的核心观点是,不是所有人的威胁模型都和大型科技公司一样。
茉莉: 就是说我自己的设备、自己的网络环境,我能不能自己判断风险?而不是一刀切把功能砍掉。
白桦: 所以很多人呼吁保留一个配置开关,让用户自己选择、自己承担风险。
茉莉: 这个争论其实不新鲜,但放在 ADB 无线调试这个场景下,它触及了一个很具体的问题:开发者和高级用户的灵活度,和系统默认安全边界之间,到底怎么平衡。
茉莉: 最后来看一个很有创意的硬件项目——Scanwheel,一款可以自己动手搭建的鼓式机械电视。
白桦: 鼓式机械电视,这个听起来像是回到了电视技术的原点。作者是 AncientJames,把整个项目放在了 GitHub 上。
茉莉: 有个小细节:readme 里的原始演示视频链接被设成了 example.com,一个占位地址。不过翻一下项目的 git 历史记录,能找到正确的 YouTube 视频 ID,是 41b8fw3_wP8。
白桦: 那实际效果怎么样?评论区普遍说效果「令人惊叹」。
茉莉: 确实。而且评论里脑洞开得挺大——有人说把它放大到卡车后厢那么大,甚至做到和街道等宽。
白桦: 还有人设想将来能不能做到轮毂盖上。当然也有人提醒,这种旋转机械不要在操作场合使用,安全第一。
茉莉: 对。这个项目把一种几乎被遗忘的显示技术带回来了,而且完全开源、自己动手,这个方向本身就很有意思。
茉莉: 好了,以上就是本期节目的全部内容。我们快速过一遍今天聊了什么。
白桦: 英国 AISI 和 CAISI 联合发布了 Kimi K3 的网络安全能力评估,报告拿它跟美国的顶级模型做了对比——NIST 完整报告里明确说,那个对比对象是 Opus。
茉莉: 然后有人用 Kimi K3 在浏览器里搞了个外形像 Windows XP 的 JavaScript 应用,其实不是真跑 XP,只是一个模拟 XP 界面的网页。
白桦: Debian 那边发起了一个全体决议,想给在项目里用大语言模型这件事定个更清晰的规矩。
茉莉: Claude 的官方博客也发了第五代模型的上下文工程新规则。Hacker News 上有人开玩笑说,这条路走到头就是系统提示只需要写一句"你知道该做什么"。
白桦: 《卫报》报道了美国民间自发破坏 Flock 监控摄像头的运动,这些摄像头做自动车牌识别,批评者觉得公共空间被过度监控了。
茉莉: 还有个挺有意思的讨论——"志留纪假说",说可能有过前人类工业文明。但有用户从化石证据上反驳了,我们连 35 亿年前的微生物化石都找得到,没道理漏掉一个工业文明。
白桦: 硬件方面,有人在 8 美元的 ESP32 上跑了一个 28.9M 参数的大模型,生成速度每秒 9.7 个 token。
茉莉: ARC-AGI 排行榜上,Opus 5 准确率 30%,其他模型全在 1% 到 3% 之间,差距非常大。
白桦: 还有 MouthPad 舌控触控板、Tile 追踪器的安全缺陷、PyTorch Monarch 支持 AMD GPU、通用汽车押注钠离子电池做电网储能……话题确实不少。
茉莉: 好,感谢收听本期节目,我们下期再见。
白桦: 下期见。