
0723 | 面试项目藏恶意Git钩子、Moonshot蒸馏争议与Gemma 4混合推理
Show notes
本期《HackerNews每日沙龙》涵盖多项技术社区热点:一则伪装成面试项目的恶意Git钩子攻击引发安全警觉;初创公司Moonshot被指用模型蒸馏技术获取数据训练K3,激起规则公平性争论;Cactus展示能输出置信度分数的后训练模型,实现设备端与云端智能路由;科技评论先驱约翰·德沃夏克去世,维基百科年龄争议再被提及;陶哲轩用ChatGPT分析雅可比猜想反例,展现AI辅助数学研究的前景;微软宣布2027年取消短信双重认证,强制推行通行密钥引发用户体验争议;Codeberg禁止加密货币项目触发去中心化托管讨论;Reddit屏蔽纯HTML访问被解读为AI授权商业策略。此外还有Fairphone 6摄像头Linux支持、Kagi付费搜索体验、Postgres运维生存指南补充、AI基准测试的「鹈鹕最大化」现象、Ghost Cut剪贴板问题,以及SIMD自动向量化与手工调优的深入辩论。
时间轴
- 00:00:00 开场
- 00:00:41 伪装面试的恶意Git钩子攻击
- 00:01:56 Moonshot被指蒸馏Fable模型训练K3
- 00:02:37 Cactus Hybrid:教Gemma 4知道何时自己错了
- 00:04:25 科技评论先驱约翰·德沃夏克去世
- 00:05:17 陶哲轩用ChatGPT探索雅可比猜想反例
- 00:06:23 微软2027年取消短信验证,通行密钥引发争议
- 00:07:25 Codeberg禁止加密货币项目引发信任讨论
- 00:08:14 Reddit屏蔽纯HTML访问,AI授权背后的商业逻辑
- 00:09:11 Fairphone 6广角摄像头获实验性Linux支持
- 00:10:14 回到Kagi:付费搜索的阿拉伯语体验再审视
- 00:11:36 创业公司Postgres生存指南的缺失环节
- 00:12:33 AI实验室在「鹈鹕最大化」?模型基准测试的讨论
- 00:13:43 Ghost Cut:剪贴板为何在所有平台都坏了
- 00:15:05 每个人都该了解SIMD:自动向量化vs手工调优之争
相关信息
- I Inspected My Take-Home Interview Project. It Was a Whole Operation - Bri Hacker News Campaign Feed
- "We have information that Moonshot distilled Fable for the development of K3" - Bri Hacker News Campaign Feed
- Show HN: Cactus Hybrid: We taught Gemma 4 to know when it's wrong - Bri Hacker News Campaign Feed
- John C. Dvorak has died - Bri Hacker News Campaign Feed
- Terrence Tao's ChatGPT Conversation about the Jacobian Conjecture Counterexample - Bri Hacker News Campaign Feed
- Passkeys were invented by engineers with zero understanding of consumer brain - Bri Hacker News Campaign Feed
- Codeberg Bans Cryptocurrency Projects - Bri Hacker News Campaign Feed
- So Reddit has decided that plain HTML is unsafe - Bri Hacker News Campaign Feed
- Fairphone 6 wide camera experimental Linux support - Bri Hacker News Campaign Feed
- Back to Kagi - Bri Hacker News Campaign Feed
- The startup's Postgres survival guide - Bri Hacker News Campaign Feed
- Are AI Labs Pelicanmaxxing? - Bri Hacker News Campaign Feed
- Ghost Cut – or why Cut and Paste is broken everywhere - Bri Hacker News Campaign Feed
- Everyone Should Know SIMD - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 欢迎收听Bri播客旗下的《HackerNews每日沙龙》,我是茉莉。
白桦: 我是白桦。今天我们来聊聊社区里几件有意思的事。
茉莉: 一份带回家的面试项目,竟然被人埋了恶意Git钩子,克隆下来跑就中招——这事在社区里引起不少讨论。
白桦: 还有初创公司Moonshot被指用模型蒸馏技术获取数据来训练K3,大家在争论规则对不同玩家是不是一碗水端平。另外Cactus在Gemma 4上做了后训练,让每个回答带个置信度分数,开发者可以按分数决定走本地推理还是调云端模型。
茉莉: 一位安全研究者最近把他收到的带回家面试项目打开看了一下,结果发现——这根本不是面试,而是一次精心策划的攻击。
白桦: 怎么发现的?
茉莉: 他把项目克隆下来一运行,仓库里藏了一个 Git 钩子,直接执行了恶意软件。这位名叫 CITIZENDOT 的研究者事后形容,整个调查过程就像一场 CTF 挑战,一层一层剥开,越挖越深。
白桦: 用面试当诱饵,这个思路确实挺刁的。
茉莉: 而且 Hacker News 上的讨论认为,这类攻击以后会越来越普遍。用户 ChrisMarshallNY 说,攻击者做了充分准备,这种手法很可能会频繁得手。
白桦: 那攻击者到底是什么来路?社区里的看法好像不太一样。
茉莉: 对。有人——比如 LoganDark——觉得相关技能可能来自大语言模型。用户 throw_m239339 说得更彻底:整个骗局很可能从一开始就是全自动的,还说现在已经进入了「智能体时代」。
白桦: 但 ChrisMarshallNY 不完全认同这个判断。
茉莉: 他怀疑背后是长期擅长这类攻击、经验丰富的工程师在利用大语言模型,而不是全靠 AI 自动跑。
白桦: 说到模型,有一条消息在社区里引起的争议不小——有说法称,初创公司 Moonshot 在开发模型 K3 的时候,使用了从 Fable 模型蒸馏技术获取的数据。
茉莉: 这个消息是用户 softwaredoug 在 Hacker News 上分享的,还附上了相关推文链接。
白桦: 蒸馏本身在技术上不算罕见,但这次讨论的焦点不在技术,而在规则。
茉莉: 社区里有评论说得很直接——这体现了「对别人一套规则,对自己另一套规则」的双重标准。换句话说,大家质疑的是:如果同样的事情发生在别人身上,评判标准会不会完全不一样。
白桦: 换个角度看看模型能力这个话题。孵化自 Y Combinator 的初创公司 Cactus 最近展示了一个新系统——Cactus Hybrid,他们对 Gemma 4 模型做了后训练,让每次回答都能附带一个置信度分数,范围是 0 到 1。
茉莉: 也就是说模型自己会说:这道题我有多大把握。
白桦: 对。开发者可以拿这个分数做路由策略——置信度高的时候,直接用速度快的设备端推理,数据不出本地,隐私也有保障;置信度低的时候,自动转发给云端更强的模型。
茉莉: 这个思路的关键是,凭什么信号来判断该不该转给云端?
白桦: 他们的研究基于对 Gemma 4 不同层隐藏状态的机制分析,发现这些隐藏状态里携带着模型在多种场景下的「自我意识」信号。这个信号不是靠模型自己用文字说「我不确定」,而是从内部表征中提取出来的。
茉莉: 跟传统做法比起来怎么样?
白桦: 创始团队说,传统混合应用依赖的路由信号,无论是让模型用文本自评,还是用词元熵这类启发式方法,在测试中仅仅比随机猜测略好。而他们的方法实际运行下来,只需要把 15% 到 35% 的查询路由到 Gemini 3.1 Flash-Lite,多数基准测试上就能达到和纯云端模型相当的性能。
茉莉: 具体到不同任务呢?
白桦: 差异还挺明显的。ChartQA 路由率最低,15% 到 20%;LibriSpeech 在 25% 到 30%;MMBench、GigaSpeech 和 MMAU 在 30% 到 35%;MMLU-Pro 路由率最高,到了 45% 到 55%,说明这类任务上模型更「没底」,需要更多求助云端。
茉莉: 最后说一个让人感慨的消息:科技专栏作家、播客先驱约翰·C·德沃夏克去世了,享年 80 岁。家人和朋友近日在社交平台上公布了这一消息。
白桦: 德沃夏克 1946 年出生,早年在《Byte》杂志写专栏,以犀利又有洞察力的评论受到广泛尊敬。后来在 ZDTV 等媒体担任主持人,成为早期科技视频节目的标志性面孔。
茉莉: 他身上还有一个挺特别的故事——关于他确切年龄的长期争议。维基百科很多年都错误记载了他的出生年份,而且拒绝他本人提交更正。
白桦: 这件事让德沃夏克很无奈。他后来专门撰文批评维基百科,说这种做法背离了 Wiki 的核心理念——一个连本人都不能纠正的错误,还是维基吗?
茉莉: 先来看一条有意思的数学圈讨论。菲尔兹奖得主陶哲轩最近在 ChatGPT 里跟一个大语言模型对话,探讨一个声称推翻雅可比猜想的反例。
白桦: 雅可比猜想是代数几何领域一个悬置多年的大问题,目前还没有被证明或推翻。陶哲轩这次对话,并不是宣布猜想真的被破解了。
茉莉: 对,更像是一次展示——让大语言模型辅助数学家,一步步分析一个复杂的证明过程,看看它能走到哪里。
白桦: Hacker News 上的评论也很有意思。不少人的判断是,这类发现本身算不上革命性突破,但它确实是一个信号,说明 AI 在数学研究领域的能力正在往前走。
茉莉: 还有人顺着这个话题往前推了一步,说如果未来大语言模型能破解因式分解的复杂性问题,甚至去证明 P 等于 NP,那对现有互联网安全体系的冲击就大了。
白桦: 不过现阶段,这类分析仍然需要人类专家主导,AI 更像是一个辅助工具,而不是独立的研究者。
茉莉: 接下来这条对日常办公安全影响很大。微软已经通知 M365 租户管理员,从 2027 年 2 月 1 号开始,将移除短信和语音这两种双重认证方式。
白桦: 与此同时,从 2026 年 9 月 1 号开始,微软会为用户自动注册通行密钥,也就是 passkey。
茉莉: 通行密钥的思路是基于公私钥对,私钥只在你的设备上,访问时还需要 PIN 码或者指纹、面部这些生物识别来解锁,从原理上说,确实比传统的短信验证码和口令更安全。
白桦: 不过 Hacker News 上也有用户提出了实际的困扰。有人指出,这套方案实际上是用 Microsoft Authenticator 把用户给锁住了。
茉莉: 具体来说就是,如果你习惯用 Bitwarden 这类第三方的通行密钥管理器,目前在这个场景下是用不了的,必须额外装一个 Microsoft Authenticator 才能完成登录。这确实给用户带来了额外的限制。
茉莉: 再来看一条关于代码托管服务的讨论。开发者 fishgoesblub 提醒大家一句话:不要轻信任何服务,不管它来自大公司还是志愿者。
白桦: 他的建议很直接,做好备份,尽可能自托管。他个人推荐的是 Gitea,以及由 Codeberg 维护的复刻版本 Forgejo。
茉莉: 另一位用户 sanskritical 提到了 Nostr 上的去中心化 Git 方案,叫 Nostrgit。思路是通过公钥来实现项目的自主所有权,不再受某一个实体约束。
白桦: 还有一位用户 bergie 补充了 Git over Reticulum,宣称这个替代选项可以覆盖版本管理、议题跟踪和发布管理,算是一个更完整的方案。
茉莉: 总体上,大家讨论的核心是同一个问题:把代码完全交给单一平台,风险到底有多大?
茉莉: 最后来看 Reddit 的商业动向。Reddit 已经跟 OpenAI 还有 Google 分别签了许可协议,把平台上的内容授权给这些 AI 公司。
白桦: 有评论者翻了一份财报,指出 Reddit 的毛利率达到了 91.5%,然后推测说,这些协议其实是想阻止其他 AI 公司再免费获取 Reddit 的内容。
茉莉: 这个数据确实很扎眼,百分之九十以上的毛利率说明平台从用户生成的内容里获得了极高的收益。
白桦: 所以讨论里很快就出现了另一个问题:那些贡献内容的用户,是不是也该分到一些补偿?
茉莉: 有人回得也挺直接,说你们已经通过看到的广告获得补偿了。还有人在讨论里提到了虚拟贴纸这个词,但目前不清楚具体指的是什么机制。
白桦: 说到底,这个争论的核心还是老问题:平台的价值到底有多少应该回馈给内容的真正创造者。
茉莉: 先来看一条关于 Fairphone 6 的消息。一位独立开发者在自己的博客上介绍了 Fairphone 6 广角摄像头获得实验性 Linux 支持的最新进展。
白桦: 这个项目的细节还没有完全公开,但从 Hacker News 上的讨论来看,社区反响相当积极。有用户直接说"很高兴看到这个,爱 Fairphone!",还有人感慨"希望我有一天也能做这么酷的东西"。
茉莉: 不过讨论里也出现了一个常见的疑问——Fairphone 能不能跑 GrapheneOS?有位用户给出了明确的回答:Fairphone 的硬件并不支持 GrapheneOS 所需的相关安全特性。
白桦: 他还贴出了 grapheneos.org 上 FAQ 页面的链接,里面专门有一节叫 future-devices,详细说明了哪些硬件在考虑范围之内。目前来看,Fairphone 不在其中。
茉莉: 所以对 Fairphone 用户来说,这个实验性的 Linux 摄像头驱动是一个好消息,但在安全定制 ROM 方面,选择仍然有限。
白桦: 接下来是一条关于搜索引擎的个人体验分享。博客作者 elashri 写了一篇文章,标题叫《回到 Kagi》。他没有在 Hacker News 上贴原文链接,而是在评论区回应了读者之前提出的一个阿拉伯语痛点。
茉莉: 他非常坦率地说,这个问题并没有解决——阿拉伯语新闻源仍然不好用。但他补充说,因为新闻阅读并不是他的主要活动,综合考虑之后,他觉得其他替代方案更差。
白桦: 他还比较了一下 Google 新闻。他的感受是 Google 新闻虽然好一些,但在瑞士经常根据位置假定他懂法语,推送很多法语内容。就算登录账号可以解决这个问题,又带来了隐私方面的顾虑。
茉莉: 那他现在的折中办法是什么呢?直接去浏览半岛电视台的阿拉伯语版,快速扫一眼标题来获取动态。简单直接,没有算法推荐,也不用担心位置推断。
白桦: 另外有个挺有意思的评论,有人问在 LLM 时代搜索引擎还重不重要,举了一个例子说自己的祖辈已经在用 ChatGPT 语音功能来处理原来需要网页搜索的事情。
茉莉: 这个问题 elashri 没有直接回答,但它确实触及了一个更大的趋势:当 AI 助手可以直接给出答案时,传统搜索引擎的角色正在发生变化。
白桦: 再来看一个关于数据库运维的讨论。Hacker News 上有一篇叫《创业公司 Postgres 生存指南》的文章引发了社区反馈,大家指出了原文遗漏的几个关键环节。
茉莉: 先说监控告警。有用户指出,如果缺少监控,像事务 ID 回卷这样的危险预警可能会被完全忽略。社区的建议是把 AWS 那种邮件级别的告警升级,变成可以直接呼叫值班人员的事件通知。
白桦: 另一个被点名批评的缺失是备份与恢复方案。社区的看法很一致:高可用虽然在创业初期不是刚需,但生产数据库必须从一开始就建立备份与恢复机制。
茉莉: 而原指南对这部分毫无涉及。这个批评其实指向一个更普遍的问题:很多技术指南关注的是怎么搭起来,而不是搭起来之后怎么保证数据不会丢。
白桦: 最后来看一篇有点好玩的 AI 分析文章,讨论了一个叫"鹈鹕最大化"的概念。什么意思呢?就是质疑前沿 AI 实验室可能在基准测试中对特定提示做了过度优化。
茉莉: 文章展示的证据是多个模型生成的骑自行车的鹈鹕 SVG 图像。有意思的是,每个模型画出来的鹈鹕都有自己独特的、相对一致的风格。
白桦: 不过讨论区的技术人员提出了不同的看法。他们认为,如果实验室真要取巧,更可能是在训练阶段随机加入大量动物和交通工具的增强数据,目的是追求泛化能力,而不是仅仅在"骑自行车的鹈鹕"这一个提示上做有监督微调。
茉莉: 还有人调侃说,光是想一想数据标注员必须手工生成几千张不同动物搭配不同交通工具的 SVG 图像,就觉得实在太好笑了。
白桦: 另外也有评论提到,预训练数据里本身就可能已经包含了大量鹈鹕图像,所以模型画出鹈鹕来并不奇怪。这场讨论目前还没有定论,但它提醒我们在看基准测试结果时,得留个心眼。
茉莉: Hacker News 上最近有个讨论挺热闹的,标题就叫"Ghost Cut — 或者说,为什么剪切和粘贴在所有地方都是坏的。" 发帖人点名说 Excel 的剪切粘贴行为尤其让人觉得反直觉,体验非常糟糕。
白桦: 具体是怎么个糟糕法?
茉莉: 讨论里很多用户说,在 Excel 里用常规的剪切再粘贴,会破坏所有引用粘贴位置的那些公式。所以他们的工作流被迫变成这样:先复制、粘贴到目标位置,然后再回到原来的地方手动把内容删掉。
白桦: 这就等于说,剪切这个功能本身在他们手里已经名存实亡了。
茉莉: 对,还有更狠的评论。有人说 Excel "一半时间不工作",而且它好像总能根据用户的意图,选择"最糟糕"的那种复制、剪切或粘贴方式。
白桦: 这个评价挺尖锐的。其实背后的逻辑是,Excel 在剪切时会自动更新引用,这在某些场景下是功能,但在大量互相引用的表格里就变成了灾难。
茉莉: 没错,用户们现在只能绕道走,等于回到最原始的手工操作:复制过去,再回头删,绕开了剪切这个本应省一步的设计。这个讨论也延伸到其他软件,认为剪切粘贴的"智能"行为一旦猜错了用户意图,代价比不智能还大。
白桦: 聊完 Excel,我们再来看另一个技术向的讨论。Mitchell Hashimoto 发了篇文章,标题是"每个人都应该了解 SIMD"。这个话题在 Hacker News 上引发了挺有意思的争论。
茉莉: 先说反对的声音。用户 qurren 说,自己从来只靠 `gcc -O3` 开自动向量化就够了,根本不需要学什么 SIMD。
白桦: 但很快有人反驳了。forrestthewoods 回应说,自动向量化的效果远不如大家想的那么好。要真正榨出最佳 SIMD 性能,往往得把数据布局从 AoS 改成 SoA。
茉莉: 这里解释一下,AoS 是 Array of Structures,SoA 是 Structure of Arrays。简单说就是数据在内存里的排列方式不同,对向量化效率影响很大。raegis 在讨论里也追问了这两个缩写的含义。
白桦: 另外,formerly_proven 补充了一个关键点:只开 `-O3` 不够,还得加上 `-march=native`,至少也要 `-march=x86-64-v3`。必要的时候甚至要手动调用 FMV,也就是函数多版本,以及微架构特化的 `target_clones`。
茉莉: 他还指出了一个容易忽略的细节:在常规数学模式下,因为浮点运算不满足交换律,非整数代码通常根本不会被自动向量化。这意味着很多科学计算场景下,编译器的自动优化其实是被静默跳过的。
白桦: 所以这个讨论的核心分歧在于:一边认为靠编译器就够了,另一边认为编译器远不够用,真正想用好像 SIMD 这样的技术,还是得理解数据布局和编译选项的细节。
茉莉: 好,今天信息量真的挺大。从那个藏在招人面试题里的恶意Git钩子,到微软宣布2027年要告别短信验证码,每一条都值得多想想。
白桦: 没错,还有Cactus那个给每个回答加置信度分数的思路,以及陶哲轩用ChatGPT分析数学反例的尝试——大模型辅助科研这件事,讨论还远没有结束。
茉莉: 最后提醒一句:不管是大厂还是志愿者维护的服务,备份永远是你自己的事。有人推荐Gitea和Forgejo,也有人提到了基于Nostr的去中心化方案,但核心道理不变——别把信任全交给别人。
白桦: 那今天就到这里。我们下期再见。
茉莉: 下期见。