0812 | NVIDIA Nemotron 3.5、推理窃取、Grok Bot与CFTC紧急命令|8月11日要闻

||Download

Show notes

本期节目盘点科技圈的一批新动态。先是 NVIDIA 发布 Nemotron 3.5 Lightning 模型并推出 NeMo Switchyard 智能路由库,但缓存与"实验性"标注引发争议;随后有论文揭示可跨会话、跨用户重放的加密推理块泄露问题,能从公开轨迹中恢复大量密钥与隐私。新产品方面,Grok Bot 以"AI 队友"定位、Cursor 式定价上线,但信任问题成为焦点。监管层面,CFTC 宣布紧急状态维持 Kalshi 在纽约运营,Manus 因监管要求恢复独立公司,OpenAI 伦理主管任职不到一年离职,伦敦地铁则扩展实时面部识别。技术话题包括 Mojo 1.0 正式发布、WorldClaw 的 agentic 3D 开放世界生成、Go 是否适合 AI 辅助工程、把 GitHub Copilot 放到中间代理后面的实测、GPU 透传让 macOS 虚拟机大幅提速 LLM 推理,以及 OpenSSH 10.5 欢迎 AI 辅助安全报告。最后以 Stratechery 关于英伟达融资扩张风险的宏观分析作结。

时间轴

  • 00:00:00 开场
  • 00:00:41 Nvidia Nemotron 3.5 Lightning 与智能路由
  • 00:03:33 从专有 LLM API 窃取加密推理过程
  • 00:05:26 Grok Bot 以 Cursor 式定价发布
  • 00:07:22 CFTC 宣布紧急状态以维持 Kalshi 运营
  • 00:09:26 Manus 将恢复独立运营
  • 00:10:40 OpenAI 伦理主管任职不到一年离职
  • 00:12:21 伦敦地铁扩展实时面部识别
  • 00:13:44 Mojo 1.0 发布与许可之争
  • 00:15:51 WorldClaw:agentic 3D 开放世界生成
  • 00:18:10 Go 是否适合 AI 辅助工程
  • 00:20:04 把 GitHub Copilot 放到 MitM 代理后面
  • 00:22:00 英伟达的冒险生意
  • 00:24:42 GPU 透传让 macOS 虚拟机跑 LLM 大幅提速
  • 00:26:29 OpenSSH 10.5:欢迎 AI 报告而非 AI 修复

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

林岚: 欢迎收听 HackerNews 每日沙龙,我是林岚。

陈序: 我是陈序。今天这期节目,我们会聊聊英伟达扩展 Nemotron 模型家族,还有一篇关于从专有大模型接口盗取推理链的研究。

林岚: 另外还有,SpaceXAI 推出的 Grok Bot 早期测试产品,监管机构动用紧急权力要求 Kalshi 继续按核心原则运营,以及 Manus 即将恢复独立运营的公告。

陈序: 这期还有关于 OpenAI 伦理主管离职、伦敦地铁站试行人脸识别、Mojo 1.0 发布、以及腾讯的 3D 世界生成模型等话题。我们这就开始。

林岚: 今天这则消息来自 NVIDIA 官方博客,说是八月十一号发布的。他们扩展了 Nemotron 3 模型家族,主打的是一个叫 Nemotron 3.5 Lightning 的模型,总共三百亿参数,但用的是混合专家架构,也就是每次只激活其中一小部分。官方把它描述成同级里最适合长期 agentic 工作负载的模型,说相比同类,输出速度最高能快四倍,agentic 任务完成能快百分之三十。不过更让人在意的,是它同时发布的那个开源路由库,叫 NeMo Switchyard。

陈序: 对,Switchyard 的卖点是把每个请求智能路由到最合适的模型,而且覆盖开发者自己的开放模型、专有模型还有 NVIDIA 自家模型,最关键是说不用重写现有应用。也就是说你调 API 的地方不用动,路由器在后面替你挑模型。不过这个方向在讨论里争议很大——有人直接质疑它是“蛇油营销”,核心问题是缓存。

林岚: 缓存确实是痛点。有评论者提出,路由器处理第二次请求时,提示词缓存怎么办?如果你为了路由效果把同一个会话里的不同请求发给不同模型,那前一次的缓存就很可能浪费了,除非你只能做会话粘性——固定一个模型跟到底,但那样路由效果就差很多。这个取舍在讨论里被反复拿出来说。

陈序: 还有一层,有用户直接指出 GitHub 上这个仓库的 README 写的是“实验性软件,不可用于生产”,跟新闻稿里可部署的宣传是矛盾的。另外文档里没提 cache 这个词,但代码里其实有提及。这就让那句“无需重写应用”听起来有点悬。

林岚: 不过模型本身的架构也引发了不少关注。有人注意到它用的是 Mamba-2 加 MoE 加 Attention 的混合架构,说这在追赶常规 Transformer。也有人对比说,它和同类规模模型差不多大百分之二十,激活参数相近的话,分数大概高百分之二十。当然也有人泼冷水——引用第三方测评说某个三十 B 的 Meta 模型“好得多”,但马上有人质疑那个榜单前四名全是同一个系列的变体,不太符合自己体验。

陈序: 还有一个值得记住的点,就是 NVIDIA 持续开源这件事背后的动机。有人评论说,NVIDIA 因为卖硬件,所以有持续开源的动力——开放权重做得越成功,越符合它自己的商业利益。官方还提到,这次发布有一批定制用户,涵盖网络安全、法律、代码审查、物理与生命科学推理这些领域。模型支持的上下文最长到一百万 token,单卡就能部署,采样温度官方推荐是 1.0。

林岚: 接下来这个消息有点让人坐不住,来自黑客新闻上的一篇论文,标题大意是“从专有大模型 API 里窃取推理过程”。它说的漏洞是:Anthropic、OpenAI 和 Google 的 API 会把模型的推理过程作为加密块返回给客户端,而这些加密块居然可以跨会话、跨用户、甚至跨模型重放。

陈序: 攻击的具体做法我没完全听懂,等下,让我理一理——你不用直接去攻击那个强模型,你只要拿它的推理块,重放进同一个提供方更弱的“兄弟”模型里,先 jailbreak 那个弱模型,就能用明文把强模型的隐藏推理恢复出来。整个流程不碰强模型,也就不会触发它的反蒸馏防护。论文里给的实例,源模型和接收方正好来自同一家。

林岚: 这个漏洞不光存在于实验室设定。作者更进一步的扫描里,从 GitHub 和 Hugging Face 上收集了六千七百多条公开的 agent 轨迹,解码出三十多万个重建的推理块。在真实非基准的用户会话里,他们恢复了七百多个隐私相关的产物——包括六十二个 API 密钥、三十三个密码、二十四个访问令牌,还有个人邮箱和邮寄地址。最麻烦的是,其中六十四个产物只出现在推理块里,平时可见的会话文本中根本不存在。

陈序: 这解释了为什么这个漏洞被人惦记。至于要不要把它修掉,评论区反而有另一种担心:如果不允许重放,那同一个对话里中途换模型就可能会丢失关键上下文。所以有评论者猜测,提供方与其说是疏忽,不如说很可能是为了体验主动留着这个能力,甚至有评论引用了密码学领域一个博客帖,猜想这种可移植性是不是提供方故意留的后门。

林岚: 还有一个新产品叫 Grok Bot,来自 SpaceXAI,官方页面的定位挺有意思——它把自己叫“AI 队友”,可以登录你的工具、像你一样使用它们,然后把做完的工作带回来。你可以像分配任务给同事一样,在桌面或 iOS 上给它派活,它会从头到尾处理项目、保持上下文、随时间变聪明,需要批准的时候才回来找你。

陈序: 几个细节值得停下来想一下。它支持多个 Bot 并行,七天二十四小时运行,就算你把笔记本合上它也能继续。用户只要演示一次工作流,这个 Bot 就会把流程存成 routine,之后自己跑。预算上,定价是每个席位每月一百二到两百美元,具体取决于你的订阅档位。下载目前只支持苹果芯片的 macOS。

林岚: 不过评论区真正热闹的不是功能,而是信任问题。很多人看到定价用的是“Cursor Ultra”和“Cursor Premium Teams”这样的名字,觉得这其实就是 Code 到 Cowork 这条产品线的延续。而关于它背后是不是 SpaceXAI、以及马斯克的个人品牌,争议非常——怎么说呢——非常直接。有人说马斯克的个人品牌“太有毒”,自己不会让他靠近数据,还好奇大企业会不会有意回避这些工具。

陈序: 还有人从商业角度泼冷水。有评论说,马斯克把 Twitter 改名已经烧掉了价值以十亿计的品牌资产,而 Cursor 这个品牌是他跟企业客户接触的少数楔子之一。可现在企业客户看起来完全在避开这个新品牌下的产品。另一个评论更直接:每月每员工一百二到两百美元,有多少公司愿意让这个工具访问自己所有文件和全部数据?然后就有人回一句嘲讽——也许美国政府会?信任这块,显然还是绕不开的那道坎。

林岚: 最后一则还是和法律框架有关。美国商品期货交易委员会,简称 CFTC,在八月十一号针对预测市场平台 Kalshi 动用了一种紧急权力。事情背景是,前阵子加州纽约州的总检察长在州法院起诉 Kalshi,想申请临时限制令,禁止它在全国范围内提供所有事件合约,索赔金额超过三百六十亿美元。CFTC 这回的回应是:宣布市场处于紧急状态,命令这个交易所继续按商品交易法的核心原则运营。

陈序: 这个定性之争很关键。有人点出来,CFTC 是把 Kalshi 定义成“事件合约”这类金融衍生品交易所,等于把纽约那套“博彩平台”的说法驳了回去。但马上就有人追问:衍生品交易所和博彩平台到底有什么区别?答案是监管、技能和准入。还有人提出一个更哲学的说法——传统衍生品交易的是那种即便没有衍生品市场也真实存在的风险,而预测市场更像是凭空制造出一个风险来交易。当然也有讽刺的声音,直接管这叫“骗局经济补贴”。

林岚: 法律层面的争论也很有意思。一边有人觉得,全国性的禁令在某个之前的判例之后“好像站不住脚”,因为这涉嫌超越州界去管别的州的交易。另一边有人反驳说,那个判例其实不适用,因为全国性禁令和普遍禁令不一样——如果为了保护纽约州居民的利益,禁令需要全国效力才奏效,那就没问题。而且 Kalshi 总部据说就在纽约市。还有人给出一个更系统的解释:纽约州也没权命令纽交所停业,那是 SEC 的职权,依据是最高条款和州际贸易条款。简单说,这场官司争的不只是 Kalshi 能不能卖合约,而是各州到底有没有权力管一个跨州的金融市场——而这,很可能要打到联邦层面才有结论。

林岚: 先说 Manus。这个 AI 智能体公司在官方博客上宣布,会很快恢复为独立公司运营。为什么要独立?因为母公司 Meta 在 2025 年 12 月 29 号收购了它,而按照某些司法辖区的监管要求,收购之后产生的一部分数据需要被删除。具体时间点很紧凑:受影响用户从 12 月 29 号之后产生的数据,会在 2026 年 8 月 23 号到 24 号之间被清掉,也就是大约两天的访问中断。官方特别强调,这不是数据泄露,也不是安全事件,纯属合规操作。数据会存在美国和新加坡。Hacker News 上争论的焦点是,究竟是谁、因为什么监管要求逼着它们分家。有人猜是欧盟,也有人抛出一个例子——印度已经封禁了阿里云。但另一个更主流的说法是,中国国家发改委正式叫停了这个收购,命令交易解除,理由是围绕战略 AI 技术的国家安全和技术转让限制。当然也有评论者直接泼冷水,说这都能猜到,何必猜,网上一搜就有。还特别提到一个对照:中国反垄断执法看来还在运作,同时有趣的是,Meta 在中国一直有业务,而且需要政府审批。

林岚: OpenAI 的伦理主管 Chloé Bakalar 在入职不到一年后就离职了。她的履历很醒目:去年八月才加入 OpenAI,此前从 2021 年 11 月到 2025 年 8 月,在 Meta 担任首席伦理学家。目前能找到的原始报道——包括金融时报和 AI 杂志——都只露出验证页面,正文看不到,AI 杂志的标题还是以“为什么离开”设问,所以具体原因还没披露。Hacker News 上围绕这件事掀起了两条讨论。一条是质疑这种伦理岗位本身有没有用。有人指出,大公司的伦理或民权职位薪水很高,但很难撼动公司早已定好的方向,很多人只是借此赚钱,之后又跳回非营利机构。另一条更尖锐——有评论说,治理者或说"真正的决策层"本质上是超道德的,无论个人道德多强,都会被更不择手段的竞争者淘汰,所以这类角色其实要先放下道德和同理心。有人拿家乡的小面包师、电工做对照,说他们留下老员工、投资社区,是因为服务社区本身就是有道德的生活;但这个说法立刻被反驳——这些例子跟 OpenAI 这种体量的公司完全不可比,距离和金钱的差距会消解决策中对人的考量。还冒出过替代方案:有人建议模型训练别只看单一分数,而是同时跟踪短期表现和伦理对齐结果,只有伦理分数够高才算成功。但立刻有人追问,那到底听谁的伦理?西方的、伊斯兰的、佛教的,还是人权的?也有人坚持,确实存在跨文化共享的道德基准,比如非暴力。目前能确定的只有离职这个事实,原因还得等 FT 或 AI 杂志的后续报道。

林岚: 英国交通警察把实时面部识别试验扩展到了伦敦地铁站,Hacker News 上直接用了“伦敦地铁开始扫描乘客面孔”这个标题。原始报道页被验证墙挡住了,警方的说法只能靠讨论串里的引述。根据评论者引用的警方声明,这次部署是情报主导的,目标是把警方或法院通缉的人识别出来,包括严重犯罪嫌疑人和可能违反保释条件或法院命令的人。但问题恰恰也在这里——评论者们担心,这套系统的目标写得再窄,实际能不能被约束住?有人点破,它很容易被用来追踪警方不喜欢的抗议活动参与者。更大层面的争论是,这是不是又一次“21 世纪威权主义”的倒退?有人讽刺说,一个连偷渡小船都拦不住的国家,却能在地铁里扫描每一个通勤者的脸。也有人唱反调:这样的反隐私措施之所以能落地,正是因为绝大多数人其实“学得很好”——大家接受了,系统才建得起来。还有位亲历者说,他刚过机场安检,觉得这套做法由来已久,从 2001 年开始,很多人就已经习惯了被"老大哥"看着。一条评论写得很简短也很扎眼——“他们说这一次不一样。”目前待解的问题是,警方的书面限定范围,在实际使用中到底能不能管住这套系统。

林岚: 最后看编程语言 Mojo 的正式 1.0 发布。Modular 的官方博文在 2026 年 8 月 11 号宣布,从 2023 年首次亮相之后,Mojo 正式达到 1.0,并说它已经成长为通用语言,而且 1.x 阶段只做增量式改动,破坏性变更会像 C++ 这些成熟语言一样谨慎管理。它还强调一个数据点:标准库开源以来,近两百名贡献者合入了超过一千一百个代码合并请求,改动超过二十万行。26.5 这个版本里,变量声明统一了写法,闭包统一了,指针类型也只有一个,还加了 Python 风格的 lambda 语法,以及更稳定的语言服务器。评论里的争议集中在两个点上。第一,AI 时代再学新语言还有没有意义?有人直接说没有——他自己已经不手写代码,只做代码审查,只爱用熟悉的语言。但立刻有反驳:Mojo 比 ChatGPT 早得多就在酝酿了,而且背后的团队正是 MLIR 编译基础设施的团队,在这个领域已经耕耘了约十年。更关键的一个反驳是,Mojo 的卖点不是代替 Python,而是用你熟悉的 Python 语法去取代 GPU 内核的编程语言——像 CUDA、Triton 这些,门槛完全不同。第二,是开源问题。有人问,语言本身是不是专有许可,标准库是不是 Apache 2?公司回应说,会继续渐进式开源,承诺 2026 年开源 Mojo 编译器和工具链。但这一承诺本身还没兑现,有评论者不买账:不喜欢闭源编译器,觉得 Python 已经有 Pydantic 这类库,把性能卸载给底层的 Rust 函数就够了。还有一个技术层面的隐忧——有人提醒,NVIDIA 不会维护 CUDA 的任何向后兼容,CUDA 一升级,Mojo 就只能干等适配。有人在评论区把这份警惕投射到了团队:见过 Swift 演变的人,听到"语言基本稳定"这种话,都该保持警觉。所以 1.0 是个节点,但是否真能追上 CUDA 的升级节奏、开源的承诺能不能兑现,仍是这次讨论里悬而未决的分歧。

林岚: 先把视线放到生成式3D上。腾讯Hunyuan3D研究团队刚发布了一个叫WorldClaw的框架,定位是agentic的开放世界规模化生成——简单说,就是给模型一段开放式文本提示,它能直接产出一个可以探索、还能编辑的3D世界,而且地形和里面的每个对象都是独立可编辑的实例,不是一整块贴图。

陈序: 项目页面展示了十一个世界,比如一个中世纪风格村庄的提示词,同时包含雪山、平原、水域、沙漠和动物。每个世界都有等距布局,还有轨道和地面两种视角,并能渲染四种通道——外观、实例掩码、法线和深度。有意思的是生成方式:散布类资产靠3D编码构建,其余对象由3D生成模型单独产出。

林岚: 讨论的焦点其实在“生成式开放世界”和“手工设计”之争。有评论拿Skyrim和Cyberpunk这类手工放置细节、靠环境讲故事的作品,去对比程序生成味更重的Starfield,认为纯生成的村庄还不够有趣,可能更适合腾讯量产gacha风格游戏,但难及顶级开放世界。另一方则反驳说AI叙事并不弱——有写作奖项在披露作者是AI后被撤销,认为全AI管线会快速进步。

陈序: 代码算是另一个争议点。有评论说晚上要去看代码,结果有人指出GitHub仓库是空的、根本没有代码,还被反讽式地点了个approve。不过也有人解释,这本身不是模型,而是调用外部模型的Python脚本,代码并未公开;少见之处在于让图像模型先完成构图,再用类似SAM3D的做法把对象提取成3D放进世界,其余是常见的程序化生成方案。

林岚: 最后从架构看,WorldClaw是“粗到细”的agentic流程:规划agent把提示转成区域、地形、资产、材质和空间关系的结构化规格,先建全局一致的地形,再只给需要细节的区域做生成和重建可编辑网格。结论是每个世界最终都是显式地形加独立可管理的纹理网格,能衔接渲染、动画和游戏引擎工作流。

陈序: 转向编程语言。谷歌开发者博客在8月11号发了一篇《为什么Go是AI辅助软件工程的理想语言》,作者是Go的产品经理和一位Google Cloud首席布道师。核心论点很直接:AI正在把软件工程从“写代码”推向“审查代码”,而Go的严格编译器、统一工具链和平台化设计,很适合AI辅助开发。

林岚: 文章有个耐人寻味的点。它说AI和人类对代码的需求很相似——如果让AI代理在没有外部验证的情况下反复迭代重构,首轮可能95%正确,但后续轮次的错误率会复合,污染上下文窗口,降低准确性,还会增加token开销。而Go的低差异、可预测惯用法,恰好提供了更干净的LLM训练数据。

陈序: HN上的讨论几乎全程围绕“AI辅助下Go和Rust谁更适合”。一位长期Go拥护者说团队用Rust的障碍已经消失,现在一切皆Rust;马上有人回应“Rust更好,因为就是更好”不具说服力,想要具体理由。随后有解释把Rust编译器比作暴君——类型系统严格、借用检查器无情,LLM不容易糊弄它。

林岚: 另一派则强调可读性。有人说如果让代理写大部分代码,可读性就很重要,而Rust比Go难读得多;马上有反例说我觉得Rust更好读。也有人说这本质是主观偏好——Go简洁一致但信息密度低、高度意见化,Rust更重、学习曲线陡,但熟悉后读得快、不需要频繁跳转。还有评论提到,代理产出太多,要求人逐行读完会抵消AI带来的速度,所以他们正改用其他方式让代理证明代码符合预期。

陈序: 接下来是一个挺实际的翻车案例。有开发者在Hacker News发帖,讲自己把GitHub Copilot放到一个中间代理后面拦截流量,学到了不少东西。起因是好奇Copilot的底层实现,以及它每月配额为什么越来越快耗尽,于是用mitmproxy拦截网络流量,再对照VS Code源码核实。

林岚: 他实时看到了模型和能力的发现与路由,查看了注入到上下文里的内容,结果发现一个让人意外的点:所谓的“近期编辑”可以从当前编辑文件以外的文件拉取上下文,里面包括.env环境变量文件。评论区有人震惊——本以为和GitHub深度集成的工具会默认处理好这类敏感文件。

陈序: 毕竟跨平台、还不依赖具体编码agent地解决.env问题并不容易:可以删掉.env,但没有原生的跨平台密钥管理器,语言标准库也不提供对接原生密钥库的API;也有人提议考虑“密钥注入代理”。另一种观点是干脆在拿不到环境变量的沙箱里运行这类工具。

林岚: 帖子里还有一个方案之争。有人提议改用eBPF来做拦截,说更简单——不需要对抗证书固定或mTLS,直接在加密前后拿到明文,几乎所有agent和IDE都适用。马上有人质疑原理:TLS大多在用户态基于OpenSSL完成,eBPF只在网络层面要绕开前向加密和证书固定怎么可能。也有人解释是靠探针挂到用户进程或库上,相当于内置进内核的动态库注入,还附上了相关文章链接。

陈序: 治理视角也有声音。有评论认为大公司在安全和创新之间妥协可以理解,总比什么都不做好,并且这恰恰说明治理问题可以成为有agent原生视角的人建设好系统的真实机会。

林岚: 最后聊一个宏观的资本市场话题。Ben Thompson在Stratechery发了一篇《英伟达的风险生意》,核心观点是:英伟达正在帮客户寻找新的融资方式,这会显著扩大AI建设的风险。文章开篇用1873年的铁路泡沫来类比——当年承销北太平洋铁路债券的公司抽佣12%,巅峰时雇了一千五百名销售并资助了一千三百家报纸,这家公司破产直接触发了1873年恐慌。

陈序: 这个类比之所以被注意,是因为今年有一本叫《1873》的新书,把1870年代美国铁路债券每年五亿美元的投入,按一千二百倍折算成今天的六千亿美元,差不多等于2026年大型科技公司的预计投资额。微软的纳德拉甚至在最近的财报电话会上说这是本“必读之书”。而微软上季度自由现金流是196亿美元,是唯一一家仍以“资本开支不由债务支撑”来否认泡沫的超大规模云厂商。

林岚: 其他云厂商的债务轨迹看起来很说明问题。Oracle、Meta、Alphabet、Amazon去年9到11月合计发行了800亿美元债券,2025年全年合计筹资1080亿,而今年到7月7号已经筹资1940亿美元——翻倍往上走。其中86%的今年新债,收益率已经高过发行价,近期新债认购倍数也从2月的5倍降到了不足2倍。这暗示市场的胃口在收紧。

陈序: 评论区对英伟达处境的解读更复杂一些。有人说这是对英伟达更有意思的角度——它已经在机器人领域布局,即使AI地位下降,机器人仍是更难进入的大赛道。也有人认为即使在西半,英伟达优势也会减弱,比如HN上关于在AMD硬件上跑大模型的帖子明显增多,虽然AMD软件仍远逊于英伟达。还有人指出英伟达的地位依赖多个条件同时成立,而这些条件正被同时质疑。

林岚: 有意思的是讨论还拐到了“分析来源之争”。有人抱怨免费通讯和talking head免费散布这类叙事,要量化和可操作的信息得自己找或付费。回答里有人推荐了本文所在的Stratechery本身——它每周免费发一篇,其余三篇要每月15美元订阅;也有人推荐SemiAnalysis,说它主要面向投资者的付费选项质量很高,但立刻被另一人痛批像“狂热的推销员在做市场拉抬”。有人回了句很直接的:如果你还得问,你不会从中受益。

林岚: 先聊一个让 Mac 虚拟机跑 AI 推理变快很多的新东西。核心作者发了一篇详细帖子,讲如何在 macOS 虚拟机里解开更新的 Metal 图形快速路径,让 llama.cpp 这类本地大模型工具提速明显。他们在 M1 Ultra 上拿 TinyLlama 这个模型测试,提示处理快了约十一倍,生成 token 的速度快了约十六倍,而且解锁之后的提示处理速度能达到裸机结果的百分之九十八。

陈序: 为什么会差这么多?这个层本身并不涉及模型,而是拦截并改写虚拟机对图形能力的回答。llama.cpp 会按照客户端报告的 GPU 代系和线程组内存上限来选择内核,原版虚拟机报告的是较旧的代系和 32 千字节的上限,所以挑了更慢的内核。这个兼容层把报告改成更新的代系和 64 千字节上限,llama.cpp 就选到了虚拟显卡能跑的新路径。作者在黑客新闻上跟不少质疑者反复确认过,这些数字只在同一个原版 Lume macOS 虚拟机里、对同一个 Apple Silicon 主机对比得出,裸机的 llama.cpp 不受影响。

林岚: 所以他们本质上是在修一个虚拟机导致的“内核选错”,而不是给了所有人通用的加速。评论里也有人指出,这不是惠及所有 llama.cpp 用户,只对用 Virtualization.framework 这类虚拟机的人有意义。作者基本认同这一点,也说具体效果得逐应用测试——比如另一个推理工具 MLX 在测试里就没区别。他们还给出了一点技术背景:Apple 的 GPU 代系并不是对应到真实硬件型号,而是从 Metal 接口引入时开始数的,前面几代的 GPU 核心名义上还是老的 PowerVR 设计。

陈序: 另一条是 OpenSSH 的新版本发布。十点五版和它的便携版在这周放出,发布说明里提到了一个有意思的转变:最近团队收到大量安全漏洞报告,其中很多是 AI 模型发现或借助 AI 辅助完成的。虽然其中很大一部分在现实威胁模型下被判定没有安全影响,但团队明确表示欢迎,尤其是那些有人工分类、能附上分析和修复建议的报告。

林岚: 他们甚至因此调整了发布节奏。发布说明称,有好几个案例里,AI 工具发现的漏洞随后也被不同的研究者独立发现,所以他们推断,那些不向开源项目报告漏洞的对手很可能也能发现同样的漏洞。于是团队决定暂时更频繁地发布修复,而不是攒到下一个计划的版本。黑客新闻上就这条政策讨论了不少,有人理解 AI 辅助报告一般不太受欢迎,但安全漏洞报告算例外;也有人纠正说,攻击者会用 AI 更快发现不公开的漏洞且不报告,所以筛选有效报告、把无效的剔掉是合理的。还有读者说得挺直接:宁愿要一个安全的 OpenSSH,而不是一个没有 AI 的版本。

陈序: 新版本还加了个实用的小功能:可以用一个参数直接列出某个用户公钥认证时会尝试的所有密钥和顺序。有人为这个叫好,说再也不用靠冗长的调试输出去猜远程主机到底想要哪种认证。另一个长期用调试模式确认实际认证密钥的读者则觉得用处有限,因为顺序本来就知道,他更希望直接回显最终哪个密钥成功了。另外,发布说明还提到,这次把公钥类型检查挪到了解析密钥之前,以减少预认证阶段的攻击面,而这个建议来自 Anthropic 的一位工程师。

林岚: 好了,这期内容就到这。今天我们聊了不少大模型发布、创业公司的动向,还有监管与安全的新进展。有几件事值得你后续留意:比如 Gemini 3 Deep Think 这类新模型的实用性,以及 AI 监管在州与联邦层面出现的分歧和摩擦。想深入哪一块,欢迎留言告诉我们。

陈序: 也别忘了,很多信息我们都会在下一期继续追踪。感谢你的收听,我们下期再见。 如果你身边有朋友也关心这些话题,不妨把这期节目分享给他们。