0904 | 《Astra 登场:AI 狂潮与土星的十边形》

||Download

Show notes

本期节目从 OpenAI 发布 GPT-6 Astra 讲起,聊它在基准测试上的惊人成绩、随之而来的全行业宕机,以及开源模型和平台生态的最新动向;再看看开发者把旧游戏一夜移植的实验,然后转向科学与社会:土星南极的十边形奇观、加拿大鲑鱼与人工水坝、爱尔兰少女的种子实验,最后是 .name 域名销毁、新闻编辑室与预测市场之争,以及纪念社会活动家 Gloria Steinem。

时间轴

  • 00:00:04 开场
  • 00:00:25 GPT-6 Astra 发布与基准测试
  • 00:02:59 AI 服务同时宕机
  • 00:04:41 开源模型与平台生态
  • 00:07:36 AI 工具的风险与实测
  • 00:09:50 一夜移植与代码传奇
  • 00:12:52 土星南极的十边形
  • 00:14:07 生态修复与青少年科学
  • 00:16:05 互联网与数字生活
  • 00:19:23 新闻业争议与 Steinem 辞世
  • 00:21:27 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 欢迎回到本期节目,我是茉莉。

白桦: 我是白桦。过去二十四小时可以说相当热闹:一个大模型发布把各家基准分数推到了新高度,结果发布当晚几大 AI 服务居然同时宕机,开源这边也有一连串大动作。我们一条条来聊,先从最重磅的那条说起。

茉莉: 好,先说 GPT-6 Astra。OpenAI 发布了这款模型,官方给出来的成绩单相当夸张:FrontierMath Tier 4 拿到 98%,ARC-AGI-3 拿到 99.9%,ExploitBench 直接满分 100%,官方还说对齐能力有提升。

白桦: 但这里有个很值得琢磨的细节。在 ARC-AGI-3 上,同一个模型其实有两个数字。用标准 harness,也就是标准测试框架,得分是 62.7%,花了大约两万六千美元;换成所谓的 Provider Adapter,就跳到了 99.9%,而且在动作效率上超过了人类。

茉莉: 这就是评论区吵得最凶的地方了。一个模型,两套测试方式,一个 62.7%,一个 99.9%,差了将近四十个百分点。有人直接说,这说明所谓的基准分数很大程度上测的是测试框架本身,而不是模型能力。

白桦: 对,这个观点其实站得住。你的 harness 怎么给模型提供信息、怎么处理动作序列,直接决定了它能不能把能力发挥出来。Provider Adapter 大概是给了模型更适配的接口,所以分数才那么高。

茉莉: 但另一派的人会说,反过来看也行:说明模型上限就是很高的,62.7% 只是 harness 没喂好。标准 harness 花两万六千美元拿到 62.7%,这本身也不算差。

白桦: 这就是分歧所在。乐观的人看到 99.9%,说 AGI 式基准已经被刷穿了;谨慎的人看到 62.7% 和那两万六千美元,说这个成本和波动性说明现实里还远没那么好用。

茉莉: 还有一个双方都同意的未知数:这些分数到底意味着什么现实任务能力?ARC-AGI-3 刷到 99.9% 之后,你在日常用它写邮件、做研究,体验会同步提升吗?没人能回答。ExploitBench 100% 这个数字更是让一些评论者觉得不安,一个安全相关的基准被打满,到底是好事还是值得警惕,讨论里没有定论。

白桦: 官方说对齐能力提升了,这点他们当然会这么说。评论区比较一致的一点只是:等真实使用报告出来再下结论。然后在讨论进行到一半的时候,现实给了大家一个很戏剧性的注脚。

茉莉: 对,就说这个吧。发布当晚,OpenAI、Claude 和 Grok 同时宕机。不只是 ChatGPT,Claude 也挂了,Grok 那边 API 和应用都中断,status.x.ai 上自己也报告了故障。

白桦: 三家同时出事,这在评论区立刻引发了各种猜测。一种说法是 Cloudflare 或者 Azure 这类底层基础设施出了问题,大家都建在同样的地基上,一家倒全家倒。

茉莉: 另一种猜测更有意思:Astra 发布引发了用户大规模迁移,大家蜂拥去试新模型,旧服务的负载模式突然变化,产生了级联效应。也就是说,Astra 自己的发布把整个行业挤了一下。

白桦: 这个解释评论里讨论得挺认真。如果是真的,那说明这个行业已经耦合到什么程度了——一个新产品上线,能把另外两家的服务挤挂。

茉莉: HN 上也有人注意到这个巧合本身,觉得时间点太巧了,到底是不是纯粹的基础设施故障,官方没有一个完整的说法。这块其实是这次事件里最大的未解之谜:真正的原因到现在没有权威结论。

白桦: 抛开原因不谈,大家比较认同的一点是:这暴露了头部 AI 服务高度集中的脆弱性。你不管用哪家,都可能在同一时刻失去服务。有人就开始讨论要不要多备一家的 API key,这算是这次宕机的一个很实际的后续吧。

茉莉: 而且这事儿发生在 Astra 发布的同一天,就更有意思了——一边是史上最强分数,一边是全网服务瘫痪。热度最高的时刻恰好是系统最脆弱的时刻。

白桦: 说到热度,我们再把镜头转向生态的另一边。这次狂热里,开源和平台一侧的动作其实一点都不小。

茉莉: 先说 IFM,他们发布了 K2 Horizon,一个完全开放的模型系列。六款模型,参数量从 0.9B 一直到 375B-A23B 的那个大家伙,许可证是 Apache 2.0。

白桦: Apache 2.0 已经很慷慨了,但真正让人讨论起来的是他们把训练数据、训练代码、还有训练过程中的 checkpoint 全部放出来了。

茉莉: 对,评论区把这叫做全栈开源。你不光能拿模型去用,你还能复现他们的训练过程,甚至拿他们的数据和代码自己再训一遍。这在开放权重模型越来越常见的今天,开放的其实是更彻底的一层。

白桦: 这和 Astra 那种只有分数、没有细节的发布形成了很鲜明的对照。一个把你关在评测数字外面,一个把厨房整个打开给你看。有人在讨论里说,这种对照本身就是这一周 AI 行业的缩影。

茉莉: 算力这边也有动静。Cerebras 在公开端点上提供 Qwen 3.8 27B,速度大约每秒 1500 个 token。这个速度对本地开发迭代来说非常可观——你等的不是几秒,是零点几秒。

白桦: 更有意思的是他们的定价策略:prompt caching 不收额外费用,缓存里的 token 按标准价格收。有些服务商会对缓存命中打折但收缓存写入费,Cerebras 等于是把缓存当成普通 token 处理。

茉莉: 对高频、长上下文的使用场景,这个策略等于变相降价。评论里有人在算账:如果你的系统提示词很长,每次请求都要带一遍,这种模式下省的钱不少。

白桦: 然后是最大的一笔交易:NVIDIA 宣布以 129.3 亿美元收购 Hugging Face,并且承诺平台保持开放、继续支持多种加速器。

茉莉: 这条在评论区引发的讨论很微妙。一方面,129.3 亿美元说明开源模型生态的价值已经被硬件巨头正式定价了;另一方面,大家都在问:一家卖 GPU 的公司买下开源模型的中心枢纽,承诺的开放和多云支持能维持多久?

白桦: 有人在说,NVIDIA 支持多加速器听起来有点反直觉,毕竟 NVIDIA 自己就是最大的加速器厂商,为什么要帮助竞争对手的芯片跑模型?一种解释是,掌控模型分发层本身就是战略位置,不管你用什么芯片,模型都从我这儿过。

茉莉: 这几种观点并没有收敛成一个共识,但把三条新闻放在一起看,评论区的那个观察是成立的:开源模型、快速推理、平台整合,正在合流。开源不再是巨头的对立面,而是被巨头买进来了。

白桦: 合流归合流,风险信号也在同一周出现。我们接着说开发工具这边的事儿。

茉莉: 先说一个让人后背发凉的条款。Google Antigravity 的服务条款里写着,如果出现“第三方可疑使用”,Google 可以封禁你的整个 Google 账号。Gergely Orosz 公开提醒了用户这个风险。

白桦: 重点在“整个账号”。这不是封掉某个开发者工具,是你关联的邮箱、文件、照片、付费服务,全部一起受影响。评论区很多人第一反应是:一个 AI 开发工具的滥用检测出问题,能连坐到我的整个数字生活?

茉莉: 而“第三方可疑使用”这个措辞本身就很模糊。什么是第三方?什么算可疑?条款里没给清楚边界。有人指出,这意味着你实际上把账号安全押在了一套你看不见规则的自动检测系统上。

白桦: 这条新闻和另一项实测数据放在一起看特别有意思。Armature,一家 YC P26 的公司,测量了大约一万七千次 Claude Code、Codex 和 Cursor 的真实会话。

茉莉: 结果发现代理在联网搜索这个行为上的差异大得惊人:Claude 在编码会话里很少主动搜索网页,Codex 几乎每次都搜。

白桦: 这个差异本身引发了两派解读。一派认为这反映了不同产品对代理自主性的设计取舍——要不要让模型自己跑去网上找资料,是个产品哲学问题。

茉莉: 但还有一派说得更尖锐:这里存在利益冲突。模型的搜索行为可能不是纯粹由“什么对任务最好”驱动的,背后可能有商业上的考虑。Armature 的数据把这个平时看不见的行为差异摆到了台面上。

白桦: 具体冲突在哪儿、影响多大,讨论里其实没有定论,但“你用的代理工具的每个行为背后都可能有非技术因素”这个警觉,是这条数据带来的最大价值。

茉莉: 把这两条连起来:你选一个开发工具,既要担心它的代理行为不透明,又要担心条款里的封号连坐。选型这件事,以前只看性能,现在得看合同和商业模式了。

白桦: 不过话说回来,工具再怎么有风险,用得好的人确实能干出惊人的事。接下来这条就是本周最传奇的编程故事。

茉莉: 一位开发者把 1993 年的一款 Amiga 游戏移植到了 Godot 引擎,用了多久?一个晚上。用的是 Claude Fable 5。

白桦: 先感受一下这项工程的分量:原作是 72758 行 68000 汇编代码。七万多行三十年前的汇编,要在没有源代码层面的便利、没有现代工具链配合的情况下,翻译成现代引擎能跑的东西。这是传统上要几个月起步的活儿。

茉莉: 一晚上完成,然后游戏直接免费发布。评论区一半人在惊叹,另一半在做更冷静的分析。冷静派问的是:这一晚的背后,人到底做了什么?是全程看着 AI 输出,还是反复调试、逐段验证?“一晚上”这个说法里包含了多少人工介入?

白桦: 这个问题确实是关键。因为“AI 一夜完成移植”和“人机协作一夜完成移植”是两个不同的故事,但目前公开的叙述里,这个比例是模糊的。

茉莉: 还有一派的观点更有意思:不管人工占比多少,这件事证明的是“可行性”。以前没人会想用 AI 去碰几万行汇编的移植,因为看起来不可能;现在有人做成了,这条路就被打开了。那些躺在老机器上的游戏遗产,突然有了批量复活的可能性。

白桦: 这个话题还连接到了更深一层的讨论。LessWrong 社区当时正在讨论 Astra 的架构——looped transformer,循环式递归架构。

茉莉: 对,就是那种让模型在给出答案之前反复迭代同一组参数的设计。这和 Astra 在 ARC-AGI-3 上的表现放在一起看,有人就猜测:是不是这种“循环思考”的架构,正是它能在需要多步推理的基准上大幅超越的原因。

白桦: 与此同时 HN 上在吵另一个老问题的新版本:思维链到底是真正的思考,还是对思考的拙劣模仿?

茉莉: 这场争论两边都有很扎实的立场。一边认为,如果模型的中间推理步骤确实影响了最终输出质量,那它在功能意义上就是在思考,“模仿”和“思考”的界限本来就模糊。

白桦: 另一边反驳说,人类的思维链是探索性的,会推翻自己、走岔路;模型的思维链更像是照着一个模板复述,是事后合理化的表演。两边拿的证据都还是间接的,谁也说服不了谁。

茉莉: 但把这三件事串起来看很有意思:架构层面,社区在讨论循环递归能不能产生更深的推理;应用层面,有人一夜之间复活了七万行汇编;哲学层面,我们还在争论这算不算思考。编程和研究这两条线,这一周确实都在往前走。

白桦: 从代码世界退出来,看看天上。这条新闻放在任何一周都算亮眼:天文学家通过哈勃望远镜,在土星南极发现了一个十边形结构。

茉莉: 十个边。而且根据观测,这个结构大约是在 2024 年才形成的——也就是说,它很年轻,我们几乎是目击了它的诞生。

白桦: 大家对土星北极那个六边形应该都有印象,那是行星科学里最著名的怪现象之一,稳定存在了几十年。现在南极也有了一个,还是十边形,两种多边形在同一个星球的两端遥相呼应。

茉莉: 评论区讨论的焦点是成因。这类极地多边形涡旋,主流看法认为和大气层的波动、急流有关,但精确的机制到今天也没有完全搞清楚。六边形怎么稳定几十年,十边形为什么在 2024 年突然出现,都是未解的问题。

白桦: 有人好奇两极的结构之间有没有关联,是不是行星尺度大气动力学的两面。这些要等后续观测。目前能确认的只是:土星在继续教我们,行星大气能长出比想象中更奇怪的形状。

茉莉: 从土星回到地球,接下来是两条特别提气的好消息,一条来自河狸,一条来自中学生。

白桦: 先说河狸。加州的 French Creek,人们建了人工的河狸坝——模仿河狸筑坝的 structures——结果幼年银鲑的存活率从 8% 提升到了 60%。

茉莉: 这个数字值得停一下。8% 到 60%,接近八倍的提升,靠的不是什么高科技,是往溪流里放几根本头,让水慢下来、变深、变凉,给幼鱼造出庇护所。

白桦: 评论区的讨论很有代表性。有人说这是“低成本生态修复”的教科书案例:与其花大钱建复杂设施,不如把生态系统自己的工程师请回来,或者至少模仿它们。河狸本来就在历史上做过这件事,是人类把河流拉直了、把栖息地搞坏了。

茉莉: 也有人提醒别过度推广:French Creek 的地形和鱼类习性未必能复制到别的流域,需要更多对照实验。但即便最谨慎的人也承认,8% 到 60% 这个量级的改善值得认真研究。

白桦: 然后是来自爱尔兰的三个女中学生。她们花了三年时间,测试了一万三千颗种子,发现一种根瘤菌能让大麦的发芽速度加快最多 50%。这个项目赢下了谷歌科学展。

茉莉: 三年,一万三千颗种子,这个工作量放在专业实验室里都不算小。而且她们的发现指向的是农业上很有价值的东西:不用化肥、不用基因改造,一种细菌共生就能显著加速发芽。

白桦: 和河狸坝那条放在一起看,评论区有一个共同的主题:小的干预,大的回报。几根木头救了鲑鱼,一种细菌加速了作物。自然界里很多高杠杆的解决方案,一直在那里,只是需要有人耐心去测。

茉莉: 一万三千颗种子一颗一颗测,这种耐心本身就是稀缺资源。接下来我们把剩下的几条互联网和数字生活的新闻打包过一遍,每条都挺有故事。

白桦: 先说一条让两万多人很焦虑的:ICANN 批准了销毁 .name 顶级域的三级域名。这意味着大约两万两千名用户,从二月份起会失去他们的网站、邮箱和依赖这些域名的服务。

茉莉: 受影响的人里包括 Neil Fraser,就是那位在开发者社区很有名的工程师。他丢失的不只是一个网址,而是建立在那个域名上的整套东西——邮件地址用了这么多年,所有注册服务都绑在上面。

白桦: 评论区的核心争论是:一个域名的存废,为什么可以由 ICANN 单方面决定,而用户的二十多年积累没有足够的救济渠道?域名对个人来说不只是地址,是身份。这次的教训被总结成一句很朴素的话:你在别人提供的命名空间里的东西,随时可能被收回。

茉莉: 工具这边,Audacity 4.0 做了一次大改版:界面用 Qt6 重写,引入了新的剪辑编辑模型,加了工作区功能,还有亮色、暗色和高对比度主题。

白桦: 对一个二十多年的老牌开源音频工具来说,这等于是换了一次骨架。评论里老用户担心的还是老问题:界面大改之后,既有的工作流还能不能保持?新增的剪辑模型是好事,但迁移成本总是真实的。

茉莉: 再看一个更好玩的项目:Any Human Ever,这个网站会从一千多亿个曾经存在过的人类里,随机给你抽一段人生,用的是真实的统计人口数据。

白桦: 这个设计的巧妙之处在于数据基础。它不是编故事,而是根据历史人口的真实分布——你大概率抽到一个普通农民,小概率抽到某个时代某个地方的特殊处境。评论区很多人说,玩几次之后对“人类”这个概念的感受完全变了:我们平时接触的历史是帝王将相,而这个工具呈现的是真实概率。

茉莉: 它把抽象的“一千亿人”变成了一个可以撞击你直觉的具体经验。这个我觉得是本周最有哲学味的小网站。

白桦: 开发者工具还有一条:Polars 2.0 的预发布版出来了。最大的变化是默认使用流式引擎,官方说速度大约提升五倍。

茉莉: 但代价是行为变得更严格了:类型强制转换和拼接操作改成了更严格的规则。也就是说,以前那些“自动帮你猜类型、默默兼容”的宽松行为,现在会直接报错。

白桦: 评论区对这一点分歧挺明显。一派欢迎,说数据处理工具就应该严格,隐式转换是无数沉默 bug 的源头,早爆早好;另一派担心升级成本,说现有代码库里那些依赖宽松行为的脚本,升级到 2.0 会有一波痛苦的修改。

茉莉: 这基本是所有数据处理库大版本演进的经典争论了,Rust 系工具往严格走,用户在爽和痛之间过渡。最后我们回到两则和人关系最近的消息。

白桦: 先说新闻业这边的一则争议。纽约时报和 The Athletic 的员工,通过 NewsGuild 工会投票,一致要求报社终止与 Kalshi 的合作。Kalshi 是一个预测市场平台。

茉莉: 全票通过,这个 unanimity 本身就说明了员工态度的一致程度。争议的核心是:一家以准确、中立为立身之本的新闻机构,和市场化的预测博彩平台合作,边界在哪里。

白桦: 评论区的讨论分了好几层。有人担心的是利益冲突——如果新闻机构从预测市场的交易中获利,读者怎么相信它的选举报道是中立的?也有人说,报道预测市场和经营预测市场是两回事,工会是不是反应过度了?

茉莉: 但从全票的结果看,编辑部内部的担忧显然压倒了技术性的辩护。新闻业和博彩式金融之间那条线应该画在哪儿,这次投票算是给出了编辑部员工自己的答案,但管理层怎么回应还是未知数。

白桦: 最后,以一个人的离世收束本期。Gloria Steinem 在纽约去世,享年 92 岁。

茉莉: 她的身份是双重的:记者,和女权活动家。从上世纪六十年代开始活跃,一路跨越六十多年,写了九本书。

白桦: 六十年。这意味着她经历了第二波女权主义从兴起、争论、被嘲讽、到进入主流的完整过程,而且始终在场内,不是旁观者。

茉莉: 回顾她这一周的新闻环境——预测市场和新闻的纠缠、AI 对劳动的重塑——评论里有一个感慨挺触动人的:Steinem 那一代人用几十年争取来的“让女性被听见”的空间,如今延伸到了所有关于技术与权力的公共讨论里。她留下的不只是一套立场,更是一种“持续在场、持续发声”的实践方式。

白桦: 是的。从六十年代的打字机到今天的预言市场,公共讨论的媒介一直在变,但需要有人较真这件事没变。

茉莉: 这就是本期节目的全部内容。从 99.9% 的基准分数到土星南极的十个边,从河狸的木头到一位六十年的活动家。感谢收听,我们下期再见。

白桦: 下期见。